S'inscrire à la newsletter
LiensBrevetsSpam de liens

Le contexte des liens : comment Google lit les mots autour d'un lien pour repérer le spam SEO

Par 9 min de lecture

Le contexte d'un lien est une empreinte des mots rares qui entourent un lien dans la page qui le contient. Le brevet US 8,577,893 B1, « Ranking based on reference contexts », classe une page selon les contextes de tous les liens qui pointent vers elle, pour récompenser les citations variées et naturelles et écarter les liens produits en masse. Google l'a déposé le 15 mars 2004, et le brevet a été délivré le 5 novembre 2013.

Que décrit le brevet US 8,577,893 ?

Le brevet US 8,577,893 décrit un facteur de classement fondé sur le contexte des liens qui pointent vers un document. Ses 2 inventeurs sont Anna Patterson, l'autrice du brevet sur l'indexation par phrases, et Paul Haahr. Le brevet compte 17 revendications et 9 planches de dessins, et sa durée a été prolongée de 2 935 jours au titre de 35 U.S.C. 154(b).

Le résumé condense le système : il « identifie un ou plusieurs mots rares » dans la partie d'une page qui entoure un lien, « crée un identifiant de contexte à partir de ces mots rares, et classe le second document selon cet identifiant ». Le brevet définit un lien au sens large comme « toute référence vers ou depuis un document ».

Quelles manipulations le brevet vise-t-il ?

Le brevet vise 4 techniques qui gonflent artificiellement le classement :

  1. Le spam de liens : obtenir de nombreux liens vers une page, par des fermes de liens « fortement maillées entre elles » ou en payant les propriétaires de pages bien classées pour ajouter un lien.
  2. Le spam de texte d'ancre : de nombreuses pages qui pointent vers un document « avec le même texte d'ancre que celui auquel on veut associer le document ».
  3. Le « bombing » : le brevet cite le cas où de nombreuses pages ont utilisé le texte d'ancre « miserable failure » pour pointer vers la biographie du président Bush, qui s'est alors classée première sur cette requête.
  4. Les cadres standard : des liens répétés sur toutes les pages d'un site, comme les liens « produits », « emplois » ou « investisseurs », qui « peuvent gonfler artificiellement le classement » de leurs cibles, « surtout quand le site compte un grand nombre de pages ».

Le brevet cite aussi les motivations : financières, puisque « de nombreux propriétaires de documents paieront pour que leur document soit bien classé », mais aussi « perturber le moteur de recherche, humilier l'entreprise qui l'exploite, ou aucune raison du tout ». Sa réponse aux 4 techniques est la même : utiliser le contexte des liens comme facteur de classement, afin que les classements gonflés artificiellement « puissent être réduits ».

Comment Google construit-il le contexte d'un lien ?

Google construit le contexte d'un lien en 4 étapes pour chaque lien trouvé en analysant un document pendant l'exploration ou l'indexation. Le document analysé est différent du document classé :

  1. Lire 2 fenêtres de texte : une à gauche du lien et une à droite. La fenêtre par défaut compte 5 mots ; le brevet en évoque plus ou moins, par exemple 15.
  2. Trouver le mot le plus rare de chaque fenêtre, avec « une pondération par fréquence inverse de document (IDF) ou une technique classique de modélisation linguistique ». Une technique hache chaque mot du corpus dans une table dont les compteurs montrent quels mots apparaissent le moins. Dans un mode de réalisation, les mots les plus rares sont de « vrais » mots, par exemple un mot qui apparaît « au moins cinquante fois sur de nombreux documents différents », ce qui exclut les blocs aléatoires de symboles ou de chiffres. Une autre mise en œuvre retient une expression rare (une combinaison de mots) dans chaque fenêtre au lieu d'un mot isolé.
  3. Hacher les 2 mots rares en un identifiant de contexte, une empreinte du contexte du lien. Chaque mot « peut être haché séparément ou après les avoir combinés ».
  4. Compter chaque contexte parmi tous les liens qui pointent vers le document : le nombre d'occurrences d'un contexte est le nombre de fois où ces mots rares sont apparus associés à des liens vers le document.

L'exemple du brevet est une page sur Saturne avec la phrase « Perhaps the most beautiful of all the planets, Saturn is surrounded by an elegant and intriguing ring system ». Le texte d'ancre est « Saturn », qui pointe vers www.planetsaturn.com. La fenêtre de gauche est « beautiful of all the planets », celle de droite « is surrounded by the elegant », les mots les plus rares sont « planets » et « elegant », et leur hachage donne le contexte 112. Les requêtes font l'objet d'une lecture comparable des mots voisins : Google vérifie les synonymes des requêtes longues grâce aux termes éloignés du mot remplacé.

Comment les contextes modifient-ils le classement d'une page ?

Les contextes modifient le classement par 3 mesures calculées à partir de la liste des contextes et de leurs nombres d'occurrences :

  1. Le nombre de contextes différents : le nombre d'entrées de la liste sert « à déterminer un score de classement pour le document » (la revendication 5 parle d'« un nombre total d'identifiants de contexte »). Le brevet ne précise pas le sens de ce facteur, mais ses exemples anti-spam impliquent que de nombreux contextes distincts pèsent plus qu'un seul contexte répété des milliers de fois.
  2. La répartition des occurrences : un contexte au nombre disproportionné est suspect. Dans l'exemple du brevet, des contextes comptant 10 000, 10, 4 et 1 occurrences : le premier est écarté « comme suspect, par exemple généré automatiquement », et la page est classée comme si elle avait 3 contextes.
  3. L'historique de la répartition : un changement brutal est suspect. Une page avec 2 contextes de 20 occurrences chacun gagne un troisième contexte de 18 000 occurrences à la période suivante : le saut d'un total de 40 à 18 040 signale le document « comme suspect ».

Dans l'exemple de Saturne, la liste contient les contextes 23, 46, 112 et 156 avec 30 000, 15, 8 et 3 occurrences. Le contexte 23 est jugé suspect « en raison de son nombre d'occurrences disproportionné par rapport aux autres contextes », puis « supprimé du calcul du classement, ou sa contribution est réduite ». Les exemples signalent un seul contexte, mais le brevet ajoute que « plusieurs contextes peuvent être jugés suspects ». Le classement peut aussi être précalculé pour chaque document et simplement consulté à l'arrivée d'une requête.

Le facteur de contexte se combine avec « le nombre de liens vers le document, l'importance des documents qui pointent vers lui, la fraîcheur de ces documents, et d'autres facteurs de classement connus ».

Le contexte remplace-t-il le texte d'ancre ?

Non : le contexte complète le texte d'ancre. Le brevet précise que d'autres données, « textuelles ou non », peuvent définir le contexte, comme « les données qui entourent le lien, celles à sa gauche ou à sa droite, ou le texte d'ancre associé au lien ». Dans la logique du brevet, un « bombing » peut contrôler le texte d'ancre, mais des milliers de copies de la même phrase produisent un seul contexte au nombre énorme, exactement ce que la mesure de répartition écarte.

Les mots qui entourent un lien comptent dans d'autres brevets de Google : le brevet du surfeur raisonnable pondère un lien selon sa probabilité d'être cliqué, à partir de caractéristiques qui incluent « le contexte de quelques mots avant et/ou après le lien ».

Que protègent les 17 revendications ?

Les revendications protègent la version du mécanisme fondée sur les mots rares. La revendication 1 couvre l'identification d'un lien, l'analyse du texte à sa gauche et à sa droite, le choix d'un mot rare dans chaque partie « selon sa fréquence d'apparition » dans un ensemble de documents, la création d'un identifiant de contexte « fondé uniquement sur le premier et le second mot rare », et le classement de la cible « dans une liste de résultats de recherche ». Les revendications dépendantes ajoutent :

  • Le hachage des 2 mots rares en identifiant (revendications 3 et 13).
  • Le nombre total d'identifiants de contexte comme base du classement (revendication 5).
  • La répartition des occurrences, avec l'impact d'un identifiant réduit (revendications 7 et 8).
  • L'historique de cette répartition (revendication 9).
  • Un score de classement utilisé comme « l'un de plusieurs facteurs » (revendications 10, 14 et 17).

La revendication 15 étend le système à un « mot rare ou une expression rare » de chaque côté de la référence. La revendication 17 couvre l'ensemble des contextes différents recueillis dans de nombreux documents qui pointent vers la cible.

Que change le brevet sur le contexte des liens pour votre SEO ?

Le brevet signifie qu'un profil de liens vaut davantage quand les liens viennent de phrases variées et naturelles que quand des milliers de liens partagent le même texte. 5 conséquences en découlent :

  1. Obtenez des liens dans des contextes éditoriaux variés. Le nombre de contextes distincts alimente le score de classement : des citations dans des articles différents, écrits par des personnes différentes, créent des contextes différents.
  2. Évitez les placements de liens sur modèle. Les articles invités, widgets ou communiqués qui répètent la même phrase autour de votre lien créent un seul contexte au nombre disproportionné.
  3. Surveillez les liens présents sur tout un site. Les liens de pied de page et de navigation répétés sur chaque page sont les « cadres standard » du brevet, et les mêmes mots autour du lien sur chaque page peuvent produire un seul contexte répété.
  4. Faites croître vos liens à un rythme naturel. Un nouveau contexte qui apparaît 18 000 fois en une période, sur une page qui en totalisait 40, est l'exemple du brevet d'un document signalé comme suspect.
  5. Laissez le texte environnant varier naturellement. Les mots rares autour d'un lien définissent son contexte. Le brevet compte ces contextes et leur répartition ; il ne vérifie pas si les mots correspondent à votre sujet : la variété compte plus qu'une phrase toute faite.

Le brevet décrit ce que le système de Google peut faire. Il ne confirme pas que Google utilise aujourd'hui des empreintes de contexte des liens dans son classement.

Quiz express

Testez ce que vous venez de lire.

Question 1 sur 4

Comment le brevet construit-il le contexte d'un lien ?

Articles liés

Nous lisons les brevets pour que vous n'ayez pas à le faire.

Chaque semaine : 3 enseignements SEO étayés par les données, 1 mythe démonté, 1 méthode à reprendre. Sans remplissage. Sans conseils de gourou.

Gratuit pour toujours. Désinscription à tout moment. Nous respectons votre boîte mail. Confidentialité.