S'inscrire à la newsletter
Texte d'ancreBrevetsExploration

L'indexation du texte d'ancre en SEO : comment Google indexe une page avec les mots que d'autres pages utilisent pour pointer vers elle

Par 8 min de lecture
Indexation du texte d'ancre : le brevet Google et le SEO, brevet US 7,308,643 B1Texte d'ancre

L'indexation du texte d'ancre est le fait d'indexer une page avec le texte d'ancre, et le texte qui l'entoure, que d'autres pages utilisent quand elles pointent vers elle. Le brevet US 7,308,643 B1, « Anchor tag indexing in a web crawler system », décrit comment le robot de Google recueille ce texte et l'associe aux pages cibles à l'échelle du web. Google l'a déposé le 3 juillet 2003, et le brevet a été délivré le 11 décembre 2007.

Que décrit le brevet US 7,308,643 ?

Le brevet US 7,308,643 décrit un système d'exploration et d'indexation qui enregistre chaque lien avec son texte, trie les liens par page cible, et indexe chaque cible avec le texte qui pointe vers elle. Ses 5 inventeurs sont Huican Zhu, Jeffrey Dean, Sanjay Ghemawat, Bwolen Po-Jen Yang et Anurag Acharya. Jeffrey Dean et Sanjay Ghemawat ont ensuite cosigné les articles de Google sur MapReduce et Bigtable. Le brevet, attribué à Google Inc. lors de sa délivrance, compte 27 revendications et 13 planches de dessins, et sa durée a été prolongée de 587 jours.

Le résumé énonce le cœur du système : « un journal de liens, contenant des paires de documents sources et de documents cibles, est consulté. Une table d'ancres triée, contenant des paires document cible-document source, est générée », avec des paires « ordonnées selon les identifiants des documents cibles ».

Comment le robot enregistre-t-il les liens ?

Le robot enregistre les liens dans des journaux de liens. Pour chaque page explorée, un enregistrement contient « les empreintes de tous les liens (URL) qui s'y trouvent », « ainsi que le texte qui entoure le lien ». L'exemple du brevet : le texte « to see a picture of Mount Everest click here », dont le lien pointe vers une image de l'Everest.

Le brevet décrit une exploration organisée en couches. Les URL sont placées dans une couche de base, une couche quotidienne ou une couche en temps réel « selon la fréquence de changement historique ou attendue du contenu des pages et une mesure de leur importance », comme le PageRank. Dans une mise en œuvre, un cycle d'exploration, ou époque, dure une journée, et des indexeurs en temps réel, quotidiens et de base rendent les documents consultables.

Que sont les tables de liens et les tables d'ancres ?

Les tables de liens et les tables d'ancres sont 2 vues des mêmes journaux de liens, indexées différemment :

  1. Les tables de liens sont indexées par page source et listent ses cibles, sans texte. Les calculateurs de PageRank les utilisent « pour ajuster le PageRank des URL ».
  2. Les tables d'ancres sont indexées par page cible et contiennent « le texte qui correspond à l'URL ». Les indexeurs les utilisent « pour faciliter l'indexation du texte d'ancre et celle des URL qui ne contiennent pas de mots ».

Comme les enregistrements d'ancres sont triés par cible, « des techniques de recherche binaire peuvent être utilisées pour localiser rapidement l'enregistrement correspondant à la cible ». Les deux sont construites comme des ensembles de tables triées en couches, fusionnées quand une condition de fusion est remplie (un calendrier, un trop grand nombre de tables, un volume de données trop élevé ou une période d'inactivité). Pour les tables de liens, le brevet préfère fusionner des tables de taille proche, « à un facteur 2 près ».

Les 2 tables ne sont pas lues de la même façon. Les calculateurs de PageRank ne gardent que l'enregistrement le plus récent d'une page source. Les indexeurs « prennent simplement toute l'information disponible » : ils lisent toutes les tables d'ancres qui contiennent la page cible.

Que se passe-t-il quand un lien disparaît ?

Quand un lien disparaît, son texte cesse d'être associé à la page cible. Le gestionnaire d'état global écrit une « entrée de suppression de lien » quand il « détermine qu'un lien n'existe plus », par exemple quand un ancien enregistrement d'une page source liste une cible qu'un enregistrement plus récent ne liste plus. Quand un document entier a disparu, il écrit une « entrée de suppression de nœud ». Lors d'une fusion, la table la plus récente l'emporte : dans l'exemple du brevet, comme la table qui contient l'entrée de suppression est plus récente, la page source n'est pas reprise dans l'enregistrement d'ancres fusionné. Pour chaque paire source et cible, la table fusionnée conserve « l'annotation la plus récente ».

Pourquoi indexer une page avec le texte d'autres pages ?

Indexer une page avec le texte d'autres pages décrit la page même quand son propre contenu ne le peut pas. Le brevet donne 3 cas :

  1. La page est inaccessible : si la cible « ne peut pas être récupérée au moment de l'exploration », parce que son serveur est en panne ou demande un mot de passe, « ce texte d'ancre fournit une information textuelle consultable par mots-clés ».
  2. La page n'a pas de texte : la cible « peut être un fichier image, vidéo ou audio », sans texte disponible. L'image de l'Everest ne contient aucun mot, mais le texte du lien la décrit.
  3. D'autres la décrivent mieux : « la page source contient des informations plus exactes sur la page cible que le contenu de la page cible elle-même ». L'exemple du brevet : une page qui fait autorité indique que « le serveur qui héberge la page cible est souvent indisponible », alors que la page elle-même « peut ne contenir aucun texte indiquant qu'elle est indisponible ».

L'exemple le plus simple du brevet : si le texte d'ancre « this is an interesting website about cats » est indexé avec la page cible, « un utilisateur qui soumet une requête contenant le terme "cat" peut recevoir une liste de documents incluant » cette page. Le résumé ajoute un autre avantage : « la possibilité d'indexer une page web avant qu'elle ait été explorée ». Un autre brevet de Google évalue le texte d'ancre selon les phrases liées présentes dans la page source et dans la page cible.

Quelles informations sont stockées avec le texte d'ancre ?

Le texte d'ancre est stocké sous forme d'annotations avec des attributs. Le brevet liste des attributs de mise en forme du texte environnant, comme un texte mis en valeur avec <EM>, une citation avec <CITE>, un nom de variable avec <VAR>, un texte fortement mis en valeur avec <STRONG> et du code source avec <CODE>. D'autres attributs incluent « la position du texte, le nombre de caractères et le nombre de mots du passage ».

Le texte stocké ne se limite pas à l'ancre. Un passage peut être tiré « du texte situé à une distance prédéterminée d'une balise d'ancre ». Cette distance peut dépendre « d'un nombre de caractères dans le code HTML du document source, de l'emplacement d'autres balises d'ancre dans le document source » ou d'autres « critères d'identification du texte d'ancre ». Au moment de la requête, le moteur peut chercher dans le contenu de la page, mais aussi dans « toutes les annotations associées à un document » pour y trouver les termes de la requête.

Comment le brevet traite-t-il les pages en double ?

Le brevet regroupe le texte d'ancre des pages en double. Avant l'indexation, un serveur de doublons compare les doublons selon leur PageRank et désigne la page « canonique ». Une page non canonique n'est pas transmise pour indexation. Dans certaines mises en œuvre, l'entrée d'une page liste les empreintes d'URL de ses doublons, dans la limite de K entrées, K ayant « de préférence une valeur comprise entre 2 et 10 ». Les indexeurs lisent alors « le texte d'ancre des liens qui pointent vers chacune des pages en double identifiées et indexent ce texte d'ancre dans le cadre de l'indexation de la page ». Le brevet précise que c'est utile quand les liens vers une page non canonique portent « un texte d'ancre dans une autre langue que le texte d'ancre des liens vers la page canonique ».

Les mots qui entourent un lien portent du sens dans d'autres brevets de Google : le brevet sur le contexte des liens en tire une empreinte pour détecter le spam, et le brevet du surfeur raisonnable s'en sert pour estimer la probabilité qu'un lien soit cliqué.

Que change l'indexation du texte d'ancre pour votre SEO ?

L'indexation du texte d'ancre signifie que les mots que d'autres emploient pour pointer vers vous font partie de la façon dont Google décrit votre page. 6 conséquences en découlent :

  1. Obtenez des liens descriptifs. Un texte d'ancre comme « un site intéressant sur les chats » peut rendre la cible trouvable pour « chat » : la description que d'autres donnent de vous est indexée avec votre page.
  2. Soignez la phrase autour du lien. Le robot stocke « le texte qui entoure le lien », pas seulement l'ancre, dans une distance prédéterminée : un lien placé dans une phrase descriptive porte plus de sens qu'un simple « cliquez ici ».
  3. Décrivez vos images et médias par des liens. Les images, vidéos et fichiers audio n'ont pas de texte propre : des liens internes au texte descriptif indiquent à l'index ce qu'ils montrent.
  4. Sachez que d'autres peuvent vous décrire. Une page qui fait autorité peut associer à votre page des faits, positifs ou négatifs, que votre propre contenu ne contient pas.
  5. Faites du maillage interne avec intention. Vos ancres internes sont aussi des textes d'ancre : utilisez-les pour décrire précisément chaque page cible.
  6. Gardez des signaux canoniques propres. Les liens vers les doublons de votre page peuvent alimenter son texte d'ancre, mais seule la version canonique est indexée : assurez-vous que la version choisie est bien celle que vous voulez.

Le brevet décrit ce que le système de Google peut faire. Il ne confirme pas comment Google pondère aujourd'hui le texte d'ancre dans son classement.

Quiz express

Avez-vous tout compris ?

Testez ce que vous venez de lire.

Question 1 sur 4

Que stocke le robot pour chaque lien dans les journaux de liens ?

Articles liés

Nous lisons les brevets pour que vous n'ayez pas à le faire.

Chaque semaine : 3 enseignements SEO étayés par les données, 1 mythe démonté, 1 méthode à reprendre. Sans remplissage. Sans conseils de gourou.

Gratuit pour toujours. Désinscription à tout moment. Nous respectons votre boîte mail. Confidentialité.