S'inscrire à la newsletter
Surfeur raisonnableBrevetsMaillage interne

Le surfeur raisonnable : pourquoi Google ne donne pas le même poids à tous vos liens SEO

Par 9 min de lecture

Le surfeur raisonnable est un modèle de liens dans lequel chaque lien transmet de l'autorité selon la probabilité qu'un internaute réel clique dessus. Le brevet US 7,716,225 B1, « Ranking documents based on user behavior and/or feature data », le décrit. Google l'a déposé le 17 juin 2004, et le brevet a été délivré le 11 mai 2010.

Que décrit le brevet du surfeur raisonnable ?

Le brevet du surfeur raisonnable décrit une version du PageRank dans laquelle les liens ont des poids différents. Ses 3 inventeurs sont Jeffrey A. Dean, Corin Anderson et Alexis Battle, et il a été cédé à Google Inc. avec 19 revendications et 7 planches de dessins. Le système construit un modèle à partir des caractéristiques des liens et des liens que les internautes suivent réellement, puis utilise ce modèle pour pondérer chaque lien dans le calcul du classement.

La famille se poursuit avec 3 continuations : US 8,117,209 B1, US 9,305,099 B1 et US 10,152,520 B1. Le brevet nomme lui-même le modèle : « ce modèle du surfeur raisonnable reflète le fait que tous les liens associés à un document n'ont pas la même probabilité d'être suivis ».

En quoi le surfeur raisonnable diffère-t-il du surfeur aléatoire ?

Le surfeur raisonnable diffère du surfeur aléatoire parce qu'il ne suit pas chaque lien avec la même probabilité. Le PageRank d'origine, le brevet Google sur l'autorité des liens, modélise un surfeur aléatoire qui choisit n'importe quel lien d'une page avec la même chance : une page de 100 liens répartit l'autorité qu'elle transmet en 100 parts égales.

Dans le brevet, « lorsqu'un surfeur accède à un document contenant un ensemble de liens, il suivra certains liens avec une probabilité plus élevée que d'autres ». Il donne 3 exemples de liens peu susceptibles d'être suivis : « les liens “Conditions d'utilisation”, les bannières publicitaires et les liens sans rapport avec le document ». La part que transmet un lien dépend donc de sa chance d'être cliqué, et pas seulement du nombre de liens de la page.

La formule de classement (Eqn. 1) conserve la structure du PageRank et ajoute un poids w à chaque lien : r(A) = a/N + (1 − a) · (w1 · r(B1)/|B1| + … + wn · r(Bn)/|Bn|). B1 à Bn sont les documents qui pointent vers A, |B| est le nombre de liens sortants de chacun d'eux, a est une constante comprise entre 0 et 1, et N est le nombre total de documents. « Le poids d'un lien peut refléter la probabilité que le lien soit sélectionné. » Le rang d'un document est alors « la probabilité qu'un surfeur raisonnable accède au document après avoir suivi un grand nombre de liens sortants ».

Que montre l'exemple chiffré du brevet ?

L'exemple du brevet (FIG. 7) montre deux liens d'une même page qui transmettent des quantités de rang différentes. Il utilise 3 documents :

  • A pointe vers B avec un poids de 0,6 et vers C avec un poids de 0,4.
  • B pointe vers C avec un poids de 0,9.
  • C pointe vers A avec un poids de 0,5.

Le brevet précise qu'« une valeur typique de a est 0,1 », mais retient a = 0,5 pour l'exemple. Le résultat est r(A) ≈ 0,237, r(B) ≈ 0,202 et r(C) ≈ 0,281. A transmet davantage par son lien vers B (0,6) que par son lien vers C (0,4), alors que les deux liens se trouvent sur la même page. C arrive en tête parce qu'il reçoit 2 liens, dont celui de B pondéré à 0,9.

Quelles caractéristiques de liens Google analyse-t-il ?

Le brevet liste les caractéristiques du lien lui-même, du document source et du document cible, et précise que chaque liste « n'est pas exhaustive ».

Caractéristiques du lien :

  • La taille et le style de police : la taille de police du texte d'ancre, la couleur de police et des attributs comme l'italique, le gris ou « la même couleur que le fond ».
  • La position dans la page : dans une liste HTML (et la position dans cette liste), dans le texte courant, au-dessus ou en dessous du premier écran affiché sur un navigateur en 800 × 600, le côté du document (haut, bas, gauche, droite), dans le pied de page ou dans la barre latérale.
  • Le texte d'ancre : les mots qu'il contient et son nombre de mots.
  • Le contexte : quelques mots avant et après le lien, et le groupe thématique du texte d'ancre.
  • Le type de lien : par exemple un lien image, et le format (rapport largeur/hauteur) de l'image.
  • Le caractère commercial du texte d'ancre.
  • Les caractéristiques de l'URL : lien vers le même hôte ou domaine, URL du lien plus courte que l'URL de la page source quand les deux partagent un domaine, et URL qui en contient une autre (par exemple pour une redirection côté serveur).

Caractéristiques du document source :

  • L'URL et le site de la page source.
  • Le nombre de liens de la page.
  • Les mots du corps et des titres.
  • Le groupe thématique de la page source, et son degré de correspondance avec le groupe thématique du texte d'ancre.

Caractéristiques du document cible :

  • L'URL et le site de la page cible, et le partage éventuel d'un hôte ou d'un domaine avec la source.
  • Les mots de l'URL et la longueur de l'adresse.

Comment le modèle apprend-il quels liens sont cliqués ?

Le modèle apprend en comparant les liens que les internautes ont choisis à ceux qu'ils ont ignorés. Le système collecte des données de comportement : « les actions de navigation (par exemple, les liens choisis par les utilisateurs, les adresses qu'ils ont saisies, les formulaires qu'ils ont remplis, etc.), la langue des utilisateurs, leurs centres d'intérêt, les termes de recherche qu'ils ont saisis ». Le brevet indique que ces données peuvent provenir d'un navigateur web ou d'un assistant de navigation, comme un plug-in, qui enregistre les documents consultés et les liens choisis.

Chaque lien choisi compte comme une instance positive, et chaque lien non choisi de la même page comme une instance négative. Quand aucun lien d'une page n'est choisi, tous ses liens comptent comme négatifs. L'exemple du brevet : le document W pointe vers X, Y et Z, et les internautes ont fait les sélections (W, X), (W, X) et (W, Z). Cela donne 3 instances positives et 6 négatives.

Le système construit ensuite un vecteur de caractéristiques pour chaque lien et entraîne le modèle avec « un naive bayes, un arbre de décision, une régression logistique ou une approche faite sur mesure ». L'entraînement produit 2 types de règles :

  1. Des règles générales valables d'un document à l'autre : un texte d'ancre au-dessus d'une certaine taille de police augmente la probabilité de sélection, un lien placé plus près du haut de la page a plus de chances d'être choisi, et un lien entre documents de sujets proches a plus de chances d'être suivi.
  2. Des règles propres à un document : « un lien placé sous le titre “More Top Stories” sur le site cnn.com a une forte probabilité d'être sélectionné ». Une probabilité faible revient à un lien dont l'URL cible contient le mot « domainpark », à un lien situé sur un document source qui contient une pop-up, à un lien vers un domaine cible qui se termine par « tv », et à un lien vers une URL cible comportant plusieurs tirets.

Le brevet présente ces règles « simplement à titre d'exemples ». Le modèle pondère ensuite de nouveaux liens qu'il n'a jamais vu cliquer : dans la revendication 12, la probabilité est déterminée « en utilisant uniquement les données de caractéristiques associées au second lien comme entrée du modèle ».

Les poids des liens sont-ils figés ?

Non, les poids des liens ne sont pas figés : le brevet qualifie le modèle de « dynamique » parce qu'« il est construit à partir de données qui changent avec le temps ». Comme les liens apparaissent et disparaissent et que le comportement des internautes évolue sans cesse, le système peut mettre à jour périodiquement les poids, et donc les rangs.

Les poids peuvent aussi dépendre de qui clique. Les données de comportement peuvent couvrir tous les utilisateurs, une catégorie d'utilisateurs ou un seul utilisateur, et les poids « peuvent être adaptés à la catégorie d'utilisateurs » ou à l'utilisateur lui-même. Le rang obtenu n'est pas non plus tout le classement : « le rang d'un document peut être l'un des nombreux facteurs utilisés pour déterminer un rang global pour le document ».

Que change le surfeur raisonnable pour votre SEO ?

Le surfeur raisonnable signifie qu'un lien transmet de l'autorité en proportion de sa chance d'être cliqué. 6 conséquences en découlent :

  1. Placez les liens importants là où les lecteurs cliquent. La règle d'exemple du brevet favorise les liens « placés plus près du haut d'un document », et l'emplacement dans le texte courant, le pied de page ou la barre latérale est une caractéristique que le modèle pondère.
  2. Rédigez des ancres descriptives et cohérentes avec le sujet. Le brevet pondère les mots de l'ancre et la correspondance entre le groupe thématique de la page source et celui du texte d'ancre.
  3. Liez les pages qui traitent de sujets proches. Les liens entre documents de sujets proches ont une probabilité de sélection plus élevée.
  4. Ne comptez pas sur les liens que personne ne clique. Les liens Conditions d'utilisation, les bannières publicitaires et les liens sans rapport avec le document sont les propres exemples du brevet de liens rarement suivis, et les liens de pied de page ou de barre latérale peuvent perdre du poids si les internautes les ignorent. Un autre brevet de Google va plus loin et mesure la qualité à partir des liens qui apportent des clics et du trafic qu'ils envoient.
  5. Gardez des pages sans pop-up ni surcharge de liens. La règle d'exemple du brevet donne une probabilité faible aux liens d'une page avec pop-up, le nombre de liens de la page est une caractéristique, et dans la formule la part de chaque lien est divisée par ce nombre.
  6. Ne cachez jamais de liens. Le texte gris et le texte de « la même couleur que le fond » font partie des attributs de lien que le modèle lit.

En SEO on-page, nous plaçons les liens importants dans le corps du texte, près du haut de la page, et retirons des gabarits les liens que les lecteurs ne cliquent jamais.

La même logique s'applique aux backlinks. Un lien enfoui dans le pied de page d'un site partenaire transmet probablement moins qu'un lien éditorial que les lecteurs cliquent au milieu d'un article. Les liens éditoriaux de sites indépendants comptent aussi pour Google Panda, qui ne retient que les liens indépendants.

Le brevet décrit ce que le système de Google peut faire. Il ne confirme ni les caractéristiques que Google pondère aujourd'hui, ni leur poids.

Quiz express

Avez-vous tout compris ?

Testez ce que vous venez de lire.

Question 1 sur 4

En quoi le surfeur raisonnable diffère-t-il du surfeur aléatoire ?

Articles liés

Nous lisons les brevets pour que vous n'ayez pas à le faire.

Chaque semaine : 3 enseignements SEO étayés par les données, 1 mythe démonté, 1 méthode à reprendre. Sans remplissage. Sans conseils de gourou.

Gratuit pour toujours. Désinscription à tout moment. Nous respectons votre boîte mail. Confidentialité.