S'inscrire à la newsletter
PageRankBrevetsNetlinking

Le PageRank par pages de confiance de Google : pourquoi votre distance aux sites de référence fait votre autorité SEO

Par 10 min de lecture

Le PageRank par pages de confiance est une méthode de classement qui note chaque page selon sa plus courte distance en liens depuis un ensemble de pages de départ de confiance. Le brevet US 9,165,040 B1, « Producing a ranking for pages using distances in a web-link graph », la décrit. Google l'a déposé le 12 octobre 2006, et le brevet a été délivré le 20 octobre 2015.

Que décrit le brevet US 9,165,040 ?

Le brevet US 9,165,040 décrit une variante du PageRank qui mesure l'autorité comme une proximité avec des pages de confiance, et non comme la somme de tous les liens entrants. Son unique inventeur est Nissan Hajaj. Il compte 34 revendications et 3 planches de dessins. Une continuation, US 9,953,049 B1, a été déposée le 19 octobre 2015, la veille de la délivrance.

Le brevet part d'une faiblesse connue de l'algorithme d'origine : « certaines pages web (appelées pages de spam) peuvent être conçues pour recourir à diverses techniques afin d'obtenir un PageRank artificiellement gonflé, par exemple en formant des fermes de liens ou en créant des boucles ». Une parade existait déjà : « une variante possible du PageRank qui réduirait l'effet de ces techniques consiste à sélectionner quelques pages de confiance (aussi appelées pages de départ) et à découvrir d'autres pages susceptibles d'être bonnes en suivant les liens depuis ces pages de confiance ».

Cette parade avait un coût. Le brevet relève que « cette variante du PageRank exige de résoudre le système entier séparément pour chaque page de départ », de sorte que « à mesure que le nombre de pages de départ augmente, la complexité du calcul augmente linéairement, ce qui limite le nombre de pages de départ utilisables en pratique ». L'invention remplace le calcul d'un PageRank par page de départ par des plus courtes distances, que le brevet dit calculables ensemble pour toutes les pages et toutes les pages de départ.

Qu'est-ce qu'une page de départ ?

Une page de départ est une page de grande qualité spécialement choisie comme point de départ du classement. Le brevet fixe 3 critères : les pages de départ « doivent être fiables, variées pour couvrir un large éventail de domaines d'intérêt public, et bien connectées aux autres pages (c'est-à-dire avec un grand nombre de liens sortants) ». Ses 2 exemples sont le Google Directory et le New York Times. Les pages de départ riches en liens sortants utiles jouent le rôle de « hubs » du web.

Le brevet veut de nombreuses pages de départ : « il est souhaitable d'utiliser un grand nombre de pages de départ pour couvrir les différentes langues et un large éventail de domaines ». Un ensemble plus varié « peut raccourcir les chemins entre les pages de départ et une page donnée ». Il en fixe aussi les limites : « comme la sélection des pages de départ suppose qu'un humain identifie manuellement ces pages de grande qualité, leur nombre total est généralement limité. De plus, un trop grand nombre de pages de départ peut les rendre vulnérables à la manipulation ».

Les pages de départ ne se valent pas toutes. Chacune peut recevoir un poids facultatif w compris entre 0 et 1 (1 par défaut), converti en distance initiale de −log(w) : une page de départ de poids plus faible part avec un handicap. Une page de départ peut aussi regrouper plusieurs pages : le chemin part alors de celle de ses pages qui est la plus proche.

Comment Google mesure-t-il la distance entre 2 pages ?

Google mesure la distance entre 2 pages en additionnant la longueur des liens du plus court chemin qui les relie. Le brevet précise que la longueur d'un lien « peut être une fonction de n'importe quel ensemble de propriétés du lien et de sa source », propriétés qui « incluent, sans s'y limiter, la position du lien, la police du lien et le nombre de liens sortants de la page source ».

Son modèle principal repose sur le nombre de liens sortants de la page source : L(q → p) = α + log(|q|out), où |q|out est le nombre de liens sortants de la page q et α = −log(d), d étant le facteur d'amortissement du PageRank. La longueur « augmente à mesure que le nombre de liens sortants de la page source q augmente ». La fonction peut aussi intégrer un poids du lien. Le brevet montre que d'autres fonctions de longueur conviennent, y compris une longueur constante de 1 par lien, ce qui revient à compter les clics.

La distance entre une page de départ et une page est la plus courte somme de longueurs de liens : D(p) = min (D(q) + L(q → p)) sur l'ensemble des pages q qui pointent vers p, en partant de la distance initiale de la page de départ. Si aucun chemin n'existe, la distance est infinie. Un lien venant d'une page à 5 liens sortants est plus court qu'un lien venant d'une page à 500 liens sortants.

Comment la distance devient-elle un score de classement ?

La distance devient un score de classement par un score proportionnel à e^(−D(p)) : plus la distance est courte, plus le score est élevé. L'exponentielle transforme chaque lien du chemin en multiplicateur d/|q|out, soit la part de PageRank qu'une page transmet par chacun de ses liens. Le brevet justifie de ne garder que le meilleur chemin par une observation : « les contributions entrantes d'une page ont une distribution fortement asymétrique, de sorte que la somme de toutes les contributions entrantes est dominée par un seul ou par très peu de termes ». Le score est donc une approximation du PageRank par pages de départ, construite à partir du seul chemin le plus fort.

La distance retenue n'est pas celle de la page de départ la plus proche, mais celle de la k-ième page de départ la plus proche. Le brevet indique : « en pratique, il suffit de choisir pour k un petit entier, par exemple 3, 4, 5 ou 6 », et les revendications exigent que k soit supérieur à 1 et inférieur au nombre de pages de départ. Ce choix « permet de supprimer des scores injustement élevés dus à un manque de proportionnalité au voisinage des pages de départ ». Une page située à un lien d'une seule page de départ mais loin de toutes les autres reçoit le score de sa k-ième distance, pas celui de sa meilleure.

Que deviennent les pages que les pages de départ n'atteignent pas ?

Les pages que les pages de départ n'atteignent pas ne reçoivent aucun score. Le brevet est explicite : « une page qui ne peut être atteinte par aucune des pages de départ ne sera pas classée ». Comme la distance finale est la k-ième plus courte, la formule donne aussi une distance infinie à une page que moins de k pages de départ atteignent. Une ferme de liens peut se lier à elle-même des milliers de fois : si aucun chemin n'y mène depuis les pages de départ, ses liens internes ne produisent ni distance ni score.

Les liens situés sur ces k plus courts chemins forment un « graphe de liens réduit ». Il contient bien moins de liens que le graphe complet du web, conserve les mêmes plus courtes distances et donne à chaque page au plus k liens entrants. Il permet de remonter le flux de classement de chaque page jusqu'à ses k pages de départ les plus proches.

À quoi d'autre le brevet utilise-t-il les distances ?

Le brevet utilise les distances pour ajuster les pages de départ et pour guider l'exploration, l'indexation et le classement :

  • Ajustement des pages de départ. Le classement produit, pour chaque page classée, la liste des pages de départ les plus proches et la longueur des plus courts chemins. Le système peut s'en servir « pour évaluer la qualité et la contribution des pages de départ, puis modifier la liste des pages de départ et/ou leurs poids ».
  • Exploration. Le robot d'exploration « peut prioriser le processus d'exploration à l'aide des scores de classement ».
  • Recherche. Les pages sont indexées et classées avec ce procédé, et le moteur de recherche utilise ces informations de classement pour repérer les documents bien classés qui répondent à une requête. L'autorité propre à une requête relève d'un autre brevet, qui compte les liens des pages déjà classées sur cette requête.
  • Au-delà du web. La technique s'applique à « toute base de données hyperliée », y compris aux « documents hyperliés d'une entreprise ».

Comment le PageRank par pages de confiance se compare-t-il au PageRank d'origine ?

Le PageRank par pages de confiance se compare au PageRank d'origine sur 4 points :

PointPageRank d'originePageRank par pages de confiance
Point de départToutes les pages du webUn ensemble de pages de départ de confiance
Ce qui compteTous les chemins, additionnésLe plus court chemin depuis la k-ième page de départ la plus proche
Fermes de liens et bouclesPeuvent gonfler les scoresNe rapportent rien sans chemin depuis les pages de départ
Pages inaccessiblesReçoivent un score de baseNe reçoivent aucun score

Les 2 modèles partagent une règle : une page qui a beaucoup de liens sortants transmet moins par chacun d'eux. Le modèle du surfeur raisonnable affine encore cette règle en pondérant chaque lien selon sa probabilité d'être cliqué.

Que change le PageRank par pages de confiance pour votre SEO ?

Le PageRank par pages de confiance signifie que ce qui compte n'est pas qui vous fait des liens, mais à quel point ces liens vous rapprochent des sites de confiance. 5 conséquences en découlent :

  1. Obtenez des liens de pages proches des pages de départ. Les exemples de pages de départ du brevet sont un grand annuaire et un grand quotidien, et il suppose que les pages de départ sont « plus proches » des autres pages de qualité. Un lien venant d'une page située à quelques liens de ces sources réduit davantage votre distance que des dizaines de liens de pages qu'aucune page de départ n'atteint.
  2. Privilégiez les liens venant de pages ciblées. Dans le modèle principal, la longueur d'un lien augmente avec le logarithme du nombre de liens sortants : un lien venant d'une page qui compte peu de liens sortants est plus court qu'un lien venant d'un annuaire qui en compte des centaines. Le brevet cite aussi la position et la police du lien parmi les facteurs de longueur possibles.
  3. Soyez proche de plusieurs sites de confiance, pas d'un seul. Le score utilise la k-ième page de départ la plus proche, avec k un petit entier (de 3 à 6 dans les exemples du brevet) : la proximité avec une seule autorité ne suffit pas.
  4. Gardez chaque page accessible. Une page qu'aucun chemin n'atteint n'est pas classée : une page vers laquelle aucun lien ne pointe n'obtient rien. Chaque clic supplémentaire depuis votre page d'accueil allonge le chemin.
  5. Oubliez les fermes de liens et les échanges de liens. Les boucles et les réseaux fermés de sites ne rapportent rien quand aucun chemin court n'y mène depuis les pages de départ. Google peut détecter ces structures directement : les fermes et les cercles de liens laissent une signature mathématique dans le PageRank.

La confiance comme signal de classement va au-delà de la distance en liens : le brevet sur la confiance décrit comment Google peut classer les résultats selon les utilisateurs et les sources qui s'en portent garants.

Le brevet décrit ce que le système de Google peut faire. Il ne confirme ni les pages que Google utilise aujourd'hui comme pages de départ, ni que cette méthode a remplacé le PageRank d'origine.

Quiz express

Avez-vous tout compris ?

Testez ce que vous venez de lire.

Question 1 sur 4

Qu'est-ce qui détermine le score d'une page dans le PageRank par pages de confiance ?

Articles liés

Nous lisons les brevets pour que vous n'ayez pas à le faire.

Chaque semaine : 3 enseignements SEO étayés par les données, 1 mythe démonté, 1 méthode à reprendre. Sans remplissage. Sans conseils de gourou.

Gratuit pour toujours. Désinscription à tout moment. Nous respectons votre boîte mail. Confidentialité.