S'inscrire à la newsletter
Signaux utilisateursBrevetsMises à jour

Réécriture de page, historique de clics et SEO : comment Google pèse les clics passés quand une page change

Par 9 min de lecture

Les statistiques de clics pondérées par version sont des signaux de qualité fondés sur les clics que Google conserve pour chaque version d'une page, et qu'il pondère selon l'ampleur des changements depuis cette version. Le brevet US 9,002,867 B1, « Modifying ranking data based on document changes », les décrit. Google l'a déposé le 30 décembre 2010, et le brevet a été délivré le 7 avril 2015.

Que décrit le brevet US 9,002,867 ?

Le brevet US 9,002,867 décrit une façon de continuer à utiliser les données de clics passées d'une page après un changement de contenu, en proportion de la ressemblance entre l'ancienne et la nouvelle version. Ses 2 inventeurs sont Henele I. Adams et Hyung-Jin Kim, inventeur du brevet des clics de Google. Le brevet compte 39 revendications et 6 planches de dessins.

Le résumé définit le cœur du système : « chaque statistique de qualité est pondérée par un poids déterminé au moins à partir de la différence entre le contenu d'une version de référence du document et le contenu de la version à laquelle correspond la statistique ». Les 3 revendications indépendantes (un procédé, un système et un support lisible par ordinateur) exigent toutes une façon précise de mesurer cette différence : comparer les répartitions dans le temps des shingles de l'ancienne version et de la version actuelle, décrites plus bas.

Quel problème le brevet résout-il ?

Le brevet résout le décalage entre les anciens clics et le nouveau contenu. Les statistiques de qualité viennent du comportement passé des internautes, par exemple « la fréquence à laquelle un utilisateur a choisi le résultat correspondant au document ». Quand une page change, les clics obtenus par l'ancien contenu peuvent ne rien dire du nouveau.

Le dessin du brevet montre une page personnelle qui parle d'abord d'animaux, avec des clics venus de requêtes comme « dog breeds », « wombat facts » et « information on cats », puis passe aux desserts : éclairs au chocolat, brownies, glaçage de cupcakes. Les clics venus de « wombat facts » ne décrivent plus la page. La réponse du brevet : « plutôt que d'ignorer toutes les statistiques passées quand un document change, le système peut les pondérer, par exemple par un score tiré de l'ampleur du changement ».

Comment Google mesure-t-il l'ampleur d'un changement ?

Le système mesure le changement en comparant chaque version passée à une version de référence, dans certaines mises en œuvre « la version la plus récente du document obtenue par le système », comme « la dernière version obtenue lors d'une exploration ». Les versions sont stockées à « la même adresse », la même URL. Le résultat est un score de différence, et le brevet décrit 4 façons de le calculer :

  1. Les « shingles » : « des suites contiguës de tokens d'un document », extraites de la page ou de ses extraits. Le système compare les 2 ensembles de shingles pour obtenir un score de similarité, puis prend son inverse comme score de différence. La formule d'exemple divise le nombre de shingles communs par le nombre de shingles distincts des deux versions réunies. Une variante divise par les shingles d'une seule version, ce qui « donne plus d'importance aux changements de la version la plus récente », et les shingles peuvent aussi être pondérés par leur fréquence documentaire inverse.
  2. La répartition dans le temps des shingles : chaque shingle est associé à la première fois où il a été observé, et les répartitions de ces dates sont comparées, par exemple par « la distance entre la moyenne d'une répartition et celle de l'autre ». Des versions proches ont des moyennes proches ; une version qui a changé radicalement, non.
  3. La comparaison de texte : sur le texte entier ou sur les parties importantes pour le classement, par exemple en cherchant « la plus longue sous-suite commune aux deux versions » et en calculant « le pourcentage de recouvrement des deux versions ».
  4. Les empreintes : un hachage des shingles de la page. 2 empreintes sont comparées bit à bit (un ou exclusif, puis la somme des bits qui diffèrent), avec une pénalité supplémentaire quand plusieurs empreintes ne correspondent que dans le désordre.

La comparaison peut ne porter que sur le texte hors gabarit. Le gabarit est repéré en comparant des documents apparentés, par exemple du même domaine, et en retenant « le texte commun à tous les documents, ou à la plupart », comme un texte commun à gauche ou en bas de page. Une fois ce texte retiré, un changement de gabarit n'a pas à compter comme un changement de contenu.

Comment les clics passés sont-ils pondérés ?

Les clics passés sont pondérés selon la ressemblance entre leur version et la version de référence. Chaque version reçoit sa propre statistique de qualité pour une requête ; le système pondère chacune par un poids tiré du score de différence et les combine en une « statistique de qualité globale pondérée ». La règle est explicite : « des scores de différence indiquant de plus grands écarts doivent donner des poids plus faibles que des scores indiquant de plus petits écarts ». Une version proche de la page actuelle garde plus de poids qu'une version sans ressemblance.

Le score de différence n'est pas le seul critère. Le poids peut aussi dépendre :

  1. Du nombre de changements de la page depuis la détection de cette version : « plus le document a changé de fois depuis la détection de la version, plus le poids est faible ». Une page souvent modifiée déprécie donc plus vite ses anciennes versions.
  2. De la durée pendant laquelle les versions suivantes sont restées inchangées : plus une version ultérieure est restée stable longtemps, plus le poids de l'ancienne baisse.
  3. De la quantité de données recueillies pour les versions suivantes : plus les nouvelles versions ont de données, moins celles de l'ancienne version comptent.

La fonction qui transforme ces critères en poids peut être linéaire, quadratique, en escalier ou polynomiale, « réglée à la main » ou obtenue par apprentissage automatique. Les statistiques peuvent être propres à une zone géographique, à une langue, ou aux deux.

Le système stocke la statistique pondérée pour chaque couple requête-document et, dans certaines mises en œuvre, une statistique non pondérée, combinée sans les poids tirés des différences. Quand une exploration détecte que la page a changé, le système peut recalculer les scores de différence par rapport à la nouvelle version et repondérer les statistiques.

Quand Google utilise-t-il la statistique pondérée ou non pondérée ?

Le système choisit à l'aide de critères comparés à des seuils, ou combinés en un score unique comparé à un seuil. Le brevet cite 4 critères :

  1. Le changement récent : si la dernière version explorée diffère suffisamment de la version utilisée pour calculer la statistique pondérée, le système utilise la statistique non pondérée, car les poids « ne reflètent pas correctement la version la plus récemment explorée du document ». Le seuil peut être fixé de façon empirique.
  2. Le renouvellement de la page elle-même : certains documents, « par exemple la page d'accueil d'un site d'actualités, renouvellent fréquemment leur contenu ». Au-delà d'un seuil, le système utilise la statistique non pondérée, car la statistique pondérée « reflète un seul moment de l'histoire en changement constant du document ».
  3. Le renouvellement des pages concurrentes : le système prend les premiers documents de la requête, compte ceux qui changent plus souvent qu'un premier seuil et, si ce nombre dépasse un second seuil, utilise la statistique non pondérée pour la requête.
  4. La catégorie de la requête : des catégories comme le sport, les célébrités ou les requêtes commerciales peuvent être associées à l'une ou l'autre statistique. Les requêtes classées comme « cherchant des informations récentes » utilisent la statistique pondérée, et l'exemple du brevet est celui des célébrités, « car ces requêtes cherchent plus probablement les informations les plus récentes ».

Le brevet ajoute une date butoir. Si les informations pertinentes pour une requête « n'auraient pas existé avant une date donnée », le système peut recalculer la statistique pondérée pour minimiser les données recueillies avant cette date, par exemple en donnant un poids nul aux versions plus anciennes. Son exemple est la requête « Results of Summer Olympics 2008 », pour laquelle les données antérieures à 2008 ne sont pas pertinentes.

Une page peut-elle être pénalisée parce qu'elle ne change pas ?

Oui : dans certaines mises en œuvre, le brevet décrit une pénalité pour les pages qui restent figées alors que les pages concurrentes changent. Le système « pénalise la statistique de qualité d'un document pour une requête quand ce document change peu dans le temps alors que les autres documents qui répondent à la requête », comme ceux aux meilleures statistiques, « changent dans le temps ». Le changement se mesure par sa fréquence ou par la quantité de contenu modifié. Le changement de la page est jugé faible quand il passe sous un seuil calculé à partir du changement des autres documents, et la pénalité consiste par exemple à « réduire la valeur de la statistique ».

La même idée d'une fraîcheur relative à la requête apparaît dans le brevet sur la vélocité des liens, où un rythme de nouveaux liens en baisse classe une page comme périmée.

Que change ce brevet pour votre SEO ?

Le brevet signifie qu'une page conserve son historique de clics à travers de petites mises à jour, mais le perd à proportion de l'ampleur d'une réécriture. 6 conséquences en découlent :

  1. Mettez à jour une page qui performe, ne la remplacez pas. De petites mises à jour ciblées gardent la page proche des versions qui lui ont valu ses clics, dont le poids est préservé.
  2. Préparez soigneusement les grandes réécritures. Une page réécrite de zéro garde peu de son historique de clics : attendez-vous à reconstruire ses signaux.
  3. Ne réaffectez pas une URL à un sujet sans rapport. Comme la page passée des wombats aux brownies, les anciens clics cessent de décrire la page, et le nouveau sujet doit gagner les siens.
  4. Un changement de gabarit n'est pas un changement de contenu. Le texte commun à tout le site peut être exclu de la comparaison : une refonte graphique seule n'a pas à remettre l'historique à zéro.
  5. Ne modifiez pas pour modifier. Chaque changement enregistré depuis la détection d'une version peut faire baisser le poids de cette version : une succession de retouches mineures peut éroder l'historique de clics plus vite qu'une mise à jour substantielle.
  6. Gardez vos pages à jour là où vos concurrents le sont. Sur les requêtes où les meilleures pages changent souvent, une page qui ne change jamais peut être pénalisée. Google peut savoir quelles requêtes demandent des pages récentes à partir des requêtes elles-mêmes, comme le décrit le brevet sur la fraîcheur des requêtes.

Notre marketing de contenu suit la règle 1 : les pages qui obtiennent des clics reçoivent des mises à jour ciblées, et les réécritures complètes sont réservées aux pages qui ont peu d'historique de clics.

Le brevet décrit ce que le système de Google peut faire. Il ne confirme pas comment Google pèse aujourd'hui les clics passés après le changement d'une page.

Quiz express

Avez-vous tout compris ?

Testez ce que vous venez de lire.

Question 1 sur 4

Comment la statistique de clics de chaque version est-elle pondérée ?

Articles liés

Nous lisons les brevets pour que vous n'ayez pas à le faire.

Chaque semaine : 3 enseignements SEO étayés par les données, 1 mythe démonté, 1 méthode à reprendre. Sans remplissage. Sans conseils de gourou.

Gratuit pour toujours. Désinscription à tout moment. Nous respectons votre boîte mail. Confidentialité.