La détection des quasi-doublons est l'identification des pages au contenu identique ou presque, pour qu'un moteur de recherche n'en garde qu'une. Le brevet US 6,658,423 B1, « Detecting duplicate and near-duplicate files », décrit une méthode par empreintes qui le fait à l'échelle du web. Google l'a déposé le 24 janvier 2001, et le brevet a été délivré le 2 décembre 2003.
Que décrit le brevet US 6,658,423 ?
Le brevet US 6,658,423 décrit une méthode qui attribue à chaque document quelques empreintes et déclare 2 documents quasi identiques dès qu'une seule empreinte correspond. Ses 2 inventeurs sont William Pugh et Monika H. Henzinger, inventrice du brevet sur l'historique des liens. Le brevet compte 38 revendications et 18 planches de dessins.
Le résumé condense la méthode : les empreintes sont attribuées « (i) en extrayant des parties du document, (ii) en répartissant ces parties dans un nombre prédéfini de listes, et (iii) en générant une empreinte pour chaque liste remplie. Deux documents peuvent être considérés comme quasi identiques si l'une de leurs empreintes correspond ».
D'où viennent les pages dupliquées ?
Les pages dupliquées viennent de 5 sources, selon le brevet :
- Les sites miroirs : des documents « dupliqués sur différents sites » pour réduire les délais et la latence.
- Les formats : un document peut avoir « une version texte brut et une version HTML », et davantage de versions à mesure que les appareils se multiplient.
- Les versions : des documents auxquels « des informations différentes ont été ajoutées au début ou à la fin ».
- Le remplacement de mots : des documents « générés à partir d'autres en remplaçant systématiquement certains mots ».
- L'agrégation : des documents qui « regroupent ou intègrent des documents disponibles ailleurs ».
La troisième source couvre les informations « liées à son emplacement sur le web, la date, la date de dernière modification, une version, un titre, un chemin de classement hiérarchique », car « une page web peut être classée dans plus d'une catégorie de la hiérarchie d'un site ». Les dessins du brevet montrent un cas concret : une recherche « aeron chair » renvoie 5 résultats pointant vers des URL différentes, sur plusieurs domaines, qui affichent tous la même fiche produit du fauteuil Aeron de Herman Miller avec un texte produit identique. Ces pages « ne diffèrent que par la date à laquelle la page a été récupérée » (« Monday, July 3 » ou « Tuesday, July 4 »), « la catégorie de la page » (« Home: Personal Care: Aeron Chair » ou « Home: Back Care: Chairs: Aeron Chair ») « et/ou le titre ». Sans détection, les 5 apparaîtraient dans les résultats, alors que « la plupart des internautes ne voudraient pas voir les autres après en avoir vu une ».
Retirer les doublons sert les internautes, et permet au moteur de « réduire ses besoins de stockage » et « les ressources nécessaires au traitement des index et des requêtes ». Le brevet note aussi que les doublons « peuvent signaler un plagiat ou une violation du droit d'auteur ».
Pourquoi les anciennes méthodes étaient-elles trop coûteuses ?
Les anciennes méthodes étaient trop coûteuses parce qu'elles exigeaient de nombreuses empreintes communes. Les techniques précédentes créaient des empreintes d'éléments comme « les paragraphes, les phrases, les mots ou les shingles (des suites de mots consécutifs qui se chevauchent) », et considéraient 2 documents comme quasi identiques s'ils partageaient plus d'un certain nombre d'empreintes, au moins 2 et « en général bien plus ». Compter les empreintes communes parmi « des milliards de documents » est « très coûteux en calcul et en stockage ».
Le brevet ajoute qu'écarter les empreintes uniques n'aide guère ces méthodes, car les documents restants « peuvent malgré tout n'avoir aucun quasi-doublon ».
La nouvelle méthode n'exige qu'une seule empreinte commune. Le brevet associe chaque empreinte à son document et trie ces paires par valeur d'empreinte : « seuls les documents aux empreintes concordantes » doivent être comparés, et les documents « sans aucune empreinte commune ne sont pas vérifiés ».
Comment fonctionne la méthode des empreintes ?
La méthode fonctionne en 3 étapes pour chaque document :
- Extraire les parties : le document peut d'abord être réduit à une « forme canonique », sans mise en forme ni composants non textuels. Les parties sont ensuite extraites : il peut s'agir de « sections, paragraphes, phrases, mots ou caractères », avec ou sans chevauchement (shingles), et ces réglages doivent être « appliqués de façon cohérente à tous les documents ». L'exemple du brevet utilise des mots isolés, sans chevauchement. Les mots vides peuvent être ignorés, et l'extraction peut écarter les documents courts, « par exemple de 50 mots ou moins », car « les pages d'erreur standard (signalant un lien mort, par exemple) sont en général courtes et ne doivent pas être traitées ».
- Répartir les parties dans des listes : chaque partie est hachée pour décider à laquelle d'un nombre fixe de listes elle appartient. Dans l'exemple du brevet, « le nombre de listes est fixé à quatre », et « chaque partie va dans une seule et unique liste ». Le hachage est « reproductible, déterministe et insensible à l'état » : le mot « the » est « toujours envoyé dans la même liste », quel que soit le document. Pour le texte des pages web, « trois à huit listes » devraient « donner de bons résultats », et de bons résultats ont été obtenus « avec trois listes et avec quatre listes ».
- Créer une empreinte par liste : chaque liste produit une empreinte, si bien qu'un document a autant d'empreintes que de listes. La fonction d'empreinte doit rendre « très improbable que deux listes différentes produisent la même empreinte », tandis que « deux listes identiques génèrent toujours la même empreinte ». Elle peut tenir compte de l'ordre des mots dans une liste, ou non.
2 documents sont quasi identiques « s'ils ont une empreinte en commun », et pourraient être considérés comme des doublons exacts si toutes leurs empreintes sont identiques. Quand 2 documents diffèrent de quelques mots, ces mots ne tombent que dans certaines listes : les listes intactes restent identiques et produisent toujours la même empreinte. Le nombre de listes fixe la tolérance : quand il augmente, « le nombre attendu de différences » nécessaires « avant que deux documents ne partagent plus aucune empreinte commune augmente ».
Une variante permet à chaque partie d'aller dans zéro, une ou plusieurs listes, chaque liste ayant sa propre fonction de hachage indépendante. Si une fonction de hachage répond « vrai » pour un mot avec une probabilité p, une liste reste inchangée après k mots différents avec une probabilité de (1-p)^k, et p comme le nombre de listes se règlent à partir de là. Comme les documents longs modifient davantage de listes, p peut être réduit progressivement pour les documents plus grands, afin de continuer à trouver les quasi-doublons. Les empreintes présentes dans un seul document peuvent aussi être retirées à l'avance, puisqu'elles ne peuvent jamais correspondre à un autre document.
Comment Google utilise-t-il la détection des quasi-doublons ?
Google peut utiliser la détection des quasi-doublons à 4 moments :
- Pendant l'exploration : « pour accélérer l'exploration et économiser de la bande passante en n'explorant pas les pages ou sites quasi identiques, d'après les documents découverts lors d'une exploration précédente ». L'un des 2 quasi-doublons est marqué comme « à ne pas traiter lors d'une exploration ultérieure ».
- Pendant l'indexation : « si plusieurs documents sont quasi identiques, un seul est indexé ».
- Au moment de la requête : les documents sont regroupés en grappes, et si 2 résultats d'une même grappe « répondent aussi bien à la requête (par exemple avec le même titre ou le même extrait) » et « apparaissent dans le même groupe de résultats (par exemple la première page) », seul « celui jugé le plus pertinent (par exemple grâce à un PageRank élevé ou à une date plus récente) est renvoyé ». Le résultat retiré est remplacé par le suivant : si le cinquième de 10 résultats double le deuxième, le cinquième est retiré et le onzième est ajouté. Dans l'exemple Aeron, les résultats 2 à 5 seraient retirés et remplacés.
- Pour réparer les liens morts : si une page n'existe plus, « un lien vers une page quasi identique peut être fourni ».
Quand les doublons sont purement éliminés, le brevet donne des exemples de celui à garder : « celui qui a le meilleur PageRank, la meilleure confiance de l'hôte, le plus récent ».
Comment les grappes de quasi-doublons sont-elles construites ?
Les grappes de quasi-doublons sont construites en supposant une propriété de transitivité : « si le document A est un quasi-doublon du document B, lui-même quasi-doublon du document C, alors A est considéré comme un quasi-doublon du document C », même si A et C ne correspondraient pas directement. Chaque document est comparé aux documents déjà traités : il rejoint la grappe d'un quasi-doublon, 2 grappes fusionnent quand un document les relie, et un document sans quasi-doublon ouvre une nouvelle grappe. Un document « n'appartient qu'à une seule grappe ».
Le brevet décrit aussi 2 autres usages des empreintes : réduire la collection avant d'appliquer une autre méthode de détection, et servir d'« étape de préfiltrage » à une technique plus fine et plus coûteuse. Dans ce cas, les paires signalées comme quasi-doublons sont vérifiées à nouveau, les autres sont « simplement écartées », et la méthode peut être réglée pour « pécher par excès de faux positifs ».
Quel lien entre ce brevet et les autres signaux de contenu dupliqué ?
Ce brevet retire les doublons de l'index et des résultats, tandis que d'autres brevets jugent la redondance du contenu : les consignes de Google Panda demandent si un site contient « des articles en double, qui se recoupent ou se répètent », et le brevet sur le gain d'information note ce qu'une page apporte au-delà des pages déjà vues. Le brevet sur les changements de document utilise les shingles, des suites de mots qui se chevauchent que ce brevet cite parmi les unités classiques des anciennes méthodes d'empreintes, pour mesurer l'ampleur des modifications d'une page.
Que change la détection des quasi-doublons pour votre SEO ?
La détection des quasi-doublons signifie que quand plusieurs de vos pages disent la même chose, Google en garde une et écarte les autres, et celle qu'il garde n'est pas forcément celle que vous voulez. 5 conséquences en découlent :
- Donnez une seule URL à chaque produit. L'exemple même du brevet est une fiche produit présente sur 5 URL qui ne diffèrent que par le chemin de catégorie, la date d'exploration ou le titre : utilisez une URL canonique par produit, vers laquelle pointent les catégories.
- Choisissez votre version canonique. La version conservée peut être celle au PageRank le plus élevé, la plus récente ou, quand les doublons sont éliminés, celle de l'hôte le plus fiable : indiquez à Google la version que vous préférez avec une balise canonical et un maillage interne cohérent.
- Réécrivez les descriptions fournisseurs. Les pages qui reprennent le même texte fabricant que d'autres boutiques risquent d'en être des quasi-doublons, et une seule version est alors affichée : un texte unique sort votre page de leur grappe.
- Ne comptez pas sur de petites variations. Les quasi-doublons du brevet diffèrent par une date, un chemin de catégorie et un titre, et la méthode est conçue pour détecter le « remplacement systématique de mots » : tant qu'une liste reste identique, une seule empreinte commune suffit.
- Ne misez pas sur les pages très courtes. Le brevet propose d'écarter les documents d'environ 50 mots ou moins, la longueur des pages d'erreur standard : une page aussi courte est jugée sans intérêt pour la comparaison.
Une revue SEO technique de notre équipe liste chaque URL qui sert le même produit, puis vérifie que les balises canoniques et les liens internes désignent la même version.
Le brevet décrit ce que le système de Google peut faire. Il ne confirme pas quelle méthode de détection des doublons Google utilise aujourd'hui.



