Le classement fondé sur la confiance est une méthode qui renforce un résultat de recherche selon la confiance accordée aux personnes et aux organisations qui l'ont étiqueté. Le brevet US 7,603,350 B1, « Search result ranking based on trust », la décrit. Google l'a déposé le 9 mai 2006, et le brevet a été délivré le 13 octobre 2009.
Que décrit le brevet US 7,603,350 ?
Le brevet US 7,603,350 décrit un moteur de recherche qui ajuste les scores de pertinence avec une mesure de la confiance associée aux entités qui ont étiqueté chaque document. Son unique inventeur est Ramanathan Guha, connu sous le nom de R.V. Guha, l'un des créateurs de RSS et de schema.org. Le brevet compte 14 revendications et 3 planches de dessins. 3 continuations portent le même titre : des demandes déposées en 2009, 2012 et 2014, délivrées sous les numéros US 8,352,467, US 8,818,995 et US 10,268,641.
Le résumé décrit toute la chaîne : le moteur « détermine les étiquettes associées aux documents sélectionnés, et les rangs de confiance des entités qui ont fourni ces étiquettes. Les rangs de confiance servent à déterminer les facteurs de confiance des documents. Les facteurs de confiance servent à ajuster les scores de pertinence des documents ».
Le brevet part d'un problème qu'il nomme clairement : sur les « sites de connaissance verticaux » (forums, sites d'avis, blogs d'experts), les utilisateurs savent à qui faire confiance, mais « lorsque l'utilisateur revient sur un moteur de recherche généraliste », cette information de réputation est perdue. L'invention l'intègre à la recherche web générale.
Qu'est-ce qu'une étiquette ?
Une étiquette est un marqueur descriptif qu'une entité associe à un contenu web. Le brevet définit l'entité au sens large : « une personne, un groupe, une organisation, un site web, une entreprise, une institution, une administration ou équivalent ». Un expert en appareils photo peut étiqueter le test d'un reflex numérique Canon comme « Professional review » ; un expert peut étiqueter un groupe de pages sur les symptômes du cancer du côlon, sur un site de santé, comme « Symptoms ».
Techniquement, une étiquette se trouve dans une annotation, notée <label, URL_pattern>. Le motif d'URL peut viser une seule page, un répertoire ou un site entier, et peut contenir des jokers et des expressions régulières : l'annotation « professional review » sur www.digitalcameraworld.com/review/ applique l'étiquette à tous les documents de ce répertoire. 4 détails comptent :
- Tout le monde peut étiqueter : les étiquettes peuvent venir de l'entité qui a créé le document ou d'un tiers.
- Une ancre de lien peut être une étiquette : quand une entité fait simplement un lien vers une page, « un robot d'exploration extrait l'étiquette du lien » et utilise le texte d'ancre comme étiquette.
- Une étiquette peut porter une note : elle « peut aussi inclure des valeurs numériques », une évaluation ou un degré d'importance.
- Les étiquettes sont collectées de 2 façons : par l'exploration des sites des entités, ou par des fichiers d'annotations que les entités soumettent.
Le brevet décrit une syntaxe de requête pour les étiquettes : « label:terme ». La requête « cancer label:symptoms » demande des documents sur le cancer qui ont été étiquetés comme portant sur les « symptoms ». Quand la requête contient une étiquette, seules les étiquettes correspondantes comptent. L'exemple du brevet : 3 entités étiquettent un test d'appareil photo « professional review » et une quatrième l'étiquette « negative review » ; pour l'étiquette de requête « professional review », « seules les trois premières étiquettes d'annotation seraient considérées comme correspondantes ».
Comment Google mesure-t-il la confiance entre entités ?
Google mesure la confiance à travers des relations explicites et implicites entre entités. Le brevet cite plusieurs sources :
- Un « bouton de confiance » sur le site d'une entité, qui enregistre que le visiteur fait confiance à cette entité.
- Des listes de confiance des entités auxquelles quelqu'un fait confiance, et des listes de vanité des entités qui font confiance au propriétaire du site.
- Des liens depuis la page web d'un utilisateur vers les pages d'entités de confiance.
- Les habitudes de visite : un utilisateur qui visite la page d'une entité « avec une certaine fréquence » est réputé lui faire confiance.
- Les carnets d'adresses e-mail et les listes de messagerie instantanée : les entités qui y figurent peuvent être enregistrées comme dignes de confiance.
Le brevet stocke chaque relation sous forme de tuple <entité1, entité2, valeur_de_confiance>, par exemple <3365, 1230, 1>. Dans un mode de réalisation, la valeur de confiance vaut 0 ou 1.
La confiance peut être propre à un sujet : <entité1, entité2, sujet, valeur_de_confiance>. Un utilisateur peut faire confiance à une entité « en matière de politique et d'économie, mais pas en matière de sport et de divertissement ». La confiance peut aussi être déduite par transitivité : si un utilisateur fait confiance à une deuxième entité et que celle-ci fait confiance à une première, le système peut attribuer une valeur de confiance entre l'utilisateur et la première entité.
La confiance n'est pas définitive. Le système peut renforcer ou affaiblir une relation, et peut la faire « décroître avec le temps si la relation de confiance n'est pas confirmée par l'utilisateur », par exemple par un nouveau clic sur le bouton de confiance. Les utilisateurs peuvent aussi modifier leurs relations de confiance, et l'exploration du web met régulièrement à jour les données de confiance.
Comment le rang de confiance est-il calculé ?
Le rang de confiance est calculé à partir de tout le réseau de relations de confiance, par un calcul de vecteur propre comparable au PageRank sur le réseau des liens. Le système stocke la confiance dans une matrice carrée M, où « chaque valeur M_ij indique la confiance de l'entité i envers l'entité j ». Le rang de confiance de l'entité i est la i-ème composante du vecteur propre associé à la valeur propre 1.
Dans un tel calcul, une entité à qui de nombreuses entités, elles-mêmes dignes de confiance, font confiance obtient un rang de confiance élevé. Pour la confiance par sujet, « une matrice de confiance M distincte est construite pour chaque sujet t » : une entité peut être bien classée dans un domaine et mal classée dans un autre. Les matrices par sujet peuvent aussi être agrégées selon des hiérarchies thématiques. Les rangs de confiance sont calculés dans un processus séparé, en amont des requêtes, et recalculés quand l'exploration met à jour les informations de confiance.
Comment la confiance modifie-t-elle le classement ?
La confiance modifie le classement par un facteur de confiance appliqué au score de pertinence de base d'un document, par exemple par multiplication. Le processus de la figure 4 se déroule en 7 étapes :
- Recevoir la requête : au moins un terme de requête, et éventuellement une ou plusieurs étiquettes.
- Retrouver les documents pertinents pour les termes de la requête, avec n'importe quel modèle de recherche (le brevet cite le PageRank comme exemple).
- Déterminer les étiquettes de chaque document, en comparant son URL aux motifs d'URL des annotations.
- Récupérer les rangs de confiance des entités dont les étiquettes correspondent aux étiquettes de la requête.
- Agréger les rangs de confiance par étiquette, puis combiner les valeurs agrégées en un facteur de confiance.
- Appliquer le facteur de confiance au score de base, « par exemple en le multipliant par le facteur de confiance ».
- Reclasser les résultats selon les scores ajustés par la confiance.
Le brevet décrit plusieurs façons d'agréger les rangs de confiance, et précise que d'autres sont possibles :
- Linéaire : un poids fixe (par exemple 1) appliqué à chaque rang de confiance avant de les additionner.
- Asymptotique : par exemple la somme des logarithmes des rangs de confiance, chaque entité supplémentaire ajoutant moins.
- Poids décroissant : un poids qui décroît à mesure que le nombre d'occurrences d'une même étiquette augmente ; par exemple, les rangs de confiance peuvent être ordonnés selon l'âge de l'annotation, avec un poids décroissant (ou au contraire croissant) pour la plus ancienne.
- Sigmoïde : une fonction de pondération sigmoïde.
L'exemple du brevet porte sur le test d'un appareil photo numérique Casio, pour une requête qui combine les termes « digital camera » et l'étiquette « professional review ». Le test porte 6 annotations : « Professional Review » par Phil Photo (rang de confiance 8), Earl Expert (6) et Chris Click (7) ; « Digital SLR » par Phil Photo (8) et Eddy Shooter (2) ; « Best buy » par Betsy Buyer (3). L'agrégation linéaire donne 21 pour « Professional Review », 10 pour « Digital SLR » et 3 pour « Best buy ». Seule l'étiquette qui correspond à la requête alimente le facteur de confiance : le 21 compte, les autres étiquettes n'ajoutent rien. La page de résultats affiche, à côté de chaque résultat, le nom de l'entité qui a fourni l'étiquette correspondante.
Le classement par la confiance fonctionne-t-il sans étiquette dans la requête ?
Oui : le classement par la confiance s'applique aussi aux requêtes ordinaires, sans étiquette. Le brevet indique que le système peut « recevoir des requêtes qui n'incluent pas d'étiquettes, et fournir quand même un classement fondé sur la confiance ». Dans ce cas, les rangs de confiance des entités à l'origine des annotations applicables à un document sont récupérés, agrégés et appliqués à son score de base, puis les résultats sont reclassés.
Les revendications sont plus étroites que la description. Chacune des 14 revendications exige une requête contenant un « terme d'étiquette de requête », décrit comme un « identifiant catégoriel ». La méthode revendiquée augmente le score de pertinence d'un résultat selon le rang de confiance de l'entité qui a associé l'étiquette correspondante, classe les résultats, et affiche à côté de chaque résultat le nom de cette entité. Les revendications 3, 5, 9 et 11 ajoutent l'agrégation de 2 rangs de confiance en un facteur de confiance.
Ce brevet est-il le même que TrustRank ?
Non : ce brevet n'est pas TrustRank. TrustRank est un algorithme publié en 2004 par Zoltán Gyöngyi, Hector Garcia-Molina et Jan Pedersen, chercheurs à l'université Stanford et chez Yahoo, pour distinguer les bonnes pages du spam en propageant la confiance depuis un ensemble de pages de départ à travers les liens.
Les 2 idées diffèrent par leur source de confiance :
| Point | TrustRank (Stanford et Yahoo, 2004) | Brevet sur la confiance (Google, 2006) |
|---|---|---|
| Qui reçoit la confiance | Des pages de départ | Des personnes et des organisations |
| Comment la confiance circule | Par les liens entre pages | Par la confiance déclarée entre entités |
| Ce qui est noté | Toute page accessible par les liens | Les pages étiquetées par des entités de confiance |
| Objectif principal | Lutter contre le spam | Classer les résultats selon l'avis des experts |
L'approche par les liens la plus proche de TrustRank chez Google est le modèle des pages de confiance, qui mesure la distance en liens entre une page et des pages de départ de confiance.
Que change le brevet sur la confiance pour votre SEO ?
Le brevet sur la confiance signifie qu'une page gagne en force de classement quand des entités de confiance l'étiquettent avec des termes qui la décrivent. 6 conséquences en découlent :
- Faites-vous recommander par les experts de votre domaine. Le facteur de confiance dépend du rang de confiance des entités qui étiquettent votre page, pas seulement de leur nombre.
- Construisez la confiance sujet par sujet. Dans la version par sujet, chaque sujet a sa propre matrice de confiance : une autorité dans un domaine ne se transfère pas automatiquement à un autre.
- Obtenez la bonne étiquette, pas n'importe quelle mention. Quand la requête contient une étiquette, seules les étiquettes correspondantes comptent. Être étiqueté « professional review » compte pour cette requête ; une étiquette d'une catégorie sans rapport n'ajoute rien.
- Soignez les ancres de lien venant de sites de confiance. Un lien depuis le site d'une entité peut devenir une annotation, avec le texte d'ancre comme étiquette : une ancre descriptive venant d'un expert de confiance vaut recommandation sur ce sujet.
- Entretenez les relations de confiance. La confiance entre entités peut décroître avec le temps si elle n'est pas confirmée : une réputation acquise une fois n'est pas garantie pour toujours.
- Rendez vos auteurs identifiables. Les rangs de confiance appartiennent à des entités, et les résultats affichent le nom de l'entité à l'origine de l'étiquette correspondante : un expert nommé, avec un parcours public, peut accumuler de la confiance, ce qu'une source anonyme ne peut pas faire.
Le même principe de confiance gagnée auprès de sources indépendantes traverse Google Panda, qui ne compte que les liens de sites sans rapport avec le site cible.
Le brevet décrit ce que le système de Google peut faire. Il ne confirme pas que Google utilise aujourd'hui des étiquettes ou des rangs de confiance dans ses résultats.