Un score de gain d'information est une mesure des informations nouvelles qu'un document apporte par rapport aux documents qu'un utilisateur a déjà vus sur le même sujet. Le brevet US 11,354,342 B2, « Contextual estimation of link information gain », décrit comment Google le calcule et l'utilise pour classer et présenter des documents. Google a déposé la demande internationale (PCT/US2018/056483) le 18 octobre 2018, la demande américaine a été publiée sous le numéro US 2020/0349181 A1 le 5 novembre 2020, et le brevet a été délivré le 7 juin 2022.
Que décrit le brevet US 11,354,342 ?
Le brevet US 11,354,342 décrit un système qui note les documents non encore vus selon les informations qu'ils apporteraient à un utilisateur donné, puis les sélectionne ou les reclasse selon ce score. Ses 2 inventeurs sont Victor Carbune et Pedro Gonnet Anders, tous deux basés en Suisse. Le brevet compte 16 revendications et 6 planches de dessins.
Le résumé donne la définition : un score de gain d'information « indique les informations supplémentaires contenues dans le document au-delà de celles des documents déjà consultés par l'utilisateur ». Dans les revendications, le score est « fondé sur une quantité d'informations nouvelles contenues dans le nouveau document » qui « diffèrent des informations extraites de chaque document du premier ensemble ». Le brevet applique ce score à 2 interfaces : une page de résultats de recherche et un assistant automatisé qui présente des informations, souvent lues à voix haute par synthèse vocale. La revendication 1 couvre le cas de l'assistant ; les revendications 5 et 10 couvrent les documents consultés par l'utilisateur, notamment depuis une page de résultats.
Quel problème le gain d'information résout-il ?
Le gain d'information résout la redondance des documents qui traitent d'un même sujet. L'exemple du brevet est une recherche sur un problème d'ordinateur : l'utilisateur reçoit « plusieurs documents qui proposent une liste similaire de solutions, d'étapes de dépannage, de ressources, etc. ». 2 documents peuvent être pertinents pour la requête, mais l'utilisateur « peut avoir moins d'intérêt à consulter un second document après avoir déjà vu des informations identiques ou similaires dans un premier document ou un ensemble de documents ».
La pertinence demande si un document correspond à la requête. Le gain d'information demande si le document apprend encore quelque chose à l'utilisateur.
Comment Google calcule-t-il un score de gain d'information ?
Google calcule le score en 5 étapes, présentées dans l'organigramme principal du brevet (FIG. 5) :
- Identifier un premier ensemble de documents qui partagent un sujet fourni par l'utilisateur et que celui-ci a déjà consultés (ou écoutés).
- Identifier un second ensemble de documents sur le même sujet que l'utilisateur n'a pas consultés.
- Déterminer un score de gain d'information pour chaque document du second ensemble, dans certaines mises en œuvre avec un modèle d'apprentissage automatique.
- Sélectionner un nouveau document selon les scores.
- Présenter les informations du document sélectionné à l'utilisateur.
Le modèle reçoit des données des 2 ensembles : les documents eux-mêmes ou une représentation sémantique de ceux-ci, comme « une représentation vectorielle (embedding), un vecteur de caractéristiques, une représentation en sac de mots, un histogramme généré à partir des mots et expressions du document ». Dans une configuration, n entrées sont réservées aux caractéristiques sémantiques des documents déjà présentés et m entrées au nouveau document, soit une dimension de n + m. Les entrées inutilisées peuvent rester vides ou être remplies de zéros, pour avoir peu ou pas d'effet sur le résultat.
La sortie peut être « un score quantitatif compris entre 0,00 et 1,00 », où 0,00 signifie qu'aucun gain d'information n'est attendu compte tenu des documents déjà vus, et 1,00 que le nouveau document ne contient que des informations que l'utilisateur n'a pas encore vues (le brevet parle de « gain d'information total »). Le brevet admet aussi d'autres formes, comme « une valeur sur une plage de nombres ».
Le score est-il le même pour tous les utilisateurs ?
Non. Le score est calculé pour un utilisateur, par rapport aux documents qui lui ont déjà été présentés. Une base de données des documents de l'utilisateur conserve des informations sur les documents présentés, comme les entités, un identifiant d'emplacement ou un vecteur sémantique du texte. Tant qu'aucun document n'a été consulté, le brevet indique qu'un score de gain d'information « peut ne pas être généré », ou qu'un score arbitraire identique peut être attribué à tous. Cette base propre à chaque utilisateur ressemble au profil d'utilisateur que Google construit pour personnaliser les résultats à partir de termes, de catégories et de liens.
La portée peut se limiter à une session : dans certaines mises en œuvre, « chaque fois qu'un sujet est fourni par l'utilisateur » ouvre « un ensemble indépendant de documents consultés qui n'est pas conservé d'un sujet à l'autre ». Dans d'autres, les références sont conservées après la fin de la session de recherche.
Le gain d'information ne remplace pas la pertinence. Le brevet décrit des documents d'abord notés par le moteur de recherche, puis « les scores peuvent être ajustés en fonction des scores de gain d'information ». La liste classée peut reposer « sur les scores de gain d'information et/ou sur un ou plusieurs autres scores ».
Comment le modèle est-il entraîné ?
Le modèle peut être entraîné sur des paires de documents étiquetées avec le gain d'information du second par rapport au premier. Chaque paire passe dans le modèle, la sortie est comparée à l'étiquette, et l'erreur sert à entraîner le modèle, avec des techniques comme la descente de gradient et la rétropropagation. Le brevet cite plusieurs types de modèles : des réseaux de neurones (« à propagation avant, convolutifs, etc. »), des « machines à vecteurs de support, des classifieurs bayésiens ». La revendication 15 précise un réseau de neurones.
Les étiquettes peuvent venir de personnes, de plusieurs façons :
- Des personnes lisent les documents et donnent « un score subjectif de gain d'information » sur la quantité d'informations nouvelles obtenues avec le second document après le premier.
- Des annotateurs humains attribuent une valeur au second document d'une paire, via un moteur d'annotation du gain d'information.
- Des personnes qui font simplement leurs recherches au quotidien peuvent se voir poser, par exemple « via un plugin de navigateur », des questions comme « Ce document ou cette information vous a-t-il été utile compte tenu de ce que vous avez déjà lu ? » ou « Ce document était-il redondant ? ».
- Un utilisateur en cours de session de recherche peut voir une fenêtre lui demandant d'évaluer les informations apportées par un document consulté.
Dans ces configurations, les étiquettes traduisent un jugement humain sur ce qui est nouveau et ce qui est redondant.
Les vecteurs sémantiques peuvent eux-mêmes venir d'un autre modèle entraîné : le brevet cite un auto-encodeur (par exemple word2vec) dont la partie encodeur génère la représentation sémantique de chaque document.
Comment le gain d'information modifie-t-il la page de résultats ?
Le gain d'information modifie la page de résultats au fil de la lecture. L'exemple du brevet utilise 4 documents pour la requête « Help me fix my computer ». Le Document 1 couvre le dépannage logiciel courant, le Document 2 ajoute des problèmes courants d'applications, le Document 3 couvre le dépannage matériel et des solutions logicielles, et le Document 4 couvre uniquement des solutions matérielles. Comme les Documents 1 et 2 se recoupent, le Document 2 obtient un score moins indicatif de gain d'information que les Documents 3 et 4, et le Document 4 obtient le plus élevé, car ses informations ne figurent « pas du tout » dans les autres.
Quand l'utilisateur ouvre le Document 1 puis revient aux résultats, les documents restants sont notés et classés à nouveau : « le Document 4 peut désormais apparaître plus haut dans la liste que le Document 2 ». Chaque nouveau document consulté passe du second ensemble au premier, et les scores sont recalculés.
Le brevet va plus loin. Un document jugé contenir des « informations identiques » à un autre document « peut être retiré de la liste (ou au moins fortement rétrogradé) » quand l'utilisateur y revient, ce qui peut traduire « un gain d'information nul ». Le document consulté lui-même peut être exclu de la liste mise à jour (revendications 8 et 13). Les pages presque identiques subissent un filtre comparable dès l'indexation, où Google crée des empreintes des pages pour n'en garder qu'une version.
Comment un assistant utilise-t-il le gain d'information ?
Un assistant automatisé applique la même logique pour sauter ce que l'utilisateur a déjà entendu. L'exemple du brevet est une question orale sur un message d'erreur d'ordinateur. Un premier document donne 2 éléments d'information, 2 causes possibles de l'erreur, tous deux lus par synthèse vocale. Après une relance comme « quelle autre cause pourrait expliquer ce message d'erreur ? », un second document contient la deuxième cause et une troisième. L'assistant détermine que « le deuxième élément d'information a déjà été transmis à l'utilisateur » et ne lit que le troisième.
Le brevet explique pourquoi c'est important à l'oral : écouter prend plus de temps que lire et l'utilisateur ne peut pas facilement parcourir ou sauter un passage, donc supprimer l'information redondante raccourcit la réponse et peut réduire le nombre d'interruptions et de tours de dialogue supplémentaires. Sur une page de résultats, le bénéfice annoncé est une session de recherche plus courte ou plus efficace, avec « moins d'interactions ».
Le gain d'information est-il la même chose que les consignes de Google sur le contenu utile ?
Non, pas au sens strict : le terme « gain d'information » n'apparaît pas dans le guide de Google sur la création de contenu utile, fiable et centré sur les personnes, mais les 2 vont dans le même sens. Le guide demande si un contenu apporte « des informations, reportages, recherches ou analyses originales » et « une analyse pertinente ou des informations intéressantes qui vont au-delà de l'évidence ». Le score du brevet exprime une idée proche, calculée par rapport à ce qu'un utilisateur donné a déjà vu.
Le brevet décrit ce que Google peut calculer, pas un facteur de classement confirmé. La question de la redondance fait écho au brevet Panda, dont les consignes de 2011 demandaient si un site contient « des articles en double, qui se recoupent ou se répètent ».
Que change le gain d'information pour votre SEO ?
Le gain d'information signifie qu'une page gagne sa place par ce qu'elle ajoute aux pages déjà positionnées, pas en les répétant. 5 conséquences en découlent :
- Lisez les premiers résultats avant d'écrire. Listez ce que toutes les pages positionnées disent déjà : dans la logique du brevet, ce sont les informations qu'un lecteur ayant vu l'une d'elles ne gagnerait pas une seconde fois.
- Ajoutez des informations que les autres n'ont pas. Données de première main, tests, exemples originaux, chiffres issus de votre propre travail et analyse experte forment le contenu qu'aucun concurrent ne peut dupliquer.
- Répondez à la question suivante. Un lecteur qui a vu le premier résultat a encore des questions. Couvrez les questions de suivi que les premiers résultats laissent ouvertes, comme l'assistant du brevet le fait avec « quelle autre cause ? ».
- Ne réécrivez pas le consensus. Dans les termes du brevet, une page qui paraphrase les 3 premiers résultats apporterait peu de gain d'information à un lecteur qui en a déjà lu un, et une page aux informations identiques peut être retirée ou rétrogradée.
- Structurez les parties uniques. Placez les informations originales dans des sections claires et autonomes, pour qu'un assistant ou un résumé génératif puisse les extraire comme la partie qui apporte de la valeur.
Notre marketing de contenu commence par l'étape 1 : nous listons ce que disent déjà les 10 premiers résultats, puis nous construisons chaque page autour des données de première main et des questions de suivi qu'ils laissent ouvertes.
Le brevet décrit ce que le système de Google peut faire. Il ne confirme pas que Google utilise aujourd'hui un score de gain d'information dans son classement.