Une réponse par entité est une réponse directe à une question, choisie parmi les entités du type attendu que les premiers résultats citent le plus souvent et le plus au cœur de leur sujet. Le brevet US 9,477,759 B2, « Question answering using entity references in unstructured data », décrit comment Google la choisit. Google l'a déposé le 15 mars 2013, et le brevet a été délivré le 25 octobre 2016.
Que décrit le brevet US 9,477,759 ?
Le brevet US 9,477,759 décrit un système de réponse aux questions qui lit les entités citées dans les premiers résultats d'une requête et renvoie la mieux classée comme réponse. Ses 2 inventeurs sont Dvir Keysar et Tomer Shmiel, qui ont aussi cosigné le brevet sur les questions associées. Le brevet compte 21 revendications et 8 planches de dessins.
Le brevet part d'une limite des systèmes antérieurs : les réponses « ont été déterminées à partir de questions déjà résolues par des utilisateurs et de bases de données constituées manuellement ». Ici, les réponses « peuvent être identifiées automatiquement à partir du contenu non structuré d'un réseau comme Internet », et le système peut « tirer parti des techniques de classement des résultats de recherche ».
Le résumé définit la méthode : une requête « associée au moins en partie à un type d'entité » est reçue, des résultats sont générés, des « données générées au préalable » contenant « les références d'entités du type correspondant dans les résultats » sont récupérées, ces références « sont classées », et « une réponse est fournie à partir de l'entité retenue ».
Qu'est-ce qu'une entité, et qu'est-ce qu'un type d'entité ?
Une entité est « une chose ou un concept unique, bien défini et distinguable », comme une personne, un lieu, un objet ou une idée. Un type d'entité est la catégorie à laquelle la réponse doit appartenir : « les types peuvent inclure les personnes, les lieux, les films, les musiciens, les animaux, etc. ». Le brevet se concentre sur les questions « qui », dont la réponse est une personne, et précise que la même technique peut répondre aux questions « quoi » ou « où ».
Une personne est définie au sens large : « un individu, un groupe de personnes, une entreprise, une entité juridique, une équipe ». Les exemples de questions « qui » du brevet incluent [Who was the first to climb Mount Everest?] et [Who won the 1997 World Series]. Une question « qui » peut aussi être implicite, sans point d'interrogation ni mot interrogatif : la requête [first to climb Mount Everest] « est interprétée comme une question “qui” ».
Comment Google trouve-t-il la réponse ?
Google trouve la réponse en 5 étapes :
- Recevoir une requête associée à un type d'entité, comme une question « qui ».
- Récupérer les premiers résultats, « par exemple les dix premiers résultats ».
- Récupérer les références d'entités de chaque résultat, une liste généralement établie hors ligne à l'avance (elle peut aussi être établie au moment de la recherche) avec, pour chaque entité, un identifiant, « sa fréquence d'apparition », « son emplacement dans la page » et des métadonnées comme la fraîcheur.
- Agréger et classer les références d'entités de l'ensemble des résultats.
- Renvoyer l'entité en tête comme réponse, sous forme de texte ou de phrase en langage naturel, éventuellement avec « une photo » ou « un lien vers une encyclopédie », affichée « avec les résultats de recherche ou à leur place ».
Comment fonctionne l'exemple du « roi d'Espagne » ?
Le dessin du brevet montre la requête [Who is the king of Spain?] avec 4 résultats, dont le système utilise les trois premiers. Le premier, intitulé « Monarchy of Spain », cite Juan Carlos 2 fois (une fois dans l'extrait, une fois ailleurs dans le résultat), Philippe II, « roi d'Espagne au XVIe siècle », 1 fois, et Mike Jones, « auteur d'un livre sur les rois d'Espagne », 1 fois. Le deuxième cite Juan Carlos 5 fois, Sophie de Grèce 3 fois et Bob Smith 1 fois. Le troisième cite Philippe II 2 fois, Isabelle 2 fois et Charles Quint 1 fois.
Le total compte « 7 occurrences de [Juan Carlos I] » dans les trois premiers résultats, contre 3 pour Philippe II et 3 pour Sophie de Grèce, et le système répond « The King of Spain is Juan Carlos I ». Le dessin montre les noms dans les extraits, mais le brevet précise que les références d'entités « peuvent apparaître dans tout contenu de la page », y compris dans son texte non structuré.
L'exemple date du dépôt, en 2013. Juan Carlos Ier a abdiqué en 2014 : le même comptage s'appuierait aujourd'hui sur des pages mises à jour depuis. La fraîcheur, que le brevet compte parmi ses signaux, est ce qui permettrait à la réponse de suivre un tel changement.
Quels signaux classent les références d'entités ?
2 signaux principaux classent les références d'entités, combinés en « une combinaison pondérée de signaux », où la pondération peut inclure « le classement des résultats de recherche ou d'autres mesures de qualité de la recherche » :
- La fréquence d'apparition : « le nombre total de fois où une entité apparaît dans un document », éventuellement normalisé « par la longueur du document ».
- Le score de pertinence thématique : il peut inclure « la fraîcheur, l'âge du document, le nombre de liens vers et depuis le document, le nombre de sélections du document dans les résultats passés, la force du lien entre le document et la requête ».
La pertinence thématique dépend de la page autant que de l'entité. Les exemples du brevet : « George Washington » a « un score plus élevé sur une page d'histoire que sur une page d'actualité », et « Barack Obama » un score plus élevé « sur un site politique que sur le site d'une faculté de droit ». Le classement et la sélection peuvent aussi s'appuyer sur « un score de qualité, un score de fraîcheur, un score de pertinence ».
Que protègent les revendications du brevet US 9,477,759 ?
Les 21 revendications se rattachent à 3 revendications indépendantes (un procédé, un système et un support lisible par ordinateur), et elles sont plus précises que la description :
- Les résultats de recherche sont classés « selon leur pertinence pour la requête », et seul le sous-ensemble « au-dessus d'un premier seuil de classement prédéterminé » est compté.
- Pour chaque référence d'entité, le système calcule « une somme pondérée des fréquences d'apparition » dans chaque résultat de ce sous-ensemble, une somme qui normalise la fréquence pour chaque jeu de données générées au préalable, puis classe les entités selon cette somme.
- En cas d'égalité, les revendications dépendantes ajoutent les résultats « sous le premier seuil de classement prédéterminé et au-dessus d'un second seuil prédéterminé », en tirent un signal de classement et reclassent les entités.
- D'autres revendications dépendantes normalisent la fréquence par « la longueur des données générées au préalable », calculent un score de pertinence thématique « selon le nombre de liens vers et depuis » ces données, et précisent que les données peuvent être non structurées.
Comment Google s'assure-t-il que la réponse est fiable ?
Google construit sa confiance en ajoutant des résultats jusqu'à ce qu'une réponse se détache. « Traiter seulement les deux premiers résultats peut donner une égalité ou une quasi-égalité » : le système « peut ajouter successivement les données des résultats suivants jusqu'à ce qu'une réponse soit nettement plus fréquente que les autres ». Le nombre de résultats traités peut dépendre de « la conception du système, des préférences de l'utilisateur, du type de requête », de la vitesse du système, des réponses déjà données ou de « la qualité d'une réponse identifiée ».
Les références d'entités sont identifiées « en comparant les mots et expressions du contenu à des références d'entités connues », comme une base de noms. Les noms inconnus peuvent être trouvés par regroupement statistique (clustering) : « un prénom et un nom qui apparaissent ensemble de façon répétée dans un texte non structuré peuvent être identifiés comme une référence d'entité ». Les autres noms du contenu désambiguïsent une référence : [George Washington] à côté de [Martha Washington] désigne le président des États-Unis, alors que [George Washington] à côté de [University] et de [Washington D.C.] désigne l'université George Washington.
Le brevet décrit aussi un graphe de connaissances dans lequel les références d'entités peuvent être stockées et qui sépare les entités portant le même nom. Ses exemples : la ville, le film et la marque de fromage frais nommés « Philadelphia » sont des nœuds distincts dotés de leur propre identifiant, et la ville de New York se distingue de l'État parce que l'une est reliée au type d'entité [City] et l'autre au type [State].
Que change la réponse par entités pour votre SEO ?
La réponse par entités signifie que la réponse donnée par Google est l'entité que les premières pages nomment le plus souvent et le plus au cœur de leur sujet : une désignation claire et cohérente dans vos contenus alimente la réponse. 5 conséquences en découlent :
- Positionnez-vous dans les premiers résultats. La réponse se construit à partir des entités des premiers résultats, « par exemple les dix premiers », et les revendications ne comptent que les résultats au-dessus d'un seuil de classement.
- Nommez la réponse explicitement. La fréquence compte, et les références sont trouvées en comparant des noms : écrivez le nom de l'entité dans le texte plutôt que de vous reposer sur des pronoms.
- Consacrez votre page au sujet de la question. La pertinence thématique augmente quand l'entité est au cœur de la page, comme George Washington sur une page d'histoire.
- Tenez vos pages factuelles à jour. La fraîcheur fait partie de la pertinence thématique, et l'exemple du roi d'Espagne montre à quelle vitesse une réponse peut changer.
- Désambiguïsez vos entités. Employez le nom complet et citez les entités liées (lieu, dates, fonctions, personnes proches), comme Martha Washington identifie le président, pour que le système relie votre mention à la bonne entité, comme le décrit le brevet sur le Knowledge Graph.
Le brevet décrit ce que le système de Google peut faire. Il ne confirme pas comment Google choisit aujourd'hui ses réponses directes.