La notation des passages-réponses est la méthode qu'utilise Google pour évaluer les passages qui se disputent la réponse à une question, en combinant leur correspondance avec la requête, leur correspondance avec la réponse probable, et des signaux de qualité du passage. Le brevet US 9,940,367 B1, « Scoring candidate answer passages », la décrit. Google l'a déposé le 12 août 2015, à partir d'une demande provisoire du 13 août 2014, et le brevet a été délivré le 10 avril 2018.
Que décrit le brevet US 9,940,367 ?
Le brevet US 9,940,367 décrit un système qui génère des passages candidats à partir des ressources les mieux classées pour une requête-question, note chacun d'eux, et choisit le meilleur pour un encadré de réponse. Ses 8 inventeurs sont Steven D. Baker, Srinivasan Venkatachary, Robert Andrew Brennan, Per Bjornsson, Yi Liu, Hadar Shemtov, Massimiliano Ciaramita et Ioannis Tsochantaridis. Le brevet compte 20 revendications et 12 planches de dessins.
Le passage-réponse est affiché « séparément et distinctement des résultats de recherche, par exemple dans un encadré de réponse ». Le brevet n'emploie pas les mots « extrait optimisé », mais il décrit ce type de réponse.
D'où viennent les passages candidats ?
Les passages candidats viennent des N premières ressources renvoyées pour la requête. Le brevet précise que « la valeur de N peut varier », et que dans certaines mises en œuvre N est « égal au nombre de résultats renvoyés sur la première page de résultats ». Il ajoute qu'« un ensemble plus large de ressources peut aussi être utilisé » : les N premières ressources sont le cas décrit par défaut, pas une limite absolue.
Chaque ressource est découpée en unités de passage : « une phrase complète, une partie de phrase, un titre, ou un contenu structuré, comme un élément de liste ou une cellule ». Le système assemble des candidats à partir des unités qui respectent un ensemble de critères de sélection.
Quel contenu peut entrer dans un passage candidat ?
Un contenu entre dans un passage candidat seulement s'il respecte des critères qui diffèrent pour le texte courant et pour le contenu structuré. Pour le texte courant, le brevet donne 7 exemples, qu'il qualifie d'« illustratifs » :
- Des phrases complètes : une phrase partielle est écartée ou complétée jusqu'à obtenir une phrase entière.
- Un nombre minimal de mots : les unités trop courtes sont écartées ou complétées.
- La visibilité : un texte « affiché de façon invisible pour l'utilisateur » est exclu.
- Pas de texte générique : un texte détecté comme passe-partout est exclu.
- L'alignement : un contenu qui n'est pas contigu au passage est exclu.
- Une seule section : des textes placés sous des titres différents ne se mélangent pas dans un même passage, et un titre ne peut être que la première phrase.
- Pas de légendes d'image : une légende ne peut pas se combiner avec d'autres unités.
Le brevet mentionne aussi une taille maximale de passage et « l'exclusion du texte d'ancre » comme critères supplémentaires.
Quelles règles s'appliquent aux listes et aux tableaux ?
Les listes et les tableaux suivent des critères de contenu structuré qui visent une réponse complète et cohérente. Le brevet les décrit ainsi :
- La génération incrémentale de liste : le système prend une unité dans chaque élément de liste avant d'en prendre une seconde, pour qu'« une liste complète ait plus de chances d'être générée ». Dans l'exemple du thermomètre, la réponse ne garde que la première phrase de chaque élément, car une taille maximale a été atteinte : « dans les listes courtes, la deuxième phrase d'un élément de liste à plusieurs phrases est moins informative que la première ».
- Toutes les étapes d'une liste d'étapes : quand des termes d'ordre comme « étapes », « premièrement », « deuxièmement » sont détectés, « toutes les étapes sont incluses ». Si l'inclusion de toutes les étapes dépasse la taille maximale du passage, le candidat est écarté dans certaines mises en œuvre, alors que dans d'autres la limite de taille est ignorée pour ce passage.
- L'ordre superlatif : pour une requête superlative comme [longest bridges in the world], le système sélectionne les lignes par ordre décroissant de l'attribut, par exemple les lignes des 3 ponts les plus longs dans un tableau de 100.
- Les requêtes informationnelles : pour [nutritional information for Brand X breakfast cereal], le système peut sélectionner « le tableau entier ».
- Les requêtes sur l'attribut d'une entité : pour [calcium nutrition information for Brand X breakfast cereal], il ne sélectionne que les valeurs qui décrivent le calcium.
- Les paires clé-valeur : chaque unité doit contenir une paire clé-valeur complète, jamais une clé sans sa valeur.
Le mélange de texte et de structure suit 2 règles de plus. Une fois qu'un contenu structuré est dans le passage, « un contenu non structuré ultérieur ne peut pas y être ajouté ». Et la phrase qui précède un tableau est vérifiée pour détecter une référence énumérative : dans l'exemple des frais de bagages, elle commence par « These » (« Ces »), donc « seule cette phrase est incluse » avant le tableau ; sinon, « deux phrases ou plus précédant le contenu structuré sont incluses ».
Comment Google note-t-il un passage par rapport à la requête ?
Google attribue à chaque passage un score lié à la requête qui combine 2 scores de correspondance :
- Le score de correspondance avec la requête : la similarité entre les termes de la requête et le passage. Dans certaines mises en œuvre, il est « proportionnel au nombre de correspondances entre les termes de la requête et les termes du passage candidat », avec des termes « pondérés, par exemple, par leurs valeurs TF/IDF ».
- Le score de correspondance avec les termes de réponse : la similarité entre le passage et les termes susceptibles de figurer dans la réponse.
Les 2 scores sont additionnés, multipliés ou « combinés d'autres façons appropriées ».
Que sont les termes de réponse ?
Les termes de réponse sont les termes qu'emploient les résultats les mieux classés pour répondre à la question. Le brevet explique pourquoi ils sont nécessaires : les requêtes-questions « ne décrivent pas ce que l'utilisateur cherche, puisque la réponse lui est inconnue ». Dans certaines mises en œuvre, les termes de réponse probables sont « tirés des N premières ressources renvoyées pour la requête ». Le système construit le score en 5 étapes :
- Lister les termes des ressources les mieux classées dans un vecteur de termes ; les mots vides peuvent être omis.
- Pondérer chaque terme par « le nombre de ressources du sous-ensemble le mieux classé dans lesquelles il apparaît, multiplié par sa valeur d'IDF (fréquence inverse de document) ». L'IDF peut venir d'un large corpus de documents ou des N premiers documents.
- Compter chaque terme dans le passage candidat.
- Multiplier le poids par le nombre d'occurrences.
- Combiner les poids multipliés, par exemple en les additionnant, pour obtenir le score de correspondance avec les termes de réponse.
L'exemple du brevet utilise le terme « apogee » avec un poids de 0,04 : un passage qui le contient 2 fois obtient 0,08, et un passage qui le contient 3 fois obtient 0,12. Avec cette formule, un terme présent dans beaucoup de premiers résultats et doté d'un IDF élevé pèse le plus : c'est le vocabulaire de la réponse.
Comment le type d'entité attendu change-t-il le score ?
Le score de correspondance avec les termes de réponse baisse quand le passage ne nomme aucune entité du type que la réponse exige. Le système détermine un type d'entité pour la réponse, soit à partir des termes aux scores les plus élevés, soit à partir de la requête : pour [who is the fastest man], le type d'entité est « man » (homme). Il identifie ensuite les entités décrites dans chaque passage. Dans l'exemple du brevet, un passage sur les sprinteurs olympiques et le 100 mètres perd des points, car « le terme “sprinter” est neutre en genre ». Le score peut être binaire (1 si un terme du bon type est présent, 0 sinon) ou une probabilité que le bon terme figure dans le passage.
Quels signaux notent un passage indépendamment de la requête ?
6 signaux indépendants de la requête notent le passage dans le processus d'exemple du brevet, qui précise que « davantage ou moins de critères de notation peuvent être utilisés » :
- La position : plus le passage est placé haut dans la page, plus son score est élevé.
- Le modèle de langage : les passages en phrases complètes l'emportent sur les phrases partielles, et un modèle de trigrammes compare le passage aux passages-réponses historiques, « des passages-réponses qui ont été servis pour toutes les requêtes », car les réponses servies partagent « une structure de n-grammes similaire », puisqu'elles « contiennent des énoncés explicatifs et déclaratifs ». Le contenu structuré en est exempté dans certaines mises en œuvre : une ligne de tableau peut avoir un score de modèle de langage très faible tout en étant très informative, c'est pourquoi elle « n'est pas soumise à la notation par le modèle de langage ».
- Les limites de section : un passage « est pénalisé s'il contient du texte qui franchit des limites de mise en forme, comme des paragraphes ou des sauts de section ».
- Les termes interrogatifs : un passage qui contient une question obtient un score inférieur à un passage composé « uniquement d'énoncés déclaratifs ». L'exemple : « The moon is approximately 238,900 miles from the Earth » l'emporte sur un passage qui demande à quelle distance se trouve la Lune.
- Les termes de rupture du discours : un passage qui commence par « inversement », « cependant » ou « d'un autre côté » reçoit un score faible ; un passage qui contient un tel terme plus loin obtient un meilleur score, et un passage qui n'en contient aucun obtient le meilleur.
- Les scores de la ressource : le score de classement de la page pour la requête, son score de réputation (« la fiabilité et/ou la probabilité que le sujet de la ressource serve bien la requête ») et le score de qualité du site qui l'héberge. « En général, plus ces scores sont élevés, plus le score de réponse sera élevé. »
Ces composantes sont additionnées, multipliées ou combinées d'autres façons pour former le score indépendant de la requête.
Comment le score final de réponse est-il calculé ?
Le score final de réponse combine le score lié à la requête et le score indépendant de la requête, là encore par somme, produit ou autre méthode. Le brevet laisse place à des variantes : « seul le score lié à la requête peut être utilisé pour le score de réponse », et le score de réponse « peut être ajusté par des processus de notation supplémentaires ». Le passage qui obtient le meilleur score est celui qui est choisi et affiché avec les résultats.
Quel lien entre ce brevet et le brevet sur le contexte des titres ?
Ce brevet note le passage lui-même, tandis que le brevet sur le score de contexte ajuste ce score selon les titres placés au-dessus du passage. Steven D. Baker et Srinivasan Venkatachary ont signé les deux. Les 2 brevets s'accordent sur les questions : une question à l'intérieur du passage fait baisser son score, alors qu'une question juste avant le passage, idéalement comme titre, le fait monter.
Les scores de la ressource incluent le score de qualité du site, le type de signal à l'échelle du site décrit dans le brevet sur le score de qualité de site.
Que change la notation des passages-réponses pour votre SEO ?
La notation des passages-réponses signifie que le passage que Google extrait est une réponse courte, déclarative et autonome, qui emploie le vocabulaire des premiers résultats. 8 conséquences en découlent :
- Positionnez-vous d'abord dans les premiers résultats. Dans la mise en œuvre décrite, les candidats viennent des N premières ressources, et N peut correspondre à la première page.
- Employez le vocabulaire de la réponse. Les termes qu'emploient la plupart des premiers résultats ont le poids de réponse le plus élevé. Couvrez-les dans la réponse elle-même.
- Répondez par des phrases déclaratives. Énoncez la réponse (« La Lune se trouve à environ 384 400 km de la Terre »), et placez la question dans le titre, pas dans la réponse.
- Gardez chaque réponse dans une seule section. Les passages qui franchissent des paragraphes ou des sections sont pénalisés, et les unités placées sous des titres différents ne se mélangent pas.
- N'ouvrez pas une réponse par « cependant ». Les termes de rupture du discours en début de passage font baisser son score.
- Construisez des listes complètes avec des termes d'ordre. Les listes d'étapes avec « premièrement », « deuxièmement » ou « étapes » sont reprises en entier : gardez-les assez courtes pour tenir dans un passage, et placez l'information clé dans la première phrase de chaque élément.
- Nommez l'entité qu'attend la question. Pour une question en « qui », un passage qui nomme une personne du type attendu évite la pénalité de type d'entité. Pour ces questions, un autre brevet sur les réponses par entités compte les entités nommées dans les premiers résultats.
- Utilisez des tableaux propres et des paires clé-valeur. Les tableaux permettent au système de choisir les lignes qui répondent aux questions superlatives ou sur un attribut, et une courte phrase commençant par « Ces » peut introduire le tableau.
Notre travail de SEO sémantique applique ces 8 règles à chaque section de réponse, en commençant par le vocabulaire que partagent les premiers résultats sur la question.
Le brevet décrit ce que le système de Google peut faire. Il ne confirme pas que les extraits optimisés utilisent aujourd'hui ces signaux exacts.