S'inscrire à la newsletter
Compréhension des requêtesBrevetsSynonymes

SEO et synonymes en contexte : comment Google apprend des sessions de recherche quels mots peuvent se remplacer

Par 10 min de lecture

Un synonyme en contexte est un mot ou une expression qui peut en remplacer un autre dans une requête seulement quand les mots voisins le permettent. Le brevet US 7,636,714 B1, « Determining query term synonyms within query context », décrit comment Google apprend ces synonymes à partir de la façon dont les internautes reformulent leurs propres requêtes. Google l'a déposé le 31 mars 2005, et le brevet a été délivré le 22 décembre 2009.

Que décrit le brevet US 7,636,714 ?

Le brevet US 7,636,714 décrit une méthode qui exploite les journaux de requêtes pour trouver des paires de requêtes qui ne diffèrent que d'une expression, puis vérifie si les expressions échangées sont synonymes dans un contexte donné. Ses 2 inventeurs sont John Lamping et Steven Baker ; Steven Baker a aussi cosigné le brevet sur le contexte des titres pour les passages-réponses. Le brevet compte 19 revendications et 4 planches de dessins, et a été attribué à Google Inc.

Le résumé expose la méthode : les requêtes sont « triées par identité de l'utilisateur et par session » ; pour chaque requête, « plusieurs pseudo-requêtes sont déterminées », chacune « obtenue en remplaçant une expression de la requête par un symbole » ; les synonymes candidats sont des termes « employés dans une requête à la place de l'expression » ; leur solidité est évaluée ; les synonymes validés « peuvent être proposés à l'utilisateur ou ajoutés automatiquement à sa requête ».

D'où viennent les synonymes ?

Les synonymes viennent des internautes qui reformulent leurs propres recherches. Chaque requête est enregistrée « avec un identifiant d'utilisateur, un horodatage et une liste de résultats (par exemple les identifiants des dix premiers documents) ». Toutes les requêtes reçues sur une période, « par exemple une semaine », sont triées « par identifiant d'utilisateur (par exemple par cookie), puis par heure ». Une session est définie comme les requêtes d'un même appareil dans un intervalle donné, « par exemple une heure ». Le système cherche ensuite les paires de requêtes qui ne varient que d'une expression.

L'exemple de paire du brevet : [free loops for flash movie] suivi de [free music for flash movie]. Les requêtes au contexte trop pauvre peuvent être écartées : les requêtes analysées « peuvent devoir compter au moins trois termes ». Dans l'exemple de session du brevet, la requête [gm cars] est écartée pour cette raison.

Qu'est-ce qu'une pseudo-requête ?

Une pseudo-requête est une requête dans laquelle une expression est remplacée par un symbole qui joue le rôle de variable. Le brevet utilise le symbole « : ». Chaque suite d'un ou plusieurs termes consécutifs est remplacée tour à tour, « en laissant au moins deux mots dans les pseudo-requêtes ». À partir de [gm used car prices], le système forme 4 pseudo-requêtes : [: used car prices], [gm : car prices], [gm used : prices] et [gm used car :]. Toute requête qui correspond à ce modèle, comme [general motors used car prices], devient une paire candidate, et l'expression qui remplit le symbole, « general motors », devient un synonyme candidat de « gm ».

L'exemple détaillé du brevet compare les dix premiers résultats des requêtes. Dans le contexte de [gm used car prices], « general motors » partage 5 URL de résultats avec la requête d'origine, tandis que « ford » n'en partage aucune. Dans le contexte de [nutrition of gm food], c'est « genetically modified » qui partage 6 URL de résultats, tandis que « macdonalds » n'en partage aucune. Le nombre de résultats communs sépare le vrai synonyme du faux, et le bon synonyme de « gm » change avec les mots qui l'entourent.

Avant toute analyse de contexte, chaque expression garde ses dix candidats les plus significatifs, classés par une hiérarchie de tests : d'abord le nombre de requêtes liées dans les sessions, puis le nombre de résultats communs, puis la fréquence dans les requêtes de la pseudo-requête. Le brevet compte les requêtes distinctes plutôt que les répétitions : « il est plus significatif d'examiner de nombreuses requêtes distinctes que de compter les occurrences répétées d'une même requête ».

Comment Google vérifie-t-il un synonyme candidat ?

Google vérifie un synonyme candidat à l'aide de preuves tirées des sessions et des résultats de recherche. Le brevet cite 3 types de preuves et de tests :

  1. La co-occurrence dans les sessions : « la fréquence à laquelle les deux requêtes de la paire sont saisies par le même utilisateur dans un court intervalle ». Dans une mise en œuvre, « l'intervalle est d'une heure et la probabilité est de 0,1 % ou plus ».
  2. La probabilité de l'échange : pour chaque requête contenant l'expression A, la requête où B remplace A « a une probabilité modérément élevée d'apparaître dans les données ». Dans une mise en œuvre, la probabilité requise est de 1 %.
  3. Les résultats communs : les 2 requêtes ont « une probabilité minimale d'avoir un certain nombre de premiers résultats en commun », par exemple une probabilité de 60 à 70 % avec 1 à 3 résultats communs.

Des conditions de seuil peuvent s'appliquer d'abord, par exemple que « pour au moins 65 % des paires de requêtes, il y ait au moins un résultat commun », et que la requête modifiée suive l'originale « dans les cinq requêtes suivantes » avec une fréquence « d'au moins 1 sur 2 000 ». Le paramètre de 65 % « est établi empiriquement, et d'autres seuils peuvent être utilisés selon le corpus de documents ». Le brevet ajoute que les statistiques « devraient être recueillies sur au moins 1 000 requêtes contenant l'expression » pour être fiables.

Comment Google mesure-t-il la solidité d'un synonyme ?

Google mesure un synonyme en combinant 4 tests en une seule valeur de confiance appelée evidence. Chaque test compare un ratio mesuré à une valeur cible au moyen d'une fonction Scale, qui renvoie 0 quand le ratio égale la cible et tend vers 1 quand le ratio augmente. Les 4 tests sont :

  1. frequently_alterable : pour les requêtes contenant l'expression, la requête modifiée apparaît assez souvent dans les journaux, « de préférence plus de 1 % ».
  2. frequently_much_in_common : la requête d'origine et la requête modifiée partagent assez de résultats ; « de préférence, au moins 60 % des requêtes modifiées ont au moins 3 résultats en commun avec la requête d'origine ».
  3. frequently_altered : les internautes essaient de temps en temps l'échange ; « de préférence, pour 2 000 requêtes, il existe une requête modifiée correspondante dans la même session ».
  4. high_altering_ratio : les internautes ne font pas l'échange de préférence dans le sens inverse, ce qui « suggérerait que l'expression d'origine est bien meilleure que le synonyme candidat ».

La formule pondère les tests : soft_and = frequently_alterable + 2 × frequently_much_in_common + 0,5 × frequently_altered + high_altering_ratio, puis evidence = 1,0 - exp(-soft_and / 1,5). Les résultats communs pèsent le plus lourd. « Une valeur proche de 1,0 indique une confiance très élevée, tandis qu'une valeur de 0,6 traduit une bonne confiance », et pour de nombreuses applications un candidat peut être validé « si la valeur d'evidence est supérieure à 0,6 ». Le seuil dépend de l'application.

Pourquoi le contexte compte-t-il ?

Le contexte compte parce qu'un mot peut être synonyme dans un cadre et pas dans un autre. L'exemple du brevet utilise la paire [killer whale free photos] et [killer whale download photos]. L'échange de « free » par « download » apparaît dans 4 contextes : après « whale » (whale :), avant « photos » (: photos), entre les deux (whale : photos), et en général (:). Ces contextes sont des mots adjacents ; pour les synonymes dans les requêtes longues, un brevet Google plus récent vérifie le candidat grâce aux mots éloignés de la requête.

Les statistiques sont recueillies pour chaque contexte où une expression apparaît souvent, par exemple « les 10 000 contextes pour lesquels il existe le plus de requêtes », en ne gardant pour chaque contexte « que les 20 synonymes candidats les plus courants ». Les tests peuvent alors être menés pour chaque contexte séparément. La conclusion du brevet : « "download" n'est pas en général un bon synonyme de "free", c'en est un bon dans le contexte (: photos), et ce n'en est pas un dans le contexte (: press) ». Le brevet qualifie le contexte (: photos) d'« exception à la règle générale ». Des photos gratuites et des photos à télécharger répondent au même besoin ; une presse libre et une presse à télécharger, non.

C'est pourquoi le brevet écarte les listes figées. Un thésaurus est « coûteux à construire », « généralement limité à une langue », et manque les synonymes de contexte : « music » ne figure pas comme synonyme de « loop » dans les thésaurus courants, alors qu'il en est un dans [free loops for flash movie]. Le regroupement de « mots liés » échoue dans l'autre sens : « sail » et « wind » apparaissent ensemble dans de nombreux documents, « mais ils ne sont pas synonymes ».

Comment Google utilise-t-il les synonymes ?

Google utilise les synonymes validés pour proposer des requêtes alternatives ou élargir automatiquement la requête de l'internaute. L'organigramme du brevet montre la recherche : recevoir une requête, identifier les résultats, déterminer des synonymes candidats pour une expression à partir d'une liste prédéfinie, en déduire une requête modifiée, et identifier les résultats de cette requête. Le brevet décrit 3 niveaux d'usage :

  1. La suggestion (l'« approche prudente ») : des requêtes alternatives contenant le synonyme sont affichées avec les résultats de la requête d'origine, chacune liée à ses propres résultats.
  2. L'élargissement automatique (l'« approche plus agressive ») : l'expression est remplacée par une disjonction, par exemple « gm » serait remplacé par « gm » OR « general motors ». Une requête contenant « gm » peut alors trouver des pages qui ne disent que « general motors ». Cette disjonction est au cœur de la revendication 1.
  3. L'ajustement du score : le synonyme peut servir « uniquement à modifier le score associé aux documents trouvés » ; la revendication 11 modifie le classement des résultats « selon que les résultats contiennent ou non le terme de remplacement ».

Si les preuves en faveur d'un synonyme sont relativement faibles, il peut être utilisé « à titre indicatif plutôt que comme équivalent ».

L'idée que la pertinence dépend des mots qui entourent un terme traverse l'indexation par phrases, où les phrases liées se prédisent mutuellement.

Que change l'apprentissage des synonymes en contexte pour votre SEO ?

L'apprentissage des synonymes en contexte signifie que Google associe votre page aux mots que les gens veulent dire, pas seulement à ceux qu'ils tapent, mais uniquement là où le contexte le permet. 5 conséquences en découlent :

  1. Arrêtez de créer une page par synonyme. Si les internautes traitent 2 expressions comme interchangeables dans un contexte, Google peut élargir une requête à l'autre : une page solide sert les deux.
  2. Employez le vocabulaire de votre audience. Les synonymes viennent de la façon dont les vrais internautes reformulent : leur vocabulaire, abréviations comprises comme « gm », est celui que Google apprend. Leurs requêtes portent des signaux de temps : Google lit leurs dates et leurs termes pour décider quand les résultats récents comptent.
  3. Respectez les sens propres à chaque contexte. Un synonyme valable dans un contexte peut être faux dans un autre : ne supposez pas qu'un échange de mots fonctionne pour tous vos sujets.
  4. Vérifiez les résultats communs avant de cibler une variante. Le brevet valide les synonymes par les premiers résultats partagés : si 2 requêtes renvoient les mêmes pages, elles forment une seule cible ; sinon, deux.
  5. Écrivez pour l'intention, avec des variations naturelles. Couvrir un sujet avec les termes que les gens emploient autour permet à l'élargissement des requêtes de jouer en votre faveur.

Le brevet décrit ce que le système de Google peut faire. Il ne confirme pas comment Google apprend aujourd'hui les synonymes.

Quiz express

Avez-vous tout compris ?

Testez ce que vous venez de lire.

Question 1 sur 4

D'où le brevet apprend-il les synonymes ?

Articles liés

Nous lisons les brevets pour que vous n'ayez pas à le faire.

Chaque semaine : 3 enseignements SEO étayés par les données, 1 mythe démonté, 1 méthode à reprendre. Sans remplissage. Sans conseils de gourou.

Gratuit pour toujours. Désinscription à tout moment. Nous respectons votre boîte mail. Confidentialité.