S'inscrire à la newsletter
Structure de pageBrevetsPertinence

La distance sémantique en SEO : comment Google mesure la proximité de vos termes grâce aux listes, titres et intertitres

Par 9 min de lecture

La distance sémantique est une mesure de la proximité de 2 termes dans une page selon sa structure, comme les listes, les intertitres et les titres, plutôt que selon le seul nombre de mots qui les séparent. Le brevet US 7,716,216 B1, « Document ranking based on semantic distance between terms in a document », décrit comment Google la calcule et l'utilise pour classer les pages. Google l'a déposé le 31 mars 2004 (demande 10/813,573), et le brevet a été délivré le 11 mai 2010, avec un ajustement de durée de 559 jours.

Que décrit le brevet US 7,716,216 ?

Le brevet US 7,716,216 décrit un module de classement qui détecte les structures sémantiques d'une page, calcule avec elles les distances entre les termes de la requête, et note la pertinence de la page à partir de ces distances. Ses 2 inventeurs sont Georges R. Harik et Monika H. Henzinger, inventrice du brevet de Google sur l'historique des liens. Le brevet compte 21 revendications et 11 planches de dessins. Son module de classement a 3 parties : un analyseur de page qui détecte les listes (y compris implicites), les intertitres et les titres ; un composant de distance qui calcule une distance pour chaque paire de termes ; et un composant de pertinence qui transforme ces distances en score de pertinence.

Le résumé le condense : les techniques « repèrent des structures sémantiques définies implicitement dans un document, par exemple des listes implicites dans un document HTML », et « les distances peuvent servir à générer des scores de classement qui indiquent la pertinence du document pour une requête ».

Pourquoi le nombre de mots ne suffit-il pas ?

Le nombre de mots ne suffit pas parce que le code HTML d'une page ne suit pas sa présentation visuelle ou logique. Les moteurs tiennent compte de « la proximité des termes », souvent mesurée « en comptant le nombre de mots entre les termes recherchés ». Mais dans les pages web à la mise en forme complexe, « la proximité des termes dans le fichier HTML peut ne pas correspondre à leur proximité à l'affichage ».

L'exemple du brevet est une liste intitulée « Saturn Facts ». Sur le plan du sens, chaque ligne est « probablement aussi pertinente que toutes les autres lignes et que le titre de la liste » : l'élément « Mass is 95 times that of Earth » doit être « considéré comme aussi éloigné du titre de la liste que l'élément "One Orbit of Sun is 10,759.2 Days" », quelles que soient leurs positions.

Comment Google détecte-t-il les listes dans une page ?

Google détecte les listes en analysant la page sous forme d'arbre et en cherchant les mises en forme répétées. Les listes explicites utilisent les balises HTML <ul> et <ol>. Mais « les auteurs web utilisent souvent d'autres balises que <ul> et <ol> pour créer des listes », comme des tableaux imbriqués ou des balises <div>, <br> ou <p>.

Le brevet détecte ces listes implicites « en cherchant des ensembles de deux commandes de mise en forme ou plus qui se répètent ». Dans son exemple, chaque élément de la liste sur Saturne est un mot en gras (<b>) suivi d'un retour à la ligne (<br>) : la répétition de cette paire définit les éléments. Des règles particulières traitent le premier ou le dernier élément, par exemple quand le premier <br> manque.

Les intertitres et les titres sont eux aussi détectés dans l'arbre, comme « du texte associé à des nœuds situés au-dessus d'autres nœuds dans l'arbre ». Le texte placé sous un nœud d'intertitre ou de titre « peut être considéré comme appartenant » à cet intertitre ou à ce titre.

Comment Google mesure-t-il la distance entre 2 termes d'une liste ?

Google mesure la distance avec 3 règles qui ajustent le nombre de mots, pour une liste composée d'un en-tête et d'éléments :

  1. Même élément : « si les deux termes apparaissent dans le même élément de liste, ils sont considérés comme proches ».
  2. En-tête et élément : si un terme est dans un élément et l'autre dans l'en-tête, la paire est « à peu près aussi éloignée » que toute paire formée par l'en-tête et un autre élément.
  3. Éléments différents : « les paires de termes situés dans des éléments différents peuvent être considérées comme plus éloignées » que celles des règles 1 et 2.

L'illustration du brevet : le dernier mot de l'élément A et le premier mot de l'élément B « peuvent être très proches en nombre de mots », et pourtant « la mesure de distance peut indiquer qu'ils sont plus éloignés ».

Le point de départ reste le nombre de mots : les mesures de distance « peuvent reposer de façon générale sur l'écart entre les termes, mesuré par exemple par le nombre de mots », puis sont « enrichies par la notion de proximité sémantique ». Le brevet résume le résultat : « les termes situés dans des éléments différents d'une liste, les termes séparés par la structure ou les termes séparés par de nombreux mots sont considérés comme éloignés ».

Comment les titres et les intertitres modifient-ils les distances ?

Les titres et les intertitres rapprochent leurs termes du texte qu'ils introduisent. « Un terme du titre d'un document peut être considéré comme proche de tous les autres termes du document, quel que soit le nombre de mots qui les sépare ». « Un terme d'un intertitre peut être considéré comme très proche des autres termes placés sous cet intertitre dans l'arbre ».

Un terme de la requête présent dans le titre est donc proche de tous les termes de la page, et un terme présent dans un intertitre est proche de tous les termes de sa section.

Comment la distance sémantique modifie-t-elle le classement ?

La distance sémantique modifie le classement en favorisant les pages où les termes de la requête sont proches dans la structure. « Les documents dont les termes recherchés sont relativement proches, selon les mesures de distance, peuvent recevoir des scores de classement plus élevés ». Le brevet ajoute que, « dans certaines applications », d'autres facteurs peuvent entrer dans le score final, comme « la fréquence inverse de document (IDF) » pour donner plus de poids aux mots rares, et des mesures de qualité « fondées sur la structure des liens d'un corpus ou sur une qualité prédéfinie de certains sites ou domaines ».

L'analyse de la structure « peut être réalisée à l'avance sur un corpus de documents » et stockée sous forme d'annotations : au moment de la requête, le système peut alors « simplement » consulter les annotations précalculées du document. La structure donne une mesure de la proximité entre termes ; les vecteurs de mots en donnent une autre, apprise des contextes où les mots apparaissent.

Le même principe, selon lequel les intertitres définissent le sujet d'un passage, anime le brevet sur le contexte des titres pour les passages-réponses.

Que protègent les revendications du brevet US 7,716,216 ?

Les revendications protègent les règles des listes, pas celles des titres et des intertitres. La revendication indépendante 1 exige une liste « comportant un en-tête et une pluralité d'éléments associés à cet en-tête », et le choix de 1 règle parmi 3 selon la position des 2 termes : dans des éléments différents, dans le même élément, ou dans l'en-tête et un élément. La distance est ensuite calculée « au moyen d'une fonction fondée sur la règle choisie », une fonction qui « diffère » pour chacune des 3 règles, et le résultat sert à classer le document pour une requête qui contient les 2 termes.

Les revendications dépendantes ajoutent 4 précisions :

  1. Le nombre de mots comme base : la revendication 6 calcule la distance « comme un nombre de mots entre le premier et le second terme du document, enrichi par la règle choisie ».
  2. Les listes implicites : la revendication 7 les repère grâce aux « occurrences répétées d'un ensemble de deux commandes de mise en forme ou plus », et les revendications 4 et 14 citent « des balises de paragraphe, de retour à la ligne, de gras ou de tableau ».
  3. Les listes explicites aussi : les revendications 5 et 21 ajoutent la détection des « structures sémantiques définies explicitement », comme les listes <ul> et <ol>.
  4. Une analyse avant le classement : la revendication 11 précise que la structure sémantique est « identifiée avant le classement ».

Les règles sur les titres et les intertitres figurent seulement dans la description, comme des mises en œuvre possibles.

Où se place le module de classement dans un moteur de recherche ?

Le module de classement intervient après la sélection, pour trier les documents qui correspondent déjà à la requête. Dans l'exemple de moteur de recherche du brevet, le moteur génère d'abord « un ensemble initial de documents qui correspondent à la requête (c'est-à-dire des documents qui contiennent les termes de la requête) », le transmet au module de classement, puis le trie selon les scores reçus.

Le brevet applique ce principe à « un moteur de recherche généraliste », à « un moteur plus spécialisé, comme un moteur de recherche d'actualités », et à « une base de documents d'entreprise ». Un document, en ce sens, peut être une page web, mais aussi « un e-mail, un blog, un fichier » ou « un message de groupe de discussion ».

Que change la distance sémantique pour votre SEO ?

La distance sémantique signifie que la structure de votre page indique à Google quels termes vont ensemble. 5 conséquences en découlent :

  1. Placez vos termes principaux dans le titre. Un terme du titre est proche de tous les termes de la page.
  2. Rédigez des intertitres qui nomment le sujet de leur section. Un terme d'intertitre est proche de tout ce qui le suit : l'intertitre et sa section forment une unité.
  3. Gardez les termes liés dans un même élément de liste. Les termes d'un même élément sont proches ; ceux répartis sur plusieurs éléments sont éloignés, même s'ils se suivent dans le texte.
  4. Donnez à vos listes un en-tête descriptif. Chaque élément est aussi proche de l'en-tête que les autres : l'en-tête relie la liste à la requête.
  5. Utilisez un balisage propre et cohérent. Les listes implicites sont détectées grâce aux mises en forme répétées : des modèles cohérents rendent votre structure lisible pour les machines comme pour les lecteurs.

Notre travail de SEO technique vérifie que listes, titres et intertitres utilisent de vrais éléments HTML, pour que la structure que lit le brevet figure dans le balisage et pas seulement dans la mise en forme.

Le brevet décrit ce que le système de Google peut faire. Il ne confirme pas que Google mesure aujourd'hui la distance entre les termes de cette façon.

Quiz express

Avez-vous tout compris ?

Testez ce que vous venez de lire.

Question 1 sur 4

Pourquoi le nombre de mots ne suffit-il pas à mesurer la proximité des termes dans une page web ?

Articles liés

Nous lisons les brevets pour que vous n'ayez pas à le faire.

Chaque semaine : 3 enseignements SEO étayés par les données, 1 mythe démonté, 1 méthode à reprendre. Sans remplissage. Sans conseils de gourou.

Gratuit pour toujours. Désinscription à tout moment. Nous respectons votre boîte mail. Confidentialité.