Une entité est, selon les termes du brevet de Google, « une chose ou un concept singulier, unique, bien défini et distinguable ». Le 16 mai 2012, Google a présenté le Knowledge Graph avec une formule devenue célèbre : « things, not strings » (des choses, pas des chaînes de caractères). Elle marque le passage de la correspondance de mots-clés à la compréhension des entités (personnes, lieux, concepts) et des relations entre elles.
Quelle différence entre une chaîne et une chose ?
Un mot-clé est une chaîne de caractères. Une entité est une chose que le moteur connaît, avec des attributs et des liens. L'exemple du brevet : il peut exister un nœud pour la ville « Philadelphia », un pour le film « Philadelphia » et un pour la marque de fromage frais « Philadelphia », chacun avec son propre identifiant unique. Même chaîne, trois entités.
Le brevet décrit deux mécanismes dans le Knowledge Graph :
- La désambiguïsation (un nom, plusieurs entités) : la ville de « New York » se distingue de l'État de « New York » parce que l'une est reliée au type « City » et l'autre au type « State ». De même, « Georgia » relié à « United States » est l'État américain, tandis que « Georgia » relié à « Asia » et « Eastern Europe » est le pays.
- La différenciation (plusieurs noms, une entité) : « George Washington », « Geo. Washington », « President Washington » et « President George Washington » peuvent tous renvoyer à un seul nœud d'entité. La Californie peut porter des alias comme « CA », « Calif. » ou « Golden State ».
Pour vos contenus, la pertinence ne consiste donc plus seulement à répéter une expression. Elle consiste à couvrir une entité et ses relations clairement, pour que la page soit associée à la bonne entité et non à un homonyme.
Que décrit réellement le brevet ?
Le brevet Google US 10,235,423 B2, « Ranking search results based on entity metrics » (déposé comme demande PCT le 12 décembre 2012, délivré le 19 mars 2019, 27 revendications), décrit le classement de résultats obtenus depuis un Knowledge Graph à l'aide de plusieurs métriques déterminées au moins en partie à partir du Knowledge Graph, combinées ensuite avec des poids qui dépendent du type d'entité de chaque résultat. Les revendications exigent qu'au moins une de ces métriques soit « indépendante de la requête ».
Le brevet cite quatre métriques à titre d'exemple :
- Relatedness (R) : fondée sur la cooccurrence, sur les pages web, de l'entité de la requête avec son type d'entité. L'exemple du brevet : la requête « Empire State Building », de type « Skyscraper » (gratte-ciel), où la cooccurrence de « Empire State Building » et « Skyscraper » dans les pages web peut déterminer la métrique. Une des formules données est N(E, REj) / (N(E) + N(REj) - N(E, REj)) : les occurrences des deux termes ensemble divisées par les occurrences de l'un ou de l'autre, dans un corpus de textes comme un ensemble de pages web.
- Notable entity type (N) : N = G / n, où G est une métrique de popularité globale du résultat (par exemple la probabilité qu'un utilisateur quelconque le sélectionne, le nombre de liens vers lui ou depuis lui, ou les visites) et n est le rang de son type d'entité dans une liste de types notables du domaine. L'exemple du brevet : un roman de fiction avec une popularité de 50 et un rang de type de 1 obtient 50 ; une nouvelle avec une popularité de 20 et un rang de type de 8 obtient 2,5.
- Contribution (C) : fondée sur les critiques, les classements de notoriété et d'autres informations, comme un restaurant noté de 0 à 3 étoiles par le critique d'un journal, les listes de best-sellers pour les livres, ou les avis sur Amazon, Yelp ou IMDB. Une fonction de pondération fait compter davantage les contributions les mieux notées : « les films les mieux notés d'un acteur auront la plus forte contribution à sa métrique de notoriété ».
- Prize (P) : fondée sur les prix et récompenses, comme un Oscar ou un Golden Globe pour un film, un prix Pulitzer ou Man Booker pour un livre, un prix Nobel ou une médaille militaire pour une personne. Les prix les plus importants pèsent le plus.
Le score est alors une somme pondérée : S = (a × R) + (b × N) + (c × C) + (d × P). Le brevet précise que ce « calcul particulier d'un score n'est qu'un exemple ».
Pourquoi les poids changent-ils selon le type d'entité ?
Parce qu'une métrique ne dit pas la même chose dans tous les domaines. Le brevet stocke des poids propres à chaque domaine, un domaine étant un groupe de types d'entités (« Books », « Film », « People », « Places ») :
- Le système « peut accorder le poids le plus élevé à la métrique de prix pour les entités du domaine "Film" et le poids le plus élevé à la métrique de contribution pour les entités associées au domaine "Book" ».
- La métrique de type notable peut peser davantage pour « People » que pour « Movie », car le type d'un film (son genre) « ne donne pas nécessairement beaucoup d'informations sur sa pertinence comparative, alors que le type d'entité d'une personne, par exemple président des États-Unis, en donne davantage ».
- Un poids peut valoir 0 quand une métrique n'est pas utilisée dans un domaine, et même être négatif quand une valeur élevée d'une métrique « est considérée comme nuisible à la pertinence » dans ce domaine.
Les poids peuvent être déterminés expérimentalement, à partir de paramètres du système ou de sélections agrégées des utilisateurs. Le classement obtenu peut ordonner une liste de résultats, ordonner des vignettes d'images ou choisir les éléments à afficher sur une carte.
Comment écrire pour les entités ?
Ce sont des pratiques éditoriales générales cohérentes avec la logique du brevet, pas des consignes qui en sont tirées :
- Cartographiez l'entité, pas seulement le mot-clé. Avant d'écrire, listez les sous-sujets, attributs et entités liées qu'une ressource complète doit couvrir. Cette carte devient votre plan.
- Employez un langage sans ambiguïté. Nommez les choses explicitement. Définissez l'entité dès le début. Indiquez son type (« X, un type de Y, utilisé pour Z »), puisque le brevet distingue les entités par leurs types et leurs liens. Les noms explicites alimentent les réponses directes : Google répond aux questions « qui » en comptant les entités nommées dans les premiers résultats.
- Ajoutez des données structurées. Le balisage
schema.orgest un moyen répandu d'indiquer explicitement de quelles entités parle une page. Le brevet lui-même ne mentionne pas schema.org. - Restez cohérent sur tout le site. Renforcez les mêmes associations d'entités par le maillage interne et des références répétées et exactes.
Que change le brevet sur les métriques d'entités pour votre SEO ?
Le brevet signifie que pour les résultats liés à des entités du Knowledge Graph, la pertinence peut être mesurée par des signaux sur l'entité elle-même, pondérés selon son type, et pas seulement par la correspondance avec la chaîne de la requête. 4 conséquences en découlent :
- Rendez explicite le type de l'entité. Le type conditionne à la fois la désambiguïsation et les poids appliqués : une page qui dit clairement de quel genre de chose elle parle est plus facile à situer.
- Écrivez l'entité à côté de son type. La relatedness se calcule à partir de la fréquence à laquelle une entité et son type apparaissent ensemble sur les pages web (« Empire State Building » avec « Skyscraper »). Les nommer ensemble correspond à la façon dont le brevet mesure ce lien.
- Citez les signaux qui comptent dans votre domaine. Avis et notes pour les livres, restaurants ou produits, prix pour les films, fonctions notables pour les personnes : le brevet montre que chaque domaine peut les pondérer différemment.
- N'attendez pas une recette unique pour tous les sujets. Un signal utile dans un domaine peut ne rien compter, voire jouer contre vous, dans un autre.
Notre travail de SEO sémantique associe chaque page à une entité principale et écrit son type à côté de son nom dans le titre, le premier paragraphe et les données structurées.
Le brevet décrit ce que le système de Google peut faire. Il ne confirme pas que Google classe aujourd'hui les résultats avec ces métriques ou ces poids exacts.