S'inscrire à la newsletter
Signaux utilisateursBrevetsClics

Le biais de présentation en SEO : comment Google minore les clics obtenus grâce à la seule position et au gras

Par 13 min de lecture

Le biais de présentation est la part des clics qu'un résultat reçoit en raison de la façon dont il est affiché, indépendamment de sa qualité. Le brevet US 8,938,463 B1, « Modifying search result ranking based on implicit user feedback and a model of presentation bias », décrit comment Google modélise ce biais et le retire des signaux de clics. Google l'a déposé le 12 mars 2007, et le brevet a été délivré le 20 janvier 2015.

Que décrit le brevet US 8,938,463 ?

Le brevet US 8,938,463 décrit un modèle a priori qui prédit la fréquence à laquelle un résultat devrait être cliqué selon sa présentation, utilisé pour corriger le classement fondé sur les clics. Ses 2 inventeurs sont Hyung-Jin Kim, inventeur du brevet des clics de Google, et Adrian D. Corduneanu. Le brevet compte 27 revendications et 8 planches de dessins, et sa durée a été prolongée de 836 jours.

Le résumé définit la méthode : recevoir des caractéristiques, dont « une première caractéristique révélatrice d'un biais de présentation », recueillir « les sélections de résultats », générer « un modèle a priori » qui représente « une probabilité de fond de sélection d'un résultat selon les valeurs de ces caractéristiques », et le transmettre « à un moteur de classement pour réduire l'influence du biais de présentation ».

Pourquoi les clics doivent-ils être corrigés ?

Les clics doivent être corrigés parce que les internautes cliquent sur des résultats pour des raisons sans rapport avec la qualité. Le brevet affirme que « les utilisateurs ont tendance à cliquer sur les résultats aux bons extraits, ou mieux classés, quelle que soit leur pertinence réelle ». Il cite « un titre ou un extrait attrayant » et la position du résultat. Son exemple : « le premier résultat recevra beaucoup plus de clics que le dernier, même si leurs positions sont inversées ». Les résultats sont aussi répartis sur plusieurs pages, si bien que « beaucoup des résultats d'une recherche type ne seront peut-être jamais vus par l'utilisateur ».

Le brevet reprend le cadre de clics de Navboost : les clics sont classés selon leur durée, avec des poids d'exemple de −0,1 pour un clic court, 0,5 pour un clic moyen, 1,0 pour un clic long et 0,9 pour un dernier clic (0,3 seulement quand un autre clic a précédé le dernier). Ces clics pondérés alimentent la « fraction de clics traditionnelle », BASE = #WC(Q,D) / (#WC(Q) + S0) : les clics pondérés sur un résultat pour une requête, divisés par les clics pondérés sur tous les résultats de cette requête plus un facteur de lissage. Les versions par langue et par pays se replient sur la fraction plus large quand les données manquent.

Quels éléments créent un biais de présentation ?

Le tableau du brevet liste 19 éléments qui peuvent augmenter ou diminuer le taux de clic, souvent indépendamment de la qualité. Les principaux :

ÉlémentEffet sur les clics décrit dans le brevet
PositionLes résultats mieux placés peuvent avoir un taux de clic plus élevé
PageLes résultats des pages les plus hautes peuvent avoir un taux de clic plus élevé
Termes en grasLes résultats avec plus de termes en gras dans le titre, l'extrait et l'URL peuvent avoir un taux de clic plus élevé
Position des termes en grasLes termes en gras n'ont pas le même effet en début ou en fin de phrase
Longueur du titre, de l'extrait et de l'URLLes résultats aux titres, extraits et URL plus longs peuvent avoir un taux de clic plus élevé
Termes attrayantsLes termes à connotation sexuelle, ou plus largement « tout terme qui augmente le taux de clic de tout résultat où il apparaît, indépendamment de la requête ou de l'URL »
Qualité des résultats voisinsDes résultats de grande qualité aux positions précédentes ou suivantes peuvent faire baisser les clics d'un résultat
Pages précédentes et suivantesL'attrait des pages précédentes ou suivantes peut influer sur les clics d'un résultat
PublicitésDes publicités de meilleure qualité peuvent faire baisser le taux de clic de tous les résultats
OneboxLes résultats spéciaux affichés avant les résultats normaux (cartes, recherche de livres) peuvent faire baisser leurs clics, « surtout s'ils sont très pertinents pour le sujet »
Longueur de la requêteLes bons résultats peuvent manquer pour les requêtes longues
Type de requête et requêteLes groupes de requêtes et les requêtes précises ont des taux de clic différents
Mise en forme sans lien avec le rangUne indentation (par exemple une page plus profonde du même site) peut augmenter ou diminuer les clics
Mise en forme liée au rangUn fond bleu clair sur certains premiers résultats peut augmenter ou diminuer les clics
Autres éléments d'interfaceTout ce qui fait ressortir un résultat dans la liste peut influer sur ses clics

Le brevet ajoute les caractéristiques des moteurs personnalisés intégrés à des sites externes, comme « la mise en page, la couleur des liens, les publicités animées de la page ».

La position est-elle un biais ou un signal de qualité ?

La position est les deux à la fois. Le brevet la qualifie de « caractéristique en réalité mixte, puisque les clics liés à la position sont influencés à la fois par le biais de présentation et par la qualité du résultat ». Dans certaines mises en œuvre, la position est donc traitée comme une caractéristique de qualité, et les éléments de biais se limitent à ceux « sans lien avec la qualité du résultat », comme le gras et la longueur du titre et de l'extrait. Les revendications exigent pourtant que le rang du résultat fasse partie des caractéristiques de biais de présentation.

En règle générale, les caractéristiques retenues sont « corrélées au taux de clic » et « indépendantes de la requête (Q) et du résultat (D) ». Dans certaines mises en œuvre, la requête précise, ou son type défini par regroupement de requêtes, peut tout de même servir de caractéristique.

Comment Google construit-il le modèle a priori ?

Google construit le modèle a priori à partir des journaux de clics passés, toutes requêtes confondues. Pour chaque combinaison de valeurs, le système compte les clics de chaque type, en « comptant séparément les clics courts, moyens et longs, ainsi que les cas où un résultat est affiché mais qu'un autre est cliqué ». L'exemple du brevet : « le nombre de clics longs, courts et moyens en position 1 sur un site de recherche en anglais », ainsi que le nombre de fois où d'autres résultats ont été cliqués alors qu'un résultat était affiché en position 1. L'entrée de journal d'un résultat cliqué peut aussi stocker des caractéristiques des résultats renvoyés avec lui, comme leur score IR, même s'ils n'ont jamais été cliqués.

Le modèle peut être « une régression linéaire ou logistique classique, ou d'autres types de modèles », et il « représente pour l'essentiel les statistiques des clics passés, c'est-à-dire le pourcentage de personnes qui ont cliqué sur un résultat selon sa présentation et ses caractéristiques ». Quand les combinaisons de valeurs sont trop nombreuses, les caractéristiques sont réparties en 2 groupes disjoints : les clics sont comptés pour chaque combinaison d'un ensemble réduit de caractéristiques plus importantes, et le modèle est entraîné sur les valeurs des caractéristiques restantes. Cela permet plus de paramètres, « mais pas au point que le modèle ne puisse plus être entraîné ».

Comment la variante à deux modèles isole-t-elle le biais ?

La variante à deux modèles compare un modèle fondé sur des caractéristiques de qualité à un modèle qui y ajoute des caractéristiques de présentation. Dans l'exemple du brevet, le modèle de qualité utilise la position, le score IR, le score IR du premier résultat, les scores IR des résultats précédents et suivants, le pays, la langue et le nombre de mots de la requête. Le second modèle y ajoute le nombre de termes en gras dans les titres et extraits du résultat courant, des précédents et des suivants, la longueur de ces titres et extraits, et des indicateurs booléens de termes pornographiques, de publicité et de résultat spécial. « Toute différence entre ces deux modèles est alors probablement due au seul biais de présentation. »

Pour chaque résultat, le score de classement est multiplié par le rapport entre la fraction de clics prédite par le modèle de qualité et celle prédite par le modèle complet, ou par une fonction monotone de ce rapport. La règle sous-jacente : « si un résultat devrait avoir un taux de clic plus élevé en raison du biais de présentation, ses clics doivent être minorés ; s'il devrait avoir un taux de clic plus faible, ses clics doivent être surpondérés ».

Comment le modèle modifie-t-il le classement ?

Le modèle modifie le classement en comparant la fraction de clics réelle d'un résultat à la fraction prédite d'après sa présentation. Pour une recherche, les valeurs des caractéristiques de chaque résultat sont recherchées dans le modèle a priori, et le taux de clic prédit est comparé à la fraction de clics traditionnelle. Dans l'exemple de la position, le score de classement « peut être multiplié par un nombre inférieur à un si la fraction de clics traditionnelle est inférieure à la fraction prédite par le modèle a priori, ou par un nombre supérieur à un dans le cas contraire ».

Le brevet donne 3 transformations d'exemple, où a est la fraction de clics réelle, p la fraction prédite et les autres lettres des paramètres ajustés :

  • Boost = C(a/p)
  • Boost = max(min(1 + Z, m0), m1), avec Z = (a - p)^k1 si a ≥ p et Z = -1 * abs((a - p)^k2) si a < p
  • le même boost borné, avec Z = C[1/(1 + e^(-k(a - p)))] - 1/2

La transformation est choisie par réglage sur les données historiques « combinées à des évaluations de pertinence produites par des humains ». La correction peut s'appliquer à l'exécution, une fois les clics agrégés, ou lors de la construction du modèle, où chaque clic peut être pondéré « selon la mesure dans laquelle il a été affecté par le biais d'affichage, avant l'agrégation des clics ». Le brevet note que l'ajustement à l'exécution « peut entraîner une certaine perte ».

Comment sont notés les résultats sans historique de clics ?

Les résultats sans historique de clics reçoivent une fraction de clics prédite par un modèle a priori distinct. Pour le construire, les journaux sont coupés au hasard en 2 moitiés, et les résultats qui ont des clics dans la première moitié mais aucun dans la seconde sont extraits : ils représentent les documents les moins souvent sélectionnés. Un modèle a priori est entraîné sur eux avec des caractéristiques comme la position, le pays, la langue et le score IR. Un nouveau résultat dont la fraction de clics traditionnelle n'est pas définie, « parce que le résultat n'a encore jamais été sélectionné », reçoit alors la fraction de clics prédite par ce modèle.

Le brevet décrit aussi la combinaison d'un signal de pertinence (comme la fraction de clics) et d'un signal de présentation issu d'un modèle a priori en un signal de pertinence « globalement indépendant de la présentation », transmis ensuite au moteur de classement.

Que protègent les revendications ?

Les revendications protègent un modèle entraîné à prédire un taux de clic à partir de caractéristiques de biais de présentation et de caractéristiques de pertinence, utilisé par un moteur de recherche pour déterminer un score de qualité de chaque résultat et en retirer les « effets indépendants du biais de présentation ». Les 3 revendications indépendantes (un procédé, un système et un dispositif de stockage) exigent qu'au moins une caractéristique de biais soit le rang du résultat. Les revendications dépendantes citent comme caractéristiques de biais la position d'un autre résultat, le titre, sa longueur, l'extrait, le texte en gras dans l'extrait et la présence de publicités ; et comme caractéristiques de pertinence le score IR du résultat, le score IR d'un autre résultat, la langue de la requête et son nombre de mots. D'autres revendications dépendantes couvrent le rapport entre les deux modèles et la comparaison avec la fraction de clics, par « un rapport » ou « une différence de valeur ».

Quel lien entre ce brevet et Navboost ?

Ce brevet complète le système de clics décrit dans Navboost. Le brevet Navboost compare un résultat à lui-même pour résister au biais de présentation ; ce brevet modélise explicitement le biais et le retire du signal de clics. Les deux partagent un inventeur, Hyung-Jin Kim, et les mêmes poids de clics d'exemple. Le brevet ajoute que d'autres modèles de clics peuvent remplacer la fraction de clics traditionnelle, comme « un modèle de régression logistique à grande échelle qui utilise la requête et l'URL réelles comme caractéristiques ».

Que change le biais de présentation pour votre SEO ?

Le biais de présentation signifie que les clics obtenus par la seule position ou une mise en forme accrocheuse sont minorés, tandis que ceux obtenus au-delà des attentes comptent davantage. 6 conséquences en découlent :

  1. Dépassez le taux de clic attendu de votre présentation. Dans les exemples du brevet, un résultat cliqué plus que sa position et son affichage ne le prévoient reçoit un coup de pouce, et un résultat cliqué moins reçoit un multiplicateur inférieur à un.
  2. Ne misez pas sur les titres racoleurs. Les termes attrayants qui augmentent les clics quelle que soit la requête sont modélisés comme un biais, et leurs clics sont minorés.
  3. Obtenez des clics longs, pas seulement des clics. Le modèle compte séparément les clics courts, moyens et longs, et un clic court a un poids négatif (−0,1) dans l'exemple du brevet.
  4. Ne comptez pas sur le gras et les titres longs seuls. Le brevet modélise les termes en gras et la longueur des titres et extraits comme des caractéristiques de présentation : les clics qu'ils attirent sont attendus, la page doit donc offrir plus que ce que l'extrait promet.
  5. Connaissez votre concurrence sur la page. Des résultats voisins forts, des publicités et des résultats spéciaux font baisser vos clics attendus : le modèle en tient compte, vous êtes donc jugé sur des attentes réalistes.
  6. Une nouvelle page n'est pas jugée sur un dossier vide. Un résultat sans historique de clics peut recevoir une fraction de clics prédite à partir de caractéristiques comme sa position, le pays, la langue et son score IR.

Un audit SEO de notre équipe compare le taux de clic de chaque page dans la Search Console au taux attendu à sa position, pour repérer les pages moins cliquées que leur position ne le prédit.

Le brevet décrit ce que le système de Google peut faire. Il ne confirme pas quels éléments de biais Google modélise aujourd'hui.

Quiz express

Avez-vous tout compris ?

Testez ce que vous venez de lire.

Question 1 sur 4

Que représente le modèle a priori ?

Articles liés

Nous lisons les brevets pour que vous n'ayez pas à le faire.

Chaque semaine : 3 enseignements SEO étayés par les données, 1 mythe démonté, 1 méthode à reprendre. Sans remplissage. Sans conseils de gourou.

Gratuit pour toujours. Désinscription à tout moment. Nous respectons votre boîte mail. Confidentialité.