Navboost est le système de reclassement de Google fondé sur les clics : il fait monter ou descendre un résultat sur une requête selon le comportement des internautes après leur clic. Google a confirmé ce système sous serment en 2023. Son mécanisme est décrit dans le brevet US 8,661,029 B1, « Modifying search result ranking based on implicit user feedback ».
Qu'est-ce que Navboost ?
Navboost est un signal de classement construit à partir des clics agrégés sur chaque requête. Pandu Nayak, vice-président de la recherche chez Google, l'a décrit en octobre 2023, lors du procès antitrust United States v. Google, comme « l'un des signaux importants » de Google. Selon son témoignage, Navboost mémorise les clics sur une fenêtre glissante de 13 mois, contre 18 mois avant 2017.
Le brevet n'emploie jamais le mot « Navboost ». Le lien vient de son contenu : les mêmes données en entrée (clics, temps passé sur la page, requête, langue, pays) et le même résultat en sortie (un nouvel ordre des résultats pour les recherches futures sur la même requête).
Que décrit le brevet US 8,661,029 ?
Le brevet US 8,661,029 décrit un score de pertinence calculé à partir du rapport entre visites longues et visites totales d'un résultat sur une requête donnée. Google l'a déposé le 2 novembre 2006 (demande 11/556,143), et le brevet a été délivré le 25 février 2014, avec 30 revendications et 5 planches de dessins. Ses 4 inventeurs sont Hyung-Jin Kim, Simon Tong, Noam Shazeer et Michelangelo Diligenti. Cinq brevets de continuation prolongent la même famille, le plus récent étant US 11,816,114 B1.
La revendication 1 protège le principe en termes larges : une mesure de pertinence fondée sur « un sous-ensemble du nombre de vues du document après sélection du résultat », rapporté au nombre total de ces vues, puis transmise à un moteur de classement.
Pour chaque clic sur un résultat, le brevet liste les informations que le système peut enregistrer :
- La requête : la recherche saisie par l'internaute.
- Le document : le résultat cliqué.
- Le temps passé sur le document : le temps entre le clic sur le résultat et le moment où l'internaute revient à la page de résultats et clique sur un autre résultat.
- La langue : la langue d'interface de l'internaute, qu'il peut choisir.
- Le pays : le pays où se trouve probablement l'internaute, identifié par exemple par le domaine Google utilisé (google.co.uk pour le Royaume-Uni).
- D'autres aspects de l'internaute et de la session.
Le brevet cite d'autres données enregistrables : les résultats affichés mais non cliqués, la position des clics, les scores IR des résultats, les titres et extraits vus avant le clic, le cookie de l'internaute et son ancienneté, l'adresse IP et l'agent utilisateur du navigateur. Les clics sont suivis par un code JavaScript intégré à la page de résultats, qui détecte aussi le retour sur cette page. Une barre d'outils installée sur l'ordinateur de l'internaute peut aussi suivre la navigation après le clic, à condition que l'internaute accepte de la partager.
Comment Google mesure-t-il un bon clic ?
Google mesure un bon clic par sa durée. La métrique centrale du brevet est la fraction de clics LC|C : les clics longs divisés par l'ensemble des clics sur un couple requête-document. Selon le brevet, c'est « le nombre de clics longs (qui peuvent être des clics pondérés) divisé par le nombre total de clics », et « une mesure normalisée du temps que les gens restent sur une page une fois qu'ils ont cliqué dessus ».
La formule de base est LCC_BASE = #WC(Q,D) / (#C(Q,D) + S0) : la somme des clics pondérés pour le couple requête-URL, divisée par le nombre total de clics augmenté d'un facteur de lissage S0. Quand une requête reçoit peu de clics, la fraction tend vers zéro. Quand les clics dépassent largement S0, le lissage ne pèse plus. Un résultat doit accumuler assez de données avant que ses clics comptent.
Le brevet donne un exemple de poids par catégorie de durée de visite.
| Type de clic | Poids | Signification dans le brevet |
|---|---|---|
| Clic court | −0,1 | Indique une page médiocre |
| Clic moyen | 0,5 | Indique une page potentiellement bonne |
| Clic long | 1,0 | Indique une bonne page |
| Dernier clic (l'internaute ne revient pas aux résultats) | 0,9 | Indique probablement une bonne page |
| Dernier clic précédé d'un autre clic | 0,3 | Indique moins une bonne page |
Ces valeurs sont un exemple, pas des constantes. Le brevet précise que les durées et les poids peuvent être ajustés en comparant les journaux de clics à des évaluations humaines de la qualité des résultats, et que la pondération peut aussi être une fonction continue de la durée de visite plutôt que des catégories fixes.
Dans cet exemple, le clic court porte un poids négatif. Un retour rapide ne se contente pas de ne rien rapporter : il fait baisser la somme des clics pondérés de la page.
Pourquoi la position dans les résultats ne fausse-t-elle pas le score ?
Le score compare un résultat à lui-même, pas aux résultats qui l'entourent. Le brevet note que les internautes ont tendance à cliquer sur les résultats aux bons extraits, ou mieux classés, « indépendamment de la pertinence réelle du document ». Il appelle cela le biais de présentation : un titre ou un extrait attractif, et la position dans le classement. La fraction LC|C mesure combien de temps les internautes restent une fois qu'ils ont cliqué, ce qui la rend, selon les termes du brevet, « relativement insensible au biais de présentation ». La fraction « peut être élevée pour une URL donnée même si elle reçoit beaucoup moins de clics qu'un résultat comparable mieux positionné ». Une page en position 8 qui retient ses visiteurs peut obtenir un meilleur score qu'une page en position 1 que les internautes quittent en quelques secondes.
Comment le score modifie-t-il le classement ?
La fraction LC|C peut s'appliquer directement au score de recherche d'information (IR) du résultat, ou être transformée en un facteur de bonus appliqué au score IR. L'exemple du brevet est une sigmoïde : IRBoost = 1 + M / (1 + e^(X·(LC|C − 0.5))), avec des constantes comme (M, X) = (100, −100). Une fraction LC|C faible donne un bonus d'environ 1 : le classement bouge à peine. Au-dessus de 0,5, le bonus grimpe vite vers son maximum. Le brevet donne aussi des variantes linéaire et exponentielle, et indique que la transformation est choisie par ajustement sur des évaluations humaines de pertinence.
La fraction LC|C peut aussi s'ajouter à la fraction de clics traditionnelle, qui compare les clics sur un résultat aux clics pondérés sur tous les résultats de la requête.
Comment le brevet segmente-t-il le score par langue et par pays ?
Le système calcule la fraction à 3 niveaux : la base (tous les clics), la langue, puis le pays et la langue. Chaque niveau est lissé vers le niveau supérieur, de sorte que « s'il y a moins de données pour les fractions de clics plus spécifiques, la fraction globale se replie sur le niveau supérieur pour lequel plus de données sont disponibles ».
Les facteurs de lissage ne sont pas uniformes non plus. Le brevet les augmente pour les segments à fort trafic (il cite les requêtes anglophones des États-Unis) et « pour les sources de requêtes qui ont historiquement généré plus de spam (par exemple, les requêtes venant de Russie) ».
Un bon clic dure-t-il le même temps pour chaque requête et chaque internaute ?
Non. Le brevet ajuste les seuils, ou la formule, de « ce qui constitue un bon clic » avec des différenciateurs de durée de visite : la catégorie de la requête et le type d'internaute.
- La catégorie de requête. Une requête de navigation vise une page ou un site précis (l'exemple du brevet est « BMW »). Une requête d'information a de nombreuses pages également utiles (« George Washington's Birthday »). Le brevet subdivise encore les requêtes d'information : une date d'anniversaire se lit en quelques secondes, alors que « Hilbert transform tutorial » demande bien plus de temps. Les catégories peuvent être détectées par l'asymétrie des scores IR ou des fractions de clics (un résultat dominant suggère une requête de navigation), par régression sur l'historique des clics, ou par un regroupement K-means des durées moyennes de visite.
- Le type d'internaute. Les internautes à l'aise avec l'informatique cliquent souvent plus vite que les moins expérimentés : ils peuvent recevoir des fonctions de pondération différentes, jusqu'à un internaute unique. Un internaute qui clique presque toujours sur le premier résultat peut voir ses bons clics moins pondérés que ceux d'un internaute qui clique plus souvent plus bas. Un internaute qui pose beaucoup de requêtes sur un sujet (l'exemple du brevet est le droit) peut être présumé expert, et ses clics sur ce sujet pondérés en conséquence. Pondérer les clics par internaute rapproche le score de la personnalisation des résultats, où Google construit un profil pour chaque internaute.
Peut-on améliorer son classement avec de faux clics ?
Non : le brevet est conçu pour l'empêcher. Il anticipe les « spammeurs (des utilisateurs qui génèrent des clics frauduleux pour faire monter certains résultats) » et décrit des protections. La première est « un modèle d'utilisateur qui décrit comment un utilisateur devrait se comporter dans le temps » : les clics des internautes qui ne s'y conforment pas peuvent être ignorés. Les protections ont 2 objectifs :
- La démocratie des votes, par exemple « un seul vote par cookie et/ou adresse IP pour un couple requête-URL donné ».
- La suppression du trafic non naturel : les cookies ou adresses IP qui présentent une distribution anormale des positions de clic, des durées de clic ou des clics par minute, heure ou jour sont entièrement écartés.
Les requêtes qui semblent spammées, par exemple avec une distribution anormale des agents utilisateurs ou de l'ancienneté des cookies, peuvent se passer entièrement des signaux de clic. Les robots de clics et les fermes de clics produisent précisément ces traces : votes répétés depuis les mêmes sources, durées uniformes et rythmes de clic non naturels.
Que change Navboost pour votre SEO ?
Navboost récompense les pages qui satisfont le clic, pas celles qui se contentent de l'obtenir. Le brevet entraîne 5 conséquences pratiques :
- Écrivez des titres fidèles à la page. Un titre trompeur gagne le clic et perd le score, car l'internaute revient vite et enregistre un clic court.
- Placez la réponse sur le premier écran. Un visiteur qui voit tout de suite que la page répond à sa requête a une raison de rester. Donnez la réponse avant le contexte.
- Visez le dernier clic. Le dernier clic pèse 0,9 dans l'exemple du brevet, contre 0,3 quand l'internaute a d'abord cliqué sur un autre résultat. Terminez la tâche de l'internaute (la réponse, la comparaison, l'étape suivante) pour qu'il n'ait aucune raison de revenir aux résultats.
- Adaptez la profondeur à la requête. Le seuil d'un bon clic dépend de la catégorie de requête : un fait simple se satisfait en quelques secondes, un tutoriel demande une visite plus longue.
- Lisez la Search Console par pays. Le score est segmenté par langue et par pays : la même page peut satisfaire les internautes en France et les décevoir en Belgique sur la même requête.
Dans notre travail de SEO on-page, nous comparons le titre de chaque page avec ce que livre son premier écran, car c'est cet écart qui transforme un clic gagné en clic court.
Navboost ne remplace pas la pertinence. Une page doit d'abord être trouvée et notée par les autres systèmes de Google, comme le PageRank et l'autorité qui circule par les liens, avant que les clics puissent la déplacer. Les clics décident de l'ordre final entre les pages déjà qualifiées pour la requête.
Le brevet décrit ce que le système de Google peut faire. Le témoignage de 2023 confirme que Navboost existe et compte, pas qu'il utilise exactement ces poids.