Google prédit la qualité d'un site qu'il n'a jamais noté en comparant les phrases de ses pages à celles des sites qu'il a déjà évalués. Le brevet US 9,767,157 B2, « Predicting site quality », décrit ce modèle de phrases. Google l'a déposé le 15 mars 2013, et le brevet a été délivré le 19 septembre 2017.
Que décrit le brevet US 9,767,157 ?
Le brevet US 9,767,157 décrit une méthode qui transforme le vocabulaire d'un site web en score de qualité prédit. Ses 2 inventeurs sont Navneet Panda, l'ingénieur derrière la mise à jour Panda, et Yun Zhou. Le score prédit alimente le moteur de classement, qui l'utilise pour « classer les ressources, ou les résultats qui les présentent, d'un site par rapport aux ressources d'un autre site ».
Le brevet travaille à l'échelle du site. Il définit un site comme « un site web ou un autre ensemble de ressources de données », et chaque calcul compte les pages sur l'ensemble du site. L'objectif est de « prédire un score comparable aux scores de qualité de référence des sites déjà notés ». Le brevet ajoute que le même modèle « peut servir à prédire la qualité d'autres ensembles de texte plus petits qu'un site entier, par exemple une seule page, un paragraphe, une phrase, voire une requête ».
Dans les revendications, le moteur de classement utilise le score de référence pour les ressources d'un site déjà noté, et le score prédit pour les ressources d'un site qui en a un.
Pourquoi Google a-t-il besoin de prédire la qualité d'un site ?
Google a besoin de prédire la qualité d'un site parce que ses scores de qualité habituels ne sont pas disponibles pour tous les sites. Le brevet les appelle scores de qualité de référence et les décrit comme des signaux utilisés, « parmi d'autres signaux, pour classer les résultats ». Il précise qu'ils proviennent « d'un processus en arrière-plan coûteux en temps ou en ressources de calcul, ou d'un processus qui ne s'applique pas à tous les sites ».
Le modèle de phrases comble ce manque : il peut prédire un score pour un nouveau site, c'est-à-dire un site qui ne fait pas partie des sites déjà notés, « en l'absence d'autres informations ».
Comment Google construit-il le modèle de phrases ?
Google construit le modèle de phrases à partir des sites qui ont déjà un score de qualité de référence. La figure 2 du brevet décrit le processus :
- Lister les n-grammes présents sur chaque site d'une collection, qui peut regrouper tous les sites indexés par le moteur ou seulement les sites déjà notés. Un n-gramme est une suite de tokens, ponctuation comprise. Le brevet cite les 2-grammes et les 3-grammes, ainsi que des n-grammes plus longs de 4 ou 5 tokens, d'une seule longueur ou de longueurs mélangées. La tokenisation peut ne pas être normalisée : elle « conserve les erreurs présentes dans l'original ».
- Écarter éventuellement les n-grammes rares, présents sur très peu de sites, « par exemple moins de 10, 50, 75 ou 100 sites », un seuil « déterminé par l'expérience ».
- Compter les pages de chaque site qui contiennent chaque n-gramme. Une page peut aussi être considérée comme contenant du texte venu d'ailleurs, « par exemple du texte d'ancre des liens qui pointent vers les pages ».
- Calculer une fréquence relative pour chaque n-gramme sur chaque site : le nombre de pages qui contiennent le n-gramme divisé par le nombre de pages du site (ou une fonction de ce quotient).
- Associer chaque n-gramme à une liste de sites, chacun avec sa fréquence relative pour ce n-gramme.
- Répartir les sites en tranches selon leur fréquence relative, avec « 20 à 100 » tranches par phrase. Les tranches peuvent couvrir des intervalles de fréquence égaux, ou des intervalles choisis pour que chaque tranche contienne à peu près le même nombre de sites.
- Collecter les scores de référence des sites déjà notés.
- Faire la moyenne des scores de référence des sites notés de chaque tranche : moyenne arithmétique ou géométrique, mode, médiane ou autre mesure de tendance centrale.
Le résultat est un vecteur pour chaque phrase : un score de qualité moyen par tranche de fréquence. Le modèle peut écarter les phrases neutres, dont la moyenne est « très proche » de la moyenne globale, le score de qualité « neutre », par exemple à moins de 0,2 % à 5 % de celui-ci. L'exemple du brevet est le 2-gramme « on the », qui, « empiriquement, a presque autant de chances d'apparaître sur un site de qualité que sur un site de faible qualité ».
Qu'est-ce que la fréquence relative d'une phrase ?
La fréquence relative d'une phrase est la part des pages d'un site qui la contiennent. Un 3-gramme présent sur 30 pages d'un site de 100 pages a une fréquence relative de 0,3. Une phrase de pied de page répétée sur toutes les pages atteint 1,0.
La mesure compte des pages, pas des occurrences. Une phrase répétée 50 fois sur une page pèse autant qu'une phrase employée une seule fois sur cette page.
Comment Google note-t-il un nouveau site ?
Google note un nouveau site en cherchant chacune de ses phrases dans le modèle et en faisant la moyenne des résultats. La figure 3 du brevet décrit le processus :
- Mesurer la fréquence relative de chaque phrase sur le nouveau site.
- Chercher la phrase dans le modèle et lire le score moyen de la tranche de fréquence correspondante.
- Agréger les scores de toutes les phrases en un score de site : moyenne arithmétique ou géométrique, mode, médiane ou autre mesure de tendance centrale.
- Lisser le résultat si nécessaire (une étape facultative), pour qu'un petit nombre de phrases ne domine pas le score.
- Prédire le score de qualité du site à partir de l'agrégat, directement ou via une fonction de l'agrégat.
- Transmettre le score prédit au moteur de classement comme score de qualité du site.
Le brevet fixe 2 limites. « Si le nouveau site ne contient aucune phrase présente dans le modèle, aucune prédiction ne peut être faite », et certaines mises en œuvre exigent un nombre minimal de phrases trouvées dans le modèle, par exemple 3, 5, 10, 15, 20 ou 50.
Comment les scores des phrases sont-ils pondérés et lissés ?
L'agrégat peut être une moyenne pondérée. Le brevet cite 3 pondérations possibles :
- la fréquence de la phrase sur le nouveau site, ou une fonction de celle-ci ;
- l'écart avec le score neutre, pour que les phrases éloignées de la moyenne globale comptent davantage ;
- un poids réduit pour les phrases présentes sur un seul domaine, « traduisant le jugement que ces scores ne sont pas entièrement fiables ».
Le lissage dépend de la répartition des poids. Le système divise la somme des poids des N premières phrases (N étant un petit nombre comme 10, 20, 30, 40 ou 50) par la somme des poids de toutes les phrases. Si cette part est trop élevée, au-dessus d'un seuil comme 0,1, 0,15, 0,20, 0,30 ou 0,40, l'agrégat est interpolé avec le score neutre :
score agrégé lissé = score agrégé × alpha + score neutre × (1 − alpha)
Le coefficient alpha peut valoir 0,90, 0,80, 0,75 ou 0,60, ou être une fonction de cette part, par exemple une sigmoïde : plus les premières phrases pèsent, plus alpha est petit et plus le lissage est fort. Le lissage « peut être répété jusqu'à obtenir une valeur de quotient acceptable ».
Quelles phrases signalent une faible qualité ?
Le brevet ne publie aucune liste de bonnes ou de mauvaises phrases. Le modèle les apprend à partir des données : une phrase devient un signal négatif quand les sites qui l'emploient à une fréquence donnée ont, en moyenne, des scores de référence faibles.
Une même phrase peut donc porter 2 sens. Employée sur 5 % des pages d'un site, elle peut correspondre au profil des bons sites ; employée sur 100 % des pages, elle peut correspondre au profil des sites faibles. C'est la fréquence, et non la phrase seule, qui porte le signal. Les suites de mots à l'intérieur d'une page relèvent d'une autre méthode, où Google utilise des modèles de langage pour détecter les pages réécrites et bourrées de mots-clés.
Le brevet sur la qualité de site fait-il partie de Panda ?
Non, pas officiellement : Google n'a pas déclaré que ce brevet fait partie de Panda. Le brevet partage avec Panda son premier inventeur, et son objet, la qualité à l'échelle du site, correspond à l'objectif affiché de Panda. Il a été déposé en mars 2013, 2 ans après le premier lancement de Panda et environ 6 mois après l'autre brevet de qualité de site signé par Navneet Panda.
Les 2 brevets mesurent des preuves différentes. Le brevet Panda sur les liens et les recherches de marque compare les liens indépendants aux recherches qui visent un site. Le brevet sur la qualité de site lit le langage du site lui-même.
Que change le brevet sur la qualité de site pour votre SEO ?
Le brevet sur la qualité de site signifie que le langage de votre site entier peut servir de preuve de sa qualité, en l'absence d'autres informations. 4 conséquences en découlent :
- Écrivez dans le vocabulaire des meilleures sources de votre domaine. Le modèle compare votre profil de phrases à celui des sites déjà notés : un contenu qui se lit comme une référence reconnue a plus de chances de correspondre aux profils des sites de qualité.
- Limitez les textes répétés sur tout le site. Une phrase présente dans chaque pied de page ou barre latérale atteint une fréquence relative de 1,0 et pèse sur le profil de phrases du domaine entier.
- Évitez les pages générées en masse sur un même gabarit. Des centaines de pages issues d'un seul modèle répètent les mêmes n-grammes à haute fréquence. Si les sites qui ont ce profil ont des scores de référence faibles, le modèle reporte cette moyenne sur le vôtre.
- Lancez votre site avec des pages complètes. La prédiction est conçue pour les sites sans score de référence : ce sont les phrases de vos premières pages que le modèle lit.
Un audit SEO de notre équipe mesure les textes répétés sur tout le site et les pages générées sur un même gabarit, les 2 sources de n-grammes répétés qui pèsent sur le profil de phrases d'un domaine.
Le brevet décrit ce que le système de Google peut faire. Il ne confirme pas que Google utilise ce modèle aujourd'hui, ni avec ces paramètres exacts.