S'inscrire à la newsletter
SpamBrevetsQualité de contenu

Le contenu incohérent : comment Google utilise des modèles de langage pour détecter les pages SEO réécrites et bourrées de mots-clés

Par 9 min de lecture

Le contenu incohérent est un texte qui a peu de chances d'être de la langue naturelle, écrit pour se positionner sur des mots-clés à forte valeur plutôt que pour informer. Le brevet US 8,554,769 B1, « Identifying gibberish content in resources », décrit comment Google le détecte avec un modèle de langage et un score de bourrage de requêtes. Google l'a déposé le 17 juin 2009, à partir d'une demande provisoire du 17 juin 2008, et le brevet a été délivré le 8 octobre 2013.

Que décrit le brevet US 8,554,769 ?

Le brevet US 8,554,769 décrit un système qui calcule un score d'incohérence pour chaque page et l'utilise pour retirer ou rétrograder la page dans les résultats. Ses 4 inventeurs sont Shashidhar A. Thakur, Sushrut Karanjkar, Pavel Levin et Thorsten Brants, chercheur de Google sur les grands modèles de langage pour la traduction automatique, dont le brevet cite l'article de 2007. Le brevet compte 21 revendications et 4 planches de dessins.

Le résumé expose la méthode : générer « un score de modèle de langage » en appliquant un modèle de langage au texte, générer « un score de bourrage de requêtes » comme « une fonction de la fréquence des termes dans le contenu de la ressource et d'un index de requêtes », les combiner en « un score d'incohérence », et l'utiliser « pour décider de modifier ou non le score de classement de la ressource ».

Qu'est-ce que le contenu incohérent ?

Le contenu incohérent est « un contenu qui a de fortes chances d'être du spam ». Il comprend « des suites de texte peu susceptibles, selon des critères donnés, de représenter des chaînes de langue naturelle (par exemple une syntaxe conversationnelle) », ou de représenter les chaînes non conversationnelles que l'on trouve habituellement dans les documents web. L'exemple du brevet : un spammeur peut générer une page web qui « contient de nombreux mots-clés à forte valeur pour que le moteur la juge très pertinente ».

Le brevet cite 3 façons dont les spammeurs le produisent :

  1. Une main-d'œuvre bon marché : un texte écrit par « une main-d'œuvre peu coûteuse et non formée ».
  2. Le copier-coller remanié : « extraire du contenu, le modifier et l'assembler au hasard ».
  3. La traduction : « traduire depuis une autre langue ».

Le spammeur tire des revenus du trafic « grâce par exemple à des publicités, des liens payés au clic et des programmes d'affiliation », alors que la page « n'apporte en général aucune information utile ».

Comment fonctionne le score de modèle de langage ?

Le score de modèle de langage mesure la probabilité que chaque bloc de texte soit de la vraie langue naturelle. Le système procède en 4 étapes :

  1. Découper la page en segments : les balises HTML comme les titres et les paragraphes découpent le texte. Les petits paragraphes qui signalent des fragments comme « les éléments de menu » peuvent être « supprimés ou ignorés », et les suites de noms propres (noms, lieux géographiques), qui « représentent souvent des listes plutôt que de la langue naturelle », peuvent être écartées.
  2. Noter chaque segment avec un modèle de langage : le système choisit d'abord un modèle de langage « correspondant à la langue des segments de texte », et peut utiliser plusieurs modèles pour des segments en langues différentes. « Dans certaines mises en œuvre, un modèle de langage 5-grammes est utilisé » : il calcule la probabilité de chaque mot selon les mots qui le précèdent. Son exemple : la probabilité que « sheep » suive « the black ». Un paragraphe peut être noté d'un bloc, ou phrase par phrase, en additionnant les probabilités des phrases puis en divisant par leur nombre.
  3. Normaliser selon la longueur : par exemple, le score initial de chaque segment est divisé par la longueur du paragraphe. « Si le score du segment obtenu est supérieur à une valeur seuil, le segment est identifié comme contenant du contenu incohérent ». La normalisation peut être omise quand tous les segments ont une taille comprise dans une plage donnée.
  4. Calculer le score de la page : en fonction de « la part de termes incohérents parmi tous les termes de la ressource » et de la somme des scores des segments incohérents. Tous les termes d'un segment classé comme incohérent comptent dans le volume de contenu incohérent de la page.

L'exemple du brevet pour les probabilités de n-grammes est la phrase « NASA officials say they hope », avec des n-grammes limités à 3 mots, notée comme un produit de probabilités conditionnelles déterminées « selon les fréquences relatives dans un corpus d'entraînement ». Une technique de lissage (par exemple des poids de repli) estime les probabilités des n-grammes peu présents dans les données d'entraînement.

Comment fonctionne le score de bourrage de requêtes ?

Le score de bourrage de requêtes mesure si une page est remplie de vraies requêtes de recherche mises bout à bout. Il repose sur un index de requêtes construit à partir « d'un journal de requêtes d'un groupe d'utilisateurs sur une période donnée (par exemple un mois) ». Certaines requêtes courantes, la ponctuation, les URL et les autres chaînes qui ne sont pas de la langue naturelle peuvent être filtrées. Chaque terme est une clé, reliée à toutes les requêtes qui le contiennent, et une requête peut relever de plusieurs clés : « cat food » appartient à la fois à « cat » et à « food ». L'exemple du brevet : la clé « cat » liste « cat », « cat food », « tabby cat », « cat show breeds », « how to wash a cat » et « funny cat photos ».

Le système procède ensuite en 4 étapes :

  1. Trouver les termes les plus fréquents de la page, par exemple « les deux termes non filtrés les plus fréquents », en écartant les mots vides, les termes très courants et les termes très rares.
  2. Comparer les phrases autour de chaque occurrence aux requêtes de la clé de ce terme. Chaque requête qui correspond est un « succès ».
  3. Calculer la part de requêtes trouvées pour chaque clé. « Si une clé est associée à vingt requêtes, dont cinq correspondent à des phrases du texte, alors un quart des requêtes ont été trouvées pour cette clé ».
  4. Combiner la moyenne et le maximum de ces parts en un score de bourrage de requêtes. Avec 2 termes, la moyenne vaut (S1 + S2) / 2 et le maximum est la plus grande des deux valeurs S1 et S2. Avec un seul terme, le score vaut simplement S1. La fonction peut privilégier une mesure sur l'autre, par exemple sous la forme d'un produit de 2 fonctions monotones.

La logique : « plus on trouve de requêtes parmi toutes celles de la clé, plus il est probable que le texte ait été bourré de requêtes », car beaucoup d'entre elles « ont peu de chances d'apparaître ensemble dans le texte d'une même ressource ».

Comment le score d'incohérence modifie-t-il le classement ?

Le score d'incohérence modifie le classement au moyen de 2 seuils. Dans une mise en œuvre, le système retient comme score d'incohérence le minimum du score de modèle de langage et du score de bourrage de requêtes. Dans d'autres, le score de modèle de langage renforce le score de bourrage de requêtes, ou l'un des deux scores est utilisé seul. Ensuite :

  1. Au niveau ou en dessous d'un premier seuil : la page est retirée « des candidats aux résultats de recherche ». Le système peut la supprimer de l'index, la déplacer « vers un index de niveau inférieur », la marquer comme indisponible ou lui appliquer une pondération très forte.
  2. Entre les 2 seuils : le score de classement de la page est pondéré à la baisse pour la rétrograder. La pondération peut varier selon le score d'incohérence, par exemple un facteur « inversement proportionnel au score d'incohérence », si bien que certaines pages sont plus rétrogradées que d'autres.
  3. Au niveau ou au-dessus du second seuil : le score de classement reste inchangé.

Une page jugée incohérente peut-elle encore apparaître dans les résultats ?

Oui, dans un cas : les requêtes d'URL et de site. Le brevet décrit un filtre qui « désactive la pondération des documents incohérents pour les requêtes d'URL et de site ». Si la requête est l'URL de la page, « le résultat de recherche pour la ressource est toujours renvoyé, même si son score d'incohérence est inférieur au premier seuil ». Une page incohérente peut donc disparaître des autres requêtes tout en restant accessible à qui cherche son adresse exacte.

Le brevet énonce son objectif : retirer ou rétrograder le contenu incohérent « réduit la capacité des spammeurs à tirer des revenus de ce contenu ».

Ce brevet s'applique-t-il au contenu généré par IA ?

Oui : sa logique s'applique à tout texte produit en masse sans valeur, même si le brevet précède l'usage des grands modèles de langage pour produire du contenu. Un modèle de langage détecte les textes dont les suites de mots sont improbables, et un index de requêtes détecte les pages qui enchaînent des expressions recherchées. Les règles anti-spam de Google mentionnent, depuis mars 2024, l'« abus de contenu à grande échelle » : la production de nombreuses pages, automatiquement ou par des personnes, principalement pour manipuler le classement.

Un texte d'IA fluide a de bonnes chances d'obtenir un bon score à un test de modèle de langage, ce qui reporte le contrôle sur d'autres signaux, comme le gain d'information et le profil de n-grammes utilisé pour prédire la qualité d'un site.

Que change le brevet sur le contenu incohérent pour votre SEO ?

Le brevet signifie qu'un texte écrit pour des mots-clés plutôt que pour des lecteurs peut être mesuré et filtré. 5 conséquences en découlent :

  1. Écrivez des phrases naturelles. Un modèle de langage note la probabilité des suites de mots : un texte bourré de mots-clés, réécrit automatiquement ou mal traduit obtient un score faible.
  2. N'enchaînez pas les requêtes. Une page qui contient une grande part des requêtes connues de son terme principal paraît bourrée, même si chaque expression est réelle.
  3. Relisez les traductions automatiques. La traduction brute est l'une des sources de contenu incohérent nommées par le brevet.
  4. Gardez navigation et listes hors du texte principal. Le brevet peut ignorer les fragments courts comme les menus et écarter les listes de noms propres : le contenu qui compte, ce sont vos paragraphes.
  5. Publiez moins de pages, mais meilleures. Les pages produites en masse pour des mots-clés sont la cible exacte du brevet et de la règle de Google sur l'abus de contenu à grande échelle.

Un audit de contenu SEO de notre équipe repère les 3 schémas que vise ce brevet : les pages qui enchaînent des variantes de requêtes, les traductions automatiques brutes et les gabarits produits en masse.

Le brevet décrit ce que le système de Google peut faire. Il ne confirme pas que Google utilise aujourd'hui ces scores ou ces seuils exacts.

Quiz express

Avez-vous tout compris ?

Testez ce que vous venez de lire.

Question 1 sur 4

Quels 2 scores se combinent en score d'incohérence ?

Articles liés

Nous lisons les brevets pour que vous n'ayez pas à le faire.

Chaque semaine : 3 enseignements SEO étayés par les données, 1 mythe démonté, 1 méthode à reprendre. Sans remplissage. Sans conseils de gourou.

Gratuit pour toujours. Désinscription à tout moment. Nous respectons votre boîte mail. Confidentialité.