Les résumés génératifs de Google sont des réponses rédigées par un grand modèle de langage (LLM) à partir du contenu de documents de résultats sélectionnés, chaque partie vérifiable étant reliée à une page qui l'appuie. Le brevet US 11,769,017 B1, « Generative summaries for search results », décrit ce système. Google l'a déposé le 20 mars 2023, à partir d'une demande provisoire du 30 décembre 2022, et le brevet a été délivré le 26 septembre 2023.
Que décrit le brevet US 11,769,017 ?
Le brevet US 11,769,017 décrit un système de recherche qui fournit à un LLM le contenu de résultats de recherche pour rédiger un résumé de la réponse en langage naturel. Ses 10 inventeurs sont Matthew K. Gray, John Blitzer, Corinn Herrick, Srinivasan Venkatachary, Jayant Madhavan, Sam Oates, Phiroze Parakh, Aditya Shah, Mahsan Rofouei et Ibrahim Badr. Le brevet compte 22 revendications et 12 planches de dessins, et il cite 2 modèles de Google comme exemples de LLM : PaLM et LaMDA.
La requête peut être tapée, dictée, fondée sur une image, multimodale (l'exemple du brevet : la photo d'un avocat accompagnée de la question vocale « est-ce sain ? »), ou implicite : générée automatiquement à partir du contexte ou du profil, comme « actualité des brevets » pour un utilisateur qui s'intéresse aux brevets. Le résumé peut être affiché ou lu à voix haute.
Le brevet n'emploie jamais les noms « Search Generative Experience » ni « AI Overviews ». Google a présenté sa Search Generative Experience lors de Google I/O le 10 mai 2023, moins de 2 mois après le dépôt, et a annoncé le lancement des AI Overviews aux États-Unis le 14 mai 2024. Le brevet décrit le mécanisme qui sous-tend ce type de réponse.
Quels problèmes le brevet résout-il ?
Le brevet résout 3 faiblesses d'un LLM qui répond à partir de ses seules données d'entraînement :
- Les réponses inexactes : le LLM peut ne pas avoir été entraîné sur des données récentes, avoir été entraîné sur des données inexactes, ou produire « une soi-disant hallucination ». L'exemple du brevet est la requête « comment modifier les paramètres DNS d'un routeur Acme » : la réponse « l'adresse IP par défaut est 192.168.1.1 » peut être fausse si le modèle l'a apprise sur des données périmées et que l'adresse par défaut a changé depuis.
- La même réponse pour tous : un LLM renvoie le même résultat à un utilisateur peu technophile et à un utilisateur technophile qui saisissent la même requête.
- Les réponses trop ou pas assez détaillées : la réponse en donne trop à l'expert, ou pas assez au débutant pour terminer sa tâche.
La solution consiste à traiter un contenu supplémentaire avec la requête, voire sans elle : du contenu tiré de documents de résultats, qui peut être « plus à jour que les données d'entraînement du LLM ». Le brevet pose toutefois une limite : le résumé peut encore contenir une partie « qui ne découle pas directement du contenu traité par le LLM », générée à partir de l'entraînement préalable du modèle.
Quels documents Google fournit-il au LLM ?
Google fournit au LLM un ensemble de documents de résultats issus de 4 sources :
- Les documents qui répondent à la requête : les résultats de la requête elle-même. Le système peut par exemple garder les N premiers résultats (le brevet cite 2 ou 3 à titre d'exemple).
- Les documents qui répondent à des requêtes associées : les résultats de requêtes « souvent saisies par une population d'utilisateurs peu de temps avant ou après la requête ».
- Les documents qui répondent à des requêtes récentes : les résultats de requêtes saisies récemment depuis le même appareil ou le même compte, privilégiées quand elles sont proches dans le temps et recoupent la requête par le sujet ou les entités.
- Les documents qui répondent à des requêtes implicites : les résultats de requêtes générées automatiquement à partir du contexte ou du profil.
Les 3 sources supplémentaires sont facultatives et sélectives. Dans l'exemple du brevet, les résultats de requêtes associées ne sont ajoutés « que lorsque » les résultats de la requête elle-même « sont de faible qualité ou peu variés, et que l'intensité de la corrélation atteint un seuil ». Cette corrélation peut reposer sur le nombre de fois où les 2 requêtes sont saisies par le même appareil ou le même compte à peu de temps d'intervalle. Les requêtes récentes et implicites suivent la même logique, avec un seuil de recoupement. L'objectif est de ne dépenser des ressources de calcul supplémentaires que lorsqu'elles ont des chances de produire un résumé plus exact.
La consigne envoyée au LLM peut inclure la requête, « Dans le contexte de <requête>, résume <Contenu A>, <Contenu B>, <Contenu C> et <Contenu D> », ou l'omettre : « Résume <Contenu A>, <Contenu B>, <Contenu C> et <Contenu D> ». Dans l'exemple, A et B viennent des résultats de la requête, C d'une requête associée et D d'une requête récente.
Quelles mesures font d'une page une source ?
3 familles de mesures peuvent décider des documents de résultats qui entrent dans l'ensemble. Le brevet les liste avec des exemples.
| Famille | Mesures citées dans le brevet |
|---|---|
| Liées à la requête | Position dans les résultats de la requête, taux de sélection pour la requête, localité (origine de la requête et lieu du document), correspondance de langue |
| Indépendantes de la requête | Taux de sélection sur de nombreuses requêtes, fiabilité (selon l'auteur, le domaine ou les liens entrants), popularité globale, fraîcheur |
| Liées à l'utilisateur | Lien avec les attributs du profil de l'utilisateur, avec ses requêtes récentes et ses interactions récentes hors requêtes |
La mesure de fraîcheur « reflète la date de création ou de mise à jour » du document. La mesure de fiabilité peut être « établie selon son auteur, son domaine ou ses liens entrants ». Pour les mesures liées à l'utilisateur, l'exemple du brevet est un « cinéphile » : une page sur un film a plus de chances d'entrer dans son ensemble.
Ces mesures font varier l'ensemble d'une saisie de la requête à l'autre. La requête « history of Louisville » envoyée depuis Louisville, dans le Kentucky, et depuis Louisville, dans le Colorado, peut recevoir 2 ensembles de documents distincts, donc 2 résumés différents.
Quelle partie d'une page le LLM lit-il ?
Le LLM lit tout ou partie de chaque page sélectionnée, la partie étant choisie pour sa corrélation avec la requête. Ce contenu peut être du texte, des images (par des légendes générées, le texte détecté dedans ou la description des objets détectés) ou des vidéos (par leurs transcriptions). Le brevet décrit un extrait retenu parce qu'il contient des termes de la requête, des termes proches de ceux de la requête, ou parce que « la représentation vectorielle de l'extrait est à une distance inférieure à un seuil de celle de la requête ». Ces représentations vectorielles descendent du brevet Word2vec, qui place les mots dans un espace de sens.
Le système peut résumer ce contenu avant de le transmettre au LLM, par exemple quand il dépasse les contraintes de mémoire du LLM. Il peut aussi ajouter à chaque fragment un identifiant de source : un jeton placé au début ou à la fin du contenu, descriptif ou générique comme S1, S2, S3.
Comment Google relie-t-il une phrase à sa source ?
Google relie une partie du résumé à une source quand un document vérifie cette partie. Le brevet appelle ce processus « linkifying ». Une partie peut être une phrase, un segment de phrase cohérent sur le plan sémantique, ou une suite de N caractères ou de N mots. Le brevet décrit 2 façons de décider qu'un document la vérifie :
- La sortie du LLM elle-même : un identifiant de source (S1, S2...) placé avant ou après une partie indique que le document correspondant la vérifie.
- Une comparaison de représentations vectorielles, en 4 étapes :
- Encoder la partie du résumé en représentation vectorielle.
- Encoder une partie du document candidat en représentation vectorielle.
- Mesurer la distance entre les 2 représentations.
- Ajouter le lien quand « la mesure de distance respecte un seuil ».
Le document candidat provient soit des documents utilisés pour rédiger le résumé, soit d'une nouvelle recherche lancée sur la partie elle-même, dont on garde le premier résultat ou l'un des N premiers. Le document lié peut donc être une page que le LLM n'a jamais lue. Le système s'arrête après un document qui vérifie la partie ou après N candidats, mais une partie peut aussi recevoir plusieurs liens, chacun affiché sous forme d'icône. Une partie qu'aucun document ne vérifie reste sans lien.
L'utilisateur atteint ensuite la source « d'un seul toucher, d'un seul clic ou d'une seule autre action », et le lien peut être une ancre vers le passage qui vérifie la partie. Dans les figures du brevet, les 3 sources citées dans le résumé ont des URL différentes de celles des 3 résultats classiques affichés en dessous.
Quelle confiance Google accorde-t-il à un résumé ?
Google mesure la confiance pour chaque partie du résumé et pour le résumé entier, à partir de la confiance propre du LLM et des documents qui le vérifient. Pour une partie, la confiance peut dépendre du nombre et de la fiabilité des documents qui la vérifient. Le brevet donne 2 comparaisons : la confiance est plus élevée « quand quatre documents vérifient cette partie que quand un seul la vérifie », et plus élevée « quand quatre documents très fiables vérifient cette partie que quand quatre documents moins fiables la vérifient ».
La confiance décide si et comment le résumé s'affiche :
- Au-dessus d'un seuil haut : le résumé peut s'afficher d'abord sans aucun résultat classique, qui apparaît après un délai ou sur demande.
- Entre les 2 seuils : le résumé s'affiche avec les résultats classiques.
- Sous le seuil bas : le résumé est supprimé et seuls les résultats classiques s'affichent.
L'interface peut aussi annoter la confiance, avec une mention « confiance élevée » ou « confiance faible » pour le résumé entier, ou une couleur par partie (vert, orange, rouge dans l'exemple).
En amont, une étape choisit « aucun, un ou plusieurs » modèles génératifs pour la requête, à l'aide de classifieurs ou de règles : un LLM informatif, un LLM créatif pour les poèmes ou les essais, un modèle de diffusion texte vers image, ou un LLM plus petit ou plus grand. Le système peut ne choisir aucun modèle quand, par exemple, « les résultats de recherche pour la requête sont de grande qualité ». Une requête peut donc ne recevoir aucun résumé généré.
Comment le résumé s'adapte-t-il à chaque utilisateur ?
Le résumé s'adapte à ce que l'utilisateur sait déjà et aux résultats qu'il a ouverts. Le système compare le profil à la requête et à ses résultats : l'utilisateur est jugé familier d'un contenu s'il a déjà interagi avec des documents qui le contiennent, ou si son profil l'indique directement. La consigne devient alors « en supposant que l'utilisateur connaît [description du contenu], réponds à [requête] ».
Après une interaction avec un résultat, le système génère un résumé révisé, avec un contenu supplémentaire du type « suppose que l'utilisateur sait déjà X ». Le résumé révisé peut laisser de côté ce que ce résultat couvrait, ou au contraire l'approfondir. Une interaction peut être un clic suivi d'un temps de consultation minimal, mais elle n'exige pas de clic : le brevet compte « l'arrêt du défilement sur le résultat, le déploiement du résultat, la mise en surbrillance du résultat ».
Le résumé révisé peut remplacer le résumé initial quand l'utilisateur revient sur la page de résultats, ou s'afficher quand il saisit à nouveau la même requête ou une requête proche, « quelques minutes, heures ou jours plus tard ».
Que protègent les 22 revendications du brevet ?
Les revendications protègent 2 méthodes indépendantes :
- La revendication 1 : le résumé révisé après une interaction avec un document de résultat, à partir d'une entrée qui reflète cette interaction (les revendications 2 à 12 ajoutent la consultation pendant une durée minimale, le remplacement du résumé initial, une consigne qui reflète la familiarité, la sélection de résultats de la requête et de requêtes associées).
- La revendication 13 : la sélection d'un ensemble de documents de résultats, le résumé généré à partir de leur contenu, et une annotation de confiance sur une partie du résumé (les revendications 14 à 22 ajoutent la sélection par des mesures liées à la requête, indépendantes de la requête et liées à l'utilisateur, les requêtes associées au-dessus d'un seuil de corrélation, les liens sur les parties vérifiées, la génération sans la requête, et les requêtes implicites).
Les autres mécanismes (les 4 sources, la vérification par représentations vectorielles, le choix du modèle) sont décrits dans le brevet, mais ne sont pas tous revendiqués en tant que tels.
Quelles autres variantes le brevet décrit-il ?
- Les formats de sortie : l'utilisateur peut demander un « format liste », un « format graphique », un « top 5 » ou un résumé « dans le style de » quelqu'un, ce qui choisit un LLM affiné pour ce format ou adapte la consigne.
- Plusieurs LLM en parallèle : chacun rédige un résumé candidat, et le système en garde un, par exemple celui qui ressemble le plus aux autres candidats.
- Plusieurs LLM en série : un premier LLM choisit des passages, un deuxième résume chaque passage, un troisième rédige le résumé d'ensemble.
Que change le brevet des résumés génératifs pour votre GEO ?
Le brevet signifie qu'une page est citée dans un résumé génératif quand la recherche la sélectionne, quand ses passages vérifient des affirmations précises, et quand des sources fiables disent la même chose. 6 conséquences en découlent :
- Positionnez-vous d'abord dans les résultats classiques. Le LLM lit des documents de résultats sélectionnés selon des mesures comme la position et le taux de sélection, et la recherche de vérification garde elle aussi les premiers résultats pour la phrase. Une page qui ne se positionne sur rien de pertinent n'a aucun chemin pour devenir une source.
- Écrivez des passages qui vérifient chacun une affirmation. Avec la méthode vectorielle, un lien n'apparaît que si la représentation vectorielle d'un passage est proche de celle d'une partie du résumé. Notre lecture : les passages courts, factuels et autonomes sont les plus faciles à rapprocher.
- Construisez des signaux de fiabilité. Le brevet cite l'auteur, le domaine et les liens entrants comme base de la mesure de fiabilité, qui pèse aussi sur la confiance.
- Mettez vos pages à jour. La mesure de fraîcheur reflète la date de création ou de mise à jour, et un contenu plus récent que les données d'entraînement du LLM est l'une des raisons que donne le brevet pour lire des pages web.
- Couvrez les requêtes associées et les questions de suivi. Les résultats des requêtes associées, récentes et implicites peuvent entrer dans l'ensemble quand les résultats de la requête sont faibles ou peu variés, et les résumés révisés passent à ce que l'utilisateur n'a pas encore lu.
- Soyez corroboré. La confiance augmente quand plusieurs documents fiables vérifient la même partie, et une confiance faible peut supprimer le résumé : énoncez des faits que des sources indépendantes et fiables confirment.
Notre service GEO vérifie ces 6 points page par page, en commençant par la position de la page dans les résultats classiques sur les requêtes dont part un résumé.
Les données de clics qui alimentent le taux de sélection sont le cœur de Navboost, et la fiabilité fait écho au signal de confiance, qui classe les pages selon les entités qui s'en portent garantes.
Le brevet décrit ce que le système de Google peut faire. Il ne confirme ni les mesures qu'utilisent aujourd'hui les AI Overviews, ni leur poids.