Les ajustements temporels de score sont des modifications du score de classement d'une page selon que les requêtes qui y mènent demandent des informations récentes ou anciennes, et selon le moment où ces requêtes deviennent populaires. Le brevet US 8,924,379 B1, « Temporal-based score adjustments », les décrit. Google l'a déposé le 5 mars 2010, et le brevet a été délivré le 30 décembre 2014.
Que décrit le brevet US 8,924,379 ?
Le brevet US 8,924,379 décrit 3 méthodes qui utilisent le moment et la formulation des requêtes pour ajuster le classement. Ses 2 inventeurs sont Hyung-Jin Kim, inventeur du brevet de reclassement par les clics, et Andrei Lopatenko. Le brevet compte 9 revendications et 13 planches de dessins.
Le résumé cite les 3 méthodes :
- La classification par âge : « ajuster les scores des documents selon une classification par âge d'une ou plusieurs requêtes associées aux documents ».
- Les tendances temporelles des requêtes étendues : « stocker des données de tendance qui associent la requête et une ou plusieurs périodes à une requête étendue ».
- Les fenêtres de variation de popularité : ajuster les scores « selon que la requête est saisie pendant une fenêtre de variation de popularité d'une ou plusieurs requêtes associées ».
Comment Google classe-t-il une page comme récente ou ancienne ?
Google classe une page d'après les termes temporels des requêtes qui y mènent. Chaque page a des requêtes associées : des requêtes passées pour lesquelles elle était un résultat de recherche. Dans la description, une requête est associée à une page quand un internaute a cliqué sur le résultat de cette page pour cette requête ; dans certaines mises en œuvre, l'internaute doit aussi rester sur la page au-delà d'un seuil de temps de consultation, ou la page doit avoir été sélectionnée un nombre minimal de fois ou par un nombre minimal d'internautes. Dans les revendications, les requêtes associées doivent aussi correspondre à la requête saisie par l'internaute. L'exemple du brevet : pour la requête « Super Race Results », l'âge d'une page sur la course de 1996 est jugé uniquement à partir de « Super Race Results 1996 », « Old Super Race Results » et « Super Race Results », pas à partir de ses autres requêtes associées.
Un terme temporel « donne une indication sur la période visée par la requête », selon qu'elle porte « sur des informations récentes ou anciennes ». Le système compare les termes à une liste de termes temporels récents et à une liste de termes anciens, qui « peuvent inclure des dates et des termes au sens temporel approprié ». Les termes temporels anciens incluent les dates passées (« 1996 » quand l'année est 2010) et des mots comme « old », « previous » ou « last year's » (ancien, précédent, de l'an dernier). Les termes temporels récents incluent les dates actuelles (« 2010 » quand l'année est 2010) et des mots comme « new », « current », « future » ou « today » (nouveau, actuel, futur, aujourd'hui). Dans certaines mises en œuvre, un terme temporel déjà présent dans la requête de l'internaute est ignoré : pour la requête « new marathon results », le mot « new » d'une requête associée n'est pas pris en compte.
Chaque requête associée est classée comme récente, ancienne ou non temporelle. L'exemple du brevet est le Document A, avec 4 requêtes associées :
| Requête associée | Classification |
|---|---|
| Marathon 2010 | Récente |
| Current Marathon | Récente |
| Marathon 1998 | Ancienne |
| Marathon Results | Non temporelle |
Avec un compte non pondéré, le compte de requêtes récentes est de 2 et le compte d'anciennes de 1. La page est classée comme récente si le compte de requêtes récentes atteint un seuil, sinon comme ancienne si le compte d'anciennes l'atteint ; une page qui n'est ni l'une ni l'autre est non temporelle. Certaines mises en œuvre ajoutent des conditions, par exemple que le compte de requêtes récentes divisé par le nombre total de requêtes associées dépasse un autre seuil, ou que le compte d'anciennes reste sous un seuil. Une requête qui contient à la fois des termes temporels récents et anciens peut être classée ancienne, récente ou non temporelle selon la mise en œuvre.
Les comptes peuvent être pondérés par une statistique de qualité du résultat pour la page et la requête : « chaque requête peut être pondérée par le nombre de clics longs pour la requête et le document, divisé par le nombre total de clics longs pour la requête et le document ». Dans la version pondérée de l'exemple, les 2 requêtes récentes ont des statistiques de 0,8 et 0,7 : le compte de requêtes récentes est de 1,5. La requête ancienne a 0,01 : le compte d'anciennes est de 0,01. Avec un seuil de 1,4 pour le compte de requêtes récentes, le Document A est classé comme récent.
Comment la classification par âge modifie-t-elle le classement ?
La classification par âge modifie le classement par un ajustement positif ou négatif. L'ajustement « augmente le score d'un premier facteur prédéfini quand le document est récent, et le diminue d'un second facteur prédéfini quand le document est ancien ». Une page non temporelle ne reçoit aucun ajustement. Chaque facteur peut être un montant fixe ajouté au score ou retranché, ou un montant fixe par lequel le score est multiplié. Dans les revendications, le facteur de bonus est déterminé à partir du compte de requêtes récentes et le facteur de pénalité à partir du compte d'anciennes : plus une page a de requêtes récentes, plus son bonus peut être élevé. Dans certaines mises en œuvre, les facteurs sont choisis pour que chaque page récente obtienne un score supérieur à chaque page ancienne, sans qu'une page récente dépasse une autre page récente qui avait au départ un score plus élevé.
Dans certaines mises en œuvre, le système vérifie d'abord que la requête de l'internaute n'est pas elle-même une « requête ancienne » : « si la requête est une requête ancienne, l'internaute n'est peut-être pas particulièrement intéressé par des documents plus récents », et aucun ajustement n'est appliqué. Le postulat de départ du brevet est que, « sauf si les requêtes suggèrent explicitement le contraire, un internaute cherche l'information la plus récente sur le sujet de sa requête ».
Que sont les requêtes étendues et les tendances temporelles ?
Les requêtes étendues sont des requêtes qui contiennent tous les termes d'une requête de base plus un ou plusieurs termes supplémentaires. La méthode part des requêtes récurrentes, des requêtes qui connaissent plusieurs pics de popularité sur une période comme une année ou un mois. L'exemple du brevet est « playoff schedule » (calendrier des play-offs), qui connaît des pics en janvier, avril et octobre, les saisons de play-offs de la National Football League, de la National Basketball Association et de la Major League Baseball. Ses requêtes étendues peuvent être « playoff schedule nfl », « playoff schedule nba » et « playoff schedule mlb ».
Dans certaines mises en œuvre, les requêtes étendues sont des affinements de requête : des requêtes saisies par l'internaute après la requête de base. Un affinement peut devoir contenir un ou plusieurs termes de la requête de base : « Olympics 2010 » est un affinement de « Olympics », mais « Winter competition 2010 » ne l'est pas. Il peut aussi devoir suivre la requête de base dans un nombre maximal de requêtes ou un délai maximal, par exemple « cinq secondes plus tard », et dans certaines mises en œuvre l'internaute ne doit avoir sélectionné aucun résultat de la requête de base entre les deux. Les reformulations au sein d'une session alimentent une autre méthode de Google, où les synonymes en contexte s'apprennent des internautes qui changent une seule expression de leur requête.
Pour chaque période (l'exemple du brevet est de deux semaines), le système calcule un score de popularité pour chaque requête étendue, par exemple le nombre de fois où elle « a été saisie comme affinement pendant la période », divisé par le nombre de fois où la requête de base « a été saisie pendant la période ». Il stocke, pour chaque période, la requête étendue au score le plus élevé ; certaines mises en œuvre en stockent plusieurs, celles dont le score dépasse un seuil. Quand un internaute saisit la requête de base pendant cette période, les documents peuvent être notés « au moins en partie selon cette requête étendue ». Concrètement, le moteur de classement peut attribuer des scores plus élevés aux documents qui contiennent des termes de la requête étendue absents de la requête d'origine, ou aux documents associés à des requêtes qui contiennent ces termes, par exemple d'un facteur dérivé du score de popularité de la requête étendue sur la période.
Qu'est-ce qu'une fenêtre de variation de popularité ?
Une fenêtre de variation de popularité est « une période récurrente pendant laquelle la popularité d'une requête varie temporairement au-delà d'un seuil ». Le brevet l'illustre avec la requête « how to cook a turkey » (comment cuisiner une dinde) : sa popularité reste relativement constante jusqu'à peu avant novembre, augmente fortement, puis retrouve son niveau précédent peu après le début de décembre, un pic que le brevet attribue aux internautes des États-Unis qui préparent Thanksgiving. Autre exemple : « Easter Bunny » (le lapin de Pâques) peut devenir plus populaire chaque année autour de Pâques.
Le seuil peut être fixé de manière empirique, « pour que les petites fluctuations de fond de la popularité » ne soient pas identifiées comme des fenêtres, et les pics ou creux peuvent être détectés par des techniques classiques d'analyse de séries temporelles. Le système peut agréger plusieurs années passées, par exemple jour par jour sur l'année civile. Une requête tombe dans une fenêtre quand son moment de saisie y correspond : si la fenêtre est le mois de janvier, établie à partir des données de janvier 2000 à janvier 2009, une requête saisie le 2 janvier 2010 y tombe.
Quand une requête est saisie pendant un pic des requêtes associées à une page, le score de la page peut augmenter « d'un premier facteur prédéfini » ; pendant un creux, il peut diminuer « d'un second facteur prédéfini ». Si aucune requête associée à la page n'est dans une fenêtre, la page ne reçoit aucun ajustement. Le facteur peut aussi varier : il peut être plus grand quand la fenêtre est plus courte, quand le pic ou le creux est plus marqué, ou quand davantage de requêtes associées à la page sont dans une fenêtre. Une variante ajuste toutes les pages, en pondérant chaque requête associée par sa popularité sur la période en cours divisée par sa popularité moyenne. Les pages saisonnières peuvent donc remonter quand leur saison revient. Le brevet note aussi que les résultats choisis pour une même requête peuvent changer selon la période de l'année : pour « Turkey », les internautes choisissent d'habitude des résultats sur le pays, mais en novembre des résultats sur la façon de cuisiner une dinde.
Quels mécanismes le brevet revendique-t-il vraiment ?
Les 9 revendications couvrent uniquement le mécanisme de classification par âge. Les revendications 1, 5 et 9 (procédé, système et support de stockage) décrivent la classification des requêtes associées comme récentes ou anciennes, les comptes de requêtes récentes et anciennes, les seuils, et un bonus déterminé à partir du compte de requêtes récentes ou une pénalité déterminée à partir du compte d'anciennes. Les revendications 2, 3, 6 et 7 ajoutent la pondération par des statistiques de qualité du résultat. Les tendances temporelles des requêtes étendues et les fenêtres de variation de popularité sont décrites dans la description et le résumé, mais ce brevet ne les revendique pas.
Quel lien entre ce brevet et les autres brevets sur la fraîcheur ?
Ce brevet lit la fraîcheur à partir des requêtes, tandis que le brevet sur la vélocité des liens la lit à partir des liens et le brevet sur les changements de document à partir des modifications du contenu. Ensemble, ils décrivent 3 angles indépendants pour juger si une page est actuelle : ce que les gens recherchent, qui pointe vers elle, et comment son texte évolue.
Que change la fraîcheur des requêtes pour votre SEO ?
La fraîcheur des requêtes signifie que les requêtes qui amènent des visiteurs sur votre page indiquent à Google si elle est actuelle. 5 conséquences en découlent :
- Attirez les requêtes du présent. Une page cliquée depuis des requêtes contenant l'année en cours ou des termes comme « latest » ou « current » (dernier, actuel) peut être classée récente ; une page cliquée depuis des années passées ou des termes comme « previous » (précédent) peut être classée ancienne.
- Couvrez les variantes que les internautes ajoutent aux requêtes récurrentes. Pour une requête récurrente comme « playoff schedule », le système peut favoriser les pages qui contiennent les termes de la requête étendue la plus populaire de la période, comme « playoff schedule nfl » ou « playoff schedule mlb ».
- Préparez les contenus saisonniers avant leur fenêtre. Les pages liées à des requêtes à pics récurrents peuvent être renforcées pendant le pic : elles doivent être prêtes et indexées à l'avance.
- Gardez le contenu historique historique. Une page sur une édition passée sert les requêtes qui demandent des informations anciennes, et dans certaines mises en œuvre aucun ajustement de fraîcheur n'est appliqué à ces requêtes.
- Obtenez des clics longs sur les requêtes actuelles. Les comptes de requêtes récentes et anciennes peuvent être pondérés par les clics longs : satisfaire les internautes sur les requêtes actuelles renforce la classification récente.
Notre calendrier de marketing de contenu publie les pages saisonnières plusieurs semaines avant leur pic, pour qu'elles soient indexées quand les requêtes récurrentes reviennent.
Le brevet décrit ce que le système de Google peut faire. Il ne confirme pas comment Google ajuste aujourd'hui le classement selon la fraîcheur.