La date d'une page sert à deux lecteurs qui n'ont rien en commun. Le premier est humain : il regarde si le comparatif qu'il consulte est de cette année. Le second est une machine, et il ne regarde pas la même chose. Il cherche un champ, dans le code de la page, qui lui dise quand ce texte a été écrit et quand il a été modifié pour la dernière fois.

Nous mesurons régulièrement ce que les moteurs génératifs citent, et presque jamais l'âge de ce qu'ils citent. Ce relevé comble ce trou. Dix questions d'achat françaises, les sources que Perplexity leur attache, et pour chacune de ces pages la réponse à une question simple : porte-t-elle une date, et laquelle ?

Le résultat n'est pas celui que nous attendions. Le corpus cité n'est ni vieux ni neuf : il est ancien et redaté.

Le protocole, et ce qu'il produit

Dix questions, une par marché, formulées comme un acheteur les formule. Logiciel de facturation pour une TPE, assurance emprunteur, vélo électrique pour le trajet domicile-travail, fournisseur d'électricité verte, logiciel de gestion de projet pour une PME, aspirateur robot avec animaux, banque en ligne pour une société, matelas pour le mal de dos, CRM pour une petite équipe commerciale, assurance habitation étudiant. Cinq questions grand public, cinq questions professionnelles.

Chaque question est posée une fois à Perplexity, modèle sonar-pro, recherche web activée, via l'API DataForSEO. Le 19 septembre 2026 entre 06 h 08 et 06 h 11 UTC, pour un coût total de 0,154830 dollar. Les dix réponses donnent 187 URL citées, toutes distinctes : aucune page n'apparaît sur deux questions, ce qui confirme au passage ce que nous avions relevé sur deux moteurs comparés, à savoir qu'un corpus de sources est très spécifique à sa question.

Chacune des 187 URL a ensuite été récupérée en curl, avec un agent utilisateur de navigateur et suivi des redirections. 166 répondent 200, réparties sur 119 hôtes distincts. 20 répondent 403 et une ne répond pas du tout. Ce sont ces 166 pages que nous avons interrogées sur leur date.

La recherche porte sur les champs qu'une machine peut lire sans interpréter du texte : datePublished et dateModified dans le JSON-LD, article:published_time et article:modified_time en balises meta, et l'attribut datetime d'une balise <time>. Les commentaires HTML sont retirés avant l'extraction, faute de quoi on compte des balises désactivées et on publie un chiffre faux.

138 pages datées, 28 muettes

138 des 166 pages portent au moins une de ces dates. 28 n'en portent aucune.

Le canal est presque unique : le datePublished vient du JSON-LD 132 fois, d'une balise meta 3 fois, d'une balise <time> une seule fois. Autrement dit, hors JSON-LD il ne reste presque rien : quatre pages sur 136 tirent leur date de publication d'un autre canal. C'est un argument de plus pour les données structurées, et un argument d'une nature différente de ceux qu'on avance habituellement : il ne s'agit pas d'obtenir un affichage enrichi, il s'agit d'exister dans le temps.

Sur les 28 pages muettes, 11 servent quand même un en-tête HTTP Last-Modified. Il ne faut pas le confondre avec une date de contenu : il date le fichier servi, pas le texte écrit. Sur un site régénéré à chaque déploiement, il vaut la date du dernier déploiement et ne dit rien de l'article.

Le corpus n'est pas vieux, il est redaté

Voici les deux chiffres qui font ce relevé, et ils ne racontent pas la même histoire.

La date la plus récente des deux champs a une médiane de 59 jours. Deux mois. À ce compte, le corpus cité par Perplexity est frais, et la conclusion tiendrait en une ligne : le moteur cite ce qui vient d'être écrit.

Mais la médiane du seul datePublished est de 360 jours. Un an. 67 des 136 pages qui déclarent une date de publication ont été publiées il y a plus d'un an, soit 49,3 %, et 45 d'entre elles il y a plus de deux ans. Le moteur ne cite donc pas ce qui vient d'être écrit : il cite ce qui vient d'être retouché.

L'écart entre les deux champs le dit directement. Sur les 128 pages qui déclarent les deux, l'écart médian entre publication et dernière modification est de 196 jours, et l'écart maximal de 4 828 jours, soit treize ans.

Profil de la page citée Pages Part
Ancienne (plus d'un an) et retouchée dans les 90 derniers jours 39 30,5 %
Jamais retouchée depuis sa publication 34 26,6 %
Publiée depuis moins d'un an, et retouchée depuis 32 25,0 %
Ancienne (plus d'un an) et retouchée il y a plus de 90 jours 23 18,0 %
Total 128 100 %

Ces quatre profils s'excluent l'un l'autre et couvrent les 128 pages qui portent les deux champs. Deux lectures s'imposent.

La première ligne est la plus fournie du tableau. Un autre découpage, qui ne figure pas dans celui-ci parce qu'il chevauche deux de ses lignes, la rend plus lisible encore : 22 des 128 pages ont été publiées dans les 90 derniers jours. Ce corpus contient donc 39 vieilles pages rafraîchies pour 22 pages réellement neuves.

La deuxième ligne, en revanche, ne dit pas ce qu'on croit. Les 34 pages jamais retouchées ne sont pas des pages abandonnées : leur âge médian est de 83 jours, 17 d'entre elles ont moins de trois mois, et trois seulement dépassent l'année. Une page publiée la semaine dernière n'a pas encore eu de raison d'être modifiée. Les trois qui dépassent l'année sont un comparatif d'aspirateurs de Clubic de mai 2025, un guide de les-domotiques.fr de janvier 2025, et très loin devant les deux autres, un article du Figaro Santé sur le matelas et le mal de dos, publié le 26 novembre 2017 et jamais retouché depuis, soit 3 219 jours. Ce dernier est aussi la page la plus ancienne du corpus au sens de la date la plus récente qu'elle porte.

Le cas extrême est un comparatif bancaire de MoneyVox. Son JSON-LD déclare datePublished au 1er juillet 2013 et dateModified au 19 septembre 2026, soit le matin même du relevé. Treize ans d'écart, et la page est citée sur une question posée aujourd'hui. Selectra fournit trois pages du corpus, publiées en 2017, 2018 et 2019, toutes trois modifiées en juillet ou août 2026. Meilleurtaux en fournit deux, publiées en juin 2014, modifiées en 2026.

La conséquence pratique est inconfortable pour les plans éditoriaux. Créer une page neuve sur un sujet déjà couvert par un comparatif de 2017 entretenu depuis neuf ans vous met en concurrence avec un historique que vous ne pouvez pas rattraper par la publication. En revanche, une URL que vous détenez déjà et que vous reprenez sérieusement se retrouve dans le bon profil du tableau.

Cent six titres annoncent 2026, cinquante et un sont plus vieux

Deuxième mesure, sur le même corpus. 111 des 166 titres de page contiennent une année : 106 annoncent 2026, cinq annoncent encore 2025.

Or, parmi les 106 titres qui annoncent 2026 :

  • 51 pages ont été publiées avant 2026 ;
  • 24 ont été publiées avant 2024 ;
  • 13 ne portent aucune date lisible par une machine.

L'année dans le titre n'est donc pas une information sur le contenu, c'est une promesse commerciale. Elle est parfois adossée à une vraie mise à jour, et parfois seule. Le moteur, lui, la reprend. Sur la question d'assurance emprunteur, Perplexity écrit « si vous cherchez des offres souvent bien classées en 2026 » sur un corpus dont la médiane de publication est de 1 307 jours, soit février 2023. La phrase est exacte quant à ce que disent ses sources, et elle transmet au lecteur une fraîcheur que les sources ne garantissent pas.

Le détail le plus parlant est une URL. appvizer.fr/magazine/operations/gestion-de-projet/meilleur-logiciel-gestion-de-projet-2021 porte 2021 dans son chemin, déclare une publication au 9 juin 2021 et une modification au 15 janvier 2026, et se trouve citée sur une question de 2026. Le chemin d'URL ne se réécrit pas sans casser des liens, ce qui est exactement pourquoi il ne faut pas y mettre d'année.

Quand la date existe pour l'œil et pas pour la machine

Trois des 28 pages muettes méritent d'être ouvertes une à une, parce qu'elles ne sont pas muettes pour la même raison.

Le cas où l'information est là, mais en prose. La page de Zapier sur les CRM pour petites entreprises ne déclare aucun champ de date. Dans son texte, en revanche, on lit : « Publié à l'origine en 2018, cet article a bénéficié de contributions de Jamie Irish et Chris Hawkins. La mise à jour la plus récente date de juillet 2026. » Tout y est, l'historique complet, l'attribution des contributions, la date de révision. Rien n'est dans un champ. C'est la situation la plus frustrante du corpus : un éditeur qui fait le travail éditorial et n'en tire aucun bénéfice mécanique.

Le cas du champ vide. La page de Sellsy sur les meilleurs logiciels CRM affiche 16/3/2026 à l'écran, dans un paragraphe de métadonnées. Juste après, elle sert un élément portant le texte « mis à jour le », suivi d'un paragraphe vide, tous deux marqués par les classes que Webflow ajoute quand le champ de collection n'est pas rempli. La mécanique d'affichage de la date de mise à jour existe, elle est en place, et personne n'a renseigné le champ. C'est la variante « dates » du problème que nous avons décrit sur le rendu JavaScript : la page est correcte pour un œil humain et incomplète pour ce qui la lit.

Le cas de l'absence pure. Les pages produit de la MAIF, de Luko et de SG sur l'assurance habitation étudiant ne contiennent, elles, aucun champ de date, ni aucune date visible dans le texte. Nous avons vérifié par comptage direct sur le HTML servi, commentaires retirés : zéro occurrence de datePublished, dateModified, article:published_time, article:modified_time ou <time>.

Une question où les pages muettes sont les pages de marque

Cette troisième catégorie n'est pas répartie au hasard dans le corpus. Elle se concentre sur une question.

Sur la question d'assurance habitation étudiant, 11 pages sur 16 répondent 200, et 8 de ces 11 ne portent aucune date. Ce sont, une par une, les pages de Luko, de studyassur (deux pages), de SG, de la MAIF et du Crédit Agricole, soit six pages produit d'assureur ou de banque, auxquelles s'ajoutent celles de lecomparateurassurance.com et d'étudiant.gouv.fr. Les trois qui portent une date sont Selectra, publiée le 4 juillet 2017 et modifiée le 20 août 2026, le Crédit Mutuel, publiée le 1er juin 2026, et assurances-etudiants.com, publiée le 17 septembre 2026.

Le contraste avec le reste du corpus est net : hors cette question, 135 des 155 pages lisibles portent une date, soit 87 %, contre 3 sur 11 ici, soit 27 %.

L'explication tient à un usage de métier. Une page produit d'assureur n'est pas un article, personne ne lui a jamais demandé une date, et le gabarit qui la produit n'en prévoit pas. Le problème est que cette page est désormais lue par un système qui date ce qu'il cite. Un assureur dont l'offre étudiante a changé en juin n'a aucun moyen de le faire savoir à Perplexity, alors qu'un comparateur publié en 2017 y parvient en changeant un champ.

C'est la même asymétrie que celle observée sur la profondeur des pages citées, à un cran plus bas : les conventions éditoriales des médias et des comparateurs se révèlent être, sans que personne l'ait décidé, le format d'entrée des moteurs génératifs.

Ce que la date déclarée ne prouve pas

Trois réserves, et elles comptent.

Une date déclarée est une déclaration, pas un fait. Trois pages de meilleurs-aspirateurs-robots.fr déclarent une datePublished égale au jour du relevé, la même pour les trois, ce qui est invraisemblable pour trois guides comparatifs distincts : le champ est généré à la volée. Nous avons refait tous les calculs en excluant ces trois pages, et les résultats ne bougent pas. Sur 163 pages, la médiane de publication passe de 360 à 373 jours, la part des pages de plus d'un an de 49,3 % à 50 %, le profil de la page ancienne rafraîchie de 30,5 % à 31,2 %. Le relevé ne dépend pas de ces trois lignes.

Une modification datée n'est pas une modification éditoriale. Les deux pages de MoneyVox du corpus portent toutes deux un dateModified au 19 septembre 2026 à 06 h 00, soit pendant la nuit précédant le relevé et à la minute près sur deux pages différentes. C'est la signature d'une regénération programmée, pas celle d'un rédacteur qui reprend un texte. Nous pouvons affirmer que ces pages déclarent avoir été modifiées ce matin-là. Nous ne pouvons pas affirmer que leur contenu a changé.

Les 21 pages non lisibles pourraient tout changer. 20 pages répondent 403 à notre requête et une ne répond pas. Un 403 en curl ne prouve pas qu'un moteur est bloqué, nous l'avons déjà constaté ailleurs : Perplexity les cite, donc il les atteint. Nos chiffres portent sur les 166 pages que nous avons pu lire, et il faut les énoncer ainsi.

Enfin, ce relevé porte sur un moteur, dix questions et une seule exécution. Il décrit un corpus, pas une loi.

Ce qu'il faut retenir

Trois choses, dans l'ordre de ce qu'elles coûtent à corriger.

Renseignez datePublished et dateModified dans le JSON-LD de vos pages commerciales, pas seulement de vos articles. C'est le seul canal qui porte réellement l'information : 132 des 136 dates du corpus en viennent. Une page sans bloc JSON-LD est, pour un moteur génératif, une page hors du temps, et cela vaut aussi pour la page produit qui décrit votre offre actuelle.

Nous devons ici une précision sur notre propre site. L'article que vous lisez déclare bien les deux champs, mais avec la même valeur, parce que notre gabarit les dérive tous les deux de la date de publication. C'est exact aujourd'hui, jour de parution, et cela cessera de l'être à la première révision de cette page. Autrement dit, nous sommes pour l'instant dans le profil « jamais retouchée » du tableau plus haut, et c'est une limite de notre gabarit, pas un choix.

Vérifiez que le champ est rempli, pas seulement que le gabarit le prévoit. Le cas Sellsy montre un site où toute la mécanique est en place et le champ vide. Le contrôle prend une minute : récupérez votre page en ligne de commande, retirez les commentaires, et cherchez datePublished. Si vous ne le trouvez pas, votre lecteur humain voit une date que la machine ne voit pas.

Reprenez une URL plutôt que d'en créer une. C'est le résultat le plus contre-intuitif de ce relevé, et le plus utile : dans ce corpus, le profil le plus fréquent est celui d'une page publiée il y a plus d'un an et retouchée il y a moins de trois mois, à 30,5 %, contre 17 % pour une page fraîchement publiée. L'ancienneté n'est pas un handicap à condition qu'elle soit accompagnée d'une date de modification récente et sincère. Et n'écrivez pas l'année dans le chemin de l'URL, sous peine de la traîner cinq ans comme Appvizer.

Reste la question du délai : entre le moment où vous changez votre champ et celui où la réponse générée en tient compte, il se passe du temps, et ce temps se décompose. Nous l'avons documenté couche par couche dans notre article sur la fraîcheur des contenus.

Ce relevé se pratique aussi dans l'autre sens. Au lieu de mesurer les pages qu'un moteur cite sur un marché, on mesure celles qu'il cite à votre place sur vos propres requêtes : c'est le point de départ d'un audit GEO, avec un panel de vingt à cinquante requêtes d'acheteur soumises plusieurs fois à ChatGPT, Perplexity, Gemini et aux AI Overviews de Google, doublé de l'examen de ce qui empêche techniquement les modèles d'extraire vos contenus. Nos fourchettes de prix vous diront ce que coûte un panel de cette taille avant que vous nous appeliez.