Quand une entreprise décide de travailler sa présence dans les assistants, elle commence par les pages auxquelles elle tient : l'accueil, la page produit, la page de service. Ce sont celles qu'elle a écrites avec le plus de soin, celles qui portent le positionnement, celles que le comité de direction relit. C'est un réflexe compréhensible, et il repose sur une hypothèse jamais vérifiée : que le moteur, quand il cite un site, cite cette partie-là du site.
Nous avons voulu savoir ce qu'il cite vraiment. Pas quel domaine, question déjà traitée dans plusieurs relevés, mais quelle page. Dix questions d'achat françaises, dix marchés sans rapport entre eux, 196 sources relevées et classées une par une. Le résultat tient en deux chiffres. Quatre de ces 196 sources sont une page d'accueil. Et parmi les pages internes dont nous avons pu contrôler le site, trois sur quatre ne sont liées depuis aucun endroit de l'accueil de leur propre site.
Le relevé : dix questions d'achat, dix marchés, 196 sources
Nous avons écrit dix questions du type de celles qu'un acheteur pose réellement, en français, avec une intention d'achat explicite. Un logiciel de comptabilité pour une TPE, une pompe à chaleur air-eau pour une maison de 120 m², un vélo électrique de ville sous 2 000 euros, un CRM pour une PME de vingt commerciaux, la réparation d'un lave-linge à Lyon, une école d'ingénieurs post-bac en informatique, un matelas pour le mal de dos, un logiciel de caisse conforme pour un restaurant, un fournisseur d'électricité verte, une marque de panneaux solaires.
Le mélange des marchés est volontaire. Il ne s'agit pas ici d'un article de verticale : nous cherchions un motif qui tienne indépendamment du secteur, et dix secteurs sans rapport constituent un test plus dur qu'un seul. Les questions ont été posées à Perplexity, modèle sonar-pro, recherche web activée, le 3 septembre 2026 entre 20 h 53 et 20 h 56 UTC. Dix appels, 0,19 dollar au total.
Elles ont produit 196 URL citées, toutes distinctes, réparties sur 139 noms d'hôte. Aucune URL n'apparaît sur deux questions. 108 hôtes ne sont cités qu'une seule fois dans tout le relevé, et 12 seulement apparaissent sur plus d'une question, presque toujours à l'intérieur d'une même famille de marchés : tool-advisor.fr, independant.io et digitiz.fr sur les logiciels, www.hellowatt.fr, selectra.info et www.quelleenergie.fr sur l'énergie et l'habitat. Un seul fait exception, www.leroymerlin.fr, cité à la fois sur la pompe à chaleur et sur la réparation du lave-linge.
Nous avons ensuite décomposé chaque URL en segments de chemin, ce qui donne une mesure grossière mais objective de la profondeur de la page dans son site, puis récupéré en curl la page d'accueil de chaque hôte concerné pour y chercher un lien vers la page citée.
Quatre pages d'accueil sur 196 sources
Voici la répartition complète des 196 sources par profondeur, où zéro segment signifie la racine du domaine.
| Profondeur du chemin | Sources | Part |
|---|---|---|
| 0 segment (page d'accueil) | 4 | 2 % |
| 1 segment | 40 | 20 % |
| 2 segments | 72 | 37 % |
| 3 segments | 53 | 27 % |
| 4 segments | 17 | 9 % |
| 5 segments | 10 | 5 % |
| Total | 196 | 100 % |
La profondeur moyenne est de 2,35 segments. 78 % des sources sont à deux segments ou plus de la racine, et 41 % à trois segments ou plus, soit 80 sources sur 196. Une page comme www.planetematelas.com/blog/avis-et-tests-produits/quel-matelas-pour-mal-de-dos-guide-hybrides-et-mousse-memoire-les-plus-efficaces.html est un cas typique du relevé : trois niveaux sous la racine, un titre qui reprend mot pour mot la question posée.
Les quatre accueils cités méritent d'être regardés un par un, parce qu'ils ne contredisent pas le motif, ils le précisent. Deux viennent de la question locale sur la réparation d'un lave-linge à Lyon : satisfix.fr, dont le <title> annonce une réparation d'électroménager à domicile à Lyon dès 75 €, et www.rds-service.com, « Réparation électroménager Lyon | RDS Ménager ». Ce sont deux prestataires, et sur une question où le moteur doit nommer des prestataires, leur accueil est la réponse. Les deux autres sont comparatif-compta.fr, dont le <title> est « Logiciels de comptabilité : comparatif complet 2026 », et www.fournisseurs-electricite.com, « Fournisseurs d'électricité en France - Liste, Avis, Tarifs 2026 ». Deux sites dont l'accueil est lui-même le comparatif, et dont le nom de domaine est la question.
Autrement dit, l'accueil n'est cité que dans deux cas de figure : quand le site entier ne traite qu'un sujet, ou quand le site est l'acteur que la réponse recommande. Dès que la question demande un arbitrage entre plusieurs options, ce qui est le cas de huit questions sur dix ici, le moteur descend dans les pages. On retrouve la distinction déjà établie par le relevé automobile sur les régimes de question, transposée cette fois à l'échelle de la page plutôt qu'à celle du domaine.
Trois pages citées sur quatre ne sont pas liées depuis l'accueil
C'est la deuxième mesure, et la plus inattendue. Pour chacune des 192 pages internes citées, nous avons récupéré la page d'accueil du même hôte et cherché, parmi ses liens <a href>, un lien pointant vers la page citée.
La méthode impose des exclusions, et il faut les annoncer avant les résultats. Sur les 137 hôtes interrogés, 125 répondent 200. Huit répondent 403, un 503, un 202, un 307, et un ne répond pas du tout : les 20 pages citées rattachées à ces douze hôtes sortent du panel. Nous avons ensuite écarté les hôtes dont l'accueil porte moins de dix liens internes en HTML brut. Un accueil aussi pauvre en liens construit sa navigation côté client, et l'absence d'un lien dans le HTML n'y prouverait rien. Six hôtes dans ce cas, neuf pages de plus retirées. Reste un panel de 163 pages réparties sur 119 hôtes, soit 20 plus 9 plus 163 pour les 192 pages internes de départ.
Sur ces 163 pages, 43 sont liées depuis l'accueil de leur site, et 120 ne le sont pas. Soit 26 % contre 74 %.
Le motif ne dépend pas de la question. Le rapport va de 2 pages liées sur 18 pour le matelas à 7 sur 16 pour l'électricité verte, mais les pages liées ne sont majoritaires sur aucune des dix questions.
| Question | Pages retenues | Liées depuis l'accueil |
|---|---|---|
| Logiciel de comptabilité TPE | 16 | 3 |
| Pompe à chaleur air-eau | 18 | 3 |
| Vélo électrique de ville | 16 | 2 |
| CRM pour PME | 15 | 3 |
| Réparation lave-linge à Lyon | 14 | 6 |
| École d'ingénieurs informatique | 13 | 6 |
| Matelas et mal de dos | 18 | 2 |
| Logiciel de caisse restaurant | 19 | 6 |
| Fournisseur d'électricité verte | 16 | 7 |
| Panneaux solaires résidentiels | 18 | 5 |
| Total | 163 | 43 |
Plus la page est profonde, moins le site la met en avant
Les deux mesures se recoupent, et le croisement donne le résultat le plus utile du relevé.
| Profondeur | Pages retenues | Liées depuis l'accueil | Taux |
|---|---|---|---|
| 1 segment | 37 | 15 | 41 % |
| 2 segments | 62 | 21 | 34 % |
| 3 segments | 41 | 5 | 12 % |
| 4 segments | 15 | 1 | 7 % |
| 5 segments | 8 | 1 | 13 % |
| Total | 163 | 43 | 26 % |
Le seuil se situe au troisième segment. Une page à un ou deux niveaux sous la racine a environ une chance sur trois d'être liée depuis l'accueil de son site. Au-delà, elle tombe à une sur neuf. Or c'est précisément là que se trouvent 64 des 163 pages retenues, soit 39 % : le moteur va chercher une part importante de ses réponses dans la zone du site que le site lui-même ne met pas en avant.
Les deux derniers taux portent sur des effectifs trop faibles pour être lus séparément, quinze et huit pages. Regroupées, les pages à trois segments ou plus donnent 7 pages liées sur 64, soit 11 %, et c'est ce chiffre qu'il faut retenir plutôt que le détail ligne par ligne.
Quatre sites qui alimentent la réponse sans jamais y renvoyer
Les cas individuels sont plus parlants que les moyennes, et ils écartent l'explication la plus évidente, celle du petit site sans navigation.
www.quelleenergie.fr fournit quatre sources au relevé, sur trois questions différentes : la pompe à chaleur, l'électricité verte et les panneaux solaires. Sa page d'accueil porte 77 liens internes. Aucun ne pointe vers l'une de ces quatre pages. www.l-expert-comptable.com fournit trois sources sur la question comptable, pour 127 liens internes en accueil, dont aucun vers ces trois pages. www.legalplace.fr : trois sources, 94 liens, zéro. upway.fr : trois sources sur le vélo électrique, 88 liens, zéro.
Ce ne sont pas des sites pauvres en maillage. Ce sont des sites dont l'accueil est entièrement occupé par autre chose : les rubriques commerciales, les produits, les parcours de conversion. Les pages qui répondent aux questions vivent ailleurs, dans un blog ou un guide, et l'accueil ne les voit pas.
Le cas de www.hellowatt.fr est le plus complet du relevé. Ce site est le plus cité de tout le panel, avec huit sources sur trois questions. Son accueil porte 55 liens internes, dont deux mènent effectivement à des pages citées, /electricite-et-gaz/meilleur-fournisseur-energie et /contrat-electricite/liste-fournisseurs-electricite. Les six autres pages citées ne figurent nulle part sur cet accueil : ni /electricite-verte/fournisseurs, ni /electricite-verte/classement-fournisseurs-verts, ni les quatre autres. Nous avons vérifié à la main que la chaîne /electricite-verte/fournisseurs est absente du HTML entier de l'accueil, et pas seulement de ses attributs href.
Le contre-exemple : un artisan lyonnais qui lie ses propres pages
Un seul acteur du panel se comporte à l'inverse, et son cas est instructif parce qu'il est petit.
Sur la question de la réparation d'un lave-linge à Lyon, satisfix.fr fournit six sources à lui seul : sa page d'accueil, plus cinq pages internes, dont /reparation/lave-linge/, /depannage/lave-linge/, /reparation/electromenager/lyon/ et deux pages d'arrondissement. Son accueil ne porte que 33 liens internes, et quatre de ces cinq pages y figurent. C'est le taux de liaison le plus élevé parmi les sites cités plusieurs fois.
Ce site n'a ni l'autorité ni le volume de www.hellowatt.fr. Il a une autre propriété : sa navigation d'accueil est la liste de ses pages de réponse, parce qu'il n'a rien d'autre à mettre. Il ne s'agit pas de recommander à un site de 5 000 pages d'imiter un artisan lyonnais, mais de noter ce que cette configuration produit, à savoir un chemin court entre la racine et chaque page susceptible d'être citée. Nous avions déjà mesuré sur ce site que remonter un lien dans la page qui le porte suffit à déclencher un passage de crawl là où une priorité de sitemap n'y était pas parvenue.
Vérifier chez vous, en une heure
Le contrôle est simple et ne demande aucun outil payant.
Relevez d'abord les pages de votre site que les moteurs citent réellement, en posant vos dix ou vingt questions d'achat et en notant les URL exactes, pas les domaines. C'est le seul point du travail qui coûte du temps, et c'est aussi le seul qui ne se devine pas.
Comptez ensuite leurs segments de chemin. Si vos pages citées sont à trois niveaux ou plus, vous êtes dans la zone où le lien depuis l'accueil disparaît presque toujours, et le contrôle suivant devient prioritaire.
Cherchez enfin chaque page citée dans le HTML de votre accueil. Une commande suffit : curl -sL https://votre-domaine.fr/ | grep -c "/le/chemin/de/la/page". Trois précautions, apprises en construisant ce relevé. Retirez les commentaires HTML avant de chercher, sinon vous comptez des liens désactivés. Comparez des chemins déséchappés et privés de leur barre finale des deux côtés. Et si votre accueil est rendu côté client, cette commande ne prouve rien : lisez le HTML servi, pas la page affichée dans votre navigateur.
Ce que vous obtenez au bout d'une heure n'est pas un diagnostic complet, c'est une liste : les pages qui portent vos citations et que votre propre site ne signale pas.
Ce qu'il ne faut pas en conclure
Un lien absent de l'accueil ne veut pas dire une page orpheline. Le maillage passe aussi par les pages de rubrique, les liens d'article à article, le sitemap et les liens entrants externes, et une page peut être parfaitement atteignable sans figurer sur l'accueil. Ce que la mesure établit est plus étroit, et suffisant : la page qui vous fait citer n'est pas celle que votre site met en avant en premier.
Ce relevé est ponctuel. Dix questions, un seul moteur, un seul modèle, trois minutes de collecte. Nous avons montré ailleurs que la même question répétée à l'identique peut basculer entre deux jeux de sources distincts, et que deux moteurs interrogés le même jour ne citent pas les mêmes pages. Les 196 sources d'aujourd'hui ne seraient pas exactement les mêmes demain. Ce qui est robuste ici, c'est le motif, vérifié sur dix marchés sans rapport, pas la liste.
La mesure du maillage repose sur le HTML brut. Nous avons écarté les six accueils manifestement construits côté client, mais un accueil riche en liens peut toujours en charger d'autres en JavaScript, et nos 43 pages liées sont donc un plancher, pas un compte exact. De même, les douze hôtes qui nous ont refusé leur accueil, en 403 pour la plupart, ne sont pas nécessairement fermés aux robots des moteurs : un refus opposé à notre requête ne dit rien de ce qu'obtient un autre agent.
Enfin, la profondeur d'URL n'est pas la profondeur de clic. Un site peut servir des chemins à quatre segments tout en rendant ces pages accessibles en deux clics, et l'inverse existe aussi. Nous avons choisi la mesure la plus vérifiable par un tiers, en assumant qu'elle approche la seconde sans s'y substituer.
Ce qu'il faut retenir
Sur ce panel de dix marchés, les moteurs ne citent pratiquement jamais une page d'accueil : quatre fois sur 196. Ils citent des pages internes, à 2,35 segments de profondeur en moyenne, et 41 % d'entre elles à trois segments ou plus.
Ces pages, les sites qui les hébergent ne les mettent presque jamais en avant. Trois pages citées sur quatre ne sont liées depuis aucun endroit de l'accueil de leur propre site, et le taux de liaison tombe à 11 % au-delà du deuxième segment. Quatre sites du panel alimentent la réponse générative avec des pages vers lesquelles leur accueil, riche de 77 à 127 liens, ne renvoie pas une seule fois.
La conséquence pratique est un déplacement de priorité. La page de marque et la page de service servent à décrire ce que vous vendez ; elles ne sont pas le matériau dont les réponses sont faites. Le matériau, ce sont les pages qui traitent la question de l'acheteur dans ses termes, et elles se trouvent au niveau du site que personne ne relit. Commencez par savoir lesquelles sont citées, avant de décider quoi écrire.
Un audit GEO produit la liste des domaines que les modèles citent effectivement sur vos requêtes, et constate les blocages techniques sur des URL précises plutôt qu'en général. Le contrôle page par page décrit ici s'ajoute à cette liste et se fait avec les trois commandes ci-dessus, sans outil : c'est une méthode, pas une prestation séparée. Nos fourchettes de prix précisent ce que couvre chaque niveau d'intervention. Le panel de moteurs relevé par défaut est ChatGPT, Perplexity, Gemini et Google en mode AI Overviews.