WhoCanFindMe

Méthodologie

Comment nous mesurons la visibilité dans la recherche IA

Une explication honnête et publique de ce que signifient les scores, comment nous les calculons, et surtout, ce qu'ils ne peuvent pas vous dire. Notre méthodologie est ce dont nous sommes le plus fiers ; elle mérite d'être exposée au grand jour.

Dernière mise à jour : juin 2026 · Le domaine évolue vite, nous revérifions donc les statistiques clés chaque trimestre.

Ce que nous mesurons

WhoCanFindMe mesure deux choses différentes, et il est important de bien comprendre les deux :

  1. Préparation IA (l'audit gratuit). Un score déterministe et heuristique basé sur des signaux que nous extrayons directement de votre page publique : règles robots.txt, données structurées, extractibilité du contenu, signaux de fraîcheur et santé technique. Cela s'exécute en quelques secondes et ne coûte rien, car cela ne nécessite aucun appel API IA en direct. Cela vous indique si votre page est positionnée pour être trouvée par les robots et analyseurs IA.
  2. Visibilité mesurée (palier payant). Des requêtes ancrées en direct envoyées à ChatGPT, Perplexity et Gemini, ainsi qu'une requête de rappel des données d'entraînement envoyée à Claude (qui n'a pas encore d'API de recherche web native), pour mesurer si votre marque apparaît réellement dans les réponses. Trois moteurs reposent sur la récupération d'information ; Claude est un contrôle de mémoire d'entraînement. Voir la section 4 pour le détail complet.

Cette distinction compte. Un score de Préparation vous renseigne sur les prérequis techniques de la visibilité IA ; la Visibilité mesurée vous renseigne sur le résultat réel. Pensez à la Préparation comme à « la porte est-elle déverrouillée ? » et à la Visibilité mesurée comme à « les gens la franchissent-ils réellement ? »

Les six signaux de préparation

Le score de Préparation agrège six catégories de signaux. Chacune est mesurable indépendamment depuis votre page publique, sans aucun appel API IA.

1

Accès des robots IA

Élevé

Quoi : Si les principaux robots IA peuvent atteindre votre contenu, tout simplement.

Comment nous le mesurons : Nous analysons votre robots.txt à la recherche de règles Disallow explicites ciblant GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot et Google-Extended. Si un robot est bloqué, ce moteur ne peut pas indexer votre page : elle est catégoriquement exclue de toute citation, quelle que soit la qualité du contenu.

Preuves : Consensus : l'accès des robots est une porte binaire. 87% des citations de ChatGPT correspondent aux 10 premiers résultats de Bing (Seer Interactive, 2025) ; l'indexation par Bing, qui nécessite l'accès d'OAI-SearchBot, est donc le signal isolé le plus critique pour la visibilité sur ChatGPT.

2

Données structurées

Élevé pour Gemini, moyen pour les autres

Quoi : Le balisage schema JSON-LD qui permet aux moteurs IA d'analyser votre contenu comme des faits structurés.

Comment nous le mesurons : Nous analysons les blocs JSON-LD de votre page à la recherche des types FAQPage, Article, HowTo, Organization et BreadcrumbList. FAQPage est le type le plus prioritaire : une étude de 2026 portant sur 1,508 sites immobiliers a trouvé le balisage FAQPage présent sur 6.2% des sites visibles sur ChatGPT, contre seulement 0.8% des sites non visibles.

Preuves : Probable : étude contrôlée (Schanbacher, 2026, n=1,508). Les autres types de schema montrent une corrélation mitigée ou nulle dans des études indépendantes : ne surestimez pas le schema comme solution miracle.

3

Extractibilité

Le plus élevé pour Claude, élevé pour les autres

Quoi : La facilité avec laquelle une IA peut identifier et citer le passage le plus pertinent de votre page.

Comment nous le mesurons : Nous recherchons une structure orientée réponse (réponse directe dans les ~200 premiers mots), le nombre de titres, des paires de questions-réponses de type FAQ, des listes et tableaux, ainsi que la lisibilité Flesch. Les pages qui répondent d'emblée à la requête sont citées depuis leur premier tiers de contenu 44% du temps (recherche de praticiens). Une lisibilité comprise entre 50 et 70 sur l'échelle Flesch est optimale pour la citation par l'IA.

Preuves : Probable : consensus des praticiens, ainsi que le constat de l'étude GEO de Princeton selon lequel les signaux de structure du contenu sont corrélés à une hausse des citations (n=10,000 requêtes, Perplexity).

4

Autorité et densité factuelle

Le plus élevé pour Perplexity, élevé pour Gemini

Quoi : La qualité avec laquelle la page signale sa propre fiabilité à travers son contenu factuel.

Comment nous le mesurons : Nous comptons les statistiques et pourcentages (les affirmations chiffrées augmentent la probabilité de citation d'environ 41% selon l'étude GEO de Princeton), les liens sortants vers des domaines faisant autorité, les citations dans le texte, et le nombre de mots total (un indicateur indirect de profondeur). Ce sont des indicateurs indirects des signaux E-E-A-T, présents dans 96% des citations des Google AI Overviews.

Preuves : Prouvé : étude GEO de Princeton (statistiques : +41%, citations : +34%, n=10,000 requêtes). Corrélation E-E-A-T issue de l'étude Wellows (praticiens, 2025). Corrélation des mentions de marque avec les AIO : r=0.664, le prédicteur connu le plus fort que nous puissions mesurer depuis la page elle-même.

5

Fraîcheur

Le plus élevé pour Perplexity

Quoi : Si votre page indique aux moteurs IA à quel point son information est récente.

Comment nous le mesurons : Nous vérifions la présence de datePublished et dateModified dans le JSON-LD, du lastmod du sitemap, et des balises meta de date HTML. Nous calculons il y a combien de jours remonte le signal le plus récent. Le pipeline de récupération de Perplexity applique un filtre de récence agressif : les pages sans signal de fraîcheur sont traitées comme potentiellement obsolètes.

Preuves : Consensus : Perplexity documente explicitement la fraîcheur comme facteur de classement. Aucune étude quantifiée n'isole la hausse de citation due aux seuls signaux de fraîcheur, mais le consensus des praticiens est solide.

6

Santé technique

Élevé pour ChatGPT, moyen pour les autres

Quoi : Si la page est réellement récupérable et analysable par un robot IA.

Comment nous le mesurons : Nous vérifions la présence de HTTPS, un statut HTTP 200 valide, la balise meta viewport (indicateur indirect de compatibilité mobile), et si la page dépend fortement du rendu JavaScript. Les robots IA récupèrent généralement le HTML brut sans exécuter de JavaScript, si bien que les pages fortement dépendantes du JS peuvent leur apparaître quasiment vides.

Preuves : Consensus sur HTTPS et le rendu JS. Effet de la vitesse de page : les pages avec un FCP inférieur à 0.4s reçoivent 6.7 citations ChatGPT contre 2.1 pour un FCP supérieur à 1.13s dans une étude de praticiens, mais cela n'a pas été répliqué indépendamment et doit être considéré comme indicatif seulement.

Note sur llms.txt

Nous signalons l'absence d'un fichier /llms.txt comme un problème informatif (pas critique). Les preuves actuelles vont à l'encontre de son importance : l'étude d'Ahrefs de mai 2026 sur 137,000 domaines a révélé que 97% des fichiers llms.txt n'ont reçu aucun trafic d'un quelconque robot IA. Nous incluons ce signal car la spécification pourrait gagner en adoption, mais nous ne surestimerons pas son effet actuel.

Notation par moteur

Chaque moteur IA pondère différemment les six catégories de signaux, car leurs architectures de récupération sont réellement différentes. Plutôt que de présenter un « score IA » unique, nous calculons un score de Préparation par moteur, puis nous les moyennons pour obtenir le chiffre global affiché.

SignalChatGPTPerplexityGeminiClaude
Accès des robots25%20%20%20%
Données structurées15%10%25%20%
Extractibilité20%15%15%30%
Autorité15%25%20%15%
Fraîcheur10%25%10%5%
Technique15%5%10%10%

ChatGPT pondère fortement l'accès des robots, car 87% de ses citations proviennent des 10 premiers résultats de Bing, et Bing nécessite l'accès d'OAI-SearchBot. Perplexity valorise surtout la fraîcheur et l'autorité, car son pipeline RAG à six étapes filtre agressivement selon la récence et la densité factuelle. Gemini valorise avant tout les données structurées et les signaux d'autorité, reflet du cadre E-E-A-T de Google. Claude place l'extractibilité en premier, car c'est le moteur le plus sélectif, avec 97.8% de ses citations provenant de sources établies et clairement structurées.

Tout moteur bloqué dans robots.txt reçoit une pénalité de 55% sur son score combiné (le score est multiplié par 0.45), reflétant le fait qu'un moteur bloqué ne peut absolument pas indexer ni citer la page.

Le score de Préparation global est la moyenne arithmétique des quatre scores par moteur, chacun plafonné à [0, 100].

Visibilité mesurée (requêtes ancrées en direct)

Les scores de Préparation sont une condition nécessaire mais non suffisante pour la visibilité IA. La Visibilité mesurée va plus loin : nous envoyons de vraies requêtes aux moteurs IA réels et mesurons si votre marque apparaît dans les réponses ancrées et citées.

Pourquoi des requêtes ancrées, et non des sondages de mémoire d'entraînement

Pour la plupart des grands moteurs IA grand public (ChatGPT Search, Perplexity, Google AI Overviews et Copilot), les réponses sont ancrées dans une récupération web en direct au moment de la requête. La mémoire d'entraînement détermine si une IA « sait » qu'une marque existe ; la récupération en direct détermine si elle cite cette marque dans ses réponses. Le GEO est avant tout un problème de récupération, c'est pourquoi nous privilégions les requêtes ancrées partout où le moteur le permet.

Pour ChatGPT, Perplexity et Gemini, nous n'utilisons pas le prompting du modèle de base (demander à l'IA ce qu'elle « sait » d'une marque sans recherche web). Cela teste une mémoire d'entraînement figée, est fortement non déterministe, sujet aux hallucinations pour les marques moins connues, et ne reflète pas ce que les utilisateurs voient réellement dans les moteurs grand public ancrés. Claude est la seule exception : à ce jour, dans l'API Anthropic actuelle, Claude n'a pas d'outil de recherche web natif comparable à ceux d'OpenAI ou de Google, donc son score est nécessairement un contrôle de rappel de mémoire d'entraînement, pas une mesure ancrée. Nous signalons ce point sur chaque score Claude, et nous basculerons vers une requête ancrée dès qu'Anthropic proposera une API de recherche web.

Conception du jeu de requêtes

Nous construisons un jeu de requêtes sélectionné couvrant trois catégories : les requêtes de découverte (basées sur la catégorie, sans nom de marque), les requêtes de comparaison (stade d'évaluation), et les requêtes directes sur la marque. La répartition est d'environ 60/30/10 : la découverte est la plus pondérée, car c'est là que se capte une nouvelle audience. Un minimum de 30 requêtes par audit fournit un signal significatif ; l'audit standard complet en utilise 50.

Répétitions et traitement statistique

Une exécution unique d'une seule requête n'a presque aucun sens. Le non-déterminisme des LLM signifie que la même requête peut produire des citations différentes d'une exécution à l'autre, même à temperature=0 (la variance liée à la taille de lot au niveau du GPU ne peut pas être éliminée). L'étude GEO de Princeton a montré qu'il fallait 60 à 100 répétitions pour stabiliser les pourcentages de visibilité.

Chaque répétition renvoie la requête identique. Nous ne modifions ni ne reformulons le prompt entre les répétitions. Les audits payants standard exécutent 3 répétitions par requête et par moteur ; l'aperçu gratuit/anonyme et les relances de routine Agency n'en exécutent qu'une seule (un instantané à échantillon unique, sans marge). Le taux de citation est calculé comme la fraction des exécutions où la marque a été citée (brandCited = true). Nous utilisons l'intervalle de score de Wilson pour calculer un intervalle de confiance à 95% sur cette proportion. Cela reflète la constance d'une exécution à l'autre sous la variabilité côté fournisseur, sur des appels identiques, et non un échantillon de la façon dont la citation pourrait varier selon différentes formulations d'une même requête.

Fidélité API vs interface grand public

Pour ChatGPT, Perplexity et Gemini, nous utilisons l'API programmatique de chaque moteur avec la recherche web activée. C'est la norme du secteur et la seule approche scalable, mais elle introduit des écarts connus :

  • ChatGPT.com grand public peut inclure une personnalisation et un historique de navigation que les API ne reproduisent pas.
  • L'API Gemini avec ancrage Google Search et les Google AI Overviews ne partagent qu'environ 38.5% des principaux domaines cités, un écart structurel que nous divulguons explicitement sur chaque score Google.
  • Perplexity documente une divergence potentielle entre son API et son interface grand public.
  • L'API de Claude n'a aucun outil de recherche web, donc son score utilise le rappel des données d'entraînement du modèle plutôt qu'un appel API en direct : le plus grand écart de fidélité des quatre, divulgué sur chaque score Claude.

Nous signalons ces limites dans chaque rapport qui inclut un score de Visibilité mesurée. Nous pensons que la transparence sur les limites de la mesure a plus de valeur qu'une fausse précision.

Marges de confiance et volatilité

Les scores de visibilité IA sont des estimations, pas des faits. Trois sources de volatilité affectent toute mesure :

  1. Non-déterminisme des LLM. Même à temperature=0, les réponses de l'API varient en raison de la variance liée à la taille de lot au niveau du GPU. Un score ponctuel sans répétition peut varier de ±30% d'une exécution à l'autre. Notre moteur de Visibilité mesurée répète plusieurs fois chaque requête identique et rapporte des intervalles de confiance de Wilson sur le taux de citation obtenu. Cela mesure la constance d'une exécution à l'autre sous la variabilité côté fournisseur, et non la variation selon différentes formulations d'une même requête, afin que vous puissiez voir à quel point chaque chiffre est stable.
  2. Mises à jour des modèles et des algorithmes. OpenAI, Google et Perplexity mettent à jour leurs modèles en continu, souvent sans annonce publique. Un score vieux de six semaines peut ne plus refléter la réalité actuelle. Nous affichons la date de mesure sur chaque score et signalons les scores de plus de 30 jours.
  3. Variation géographique et de personnalisation. La même requête produit des réponses différentes selon les localisations, les langues et les types de compte. Nos mesures sont effectuées depuis des emplacements standardisés. Les résultats pour d'autres zones géographiques peuvent différer.

Le score de Préparation (audit gratuit) est bien plus stable que la Visibilité mesurée, car il teste des signaux déterministes (robots.txt, données structurées, contenu HTML), et non des sorties d'IA stochastiques. Un changement du score de Préparation reflète un changement réel sur votre page.

Ce que cela vous dit, et ne vous dit pas

Nous pensons que l'honnêteté intellectuelle sur les limites de la mesure est ce qui distingue un outil utile d'un générateur de scores à l'apparence convaincante. Voici ce que cet outil ne peut explicitement pas vous dire :

Nous ne mesurons pas le trafic organique en provenance de l'IA.

La citation par l'IA et le trafic de référencement en provenance de l'IA sont deux choses différentes. Une marque peut être fortement citée et pourtant voir son trafic de référencement stagner, car les plateformes IA répondent de plus en plus directement dans leur interface, sans générer de clics externes (Digiday, 2025). Notre score vous renseigne sur la probabilité de citation, pas sur le volume de trafic.

Le taux de citation ne garantit pas d'impact sur le chiffre d'affaires.

Le trafic de référencement en provenance de l'IA convertit à des taux plus élevés que le trafic organique traditionnel (plusieurs études constatent une conversion 5 à 23 fois supérieure à l'organique Google), mais son volume absolu reste sous 1% du trafic web. Un score de visibilité élevé est un signal de qualité de positionnement, pas une prévision de chiffre d'affaires.

Les scores de Préparation portent sur des prérequis, pas des garanties.

Un score de Préparation de 90/100 signifie que votre page dispose des bons signaux techniques en place. Cela ne garantit pas que vous serez cité. Des facteurs hors site (présence sur Reddit, mentions de marque à travers le web, reconnaissance d'entité Wikipedia/Wikidata, profils sur des sites d'avis) sont des moteurs de citation majeurs que nous ne pouvons pas mesurer depuis votre page seule.

Nous ne pouvons pas mesurer ce que nous ne pouvons pas explorer.

Notre audit récupère votre page publique comme le ferait un robot IA. Si le contenu se trouve derrière une authentification, est chargé entièrement via JavaScript sans rendu serveur, ou se trouve sur des sous-domaines qui ne nous ont pas été communiqués, nous ne pouvons pas l'évaluer.

Les scores ne sont pas comparables d'un outil à l'autre.

Un score de 65 sur WhoCanFindMe ne peut pas être comparé à un 65 obtenu sur Otterly, Peec, Profound, ou tout autre outil. Chaque outil utilise un jeu de requêtes différent, un nombre de répétitions différent, un mix de moteurs différent, et une pondération différente. Il n'existe aucune norme de l'industrie. Notre score est calibré et cohérent en interne : il peut suivre votre progression dans le temps, mais ce n'est pas un absolu du secteur.

Recherches et sources

Notre méthodologie s'appuie sur des recherches académiques publiées et des études de praticiens de première main. Le domaine évolue vite ; nous revérifions les statistiques clés chaque trimestre. Étiquettes de force des preuves : Prouvé = étude contrôlée ou répliquée dans plusieurs études ; Probable = étude unique ou fort consensus de praticiens avec un mécanisme plausible ; Légende = largement répété, sans étude.

Princeton / IIT Delhi / Georgia Tech GEO paper (Aggarwal et al., KDD 2024)

Ajout de statistiques +41%, citation de sources +34%, ajout de citations +28% de hausse de citation. n=10,000 requêtes sur un système de type Bing Chat, validé sur Perplexity.

Prouvé

Google AI Overviews measurement study (arxiv:2605.14021, June 2026)

Taux de déclenchement des AIO 13.7% au global, 64.7% pour les requêtes formulées en questions. Les domaines cités par les AIO sont plus crédibles que l'organique de première page (0.732 contre 0.645). 30% des citations AIO n'apparaissent pas dans les meilleurs résultats organiques.

Prouvé

Ahrefs llms.txt study (May 2026, 137,000 domains)

97% des fichiers llms.txt n'ont reçu aucun trafic de robot IA. 96% des requêtes provenaient d'outils d'audit automatisés, pas de moteurs IA.

Prouvé

Seer Interactive ChatGPT/Bing correlation study (2025)

87% des citations de ChatGPT Search correspondent aux 10 premiers résultats organiques de Bing.

Prouvé

Wellows E-E-A-T and AIO study

96% des citations AIO proviennent de sources à fort E-E-A-T. Les auteurs nommés ont 2.3 fois plus de chances d'être cités. Corrélation de l'autorité de domaine avec les AIO : r=0.18. Corrélation des mentions de marque externes : r=0.664.

Probable

SE Ranking Reddit study

Les domaines avec plus de 50 mentions sur Reddit affichent un indice de citation de 22.5 contre 10.4 pour 11 à 50 mentions.

Probable

Schanbacher 2026 FAQ schema study (n=1,508 real estate websites)

Balisage FAQPage sur 6.2% des sites visibles sur ChatGPT contre 0.8% des sites non visibles.

Probable

OtterlyAI llms.txt 90-day experiment

Seulement 0.1% des requêtes des robots IA ont touché /llms.txt.

Prouvé

Semrush 2026 AI Visibility Index (126M US AI search prompts)

45% des responsables marketing ne peuvent pas mesurer précisément leur visibilité IA. Passage de 2,500 à 126M de prompts entre janvier et avril 2026.

Prouvé

Superprompt.com conversion analysis (12M website visits)

Le trafic de référencement IA convertit à 14.2% contre 2.8% pour l'organique Google.

Probable

Découvrez votre score maintenant

Lancez un audit gratuit et obtenez votre score de Préparation sur ChatGPT, Gemini, Perplexity et Claude en moins de 30 secondes. Sans inscription.

Voir aussi : Données de benchmark par secteur · Tarifs · Audit gratuit