WhoCanFindMe

Metodologia

Come misuriamo la visibilità nella ricerca IA

Una spiegazione onesta e pubblica di cosa significano i punteggi, di come li calcoliamo e, soprattutto, di cosa non possono dirti. La nostra metodologia è la cosa di cui siamo più orgogliosi: merita di essere resa pubblica.

Ultimo aggiornamento: giugno 2026 · Il settore cambia in fretta, quindi riverifichiamo le statistiche chiave ogni trimestre.

Cosa misuriamo

WhoCanFindMe misura due cose diverse, ed è importante capirle entrambe:

  1. Idoneità AI (l'audit gratuito). Un punteggio deterministico ed euristico basato su segnali che estraiamo direttamente dalla tua pagina pubblica: regole del robots.txt, dati strutturati, estraibilità dei contenuti, segnali di aggiornamento e salute tecnica. Viene eseguito in pochi secondi e non costa nulla perché non richiede chiamate API IA dal vivo. Ti dice se la tua pagina è posizionata per essere trovata dai crawler e dai parser IA.
  2. Visibilità Misurata (piano a pagamento). Query dal vivo con grounding inviate a ChatGPT, Perplexity e Gemini, più una query di richiamo dai dati di addestramento inviata a Claude (che non ha ancora un'API di ricerca web nativa), per misurare se il tuo brand compare davvero nelle risposte. Tre motori si basano sul retrieval; Claude è un controllo sulla memoria di addestramento. Vedi la Sezione 4 per i dettagli completi.

La distinzione conta. Un punteggio di Idoneità ti dice quali sono i prerequisiti tecnici per la visibilità nell'IA; la Visibilità Misurata ti dice il risultato effettivo. Pensa all'Idoneità come a "la porta è aperta?" e alla Visibilità Misurata come a "le persone ci stanno davvero passando attraverso?"

I sei segnali di idoneità

Il punteggio di Idoneità aggrega sei categorie di segnali. Ognuna è misurabile in modo indipendente dalla tua pagina pubblica, senza alcuna chiamata API IA.

1

Accesso dei crawler IA

Alto

Cosa: Se i principali crawler IA riescono a raggiungere i tuoi contenuti.

Come lo misuriamo: Analizziamo il tuo robots.txt alla ricerca di regole Disallow esplicite rivolte a GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot e Google-Extended. Se un crawler è bloccato, quel motore non può indicizzare la tua pagina: è categoricamente escluso dalla possibilità di essere citato, indipendentemente dalla qualità dei contenuti.

Evidenza: Consenso: l'accesso dei crawler è un cancello binario. L'87% delle citazioni di ChatGPT corrisponde ai primi 10 risultati di Bing (Seer Interactive, 2025), quindi l'indicizzazione su Bing, che richiede l'accesso di OAI-SearchBot, è il singolo segnale più critico per la visibilità su ChatGPT.

2

Dati strutturati

Alto per Gemini, Medio per gli altri

Cosa: Markup schema JSON-LD che permette ai motori IA di leggere i tuoi contenuti come fatti strutturati.

Come lo misuriamo: Analizziamo i blocchi JSON-LD della tua pagina alla ricerca dei tipi FAQPage, Article, HowTo, Organization e BreadcrumbList. FAQPage è il tipo a priorità più alta: uno studio del 2026 su 1,508 siti immobiliari ha rilevato lo schema FAQPage presente sul 6.2% dei siti visibili su ChatGPT, contro solo lo 0.8% dei siti non visibili.

Evidenza: Probabile: studio controllato (Schanbacher, 2026, n=1,508). Altri tipi di schema mostrano correlazioni miste o nulle in studi indipendenti: non affidarti troppo allo schema come soluzione miracolosa.

3

Estraibilità

Massimo per Claude, Alto per gli altri

Cosa: Quanto facilmente un'IA può individuare e citare il passaggio più rilevante della tua pagina.

Come lo misuriamo: Cerchiamo una struttura answer-first (risposta diretta nelle prime ~200 parole), il numero di titoli, coppie di domande e risposte in stile FAQ, elenchi e tabelle, e la leggibilità Flesch. Le pagine che rispondono subito alla query vengono citate dal primo terzo dei contenuti nel 44% dei casi (ricerca di settore). Una leggibilità nell'intervallo 50-70 Flesch è ottimale per la citazione nell'IA.

Evidenza: Probabile: consenso tra professionisti, più il risultato del paper GEO di Princeton secondo cui i segnali di struttura dei contenuti correlano con l'aumento delle citazioni (n=10,000 query, Perplexity).

4

Autorevolezza e densità di fatti

Massimo per Perplexity, Alto per Gemini

Cosa: Quanto bene la pagina segnala la propria affidabilità attraverso contenuti fattuali.

Come lo misuriamo: Contiamo statistiche e percentuali (le affermazioni numeriche aumentano la probabilità di citazione di circa il 41% secondo il paper GEO di Princeton), i link in uscita verso domini autorevoli, le citazioni nel testo, e il conteggio complessivo delle parole (un proxy per la profondità). Questi fungono da proxy per i segnali E-E-A-T, che compaiono nel 96% delle citazioni di Google AI Overview.

Evidenza: Comprovato: paper GEO di Princeton (statistiche: +41%, citazioni: +34%, n=10,000 query). Correlazione E-E-A-T dallo studio Wellows (professionale, 2025). Correlazione delle menzioni del brand con AIO: r=0.664, il predittore noto più forte che possiamo misurare dalla pagina stessa.

5

Aggiornamento

Massimo per Perplexity

Cosa: Se la tua pagina comunica ai motori IA quanto sono recenti le sue informazioni.

Come lo misuriamo: Controlliamo datePublished e dateModified nel JSON-LD, il lastmod della sitemap e i tag meta data HTML. Calcoliamo quanti giorni fa risale il segnale più recente. La pipeline di retrieval di Perplexity applica un filtro di recenza aggressivo: le pagine senza segnali di aggiornamento vengono trattate come potenzialmente obsolete.

Evidenza: Consenso: Perplexity documenta esplicitamente l'aggiornamento come fattore di posizionamento. Nessuno studio quantificato isola l'aumento di citazioni dovuto ai soli segnali di aggiornamento, ma il consenso tra professionisti è forte.

6

Salute tecnica

Alto per ChatGPT, Medio per gli altri

Cosa: Se la pagina è effettivamente recuperabile e analizzabile da un crawler IA.

Come lo misuriamo: Controlliamo HTTPS, uno stato HTTP 200 valido, il tag meta viewport (proxy per l'adattabilità ai dispositivi mobili), e se la pagina dipende pesantemente dal rendering JavaScript. I crawler IA in genere recuperano l'HTML grezzo senza eseguire JavaScript, quindi le pagine che dipendono molto da JS possono apparire loro quasi vuote.

Evidenza: Consenso su HTTPS e rendering JS. Effetto della velocità della pagina: in uno studio di settore, le pagine con FCP sotto 0.4s ricevono 6.7 citazioni di ChatGPT contro 2.1 per un FCP oltre 1.13s, ma questo non è stato replicato in modo indipendente e va considerato solo indicativo.

Nota su llms.txt

Segnaliamo l'assenza di un file /llms.txt come un problema informativo, non critico. Le prove attuali vanno contro la sua importanza: lo studio di Ahrefs del maggio 2026 su 137,000 domini ha rilevato che il 97% dei file llms.txt non ha ricevuto alcun traffico da bot IA. Includiamo il segnale perché la specifica potrebbe diffondersi in futuro, ma non ne sopravvaluteremo l'effetto attuale.

Punteggio per motore

Ogni motore IA pesa le sei categorie di segnali in modo diverso, perché hanno architetture di retrieval realmente diverse. Invece di presentare un unico "punteggio IA", calcoliamo un punteggio di Idoneità per ciascun motore e poi ne facciamo la media per il numero complessivo in evidenza.

SegnaleChatGPTPerplexityGeminiClaude
Accesso crawler25%20%20%20%
Dati strutturati15%10%25%20%
Estraibilità20%15%15%30%
Autorevolezza15%25%20%15%
Aggiornamento10%25%10%5%
Tecnico15%5%10%10%

ChatGPT pesa molto l'accesso dei crawler perché l'87% delle sue citazioni proviene dai primi 10 risultati di Bing, e Bing richiede l'accesso di OAI-SearchBot. Perplexity pesa soprattutto l'aggiornamento e l'autorevolezza perché la sua pipeline RAG a sei fasi filtra aggressivamente per recenza e densità di fatti. Gemini valorizza soprattutto i dati strutturati e i segnali di autorevolezza, riflettendo il framework E-E-A-T di Google. Claude mette l'estraibilità al primo posto perché è il motore più selettivo, con il 97.8% delle citazioni provenienti da fonti consolidate e chiaramente strutturate.

Qualsiasi motore bloccato nel robots.txt riceve una penalità del 55% sul punteggio combinato (il punteggio viene moltiplicato per 0.45), a riflettere il fatto che i motori bloccati non possono indicizzare né citare la pagina.

Il punteggio complessivo di Idoneità è la media aritmetica dei quattro punteggi per motore, ciascuno limitato all'intervallo [0, 100].

Visibilità Misurata (query dal vivo con grounding)

I punteggi di Idoneità sono una condizione necessaria ma non sufficiente per la visibilità nell'IA. La Visibilità Misurata va oltre: inviamo query reali ai motori IA effettivi e misuriamo se il tuo brand compare nelle risposte con grounding e citazioni.

Perché query con grounding, e non sondaggi sulla memoria di addestramento

Per la maggior parte dei principali motori IA consumer (ChatGPT Search, Perplexity, Google AI Overviews e Copilot), le risposte si basano su retrieval web dal vivo al momento della query. La memoria di addestramento decide se un'IA "sa" che un brand esiste; il retrieval dal vivo decide se lo cita nelle risposte. La GEO è principalmente un problema di retrieval, ed è per questo che preferiamo le query con grounding ovunque il motore le supporti.

Per ChatGPT, Perplexity e Gemini non usiamo il prompting sul modello base (chiedere all'IA cosa "sa" di un brand senza ricerca web). Questo testa la memoria di addestramento congelata, è altamente non deterministico, incline ad allucinazioni per i brand meno conosciuti, e non riflette ciò che gli utenti vedono davvero nei motori consumer con grounding. Claude è l'unica eccezione: allo stato attuale dell'API di Anthropic, Claude non ha uno strumento di ricerca web nativo analogo a quello di OpenAI o Google, quindi il suo punteggio è necessariamente un controllo di richiamo dalla memoria di addestramento, non una misurazione con grounding. Segnaliamo questo aspetto su ogni punteggio di Claude e passeremo a una query con grounding nel momento in cui Anthropic rilascerà un'API di ricerca web.

Composizione del set di query

Costruiamo un set di query curato che copre tre categorie: query di scoperta (basate sulla categoria, senza nomi di brand), query di confronto (fase di valutazione), e query dirette sul brand. Il mix è di circa 60/30/10: la scoperta ha il peso maggiore perché è lì che si intercetta nuovo pubblico. Un minimo di 30 query per audit fornisce un segnale significativo; l'audit standard completo ne usa 50.

Ripetizioni e trattamento statistico

Una singola esecuzione di una singola query è quasi priva di significato. Il non-determinismo degli LLM implica che la stessa query può produrre citazioni diverse tra un'esecuzione e l'altra, anche a temperature=0 (la varianza dovuta alla dimensione del batch a livello di GPU non può essere eliminata). Il paper GEO di Princeton ha rilevato che servono da 60 a 100 ripetizioni per stabilizzare le percentuali di visibilità.

Ogni ripetizione invia di nuovo la query identica. Non variamo né parafrasiamo il prompt tra una ripetizione e l'altra. Gli audit standard a pagamento eseguono 3 ripetizioni per query per motore; l'anteprima gratuita/anonima e le riesecuzioni di routine Agency ne eseguono 1 (uno scatto a campione singolo, senza banda). Il tasso di citazione è calcolato come la frazione di esecuzioni in cui il brand è stato citato (brandCited = true). Usiamo l'intervallo di Wilson per calcolare un intervallo di confidenza del 95% su questa proporzione. Questo riflette la coerenza da un'esecuzione all'altra sotto il jitter lato provider tra chiamate identiche, non un campione di come la citazione potrebbe variare tra formulazioni diverse della stessa query.

Fedeltà tra API e interfaccia consumer

Per ChatGPT, Perplexity e Gemini usiamo l'API programmatica di ciascun motore con la ricerca web attivata. Questo è lo standard di settore e l'unico approccio scalabile, ma introduce discrepanze note:

  • ChatGPT.com in versione consumer può includere personalizzazione e cronologia di navigazione che le API non replicano.
  • L'API di Gemini con grounding di Google Search e Google AI Overviews condividono solo circa il 38.5% dei domini più citati, una discrepanza strutturale che dichiariamo esplicitamente su ogni punteggio Google.
  • Perplexity documenta una possibile divergenza tra la propria API e l'interfaccia consumer.
  • L'API di Claude non ha alcuno strumento di ricerca web, quindi il suo punteggio usa il richiamo dai dati di addestramento del modello invece di una chiamata API dal vivo: la discrepanza di fedeltà più ampia tra i quattro motori, dichiarata su ogni punteggio di Claude.

Segnaliamo questi limiti in ogni report che include un punteggio di Visibilità Misurata. Crediamo che la trasparenza sui limiti della misurazione valga più di una falsa precisione.

Bande di confidenza e volatilità

I punteggi di visibilità nell'IA sono stime, non fatti. Tre fonti di volatilità influenzano qualsiasi misurazione:

  1. Non-determinismo degli LLM. Anche a temperature=0, le risposte delle API variano a causa della varianza della dimensione del batch a livello di GPU. Un punteggio puntuale senza ripetizioni può variare del ±30% in una nuova esecuzione. Il nostro motore di Visibilità Misurata ripete più volte ogni query identica e riporta intervalli di confidenza Wilson-score sul tasso di citazione risultante. Questo misura la coerenza da un'esecuzione all'altra sotto il jitter lato provider, non la variazione tra formulazioni diverse della stessa query, così puoi vedere quanto è stabile ogni numero.
  2. Aggiornamenti di modello e algoritmo. OpenAI, Google e Perplexity aggiornano continuamente i loro modelli, spesso senza annunci pubblici. Un punteggio di sei settimane fa potrebbe non riflettere la realtà attuale. Mostriamo la data di misurazione su ogni punteggio e segnaliamo i punteggi più vecchi di 30 giorni.
  3. Variazione geografica e di personalizzazione. La stessa query produce risposte diverse a seconda di località, lingue e tipi di account. Le nostre misurazioni vengono eseguite da località standardizzate. I risultati per altre aree geografiche potrebbero differire.

Il punteggio di Idoneità (audit gratuito) è molto più stabile della Visibilità Misurata perché testa segnali deterministici (robots.txt, dati strutturati, contenuto HTML), non output stocastici dell'IA. Una variazione del punteggio di Idoneità riflette un cambiamento reale della tua pagina.

Cosa ti dice e cosa non ti dice questo strumento

Pensiamo che l'onestà intellettuale sui limiti della misurazione sia ciò che distingue uno strumento utile da un generatore di punteggi solo apparentemente convincente. Ecco cosa questo strumento non può dirti, esplicitamente:

Non misuriamo il traffico organico proveniente dall'IA.

La citazione nell'IA e il traffico di rimando dall'IA sono cose diverse. Un brand può essere citato moltissimo e comunque vedere un traffico di rimando piatto, perché le piattaforme IA rispondono sempre più spesso all'interno della propria interfaccia, senza generare click esterni (Digiday, 2025). Il nostro punteggio ti dice qualcosa sulla probabilità di citazione, non sul volume di traffico.

Il tasso di citazione non garantisce un impatto sui ricavi.

Il traffico di rimando dall'IA converte a tassi più alti rispetto al traffico organico tradizionale (più studi rilevano una conversione da 5 a 23 volte superiore rispetto all'organico di Google), ma il volume assoluto resta sotto l'1% del traffico web. Un punteggio di visibilità alto è un segnale di qualità del posizionamento, non una previsione di ricavi.

I punteggi di Idoneità riguardano i prerequisiti, non le garanzie.

Un punteggio di Idoneità di 90/100 significa che la tua pagina ha i giusti segnali tecnici in atto. Non garantisce che verrai citato. I fattori off-site (presenza su Reddit, menzioni del brand in giro per il web, riconoscimento dell'entità su Wikipedia/Wikidata, profili sui siti di recensioni) sono importanti fattori di citazione che non possiamo misurare dalla sola pagina.

Non possiamo misurare ciò che non possiamo scansionare.

Il nostro audit recupera la tua pagina pubblica nello stesso modo in cui lo farebbe un crawler IA. Se i contenuti sono dietro autenticazione, caricati interamente via JavaScript senza rendering lato server, o su sottodomini che non ci sono stati indicati, non possiamo valutarli.

I punteggi non sono confrontabili tra strumenti diversi.

Un punteggio di 65 su WhoCanFindMe non è confrontabile con un 65 su Otterly, Peec, Profound o qualsiasi altro strumento. Ogni strumento usa un set di query diverso, un numero di ripetizioni diverso, una combinazione di motori diversa e una ponderazione diversa. Non esiste uno standard di settore. Il nostro punteggio è calibrato e internamente coerente: può tracciare il tuo miglioramento nel tempo, ma non è un valore assoluto di settore.

Ricerca e fonti

La nostra metodologia si basa su ricerca accademica pubblicata e studi primari di settore. Il campo si evolve in fretta; riverifichiamo le statistiche chiave ogni trimestre. Etichette di forza dell'evidenza: Comprovato = studio controllato o replicato in più studi; Probabile = singolo studio o forte consenso tra professionisti con un meccanismo plausibile; Diceria = ampiamente ripetuto, nessuno studio.

Princeton / IIT Delhi / Georgia Tech GEO paper (Aggarwal et al., KDD 2024)

Aggiunta di statistiche +41%, citazione di fonti +34%, aggiunta di citazioni testuali +28% di aumento delle citazioni. n=10,000 query su un sistema in stile Bing Chat, validato su Perplexity.

Comprovato

Google AI Overviews measurement study (arxiv:2605.14021, June 2026)

Tasso di attivazione AIO del 13.7% complessivo, 64.7% per le query in forma di domanda. I domini citati da AIO sono più credibili dell'organico in prima pagina (0.732 contro 0.645). Il 30% delle citazioni AIO non compare nei primi risultati organici.

Comprovato

Ahrefs llms.txt study (May 2026, 137,000 domains)

Il 97% dei file llms.txt non ha ricevuto alcun traffico da bot IA. Il 96% delle richieste proveniva da strumenti di audit automatizzati, non da motori IA.

Comprovato

Seer Interactive ChatGPT/Bing correlation study (2025)

L'87% delle citazioni di ChatGPT Search corrisponde ai primi 10 risultati organici di Bing.

Comprovato

Wellows E-E-A-T and AIO study

Il 96% delle citazioni AIO proviene da fonti con E-E-A-T elevato. Gli autori nominati hanno una probabilità di citazione 2.3 volte maggiore. Correlazione dell'autorevolezza del dominio con AIO: r=0.18. Correlazione delle menzioni esterne del brand: r=0.664.

Probabile

SE Ranking Reddit study

I domini con oltre 50 menzioni su Reddit mostrano un indice di citazione di 22.5 contro 10.4 per 11-50 menzioni.

Probabile

Schanbacher 2026 FAQ schema study (n=1,508 real estate websites)

Schema FAQPage nel 6.2% dei siti visibili su ChatGPT contro lo 0.8% dei siti non visibili.

Probabile

OtterlyAI llms.txt 90-day experiment

Solo lo 0.1% delle richieste dei crawler IA ha toccato /llms.txt.

Comprovato

Semrush 2026 AI Visibility Index (126M US AI search prompts)

Il 45% dei responsabili marketing non riesce a misurare con precisione la propria visibilità nell'IA. Scalato da 2,500 a 126M prompt tra gennaio e aprile 2026.

Comprovato

Superprompt.com conversion analysis (12M website visits)

Il traffico di rimando dall'IA converte al 14.2% contro il 2.8% dell'organico di Google.

Probabile

Guarda subito il tuo punteggio

Avvia un audit gratuito e ottieni il tuo punteggio di Idoneità su ChatGPT, Gemini, Perplexity e Claude in meno di 30 secondi. Nessuna registrazione richiesta.

Correlati: Dati di benchmark per categoria · Prezzi · Audit gratuito