Metodología
Cómo medimos la visibilidad en la búsqueda con IA
Una explicación honesta y pública de qué significan las puntuaciones, cómo las calculamos y, sobre todo, qué no pueden decirle. Nuestra metodología es lo que más nos enorgullece, y merece estar a la vista de todos.
Última actualización: junio de 2026 · El campo cambia rápido, así que reverificamos las estadísticas clave cada trimestre.
Qué medimos
WhoCanFindMe mide dos cosas distintas, y es importante entender ambas:
- Preparación para IA (la auditoría gratuita). Una puntuación determinista y heurística basada en señales que extraemos directamente de su página pública: reglas del robots.txt, datos estructurados, extraibilidad del contenido, señales de actualidad y salud técnica. Esto se ejecuta en segundos y no cuesta nada porque no requiere llamadas en vivo a ninguna API de IA. Le dice si su página está en posición de ser encontrada por los rastreadores y analizadores de IA.
- Visibilidad Medida (nivel de pago). Consultas fundamentadas en vivo enviadas a ChatGPT, Perplexity y Gemini, más una consulta de memoria de entrenamiento enviada a Claude (que todavía no tiene una API nativa de búsqueda web), para medir si su marca aparece realmente en las respuestas. Tres motores se basan en recuperación de información; Claude es una comprobación de memoria de entrenamiento. Vea la Sección 4 para el detalle completo.
La distinción importa. Una puntuación de Preparación le habla de los requisitos técnicos previos para la visibilidad en IA; la Visibilidad Medida le habla del resultado real. Piense en la Preparación como «¿está la puerta abierta?» y en la Visibilidad Medida como «¿está entrando gente de verdad por ella?»
Las seis señales de preparación
La puntuación de Preparación agrega seis categorías de señales. Cada una se puede medir de forma independiente desde su página pública, sin ninguna llamada a una API de IA.
Acceso de Rastreadores de IA
AltaQué: Si los principales rastreadores de IA pueden llegar siquiera a su contenido.
Cómo lo medimos: Analizamos su robots.txt en busca de reglas Disallow explícitas dirigidas a GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot y Google-Extended. Si un rastreador está bloqueado, ese motor no puede indexar su página: queda categóricamente excluido de ser citado, sin importar la calidad del contenido.
Evidencia: Consenso: el acceso de los rastreadores es una puerta binaria. El 87% de las citas de ChatGPT coincide con los 10 primeros resultados de Bing (Seer Interactive, 2025), así que la indexación en Bing, que requiere acceso de OAI-SearchBot, es la señal individual más crítica para la visibilidad en ChatGPT.
Datos Estructurados
Alta para Gemini, Media para el restoQué: Marcado JSON-LD que permite a los motores de IA interpretar su contenido como datos estructurados.
Cómo lo medimos: Analizamos los bloques JSON-LD de su página en busca de los tipos FAQPage, Article, HowTo, Organization y BreadcrumbList. FAQPage es el tipo de mayor prioridad: un estudio de 2026 sobre 1,508 sitios web inmobiliarios encontró el schema FAQPage presente en el 6.2% de los sitios visibles en ChatGPT, frente a solo el 0.8% de los sitios no visibles.
Evidencia: Probable: estudio controlado (Schanbacher, 2026, n=1,508). Otros tipos de schema muestran una correlación mixta o nula en estudios independientes: no conviene sobrestimar los datos estructurados como solución milagrosa.
Extraibilidad
Máxima para Claude, Alta para el restoQué: Con qué facilidad una IA puede identificar y citar el pasaje más relevante de su página.
Cómo lo medimos: Buscamos una estructura de respuesta directa (respuesta directa en las primeras ~200 palabras), número de encabezados, pares de preguntas y respuestas tipo FAQ, listas y tablas, y legibilidad Flesch. Las páginas que responden la consulta desde el principio se citan desde su primer tercio de contenido el 44% de las veces (investigación de profesionales del sector). Una legibilidad en el rango de 50 a 70 en la escala Flesch es óptima para ser citado por la IA.
Evidencia: Probable: consenso de profesionales del sector, más el hallazgo del estudio GEO de Princeton de que las señales de estructura del contenido se correlacionan con un aumento en las citas (n=10,000 consultas, Perplexity).
Autoridad y Densidad Factual
Máxima para Perplexity, Alta para GeminiQué: Con qué eficacia la página señala su propia fiabilidad a través de contenido factual.
Cómo lo medimos: Contamos estadísticas y porcentajes (las afirmaciones numéricas aumentan la probabilidad de cita en ~41% según el estudio GEO de Princeton), enlaces salientes a dominios con autoridad, citas dentro del texto, y el recuento total de palabras (un indicador indirecto de profundidad). Todo esto sirve de indicador de las señales E-E-A-T, que aparecen en el 96% de las citas de Google AI Overview.
Evidencia: Probado: estudio GEO de Princeton (estadísticas: +41%, citas: +34%, n=10,000 consultas). Correlación con E-E-A-T según el estudio de Wellows (profesionales del sector, 2025). Correlación de menciones de marca con AIO: r=0.664, el predictor conocido más fuerte que podemos medir desde la propia página.
Actualidad
Máxima para PerplexityQué: Si su página le indica a los motores de IA cuán reciente es su información.
Cómo lo medimos: Comprobamos datePublished y dateModified en el JSON-LD, el lastmod del sitemap y las etiquetas meta de fecha en HTML. Calculamos hace cuántos días fue la señal más reciente. El proceso de recuperación de Perplexity aplica un filtro de actualidad agresivo: las páginas sin señales de actualidad se tratan como potencialmente desactualizadas.
Evidencia: Consenso: Perplexity documenta explícitamente la actualidad como factor de posicionamiento. Ningún estudio cuantificado aísla el aumento en las citas debido solo a las señales de actualidad, pero el consenso de los profesionales del sector es sólido.
Salud Técnica
Alta para ChatGPT, Media para el restoQué: Si la página se puede obtener y analizar de verdad por un rastreador de IA.
Cómo lo medimos: Comprobamos HTTPS, un estado HTTP 200 válido, la etiqueta meta viewport (un indicador de compatibilidad móvil), y si la página depende en gran medida del renderizado con JavaScript. Los rastreadores de IA normalmente obtienen el HTML en bruto sin ejecutar JavaScript, así que las páginas muy cargadas de JavaScript pueden parecerles casi en blanco.
Evidencia: Consenso sobre HTTPS y el renderizado con JS. Efecto de la velocidad de página: las páginas con FCP por debajo de 0.4s reciben 6.7 citas de ChatGPT frente a 2.1 con FCP por encima de 1.13s, según un estudio de profesionales del sector, pero esto no se ha replicado de forma independiente y debe tomarse solo como indicativo.
Nota sobre llms.txt
Señalamos la ausencia de un archivo /llms.txt como un problema informativo (no crítico). La evidencia actual va en contra de su importancia: un estudio de Ahrefs de mayo de 2026 sobre 137,000 dominios encontró que el 97% de los archivos llms.txt no recibió ningún tráfico de ningún bot de IA. Incluimos la señal porque la especificación podría ganar adopción, pero no vamos a exagerar su efecto actual.
Puntuación por motor
Cada motor de IA pondera las seis categorías de señales de forma distinta, porque tienen arquitecturas de recuperación genuinamente diferentes. En lugar de presentar una única «puntuación de IA», calculamos una puntuación de Preparación por motor y luego las promediamos para obtener la cifra general destacada.
| Señal | ChatGPT | Perplexity | Gemini | Claude |
|---|---|---|---|---|
| Acceso de Rastreadores | 25% | 20% | 20% | 20% |
| Datos Estructurados | 15% | 10% | 25% | 20% |
| Extraibilidad | 20% | 15% | 15% | 30% |
| Autoridad | 15% | 25% | 20% | 15% |
| Actualidad | 10% | 25% | 10% | 5% |
| Técnico | 15% | 5% | 10% | 10% |
ChatGPT pondera mucho el acceso de los rastreadores porque el 87% de sus citas provienen de los 10 primeros resultados de Bing, y Bing requiere acceso de OAI-SearchBot. Perplexity pondera sobre todo la actualidad y la autoridad porque su proceso RAG de seis etapas filtra de forma agresiva por actualidad y densidad factual. Gemini valora sobre todo los datos estructurados y las señales de autoridad, reflejando el marco E-E-A-T de Google. Claude pone la extraibilidad en primer lugar porque es el motor más selectivo, con un 97.8% de citas provenientes de fuentes establecidas y claramente estructuradas.
Cualquier motor bloqueado en el robots.txt recibe una penalización del 55% en su puntuación combinada (la puntuación se multiplica por 0.45), reflejando que los motores bloqueados no pueden indexar ni citar la página en absoluto.
La puntuación general de Preparación es la media aritmética de las cuatro puntuaciones por motor, cada una limitada al rango [0, 100].
Visibilidad Medida (consultas fundamentadas en vivo)
Las puntuaciones de Preparación son una condición necesaria, pero no suficiente, para la visibilidad en IA. La Visibilidad Medida va más allá: enviamos consultas reales a los motores de IA reales y medimos si su marca aparece en las respuestas fundamentadas y citadas.
Por qué consultas fundamentadas, y no sondeos de memoria de entrenamiento
En la mayoría de los grandes motores de IA para consumidores (ChatGPT Search, Perplexity, Google AI Overviews y Copilot), las respuestas se fundamentan en recuperación web en vivo en el momento de la consulta. La memoria de entrenamiento decide si una IA «sabe» que una marca existe; la recuperación en vivo decide si la cita en sus respuestas. El GEO es sobre todo un problema de recuperación de información, por eso preferimos las consultas fundamentadas siempre que el motor las permita.
En ChatGPT, Perplexity y Gemini no usamos prompting de modelo base (preguntarle a la IA qué «sabe» sobre una marca sin búsqueda web). Eso pone a prueba la memoria de entrenamiento congelada, es altamente no determinista, propenso a alucinaciones con marcas menos conocidas, y no refleja lo que los usuarios ven realmente en los motores de consumo fundamentados. Claude es la única excepción: a día de hoy, con la API actual de Anthropic, Claude no tiene ninguna herramienta nativa de búsqueda web comparable a las de OpenAI o Google, así que su puntuación es, por necesidad, una comprobación de memoria de entrenamiento, no una medición fundamentada. Señalamos esto en cada puntuación de Claude, y la cambiaremos a una consulta fundamentada en cuanto Anthropic lance una API de búsqueda web.
Diseño del conjunto de consultas
Construimos un conjunto de consultas curado que cubre tres categorías: consultas de descubrimiento (por categoría, sin nombres de marca), consultas de comparación (etapa de evaluación) y consultas directas de marca. La proporción es aproximadamente 60/30/10: el descubrimiento tiene el mayor peso porque es ahí donde se capta nueva audiencia. Un mínimo de 30 consultas por auditoría ofrece una señal significativa; la auditoría estándar completa usa 50.
Repeticiones y tratamiento estadístico
Una sola ejecución de una sola consulta casi no significa nada. La no determinación de los LLM implica que la misma consulta puede producir citas distintas entre ejecuciones, incluso con temperature=0 (la variación por tamaño de lote a nivel de GPU no se puede eliminar). El estudio GEO de Princeton encontró que se necesitan entre 60 y 100 repeticiones para estabilizar los porcentajes de visibilidad.
Cada repetición envía la misma consulta idéntica de nuevo. No variamos ni parafraseamos el prompt entre repeticiones. Las auditorías de pago estándar ejecutan 3 repeticiones por consulta por motor; la vista previa gratuita/anónima y las repeticiones rutinarias de Agencia ejecutan 1 (una instantánea de muestra única, sin banda). La tasa de citas se calcula como la fracción de ejecuciones en las que se citó la marca (brandCited = true). Usamos el intervalo de puntuación de Wilson para calcular un intervalo de confianza del 95% sobre esta proporción. Esto refleja la consistencia de una ejecución a otra bajo la variabilidad propia del proveedor entre llamadas idénticas, no una muestra de cómo podría variar la cita entre distintas formulaciones de la misma consulta.
Fidelidad entre la API y la interfaz de consumidor
Para ChatGPT, Perplexity y Gemini usamos la API programática de cada motor con la búsqueda web activada. Este es el estándar del sector y el único enfoque escalable, pero introduce diferencias conocidas:
- El ChatGPT.com de consumidor puede incluir personalización e historial de navegación que las API no replican.
- La API de Gemini con fundamentación de Google Search y Google AI Overviews comparten solo ~38.5% de los principales dominios citados, una brecha estructural que revelamos explícitamente en cada puntuación de Google.
- Perplexity documenta una posible divergencia entre su API y su interfaz de consumidor.
- La API de Claude no tiene ninguna herramienta de búsqueda web, así que su puntuación usa la memoria de entrenamiento del modelo en lugar de una llamada en vivo a la API: la mayor brecha de fidelidad de las cuatro, revelada en cada puntuación de Claude.
Señalamos estas limitaciones en cada informe que incluye una puntuación de Visibilidad Medida. Creemos que la transparencia sobre las limitaciones de la medición vale más que una falsa precisión.
Bandas de confianza y volatilidad
Las puntuaciones de visibilidad en IA son estimaciones, no hechos. Hay tres fuentes de volatilidad que afectan a cualquier medición:
- No determinismo de los LLM. Incluso con temperature=0, las respuestas de la API varían debido a la variación por tamaño de lote a nivel de GPU. Una puntuación puntual sin repeticiones puede variar ±30% en una nueva ejecución. Nuestro motor de Visibilidad Medida repite cada consulta idéntica varias veces e informa de intervalos de confianza de puntuación de Wilson sobre la tasa de citas resultante. Esto mide la consistencia de una ejecución a otra bajo la variabilidad propia del proveedor, no la variación entre distintas formulaciones de la misma consulta, para que pueda ver cuán estable es cada número.
- Actualizaciones de modelos y algoritmos. OpenAI, Google y Perplexity actualizan sus modelos de forma continua, a menudo sin anuncios públicos. Una puntuación de hace seis semanas puede no reflejar la realidad actual. Mostramos la fecha de medición en cada puntuación y señalamos las puntuaciones de más de 30 días de antigüedad.
- Variación geográfica y de personalización. La misma consulta produce respuestas distintas según la ubicación, el idioma y el tipo de cuenta. Nuestras mediciones se ejecutan desde ubicaciones estandarizadas. Los resultados para otras zonas geográficas pueden variar.
La puntuación de Preparación (auditoría gratuita) es mucho más estable que la Visibilidad Medida porque comprueba señales deterministas (robots.txt, datos estructurados, contenido HTML), no resultados estocásticos de IA. Un cambio en la puntuación de Preparación refleja un cambio real en su página.
Qué le dice esto y qué no
Creemos que la honestidad intelectual sobre los límites de la medición es lo que distingue a una herramienta útil de un generador de puntuaciones que solo parece convincente. Esto es lo que esta herramienta explícitamente no puede decirle:
No medimos el tráfico orgánico procedente de la IA.
La cita en IA y el tráfico de referencia desde IA son cosas distintas. Una marca puede ser citada con mucha frecuencia y aun así ver un tráfico de referencia plano, porque las plataformas de IA responden cada vez más dentro de su propia interfaz, sin generar clics externos (Digiday, 2025). Nuestra puntuación le habla de la probabilidad de cita, no del volumen de tráfico.
La tasa de citas no garantiza un impacto en los ingresos.
El tráfico de referencia desde IA convierte a tasas más altas que el tráfico orgánico tradicional (varios estudios encuentran una conversión de 5 a 23 veces mayor que el orgánico de Google), pero el volumen absoluto sigue estando por debajo del 1% del tráfico web. Una puntuación de visibilidad alta es una señal de calidad de posicionamiento, no una previsión de ingresos.
Las puntuaciones de Preparación hablan de requisitos previos, no de garantías.
Una puntuación de Preparación de 90/100 significa que su página tiene en su sitio las señales técnicas correctas. No garantiza que vaya a ser citada. Los factores externos al sitio (presencia en Reddit, menciones de marca por toda la web, reconocimiento de entidad en Wikipedia/Wikidata, perfiles en sitios de reseñas) son motores importantes de las citas que no podemos medir solo desde su página.
No podemos medir lo que no podemos rastrear.
Nuestra auditoría obtiene su página pública tal como lo haría un rastreador de IA. Si el contenido está detrás de una autenticación, se carga por completo mediante JavaScript sin renderizado en el servidor, o está en subdominios que no nos ha facilitado, no podemos evaluarlo.
Las puntuaciones no son comparables entre herramientas.
Una puntuación de 65 en WhoCanFindMe no se puede comparar con un 65 de Otterly, Peec, Profound o cualquier otra herramienta. Cada herramienta usa un conjunto de consultas distinto, un número de repeticiones distinto, una combinación de motores distinta y una ponderación distinta. No existe un estándar del sector. Nuestra puntuación está calibrada y es internamente consistente: puede seguir su mejora a lo largo del tiempo, pero no es un absoluto del sector.
Investigación y fuentes
Nuestra metodología se basa en investigación académica publicada y estudios primarios de profesionales del sector. El campo avanza rápido; reverificamos las estadísticas clave cada trimestre. Etiquetas de solidez de la evidencia: Probado = estudio controlado o replicado en varios estudios; Probable = un solo estudio o fuerte consenso de profesionales del sector con un mecanismo plausible; Anecdótico = ampliamente repetido, sin estudio.
Princeton / IIT Delhi / Georgia Tech GEO paper (Aggarwal et al., KDD 2024)
La adición de estadísticas +41%, citar fuentes +34%, la adición de citas textuales +28% de aumento en las citas. n=10,000 consultas en un sistema tipo Bing Chat, validado en Perplexity.
ProbadoGoogle AI Overviews measurement study (arxiv:2605.14021, June 2026)
Tasa de activación de AIO del 13.7% en general, 64.7% para consultas en forma de pregunta. Los dominios citados por AIO son más creíbles que los orgánicos de primera página (0.732 frente a 0.645). El 30% de las citas de AIO no aparece en los primeros resultados orgánicos.
ProbadoAhrefs llms.txt study (May 2026, 137,000 domains)
El 97% de los archivos llms.txt no recibió ningún tráfico de bots de IA. El 96% de las solicitudes provenía de herramientas de auditoría automatizadas, no de motores de IA.
ProbadoSeer Interactive ChatGPT/Bing correlation study (2025)
El 87% de las citas de ChatGPT Search coincide con los 10 primeros resultados orgánicos de Bing.
ProbadoWellows E-E-A-T and AIO study
El 96% de las citas de AIO proviene de fuentes con E-E-A-T alto. Los autores identificados por su nombre tienen 2.3 veces más probabilidad de ser citados. Correlación de la autoridad de dominio con AIO: r=0.18. Correlación de menciones externas de marca: r=0.664.
ProbableSE Ranking Reddit study
Los dominios con 50+ menciones en Reddit muestran un índice de citas de 22.5 frente a 10.4 para los que tienen entre 11 y 50 menciones.
ProbableSchanbacher 2026 FAQ schema study (n=1,508 real estate websites)
Schema FAQPage en el 6.2% de los sitios visibles en ChatGPT frente al 0.8% de los sitios no visibles.
ProbableOtterlyAI llms.txt 90-day experiment
Solo el 0.1% de las solicitudes de rastreadores de IA tocó /llms.txt.
ProbadoSemrush 2026 AI Visibility Index (126M US AI search prompts)
El 45% de los líderes de marketing no puede medir con precisión su visibilidad en IA. Escaló de 2,500 a 126M de prompts entre enero y abril de 2026.
ProbadoSuperprompt.com conversion analysis (12M website visits)
El tráfico de referencia desde IA convierte al 14.2% frente al 2.8% del orgánico de Google.
ProbableVea su puntuación ahora
Haga una auditoría gratuita y obtenga su puntuación de Preparación en ChatGPT, Gemini, Perplexity y Claude en menos de 30 segundos. Sin necesidad de registro.
Relacionado: Datos de Benchmarks por categoría · Precios · Auditoría gratuita