WhoCanFindMe

Methodik

So messen wir KI-Suchsichtbarkeit

Eine ehrliche, öffentliche Erklärung, was die Scores bedeuten, wie wir sie berechnen und, wichtig, was sie Ihnen nicht sagen können. Auf unsere Methodik sind wir am meisten stolz; sie gehört öffentlich gemacht.

Zuletzt aktualisiert: Juni 2026 · Das Feld verändert sich schnell, daher überprüfen wir wichtige Statistiken vierteljährlich neu.

Was wir messen

WhoCanFindMe misst zwei verschiedene Dinge, und es ist wichtig, beide zu verstehen:

  1. KI-Bereitschaft (das kostenlose Audit). Ein deterministischer, heuristischer Score auf Basis von Signalen, die wir direkt von Ihrer öffentlichen Seite extrahieren: robots.txt-Regeln, strukturierte Daten, Extrahierbarkeit von Inhalten, Aktualitätssignale und technische Gesundheit. Das läuft in Sekunden und kostet nichts, weil keine Live-KI-API-Aufrufe nötig sind. Es sagt Ihnen, ob Ihre Seite darauf ausgelegt ist, gefunden zu werden von KI-Crawlern und Parsern.
  2. Gemessene Sichtbarkeit (kostenpflichtige Stufe). Live-Abfragen mit Websuche an ChatGPT, Perplexity und Gemini, plus eine Trainingsdaten-Abrufanfrage an Claude (das noch keine native Websuch-API hat), um zu messen, ob Ihre Marke tatsächlich in Antworten erscheint. Drei Engines basieren auf Retrieval; Claude ist eine Prüfung des Trainingsgedächtnisses. Siehe Abschnitt 4 für die vollständigen Details.

Die Unterscheidung ist wichtig. Ein Bereitschafts-Score sagt Ihnen etwas über die technischen Voraussetzungen für KI-Sichtbarkeit; Gemessene Sichtbarkeit sagt Ihnen das tatsächliche Ergebnis. Sehen Sie Bereitschaft als „Ist die Tür entriegelt?“ und Gemessene Sichtbarkeit als „Gehen tatsächlich Menschen hindurch?“

Die sechs Bereitschaftssignale

Der Bereitschafts-Score fasst sechs Signalkategorien zusammen. Jede ist unabhängig von Ihrer öffentlichen Seite messbar, ganz ohne KI-API-Aufruf.

1

KI-Crawler-Zugriff

Hoch

Was: Ob die wichtigsten KI-Crawler Ihre Inhalte überhaupt erreichen können.

Wie wir es messen: Wir parsen Ihre robots.txt nach expliziten Disallow-Regeln für GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot und Google-Extended. Ist ein Crawler blockiert, kann diese Engine Ihre Seite nicht indexieren: Sie ist kategorisch davon ausgeschlossen, zitiert zu werden, unabhängig von der Inhaltsqualität.

Beleg: Konsens: Crawler-Zugriff ist ein binäres Tor. 87% der ChatGPT-Zitate stimmen mit Bings Top-10-Ergebnissen überein (Seer Interactive, 2025), daher ist die Bing-Indexierung, die OAI-SearchBot-Zugriff voraussetzt, das kritischste Einzelsignal für ChatGPT-Sichtbarkeit.

2

Strukturierte Daten

Hoch für Gemini, mittel für andere

Was: JSON-LD-Schema-Markup, das KI-Engines Ihre Inhalte als strukturierte Fakten auswerten lässt.

Wie wir es messen: Wir scannen die JSON-LD-Blöcke Ihrer Seite nach den Typen FAQPage, Article, HowTo, Organization und BreadcrumbList. FAQPage ist der wichtigste Typ: Eine Studie aus 2026 zu 1.508 Immobilien-Websites fand FAQPage-Schema bei 6,2% der ChatGPT-sichtbaren Sites gegenüber nur 0,8% der nicht sichtbaren.

Beleg: Wahrscheinlich: kontrollierte Studie (Schanbacher, 2026, n=1.508). Andere Schema-Typen zeigen in unabhängigen Studien gemischte oder keine Korrelation: verlassen Sie sich bei Schema nicht auf eine Wunderwaffe.

3

Extrahierbarkeit

Am höchsten für Claude, hoch für andere

Was: Wie leicht eine KI die relevanteste Passage Ihrer Seite erkennen und zitieren kann.

Wie wir es messen: Wir suchen nach Antwort-zuerst-Struktur (direkte Antwort in den ersten ~200 Wörtern), Anzahl der Überschriften, FAQ-artigen Frage-Antwort-Paaren, Listen und Tabellen sowie Flesch-Lesbarkeit. Seiten, die die Anfrage direkt zu Beginn beantworten, werden zu 44% aus ihrem ersten Drittel zitiert (Praktiker-Forschung). Lesbarkeit im Flesch-Bereich von 50 bis 70 ist für KI-Zitate optimal.

Beleg: Wahrscheinlich: Praktiker-Konsens plus die Princeton-GEO-Studie, die zeigt, dass Signale zur Inhaltsstruktur mit einem Zitat-Zuwachs korrelieren (n=10.000 Anfragen, Perplexity).

4

Autorität und Faktendichte

Am höchsten für Perplexity, hoch für Gemini

Was: Wie gut die Seite ihre eigene Vertrauenswürdigkeit durch faktischen Inhalt signalisiert.

Wie wir es messen: Wir zählen Statistiken und Prozentangaben (numerische Aussagen erhöhen die Zitatwahrscheinlichkeit laut Princeton-GEO-Studie um ~41%), ausgehende Links zu Autoritätsdomains, Zitate im Text und die Wortzahl insgesamt (ein Proxy für Tiefe). Diese stehen stellvertretend für E-E-A-T-Signale, die in 96% der Google-AI-Overview-Zitate auftauchen.

Beleg: Belegt: Princeton-GEO-Studie (Statistiken: +41%, Zitate: +34%, n=10.000 Anfragen). E-E-A-T-Korrelation aus der Wellows-Studie (Praktiker, 2025). Markennennungen korrelieren mit AIO mit r=0,664, dem stärksten Prädiktor, den wir allein von der Seite aus messen können.

5

Aktualität

Am höchsten für Perplexity

Was: Ob Ihre Seite den KI-Engines mitteilt, wie aktuell ihre Informationen sind.

Wie wir es messen: Wir prüfen datePublished und dateModified in JSON-LD, das Sitemap-lastmod und HTML-Meta-Datumsangaben. Wir berechnen, wie viele Tage seit dem letzten Signal vergangen sind. Perplexitys Retrieval-Pipeline wendet einen aggressiven Aktualitätsfilter an: Seiten ohne Aktualitätssignale gelten als potenziell veraltet.

Beleg: Konsens: Perplexity dokumentiert Aktualität explizit als Rankingfaktor. Keine quantifizierte Studie isoliert den Zitat-Zuwachs allein durch Aktualitätssignale, aber der Praktiker-Konsens ist stark.

6

Technische Gesundheit

Hoch für ChatGPT, mittel für andere

Was: Ob die Seite tatsächlich abrufbar und für einen KI-Crawler auswertbar ist.

Wie wir es messen: Wir prüfen HTTPS, einen gültigen HTTP-200-Status, das Viewport-Meta-Tag (Proxy für Mobilfreundlichkeit) und ob die Seite stark auf JavaScript-Rendering angewiesen ist. KI-Crawler rufen üblicherweise rohes HTML ab, ohne JavaScript auszuführen, sodass JS-lastige Seiten für sie nahezu leer erscheinen können.

Beleg: Konsens zu HTTPS und JS-Rendering. Effekt der Seitengeschwindigkeit: Seiten mit FCP unter 0,4s erhalten in einer Praktiker-Studie 6,7 ChatGPT-Zitate gegenüber 2,1 bei FCP über 1,13s, dies wurde jedoch nicht unabhängig repliziert und sollte nur als Hinweis gelten.

Hinweis zu llms.txt

Wir kennzeichnen das Fehlen einer /llms.txt-Datei als informativen (nicht kritischen) Hinweis. Die aktuelle Beweislage spricht gegen ihre Bedeutung: Ahrefs' Studie von Mai 2026 zu 137.000 Domains fand, dass 97% der llms.txt-Dateien null Traffic von KI-Bots erhielten. Wir nehmen das Signal auf, weil die Spezifikation an Verbreitung gewinnen könnte, werden ihre aktuelle Wirkung aber nicht überbewerten.

Bewertung pro Engine

Jede KI-Engine gewichtet die sechs Signalkategorien unterschiedlich, weil sie tatsächlich unterschiedliche Retrieval-Architekturen haben. Statt einen einzelnen „KI-Score“ zu präsentieren, berechnen wir einen Bereitschafts-Score pro Engine und mitteln diese für die zentrale Gesamtzahl.

SignalChatGPTPerplexityGeminiClaude
Crawler-Zugriff25%20%20%20%
Strukturierte Daten15%10%25%20%
Extrahierbarkeit20%15%15%30%
Autorität15%25%20%15%
Aktualität10%25%10%5%
Technisch15%5%10%10%

ChatGPT gewichtet Crawler-Zugriff hoch, weil 87% seiner Zitate aus Bings Top-10 stammen, und Bing erfordert OAI-SearchBot-Zugriff. Perplexity gewichtet Aktualität und Autorität am stärksten, weil seine sechsstufige RAG-Pipeline aggressiv nach Aktualität und Faktendichte filtert. Gemini schätzt strukturierte Daten und Autoritätssignale am meisten, was Googles E-E-A-T-Rahmen widerspiegelt. Claude stellt Extrahierbarkeit an erste Stelle, weil es die selektivste Engine ist, mit 97,8% der Zitate aus etablierten, klar strukturierten Quellen.

Jede Engine, die in robots.txt blockiert ist, erhält einen 55%-Abschlag auf ihren zusammengesetzten Score (der Score wird mit 0,45 multipliziert), was widerspiegelt, dass blockierte Engines die Seite überhaupt nicht indexieren oder zitieren können.

Der Gesamt-Bereitschafts-Score ist der arithmetische Mittelwert der vier Engine-Scores, jeweils auf [0, 100] begrenzt.

Gemessene Sichtbarkeit (Live-Abfragen)

Bereitschafts-Scores sind eine notwendige, aber keine hinreichende Bedingung für KI-Sichtbarkeit. Gemessene Sichtbarkeit geht weiter: Wir senden echte Anfragen an die tatsächlichen KI-Engines und messen, ob Ihre Marke in den fundierten, zitierten Antworten erscheint.

Warum fundierte Abfragen statt Trainingsgedächtnis-Tests

Bei den meisten großen Consumer-KI-Engines (ChatGPT Search, Perplexity, Google AI Overviews und Copilot) werden Antworten zum Anfragezeitpunkt auf Live-Websuche gestützt. Das Trainingsgedächtnis entscheidet, ob eine KI eine Marke „kennt“; die Live-Websuche entscheidet, ob sie diese Marke in Antworten zitiert. GEO ist vor allem ein Retrieval-Problem, weshalb wir fundierte Abfragen bevorzugen, wo immer die Engine sie unterstützt.

Bei ChatGPT, Perplexity und Gemini verwenden wir kein Base-Model-Prompting (die KI zu fragen, was sie ohne Websuche über eine Marke „weiß“). Das testet eingefrorenes Trainingsgedächtnis, ist stark nicht-deterministisch, anfällig für Halluzinationen bei weniger bekannten Marken und spiegelt nicht wider, was Nutzer in fundierten Consumer-Engines tatsächlich sehen. Claude ist die eine Ausnahme: Nach dem aktuellen Stand der Anthropic-API hat Claude kein natives Websuch-Werkzeug analog zu dem von OpenAI oder Google, daher ist sein Score zwangsläufig eine Prüfung des Trainingsgedächtnisses, keine fundierte Messung. Wir kennzeichnen dies bei jedem Claude-Score und wechseln zu einer fundierten Abfrage, sobald Anthropic eine Websuch-API veröffentlicht.

Design des Anfragensatzes

Wir erstellen einen kuratierten Anfragensatz über drei Kategorien: Discovery-Anfragen (kategoriebasiert, ohne Markennamen), Vergleichsanfragen (Bewertungsphase) und markendirekte Anfragen. Der Mix liegt bei etwa 60/30/10: Discovery ist am höchsten gewichtet, weil dort neues Publikum gewonnen wird. Mindestens 30 Anfragen pro Audit liefern ein aussagekräftiges Signal; das reguläre Standard-Audit nutzt 50.

Wiederholungen und statistische Auswertung

Ein einzelner Durchlauf einer einzelnen Anfrage ist nahezu bedeutungslos. LLM-Nichtdeterminismus bedeutet, dass dieselbe Anfrage über Durchläufe hinweg unterschiedliche Zitate erzeugen kann, selbst bei temperature=0 (Schwankungen durch die Batch-Größe auf GPU-Ebene lassen sich nicht ausschließen). Die Princeton-GEO-Studie fand, dass 60 bis 100 Wiederholungen nötig sind, um Sichtbarkeitsprozentsätze zu stabilisieren.

Jede Wiederholung sendet dieselbe Anfrage erneut. Wir variieren oder umschreiben den Prompt zwischen den Wiederholungen nicht. Standard-kostenpflichtige Audits laufen mit 3 Wiederholungen pro Anfrage pro Engine; die kostenlose/anonyme Vorschau und routinemäßige Agency-Neuprüfungen laufen mit 1 (eine einzelne Momentaufnahme, kein Band). Die Zitatrate wird als Anteil der Durchläufe berechnet, in denen die Marke zitiert wurde (brandCited = true). Wir nutzen das Wilson-Score-Intervall, um ein 95%-Konfidenzintervall für diesen Anteil zu berechnen. Das spiegelt die Konsistenz von Durchlauf zu Durchlauf unter anbieterseitigem Rauschen bei identischen Aufrufen wider, nicht eine Stichprobe dazu, wie sehr Zitate über verschiedene Formulierungen derselben Anfrage variieren können.

API- vs. Consumer-UI-Genauigkeit

Bei ChatGPT, Perplexity und Gemini nutzen wir die programmatische API jeder Engine mit aktivierter Websuche. Das ist der Industriestandard und der einzig skalierbare Ansatz, führt aber zu bekannten Lücken:

  • Consumer-ChatGPT.com kann Personalisierung und Browserverlauf einbeziehen, die APIs nicht nachbilden.
  • Gemini-API mit Google-Search-Grounding und Google AI Overviews teilen sich nur ~38,5% der meistzitierten Domains, eine strukturelle Lücke, die wir bei jedem Google-Score explizit offenlegen.
  • Perplexity dokumentiert eine mögliche Abweichung zwischen seiner API und der Consumer-Oberfläche.
  • Claudes API hat überhaupt kein Websuch-Werkzeug, daher nutzt ihr Score den Trainingsdaten-Abruf des Modells statt eines Live-API-Aufrufs: die größte Genauigkeitslücke der vier, offengelegt bei jedem Claude-Score.

Wir kennzeichnen diese Einschränkungen in jedem Bericht, der einen Score für Gemessene Sichtbarkeit enthält. Wir glauben, dass Transparenz über Messgrenzen wertvoller ist als falsche Genauigkeit.

Konfidenzbänder und Schwankung

KI-Sichtbarkeits-Scores sind Schätzungen, keine Fakten. Drei Quellen von Schwankung beeinflussen jede Messung:

  1. LLM-Nichtdeterminismus. Selbst bei temperature=0 schwanken API-Antworten aufgrund von Batch-Größen-Varianz auf GPU-Ebene. Ein Zeitpunkt-Score ohne Wiederholungen kann bei einem erneuten Durchlauf um ±30% abweichen. Unsere Engine für Gemessene Sichtbarkeit wiederholt jede identische Anfrage mehrfach und meldet Wilson-Score-Konfidenzintervalle für die resultierende Zitatrate. Das misst die Konsistenz von Durchlauf zu Durchlauf unter anbieterseitigem Rauschen, nicht die Variation über verschiedene Formulierungen derselben Anfrage, sodass Sie sehen können, wie stabil jede Zahl ist.
  2. Modell- und Algorithmus-Updates. OpenAI, Google und Perplexity aktualisieren ihre Modelle fortlaufend, oft ohne öffentliche Ankündigungen. Ein Score von vor sechs Wochen spiegelt möglicherweise nicht mehr die aktuelle Realität wider. Wir zeigen das Messdatum bei jedem Score an und kennzeichnen Scores, die älter als 30 Tage sind.
  3. Geografische und Personalisierungs-Variation. Dieselbe Anfrage erzeugt je nach Standort, Sprache und Kontotyp unterschiedliche Antworten. Unsere Messungen laufen von standardisierten Standorten aus. Ergebnisse für andere Regionen können abweichen.

Der Bereitschafts-Score (kostenloses Audit) ist deutlich stabiler als Gemessene Sichtbarkeit, weil er deterministische Signale prüft (robots.txt, strukturierte Daten, HTML-Inhalt), keine stochastischen KI-Ausgaben. Eine Änderung des Bereitschafts-Scores spiegelt eine echte Änderung an Ihrer Seite wider.

Was dies Ihnen sagt und nicht sagt

Wir glauben, dass intellektuelle Ehrlichkeit über Messgrenzen ein nützliches Werkzeug von einem überzeugend aussehenden Score-Generator unterscheidet. Hier ist, was dieses Werkzeug Ihnen ausdrücklich nicht sagen kann:

Wir messen keinen organischen Traffic aus KI.

KI-Zitat und KI-Verweistraffic sind unterschiedliche Dinge. Eine Marke kann stark zitiert werden und trotzdem flachen Verweistraffic sehen, weil KI-Plattformen zunehmend direkt in der Oberfläche antworten, ohne externe Klicks zu erzeugen (Digiday, 2025). Unser Score sagt Ihnen etwas über die Zitatwahrscheinlichkeit, nicht über das Traffic-Volumen.

Zitatrate garantiert keine Umsatzwirkung.

KI-Verweistraffic konvertiert zu höheren Raten als klassischer organischer Traffic (mehrere Studien finden eine 5- bis 23-fach höhere Konversion als bei Google-organisch), aber das absolute Volumen bleibt unter 1% des Web-Traffics. Ein hoher Sichtbarkeits-Score ist ein Qualitätssignal zur Positionierung, keine Umsatzprognose.

Bereitschafts-Scores betreffen Voraussetzungen, keine Garantien.

Ein Bereitschafts-Score von 90/100 bedeutet, dass Ihre Seite die richtigen technischen Signale hat. Das garantiert nicht, dass Sie zitiert werden. Off-Site-Faktoren (Reddit-Präsenz, Markennennungen im gesamten Web, Wikipedia-/Wikidata-Entitätserkennung, Bewertungsseiten-Profile) sind wichtige Zitat-Treiber, die wir allein von Ihrer Seite aus nicht messen können.

Wir können nicht messen, was wir nicht crawlen können.

Unser Audit ruft Ihre öffentliche Seite so ab, wie es ein KI-Crawler täte. Liegt Inhalt hinter Authentifizierung, wird er vollständig per JavaScript ohne Server-Rendering geladen oder befindet sich auf Subdomains, die uns nicht bekannt sind, können wir ihn nicht bewerten.

Scores sind nicht toolübergreifend vergleichbar.

Der Score von 65 bei WhoCanFindMe lässt sich nicht mit einer 65 von Otterly, Peec, Profound oder einem anderen Tool vergleichen. Jedes Tool nutzt einen anderen Anfragensatz, andere Wiederholungszahlen, andere Engine-Mischungen und andere Gewichtungen. Es gibt keinen Branchenstandard. Unser Score ist kalibriert und in sich konsistent: Er kann Ihre Verbesserung über die Zeit verfolgen, ist aber kein branchenweites Absolutmaß.

Forschung und Quellen

Unsere Methodik baut auf veröffentlichter akademischer Forschung und primären Praktiker-Studien auf. Das Feld bewegt sich schnell; wir überprüfen wichtige Statistiken vierteljährlich neu. Beleg-Stärke-Kennzeichnungen: Belegt = kontrollierte Studie oder über mehrere Studien repliziert; Wahrscheinlich = einzelne Studie oder starker Praktiker-Konsens mit plausiblem Mechanismus; Folklore = weit verbreitet wiederholt, keine Studie.

Princeton / IIT Delhi / Georgia Tech GEO paper (Aggarwal et al., KDD 2024)

Hinzufügen von Statistiken +41%, Quellenangaben +34%, Hinzufügen von Zitaten +28% Zitat-Zuwachs. n=10.000 Anfragen an einem Bing-Chat-artigen System, validiert auf Perplexity.

Belegt

Google AI Overviews measurement study (arxiv:2605.14021, June 2026)

AIO-Auslöserate 13,7% insgesamt, 64,7% bei Anfragen in Frageform. AIO-zitierte Domains glaubwürdiger als organische Erstseiten-Ergebnisse (0,732 vs. 0,645). 30% der AIO-Zitate erscheinen nicht in den organischen Top-Ergebnissen.

Belegt

Ahrefs llms.txt study (May 2026, 137,000 domains)

97% der llms.txt-Dateien erhielten null Traffic von KI-Bots. 96% der Anfragen stammten von automatisierten Audit-Tools, nicht von KI-Engines.

Belegt

Seer Interactive ChatGPT/Bing correlation study (2025)

87% der ChatGPT-Search-Zitate stimmen mit Bings organischen Top-10-Ergebnissen überein.

Belegt

Wellows E-E-A-T and AIO study

96% der AIO-Zitate stammen aus Quellen mit hohem E-E-A-T. Namentlich genannte Autoren werden 2,3-mal häufiger zitiert. Korrelation der Domain-Autorität mit AIO: r=0,18. Korrelation externer Markennennungen: r=0,664.

Wahrscheinlich

SE Ranking Reddit study

Domains mit mehr als 50 Reddit-Erwähnungen zeigen einen Zitat-Index von 22,5 gegenüber 10,4 bei 11 bis 50 Erwähnungen.

Wahrscheinlich

Schanbacher 2026 FAQ schema study (n=1,508 real estate websites)

FAQPage-Schema bei 6,2% der ChatGPT-sichtbaren Sites gegenüber 0,8% der nicht sichtbaren.

Wahrscheinlich

OtterlyAI llms.txt 90-day experiment

Nur 0,1% der KI-Crawler-Anfragen betrafen /llms.txt.

Belegt

Semrush 2026 AI Visibility Index (126M US AI search prompts)

45% der Marketingverantwortlichen können ihre KI-Sichtbarkeit nicht genau messen. Skaliert von 2.500 auf 126 Mio. Prompts zwischen Januar und April 2026.

Belegt

Superprompt.com conversion analysis (12M website visits)

KI-Verweistraffic konvertiert zu 14,2% gegenüber 2,8% bei Google-organisch.

Wahrscheinlich

Sehen Sie jetzt Ihren Score

Führen Sie ein kostenloses Audit durch und erhalten Sie Ihren Bereitschafts-Score über ChatGPT, Gemini, Perplexity und Claude in unter 30 Sekunden. Keine Anmeldung nötig.

Verwandt: Branchenvergleichsdaten · Preise · Kostenloses Audit