방법론

AI 검색 가시성을 측정하는 방법

점수가 무엇을 의미하는지, 어떻게 계산하는지, 그리고 무엇보다 무엇을 말해줄 수 없는지에 대한 정직하고 공개적인 설명입니다. 저희의 방법론은 저희가 가장 자랑스러워하는 것이며, 공개될 자격이 있습니다.

마지막 업데이트: 2026년 6월 · 이 분야는 빠르게 변하기 때문에 저희는 분기마다 핵심 통계를 재검증합니다.

저희가 측정하는 것

WhoCanFindMe는 서로 다른 두 가지를 측정하며, 둘 다 이해하는 것이 중요합니다:

  1. 페이지 준비도 (무료 AI 체크). 당신의 공개 페이지에서 직접 추출한 신호를 기반으로 한 결정론적이고 휴리스틱한 점수입니다: robots.txt 규칙, 구조화 데이터, 콘텐츠 추출 가능성, 최신성 신호, 기술적 상태. 실시간 AI API 호출이 필요 없기 때문에 몇 초 만에 실행되고 비용도 들지 않습니다. 이는 당신의 페이지가 AI 크롤러와 파서에 발견되기 좋은 위치에 있는지를 알려줍니다.
  2. 측정 가시성 (유료 등급). ChatGPT, Perplexity, Gemini, Claude에 전송되는 실시간 근거 기반 질의로, 당신의 브랜드가 실제로 답변에 등장하는지를 측정합니다. 각 엔진은 제공업체 자체의 실시간 웹 검색 도구를 활성화한 상태로 질의되므로, 저희가 채점하는 답변은 학습 데이터에서 회상된 것이 아니라 검색 기반입니다. 전체 세부 사항은 4번 섹션을 참고하세요.

이 구분은 중요합니다. 준비도 점수는 AI 가시성의 기술적 전제 조건을 알려주고, 측정 가시성은 실제 결과를 알려줍니다. 준비도를 "문이 잠겨 있지 않은가?"로, 측정 가시성을 "사람들이 실제로 걸어 들어오고 있는가?"로 생각하시면 됩니다.

여섯 가지 준비도 신호

준비도 점수는 여섯 가지 신호 카테고리를 집계합니다. 각각은 AI API 호출 없이 당신의 공개 페이지만으로 독립적으로 측정 가능합니다.

1

AI 크롤러 접근성

높음

무엇을: 주요 AI 크롤러가 애초에 당신의 콘텐츠에 도달할 수 있는지 여부.

측정 방법: 저희는 GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended를 대상으로 한 명시적인 Disallow 규칙이 있는지 robots.txt를 분석합니다. 크롤러가 차단되면 해당 엔진은 당신의 페이지를 색인할 수 없습니다: 콘텐츠 품질과 무관하게 인용 대상에서 완전히 제외됩니다.

근거: 합의됨: 크롤러 접근성은 이분법적인 관문입니다. ChatGPT 인용의 87%가 Bing 상위 10위 결과와 일치하므로(Seer Interactive, 2025), OAI-SearchBot 접근이 필요한 Bing 색인은 ChatGPT 가시성에 가장 중요한 단일 신호입니다.

2

구조화 데이터

Gemini에는 높음, 나머지는 보통

무엇을: AI 엔진이 당신의 콘텐츠를 구조화된 사실로 파싱할 수 있게 하는 JSON-LD 스키마 마크업.

측정 방법: 저희는 페이지의 JSON-LD 블록에서 FAQPage, Article, HowTo, Organization, BreadcrumbList 타입을 스캔합니다. FAQPage가 최우선 순위 타입입니다: 2026년 부동산 웹사이트 1,508개 대상 연구에서 FAQPage 스키마는 ChatGPT에 보이는 사이트의 6.2%에서 발견되었지만, 보이지 않는 사이트에서는 0.8%에 불과했습니다.

근거: 가능성 높음: 통제된 연구(Schanbacher, 2026, n=1,508). 다른 스키마 타입은 독립적인 연구에서 혼재된 결과 또는 상관관계 없음을 보였습니다: 스키마를 만능 해결책으로 과대평가하지 마세요.

3

추출 가능성

Claude에는 최고, 나머지도 높음

무엇을: AI가 당신의 페이지에서 가장 관련성 높은 부분을 얼마나 쉽게 찾아내고 인용할 수 있는지.

측정 방법: 저희는 선답변 구조(첫 약 200단어 이내의 직접적인 답변), 제목 개수, FAQ 형식의 질문-답변 쌍, 목록과 표, 그리고 Flesch 가독성을 확인합니다. 질의에 곧바로 답하는 페이지는 44%의 확률로 콘텐츠 첫 3분의 1에서 인용됩니다(실무자 연구). Flesch 가독성 점수 50~70 구간이 AI 인용에 최적입니다.

근거: 가능성 높음: 실무자들의 공통된 의견과, 콘텐츠 구조 신호가 인용 상승과 상관관계가 있다는 프린스턴 GEO 논문의 발견(n=10,000 질의, Perplexity).

4

권위 및 사실 밀도

Perplexity에는 최고, Gemini에는 높음

무엇을: 페이지가 사실적 콘텐츠를 통해 자신의 신뢰성을 얼마나 잘 알리는지.

측정 방법: 저희는 통계와 백분율(프린스턴 GEO 논문에 따르면 수치 주장은 인용 확률을 약 41% 높임), 권위 있는 도메인으로의 외부 링크, 본문 내 인용, 전체 단어 수(깊이의 대리 지표)를 셉니다. 이는 구글 AI Overview 인용의 96%에 나타나는 E-E-A-T 신호의 대리 지표입니다.

근거: 입증됨: 프린스턴 GEO 논문 (통계: +41%, 인용: +34%, n=10,000 질의). Wellows 연구(실무자, 2025)의 E-E-A-T 상관관계. AIO와 브랜드 언급의 상관관계: r=0.664, 페이지 자체에서 측정 가능한 가장 강력한 알려진 예측 변수.

5

최신성

Perplexity에는 최고

무엇을: 당신의 페이지가 AI 엔진에 정보가 얼마나 최신인지 알려주는지 여부.

측정 방법: 저희는 JSON-LD의 datePublished와 dateModified, 사이트맵 lastmod, HTML 메타 날짜 태그를 확인합니다. 가장 최근 신호가 며칠 전인지 계산합니다. Perplexity의 검색 파이프라인은 적극적인 최신성 필터를 적용합니다: 최신성 신호가 없는 페이지는 오래된 것으로 간주될 수 있습니다.

근거: 합의됨: Perplexity는 최신성을 순위 요소로 명시적으로 문서화합니다. 최신성 신호만으로 인한 인용 상승을 정량화한 연구는 없지만, 실무자들의 공통된 의견은 확고합니다.

6

기술적 상태

ChatGPT에는 높음, 나머지는 보통

무엇을: 페이지가 AI 크롤러에 의해 실제로 가져오고 파싱될 수 있는지 여부.

측정 방법: 저희는 HTTPS, 유효한 HTTP 200 상태, 뷰포트 메타 태그(모바일 친화성 대리 지표), 페이지가 JavaScript 렌더링에 크게 의존하는지를 확인합니다. AI 크롤러는 일반적으로 JavaScript를 실행하지 않고 원본 HTML만 가져오므로, JavaScript 비중이 높은 페이지는 거의 비어 있는 것처럼 보일 수 있습니다.

근거: HTTPS와 JS 렌더링에 대해서는 합의됨. 페이지 속도 효과: 한 실무자 연구에서 FCP가 0.4초 미만인 페이지는 ChatGPT 인용을 6.7건 받은 반면 FCP가 1.13초를 넘는 페이지는 2.1건에 그쳤지만, 이는 독립적으로 재현되지 않았으므로 참고 자료로만 다뤄야 합니다.

llms.txt에 대한 참고 사항

저희는 /llms.txt 파일의 부재를 심각한 문제가 아니라 정보성 문제로 표시합니다. 현재 증거는 그 중요성에 반대되는 쪽입니다: Ahrefs가 2026년 5월에 도메인 137,000개를 대상으로 진행한 연구에서 llms.txt 파일의 97%가 어떤 AI 봇으로부터도 트래픽을 받지 못한 것으로 나타났습니다. 이 규격이 향후 채택될 가능성이 있어 신호로는 포함하지만, 현재의 효과를 과장하지는 않겠습니다.

엔진별 채점

각 AI 엔진은 진정으로 다른 검색 아키텍처를 가지고 있기 때문에 여섯 가지 신호 카테고리에 서로 다른 가중치를 둡니다. 단일한 "AI 점수"를 제시하는 대신, 저희는 엔진별 준비도 점수를 계산한 다음 이를 평균해서 전체 대표 숫자를 만듭니다.

신호ChatGPTPerplexityGeminiClaude
크롤러 접근성25%20%20%20%
구조화 데이터15%10%25%20%
추출 가능성20%15%15%30%
권위15%25%20%15%
최신성10%25%10%5%
기술15%5%10%10%

ChatGPT은(는) 인용의 87%가 Bing 상위 10위에서 나오고 Bing이 OAI-SearchBot 접근을 요구하기 때문에 크롤러 접근성에 높은 가중치를 둡니다. Perplexity은(는) 6단계 RAG 파이프라인이 최신성과 사실 밀도를 적극적으로 필터링하기 때문에 최신성과 권위에 가장 큰 가중치를 둡니다. Gemini은(는) 깔끔한 마크업이 구글 시스템이 페이지를 파싱하기 쉽게 만드는 요인이기 때문에 저희가 구조화 데이터에 가장 큰 가중치를 두는 곳입니다. 구글 자체 지침은 표준 SEO가 AI 기능에도 적용된다는 것이므로, 스키마를 AI 전용 지렛대가 아니라 기본 위생 관리로 취급하세요. Claude은(는) 가장 까다로운 엔진으로, 인용의 97.8%가 확립되고 명확하게 구조화된 출처에서 나오기 때문에 추출 가능성을 최우선으로 둡니다.

robots.txt에서 차단된 엔진은 결합 점수에 55%의 페널티를 받습니다(점수에 0.45를 곱함). 이는 차단된 엔진이 해당 페이지를 전혀 색인하거나 인용할 수 없다는 사실을 반영합니다.

전체 준비도 점수는 [0, 100] 범위로 제한된 네 엔진별 점수의 산술 평균입니다.

측정 가시성 (실시간 근거 기반 질의)

준비도 점수는 AI 가시성을 위한 필요조건이지 충분조건은 아닙니다. 측정 가시성은 한 걸음 더 나아가, 실제 AI 엔진에 실제 질의를 보내고 당신의 브랜드가 근거 기반의 인용된 답변에 등장하는지 측정합니다.

왜 학습 기억 탐색이 아니라 근거 기반 질의인가

대부분의 주요 소비자용 AI 엔진(ChatGPT Search, Perplexity, Google AI Overviews, Copilot)에서 답변은 질의 시점의 실시간 웹 검색에 근거를 둡니다. 학습 기억은 AI가 브랜드의 존재를 "아는지"를 결정하고, 실시간 검색은 답변에서 그 브랜드를 인용하는지를 결정합니다. GEO는 근본적으로 검색 문제이므로, 저희는 엔진이 지원하는 한 근거 기반 질의를 선호합니다.

네 엔진 모두에 대해 저희는 베이스 모델 프롬프팅(웹 검색 없이 AI가 브랜드에 대해 "알고 있는" 것을 묻는 방식)을 사용하지 않습니다. 그 방식은 고정된 학습 기억을 테스트하며, 매우 비결정적이고, 덜 알려진 브랜드에 대해서는 환각이 발생하기 쉽고, 사용자가 근거 기반 소비자용 엔진에서 실제로 보는 것을 반영하지 못합니다. Claude도 마찬가지입니다: 저희는 Anthropic의 자체 웹 검색 도구를 통해 질의하며, 다른 세 엔진에 사용하는 것과 동일한 형태의 실시간 검색입니다. 분명히 밝혀야 할 한 가지 차이점이 있습니다: Anthropic은 특정 질문에 검색이 필요한지 모델이 스스로 결정하게 하므로, Claude의 답변은 실제로 검색했을 때만 근거를 갖습니다. 저희는 모든 답변에 대해 이를 기록하고, 근거를 가진 답변에서만 인용 기반 지표를 계산합니다.

질의 세트 설계

저희는 세 가지 그룹을 아우르는 엄선된 질의 세트를 구성합니다: 발견 질의(카테고리 기반, 브랜드명 없음), 비교 질의(평가 단계), 브랜드 직접 질의. 비율은 대략 60/30/10입니다: 새로운 잠재 고객이 확보되는 지점이기 때문에 발견에 가장 높은 가중치를 둡니다. 질의 양은 플랜에 따라 다릅니다: 무료 등급의 측정 체크는 ChatGPT에서 프롬프트 4개를 실행하고, 일회성 전체 리포트는 엔진 3개에서 25개를, Lite는 엔진 2개에서 15개를, Multi-Site는 엔진 4개 전체에서 25개를 실행합니다.

반복과 통계적 처리

단일 질의의 단일 실행은 거의 의미가 없습니다. LLM의 비결정성 때문에 같은 질의라도 temperature=0에서조차 실행마다 다른 인용을 만들어낼 수 있습니다(GPU 수준의 배치 크기 변동은 제거할 수 없습니다). 프린스턴 GEO 논문은 가시성 비율을 안정화하려면 60~100회의 반복이 필요하다는 것을 발견했습니다.

각 반복은 동일한 질의를 다시 보냅니다. 반복 간에 프롬프트를 바꾸거나 다르게 표현하지 않습니다. 무료 등급과 일회성 전체 리포트는 엔진당, 질의당 3회 반복을 실행합니다. 구독 등급은 1회만 실행하고 대신 주간 모니터링 시계열에서 정밀도 신호를 얻는데, 이는 초 단위가 아니라 주 단위로 실제 변동 원인(색인 변화, 경쟁사 움직임, 모델 업데이트)을 샘플링합니다. 이 절충안은 명확히 밝힙니다: 구독 점수판은 동일 감사 내 신뢰 구간 없이 점 추정치만 보여줍니다. 인용율은 브랜드가 인용된 실행의 비율로 계산됩니다(brandCited = true). 충분한 반복이 있을 때는 이 비율에 대한 95% 신뢰 구간을 계산하기 위해 윌슨 점수 구간을 사용합니다. 이는 동일한 호출에 걸친 공급자 측 변동 아래에서의 실행 간 일관성을 반영하는 것이지, 같은 질의를 다르게 표현했을 때 인용이 어떻게 달라지는지에 대한 샘플이 아닙니다.

API와 소비자용 UI의 충실도 차이

네 엔진 모두에 대해 저희는 제공업체의 웹 검색 도구를 활성화한 프로그래밍 방식 API를 사용합니다. 이는 업계 표준이자 유일하게 확장 가능한 접근 방식이지만, 알려진 격차를 만듭니다:

  • 소비자용 ChatGPT.com은 API가 재현하지 못하는 개인화 및 브라우징 이력을 포함할 수 있습니다.
  • 구글 검색 근거를 사용한 Gemini API와 Google AI Overviews는 가장 많이 인용된 도메인의 약 38.5%만 공유하며, 이는 저희가 모든 구글 점수에서 명시적으로 밝히는 구조적 격차입니다.
  • Perplexity는 자체 API와 소비자용 UI 사이에 잠재적 차이가 있을 수 있다고 문서화하고 있습니다.
  • Claude는 질문에 검색이 필요한지 스스로 판단하므로, 개별 Claude 답변은 근거 없이 돌아올 수 있습니다. 저희는 답변별로 근거 여부를 기록하고, 근거 없는 답변을 0으로 계산하는 대신 인용 지표에서 제외합니다.

저희는 측정 가시성 점수가 포함된 모든 리포트에서 이러한 한계를 명시합니다. 측정 한계에 대한 투명성이 거짓된 정밀함보다 더 가치 있다고 믿습니다.

신뢰 구간과 변동성

AI 가시성 점수는 사실이 아니라 추정치입니다. 세 가지 변동성 요인이 모든 측정에 영향을 줍니다:

  1. LLM의 비결정성. temperature=0에서도 GPU 수준의 배치 크기 변동 때문에 API 응답이 달라집니다. 반복 없이 측정한 점 추정 점수는 재실행 시 ±30%까지 달라질 수 있습니다. 저희의 측정 가시성 엔진은 동일한 질의를 여러 번 반복하고 그 결과인 인용율에 대해 윌슨 점수 신뢰 구간을 보고합니다. 이는 같은 질의를 다르게 표현했을 때의 변동이 아니라, 공급자 측 변동 아래에서의 실행 간 일관성을 측정하므로 각 숫자가 얼마나 안정적인지 확인할 수 있습니다.
  2. 모델과 알고리즘 업데이트. OpenAI, 구글, Perplexity는 종종 공개 발표 없이 모델을 계속 업데이트합니다. 6주 전의 점수는 현재 상황을 반영하지 못할 수 있습니다. 저희는 모든 점수에 측정 날짜를 표시하고 30일이 지난 점수에는 표시를 남깁니다.
  3. 지역 및 개인화에 따른 차이. 동일한 질의라도 위치, 언어, 계정 유형에 따라 다른 답변이 나옵니다. 저희 측정은 표준화된 위치에서 실행됩니다. 다른 지역의 결과는 다를 수 있습니다.

페이지 준비도 점수(무료 AI 체크)는 확률적인 AI 출력이 아니라 결정론적 신호(robots.txt, 구조화 데이터, HTML 콘텐츠)를 테스트하기 때문에 측정 가시성보다 훨씬 안정적입니다. 준비도 점수의 변화는 당신의 페이지에 일어난 실제 변화를 반영합니다.

이것이 알려주는 것과 알려주지 못하는 것

저희는 측정 한계에 대한 지적 정직함이 유용한 도구와 그럴듯해 보이기만 하는 점수 생성기를 가르는 기준이라고 생각합니다. 이 도구가 명시적으로 알려줄 수 없는 것은 다음과 같습니다:

저희는 AI로부터의 오가닉 트래픽을 측정하지 않습니다.

AI 인용과 AI 유입 트래픽은 서로 다른 것입니다. 브랜드가 많이 인용되어도 유입 트래픽은 그대로일 수 있습니다. AI 플랫폼이 외부 클릭을 발생시키지 않고 자체 UI 안에서 점점 더 많이 답변하기 때문입니다(Digiday, 2025). 저희 점수는 인용 확률을 알려줄 뿐, 트래픽 양을 알려주지 않습니다.

인용율이 매출 영향을 보장하지 않습니다.

AI 유입 트래픽은 전통적인 오가닉보다 높은 비율로 전환됩니다(여러 연구에서 구글 오가닉보다 5~23배 높은 전환율을 발견했습니다). 하지만 절대적인 양은 여전히 전체 웹 트래픽의 1% 미만입니다. 높은 가시성 점수는 포지셔닝 품질 신호일 뿐, 매출 예측이 아닙니다.

준비도 점수는 전제 조건에 관한 것이지, 보장이 아닙니다.

90/100의 준비도 점수는 당신의 페이지가 올바른 기술적 신호를 갖추고 있다는 의미입니다. 인용을 보장하지는 않습니다. 오프사이트 요인(Reddit 존재감, 웹 전반의 브랜드 언급, Wikipedia/Wikidata 개체 인식, 리뷰 사이트 프로필)은 당신의 페이지만으로는 측정할 수 없는 주요 인용 동인입니다.

크롤링할 수 없는 것은 측정할 수 없습니다.

저희 감사는 AI 크롤러가 하듯 당신의 공개 페이지를 가져옵니다. 콘텐츠가 인증 뒤에 있거나, 서버 렌더링 없이 완전히 JavaScript로만 로드되거나, 저희가 접근 권한을 받지 못한 서브도메인에 있다면 평가할 수 없습니다.

점수는 도구 간에 비교할 수 없습니다.

WhoCanFindMe의 65점을 Otterly, Peec, Profound, 다른 어떤 도구의 65점과도 비교할 수 없습니다. 모든 도구는 서로 다른 질의 세트, 다른 반복 횟수, 다른 엔진 조합, 다른 가중치를 사용합니다. 업계 표준은 없습니다. 저희 점수는 보정되어 있고 내부적으로 일관되므로, 시간에 따른 당신의 개선을 추적할 수는 있지만 업계 절대 기준은 아닙니다.

연구 및 출처

저희 방법론은 발표된 학술 연구와 1차 실무자 연구를 기반으로 합니다. 이 분야는 빠르게 움직이며, 저희는 분기마다 핵심 통계를 재검증합니다. 근거 강도 표시: 입증됨 = 통제된 연구이거나 여러 연구에서 재현됨; 가능성 높음 = 단일 연구이거나 타당한 메커니즘과 함께 실무자들의 강한 공통 의견; 속설 = 널리 반복되지만 연구는 없음.

프린스턴 / IIT 델리 / 조지아텍 GEO 논문 (Aggarwal 외, KDD 2024)

통계 추가 +41%, 출처 인용 +34%, 인용문 추가 +28%의 인용 상승. Bing Chat 스타일 시스템에서 질의 10,000건, Perplexity에서 검증됨.

입증됨

구글 AI Overviews 측정 연구 (arxiv:2605.14021, 2026년 6월)

AIO 발동률 전체 13.7%, 질문형 질의는 64.7%. AIO가 인용한 도메인이 첫 페이지 오가닉보다 신뢰도가 높음(0.732 대 0.645). AIO 인용의 30%는 상위 오가닉 결과에 나타나지 않음.

입증됨

Ahrefs llms.txt 연구 (2026년 5월, 도메인 137,000개)

llms.txt 파일의 97%가 AI 봇 트래픽을 전혀 받지 못함. 요청의 96%는 AI 엔진이 아닌 자동화된 감사 도구에서 발생.

입증됨

Seer Interactive의 ChatGPT/Bing 상관관계 연구 (2025)

ChatGPT Search 인용의 87%가 Bing 상위 10위 오가닉 결과와 일치.

입증됨

Wellows E-E-A-T 및 AIO 연구

AIO 인용의 96%가 높은 E-E-A-T 출처에서 나옴. 저자 이름이 명시된 경우 인용될 가능성이 2.3배 높음. 도메인 권위와 AIO의 상관관계: r=0.18. 외부 브랜드 언급과의 상관관계: r=0.664.

가능성 높음

SE Ranking의 Reddit 연구

Reddit 언급이 50건 이상인 도메인은 인용 지수가 22.5로, 11~50건인 도메인의 10.4보다 높음.

가능성 높음

Schanbacher 2026 FAQ 스키마 연구 (부동산 웹사이트 1,508개)

FAQPage 스키마가 ChatGPT에 보이는 사이트의 6.2%, 보이지 않는 사이트의 0.8%에 있음.

가능성 높음

OtterlyAI llms.txt 90일 실험

AI 크롤러 요청의 단 0.1%만이 /llms.txt에 접근함.

입증됨

Semrush 2026 AI 가시성 지수 (미국 AI 검색 프롬프트 1억 2,600만 건)

마케팅 리더의 45%가 자사의 AI 가시성을 정확히 측정하지 못함. 2026년 1월부터 4월 사이 2,500건에서 1억 2,600만 건으로 확대.

입증됨

Superprompt.com 전환 분석 (웹사이트 방문 1,200만 건)

AI 유입 트래픽은 14.2%로 전환되는 반면 구글 오가닉은 2.8%.

가능성 높음

지금 당신의 점수를 확인하세요

무료 AI 체크를 실행해서 ChatGPT, Gemini, Perplexity, Claude에서의 페이지 준비도 점수를 30초 이내에 받아보세요. 모든 무료 계정에 1회 제공됩니다.

관련 글: 카테고리별 벤치마크 데이터 · 요금제 · 무료 AI 체크