見るAIGEO
METHODOLOGY · 측정 방법과 정확도

우리는 측정 도구를 팝니다.
그래서 우리 자를 공개합니다.

「AI 검색에서의 가시성」을 숫자로 내는 도구는 늘었습니다. 그런데 그 숫자가 얼마나 정확한지를 공개하는 곳은 거의 없습니다. 아래는 전부 우리가 실제로 측정한 값입니다. 좋은 숫자만 골라 싣지 않았습니다.

[ ACCURACY — 실측한 정확도 ]
93〜100%
브랜드 탐지 F1

4엔진별 97.1 / 100 / 93.3 / 97.3%. 놓친 언급(False Negative) 0건.

99.9%
인용원 도메인 F1

엔진별 99.6~100%(최대 편차 0.4pt). 실측에서 「같은 매체가 엔진에 따라 다른 인용원으로 집계되는」 결함을 발견해 87.6%에서 고친 결과.

MAE 0.00
게재 순위 추출 오차

완전 일치 93.8%. 남은 불일치는 전부 「정할 수 없음 = null」이고 순위 오귀속은 0건. 추측해서 번호를 내는 것보다 안 내는 쪽을 택합니다.

0.0%
리포트 날조율

본문에 나오는 수치가 입력 데이터에 없는 비율. 언급률 0%·인용률 0%라는 「쓸 게 없는」 조건에서도 수치를 만들지 않았습니다.

측정일 2026-08-05 / 4엔진 실답변 80건 + 시드 16건
리포트 쪽 실측일 2026-07-24(프로덕션 경로 리포트 1건)
[ WEAK — 아직 약한 곳 ]

여기가 이 페이지를 만든 이유입니다. 약점을 쓰지 않는 정확도 공개는 광고에 불과합니다.

브랜드명 추출 정확도(엔진 차)

F1 76.8~96.5%. 우리 사내 기준(85%)을 2개 엔진에서 밑돕니다. 장문 답변에서의 추출이 약점이고, 원인은 분석 측 모델 성능 차라고 파악돼 있습니다. 전 태스크를 상위 모델로 바꾸면 개선되지만 원가가 약 10배가 되므로 조건부 라우팅으로 미착수 상태입니다.

사이트 감사와 리포트 기술의 일치(precision 75%)

실측 1건에서, 대응 완료 항목을 묶어 서술한 문장을 「미대응」으로 판정한 오탐이 1건 있었습니다. 표본 1건 관찰이며 아직 결론을 낼 수 있는 수가 아닙니다.

실답변 골든셋의 언어 커버

위 정확도는 4엔진의 실답변 80건(일·영)과 시드 16건으로 측정했습니다. 한국어·중국어·광동어 실답변은 아직 충분히 모이지 않았습니다. 즉 그 3언어의 정확도는 「일영과 같다」고 가정하고 있을 뿐 실측한 것이 아닙니다.

[ HOW WE MEASURE — 측정 방법 ]
01
같은 질문을 여러 AI에 보낸다

ChatGPT·Gemini·Claude·Perplexity. 엔진마다 답이 다르므로 1개 AI로 잰 숫자는 「AI 검색에서의 가시성」이 아닙니다. 유료 플랜은 4개 동시, 무료 플랜은 고른 1개로 측정합니다.

02
셈의 단위는 「질문」

질문 1개 = 프롬프트 1개 × 언어 1개. 엔진 수는 곱해지지 않습니다(플랜의 AI 전부에 같은 질문을 보냅니다). 같은 질문을 5언어로 재면 5질문입니다.

03
답변에서 센다, 추측하지 않는다

언급 유무·게재 순위·인용원 도메인을 실제 답변 텍스트에서 꺼냅니다. 판단할 수 없는 항목은 추정값으로 메우지 않고 null로 둡니다. 메우면 화면은 깔끔하지만 그건 측정이 아닙니다.

04
자기 정확도를 재는 장치를 갖는다

사람이 정답을 붙인 답변 세트(골든셋)에 대해 탐지·순위·인용원 정확도를 자동 채점합니다. 리포트 쪽도 별도 채점(날조율·접지율)을 갖고, 둘 다 CI에서 떨어지면 멈춥니다. 「좋아진 것 같다」는 근거로 쓰지 않습니다.

[ HONESTY — 수치의 취급 ]

추정할 수 없는 값은 null로 둡니다. 사이트의 데모 수치에는 반드시 「例示(예시)」를 붙입니다. 실재 기업의 숫자를 실측하지 않고 싣지 않습니다. 이 3가지를 못 지키게 되면 이 제품을 팔 이유가 없습니다.

이 자로,
당신의 브랜드를 재보시겠습니까.

무료로 진단하기사이트 준비도를 먼저 보기