우리는 측정 도구를 팝니다.
그래서 우리 자를 공개합니다.
「AI 검색에서의 가시성」을 숫자로 내는 도구는 늘었습니다. 그런데 그 숫자가 얼마나 정확한지를 공개하는 곳은 거의 없습니다. 아래는 전부 우리가 실제로 측정한 값입니다. 좋은 숫자만 골라 싣지 않았습니다.
4엔진별 97.1 / 100 / 93.3 / 97.3%. 놓친 언급(False Negative) 0건.
엔진별 99.6~100%(최대 편차 0.4pt). 실측에서 「같은 매체가 엔진에 따라 다른 인용원으로 집계되는」 결함을 발견해 87.6%에서 고친 결과.
완전 일치 93.8%. 남은 불일치는 전부 「정할 수 없음 = null」이고 순위 오귀속은 0건. 추측해서 번호를 내는 것보다 안 내는 쪽을 택합니다.
본문에 나오는 수치가 입력 데이터에 없는 비율. 언급률 0%·인용률 0%라는 「쓸 게 없는」 조건에서도 수치를 만들지 않았습니다.
리포트 쪽 실측일 2026-07-24(프로덕션 경로 리포트 1건)
여기가 이 페이지를 만든 이유입니다. 약점을 쓰지 않는 정확도 공개는 광고에 불과합니다.
F1 76.8~96.5%. 우리 사내 기준(85%)을 2개 엔진에서 밑돕니다. 장문 답변에서의 추출이 약점이고, 원인은 분석 측 모델 성능 차라고 파악돼 있습니다. 전 태스크를 상위 모델로 바꾸면 개선되지만 원가가 약 10배가 되므로 조건부 라우팅으로 미착수 상태입니다.
실측 1건에서, 대응 완료 항목을 묶어 서술한 문장을 「미대응」으로 판정한 오탐이 1건 있었습니다. 표본 1건 관찰이며 아직 결론을 낼 수 있는 수가 아닙니다.
위 정확도는 4엔진의 실답변 80건(일·영)과 시드 16건으로 측정했습니다. 한국어·중국어·광동어 실답변은 아직 충분히 모이지 않았습니다. 즉 그 3언어의 정확도는 「일영과 같다」고 가정하고 있을 뿐 실측한 것이 아닙니다.
ChatGPT·Gemini·Claude·Perplexity. 엔진마다 답이 다르므로 1개 AI로 잰 숫자는 「AI 검색에서의 가시성」이 아닙니다. 유료 플랜은 4개 동시, 무료 플랜은 고른 1개로 측정합니다.
질문 1개 = 프롬프트 1개 × 언어 1개. 엔진 수는 곱해지지 않습니다(플랜의 AI 전부에 같은 질문을 보냅니다). 같은 질문을 5언어로 재면 5질문입니다.
언급 유무·게재 순위·인용원 도메인을 실제 답변 텍스트에서 꺼냅니다. 판단할 수 없는 항목은 추정값으로 메우지 않고 null로 둡니다. 메우면 화면은 깔끔하지만 그건 측정이 아닙니다.
사람이 정답을 붙인 답변 세트(골든셋)에 대해 탐지·순위·인용원 정확도를 자동 채점합니다. 리포트 쪽도 별도 채점(날조율·접지율)을 갖고, 둘 다 CI에서 떨어지면 멈춥니다. 「좋아진 것 같다」는 근거로 쓰지 않습니다.
추정할 수 없는 값은 null로 둡니다. 사이트의 데모 수치에는 반드시 「例示(예시)」를 붙입니다. 실재 기업의 숫자를 실측하지 않고 싣지 않습니다. 이 3가지를 못 지키게 되면 이 제품을 팔 이유가 없습니다.