전월 대비 올랐다는 착각 — 재측정 변동폭이 월간 변화보다 컸다 (2026년 8월 실측)
한국 B2B SaaS 12곳을 20일 간격으로 다시 측정하고, 같은 날 두 번 측정한 변동폭과 비교했습니다. 월간 개별 점수 변화의 중앙값은 5.5점, 같은 날 재측정 변동의 중앙값은 6점이었습니다. AI 가시성 리포트에서 무엇을 추세로 읽고 무엇을 노이즈로 버려야 하는지 실측 데이터로 정리합니다.
이 블로그 콘텐츠는 AI 보조 도구를 활용해 초안/구조화를 수행할 수 있으며, RanketAI 편집팀 검수 후 발행됩니다.
핵심 요약: 한국 B2B SaaS 12곳을 20일 만에 같은 조건으로 다시 측정했습니다. 그리고 결과를 해석하기 전에, 같은 날 두 번 측정했을 때의 변동 폭을 먼저 산출했습니다. 같은 날 재측정에서 개별 점수는 최대 17점(중앙값 6점) 움직였고 12곳 중 2곳은 등급이 바뀌었습니다. 반면 7월 호 대비 개별 점수 변화의 중앙값은 5.5점이었습니다. 한 달간의 변화가 하루 안의 측정 변동보다 작았다는 뜻입니다. 그래서 이번 호에서 "올랐다/내렸다"로 읽은 항목은 개별 점수가 아니라, 노이즈로 설명되지 않는 인용 소스 구성이었습니다.
재측정 결과를 읽기 전에 생긴 문제
RanketAI(랭킷AI)는 2026년 7월에 한국 B2B SaaS 12곳의 가시성을 측정해 익명 집계로 공개했고, 같은 표본·같은 조건으로 재측정한 2026년 8월 호를 이번에 발행했습니다. 표본은 고정했고 입력과 측정 조건도 바꾸지 않았습니다. 변한 것은 측정 시점뿐입니다.
집계 결과만 보면 이렇게 요약됩니다.
| 지표 | 2026-07 | 2026-08 |
|---|---|---|
| 점수 중앙값 (p50) | 51 | 53 |
| 상위 25% (p75) | 59 | 58 |
| 상위 10% (p90) | 67 | 73 |
| 등급 분포 (A/B/C/D) | 5 / 5 / 0 / 2 | 6 / 4 / 0 / 2 |
여기서 흔히 나오는 해석이 "중앙값이 2점 올랐고 A등급이 한 곳 늘었으니 개선됐다"입니다. 그런데 이 문장을 쓰려면 먼저 답해야 하는 질문이 있습니다. 2점은 실제 변화입니까, 아니면 측정 자체의 정상 변동 범위입니까?
그래서 측정 변동 폭부터 산출했습니다 — 같은 날, 두 번
이번 호는 같은 날 두 라운드를 측정했습니다. 시점이 같으니 두 라운드 사이의 차이는 "한 달 동안 벌어진 일"이 아니라 측정 자체에서 발생하는 변동입니다.
| 같은 날 2라운드 비교 | 값 |
|---|---|
| 개별 점수 변화 최대 | 17점 |
| 개별 점수 변화 중앙값 | 6점 |
| 등급이 바뀐 도메인 | 12곳 중 2곳 |
같은 브랜드를 같은 질문으로 같은 날 다시 측정했을 뿐인데, 등급이 바뀐 도메인이 두 곳 나왔습니다. 이 현상은 우리 표본만의 특징이 아닙니다. 장크트갈렌 대학 연구진은 AI 검색 가시성 측정의 반복성을 분석하면서 단일 측정의 위험을 이렇게 정리했습니다.
가시성 순위는 안정적이지 않으며, 한 번의 측정으로 관측된 차이의 상당 부분은 브랜드의 실제 차이가 아니라 표본 추출에서 오는 변동으로 설명된다. — Schulte, Bleeker & Kaufmann, Don't Measure Once: Measuring Visibility in AI Search (GEO), Univ. of St. Gallen, 2026 (arXiv:2604.07585)
월간 변화는 그 변동 범위 안에 있었습니다
노이즈 기준선을 확보한 뒤 7월 호와 8월 호의 개별 점수 변화를 같은 기준으로 비교했습니다.
| 비교 축 | 개별 점수 변화 중앙값 |
|---|---|
| 같은 날 2라운드 (노이즈) | 6점 |
| 7월 → 8월 (20일 간격) | 5.5점 |
20일 동안 벌어진 개별 변화가 하루 안의 재측정 변동보다 작았습니다. 그래서 이번 호에서는 개별 도메인의 증감을 추세로 서술하지 않았고, 리포트의 한계 항목에도 같은 취지를 명시했습니다. 중앙값 2점 상승과 A등급 한 곳 증가 역시 이 범위 안에서 나온 값이라 "개선됐다"고 단정하지 않았습니다.
이는 측정을 신뢰할 수 없다는 뜻이 아닙니다. 어디까지를 신호로 읽고 어디부터를 변동으로 볼지 경계가 확보됐다는 뜻입니다. 이 경계 없이 매월 수치만 나열하면, 노이즈에 반응해 전략을 수정하는 일이 반복됩니다.
노이즈로 설명되지 않은 것 — 누가 인용되는가
개별 점수가 정체한 것과 달리, 뚜렷하게 이동한 축이 있었습니다. 자사 도메인이 답변의 근거로 인용되는 비율입니다.
| 플랫폼 | 브랜드 언급률 (7월 → 8월) | 자사 도메인 인용률 (7월 → 8월) |
|---|---|---|
| ChatGPT | 33% → 33% | 8% → 25% |
| Perplexity | 83% → 92% | 42% → 75% |
| Gemini | 83% → 83% | 83% → 67% |
언급률은 세 플랫폼 중 두 곳이 제자리였습니다. 반면 자사 도메인 인용률은 ChatGPT에서 8%에서 25%로, Perplexity에서 42%에서 75%로 올랐고 Gemini에서는 83%에서 67%로 내려갔습니다. 브랜드가 답변에 등장하는지와, 그 답변이 어느 문서를 근거로 삼는지가 서로 독립적으로 움직였다는 뜻입니다.
인용 소스 상위 목록도 재편됐습니다. 7월 호에서 인용 1위였던 동영상 플랫폼은 8월 호 상위 10위 안에서 사라졌고, 대신 네이버 블로그·티스토리·브런치 같은 블로그 플랫폼과 스타트업·IT 업계 미디어가 상위를 채웠습니다. 전체 목록은 8월 호 리포트에서 확인할 수 있습니다.
다만 이 항목에도 같은 절제가 필요합니다. 표본이 12곳이라 1곳이 곧 8.3%p입니다. ChatGPT의 8%에서 25%는 도메인 수로 보면 1곳에서 3곳입니다. 방향은 읽되 폭은 신뢰하지 않는 편이 안전합니다.
실무에서는 무엇을 봐야 할까요
이번 데이터에서 도출한 점검 순서입니다. 인과를 보장하는 처방이 아니라, 측정을 덜 오해하기 위한 순서입니다.
- 자체 변동 기준선을 먼저 확보하세요. 같은 날 두 번 측정해 점수의 변동 폭을 산출해 두면, 이후의 모든 증감을 그 폭과 비교해 판단할 수 있습니다. 기준선 없이 첫 측정 결과를 해석하면 무엇이 신호인지 알 수 없습니다.
- 개별 점수보다 등급과 분포를 보세요. 점수는 등급 경계 근처에서 쉽게 변동하지만, 등급 구간과 표본 내 위치는 상대적으로 덜 민감합니다.
- 인용된 문서 목록의 변화를 추적하세요. 이번 호에서 노이즈로 설명되지 않은 축은 인용 소스 구성이었습니다. 어떤 유형의 문서가 내 분야 답변의 근거로 채택되는지는, 점수 한 자리 변동보다 실행에 직접 연결됩니다. 자사 사이트 밖 표면이 왜 중요한지는 소스 갭 분석에서 더 자세히 설명했습니다.
- 한 번의 결과로 전략을 변경하지 마세요. 반복 측정 없이 단일 결과에 반응하면, 측정 변동을 성과로 오인하거나 반대로 정상 범위의 하락에 과잉 대응하게 됩니다.
자사 위치가 궁금하다면 RanketAI 등 AI 가시성 진단 도구로 같은 조건의 브랜드 가시성 측정을 실행해, 등급(A~D)이 업종 분포 어디에 있는지 먼저 확인해 볼 수 있습니다.
자주 묻는 질문
점수가 떨어졌습니다. 우리가 뭘 잘못한 건가요?
먼저 하락 폭이 자체 변동 범위 안인지 확인하세요. 이번 표본에서는 같은 날 재측정만으로도 개별 점수가 중앙값 6점, 최대 17점 움직였습니다. 이 범위 안의 하락이라면 원인을 찾기 전에 재측정이 먼저입니다. 범위를 넘는 하락이라면 언급 자체가 사라졌는지, 인용되던 문서가 빠졌는지를 나눠서 봐야 합니다.
그럼 몇 번을 측정해야 믿을 수 있나요?
정답이 하나로 정해지지는 않습니다. 다만 최소 조건은 분명합니다 — 같은 시점의 반복 측정으로 자체 변동 폭을 먼저 파악해야 합니다. 장크트갈렌 연구진도 반복 측정 없는 단일 실행 해석의 위험을 지적하며 측정 설계 자체를 권고했습니다. 관련 통계 기준은 AI 가시성 측정 통계 기준에서 정리했습니다.
예산과 시간이 부족하면 무엇부터 하면 되나요?
측정 횟수를 늘리기 어렵다면, 해석 단위를 낮추는 쪽이 현실적입니다. 점수 대신 등급으로 보고, 매주 대신 매월 보고, 개별 순위 대신 분포에서의 위치를 보세요. 변동에 덜 민감한 단위로 낮추는 것만으로도 오독이 줄어듭니다.
변화가 노이즈라면 월간 리포트는 왜 보나요?
개별 점수는 노이즈에 묻히지만, 집계 지표와 인용 소스 구성은 다르게 움직입니다. 이번 호에서도 언급률은 정체한 반면 자사 도메인 인용률과 상위 인용 소스는 뚜렷하게 재편됐습니다. 월간 추적의 값은 "이번 달 몇 점인가"가 아니라 **"답변의 근거로 채택되는 문서 구성이 어떻게 변하고 있는가"**를 보는 데 있습니다.
브랜드가 답변에 언급되기만 하면 되는 것 아닌가요?
언급과 인용은 다른 사건입니다. 이번 측정에서 두 플랫폼의 언급률은 제자리였지만 자사 도메인 인용률은 크게 움직였습니다. 언급은 되는데 근거는 경쟁사·제3자 문서에서 가져오는 상태라면, 브랜드 서술의 통제권이 우리 손에 없다는 뜻입니다. 답변이 후속 질문에서 얼마나 유지되는지는 AI 추천의 지속성에서 정리했습니다.
전체 수치·표본 기준·한계는 2026년 8월 벤치마크 리포트에서 확인할 수 있고, 직전 호의 발견은 2026년 7월 호 분석에 정리돼 있습니다.
핵심 실행 요약
| 항목 | 실무 기준 |
|---|---|
| 핵심 주제 | 전월 대비 올랐다는 착각 — 재측정 변동폭이 월간 변화보다 컸다 (2026년 8월 실측) |
| 적용 대상 | geo 업무에 우선 적용 |
| 우선 조치 | 입력 계약(목적·독자·자료·출력형식)부터 고정 |
| 리스크 체크 | 근거 없는 주장, 정책 위반, 형식 미준수 여부를 검증 |
| 다음 단계 | 실패 로그를 패턴 템플릿으로 축적해 재발을 줄임 |
자주 묻는 질문(FAQ)
"전월 대비 올랐다는 착각 — 재측정 변동폭이 월간 변화보다 컸다 (2026년 8월…"이 다루는 문제가 지금 중요한 이유는 무엇인가요?▾
요청 입력을 표준화해 목적, 대상 독자, 참고 자료, 출력 형식을 필수로 받는 입력 계약부터 도입하세요.
AI 가시성를 효과적으로 도입하려면 어느 정도의 기술 수준이 필요한가요?▾
geo처럼 반복 업무와 품질 편차가 큰 팀에서 효과가 빠르게 나타납니다.
AI 가시성이 기존 geo 방식과 다른 핵심 차이는 무엇인가요?▾
프롬프트 문구보다 맥락 레이어 분리와 출력 검증 루프가 실제로 작동하는지 먼저 점검하세요.
분석 근거
- 자사 연구 측정: 2026년 7월 호와 동일한 한국 B2B SaaS 12개 도메인을 동일 입력·동일 측정 조건으로 2026-08-12에 재측정했다. 같은 날 2라운드를 돌렸고, 분포에는 도메인별 최신 1건만 사용했다(7월 호와 동일 규칙).
- 노이즈 기준선: 같은 날 두 라운드 사이의 개별 점수 변화폭을 먼저 산출해, 호 간 변화가 그 범위 안인지 밖인지 구분했다. 결과는 전면 익명 집계이며 개별 브랜드·도메인은 공개하지 않는다.
- 한계: 표본 12곳이라 1곳이 비율 8.3%p에 해당하고, 두 호의 측정 간격은 20일로 정확히 한 달이 아니다. 통계적 유의성 검정은 수행하지 않았다.
핵심 주장과 근거
이 섹션은 본문 핵심 주장과 근거 출처를 1:1로 대응해 빠르게 검증할 수 있도록 구성했습니다. 아래 항목에서 주장과 원문 링크를 함께 확인하세요.
주장:같은 날 두 라운드 재측정에서 개별 점수는 최대 17점(중앙값 6점) 움직였고, 12곳 중 2곳은 등급이 바뀌었다
근거 출처:2026-08 벤치마크 data.json (한계 항목)주장:7월 호 대비 개별 점수 변화의 중앙값은 5.5점으로, 같은 날 재측정 변동폭 안에 들어왔다
근거 출처:2026-08 벤치마크 data.json (한계 항목)주장:자사 도메인 인용률은 ChatGPT 8%에서 25%, Perplexity 42%에서 75%로 오르고 Gemini는 83%에서 67%로 내려갔다
근거 출처:2026-07·2026-08 벤치마크 data.json주장:AI 가시성 측정은 반복 측정 없이 단일 실행 결과를 해석하면 통계적 노이즈를 신호로 오인할 수 있다
근거 출처:Univ. of St. Gallen (2026), arXiv:2604.07585
외부 인용 링크
아래 링크는 본문 수치와 주장에 직접 사용한 원문 출처입니다. 항목별 원문 맥락을 확인하면 해석 차이를 줄이고 재검증 속도를 높일 수 있습니다.
AI 검색에 내 사이트는 노출되고 있을까?
ChatGPT·Perplexity·Gemini가 내 브랜드를 어떻게 답하는지 무료로 확인해 보세요.
지금 진단 시작 →관련 포스트
관련 포스트는 현재 글의 선택 기준을 다른 상황에서 비교 검증할 수 있도록 선별했습니다. 관점을 확장하려면 아래 글을 순서대로 확인해 보세요.
한국 B2B SaaS 12곳 AI 가시성 실측 — ChatGPT 언급률 33%, Perplexity·Gemini의 절반 이하
한국 B2B SaaS 공개 웹 표본 12곳을 ChatGPT·Gemini·Perplexity 실제 답변에서 측정한 2026년 7월 벤치마크 요약입니다. 점수 중앙값 51점, 플랫폼별 언급률 격차(33% vs 83%), AI 답변이 인용하는 제3자 소스 패턴과 실무 시사점을 익명 집계 데이터로 정리합니다.
질문 하나가 검색 12개가 된다 — 쿼리 팬아웃 시대의 하위 질문 커버리지 설계 (2026)
Google 검색 엔지니어링 디렉터가 공식 확인한 수치 — AI Mode는 검색 1회에 기본 12개의 하위 검색을 실행합니다. 노출이 사용자가 친 질문이 아니라 보이지 않는 하위 질문에서 결정되는 구조가 무엇을 바꾸는지, 하위 질문이 갈라지는 1차 분기·2차 분기 구조와 함께 브랜드 관점에서 정리합니다.
Perplexity는 어떤 질문에도 웹 검색을 생략하지 않는다 — 응답 스트림 관찰로 본 인용 선택 구조 (2026)
Perplexity의 응답 스트림을 관찰한 분석에서 7개 질의 전부 웹 검색이 실행됐고, 회수된 소스 10~15건 가운데 실제 인용은 5~9건에 그쳤습니다. 지역 질문은 장소 정보, 사용법 질문은 영상, 뉴스는 1차 발표처로 인용 대상이 결정되는 구조를 정리하고, 국내 브랜드가 어느 채널부터 정비해야 하는지까지 다룹니다.
AI 검색 수요의 89%는 명확한 소유 브랜드가 없다 — 1,094개 카테고리 실측으로 본 선점과 고착 (2026)
Kevin Indig가 ChatGPT 답변에서 미국 1,094개 카테고리를 6개월간 추적한 결과, 명확한 소유 브랜드가 있는 카테고리는 15.2%뿐이고 추정 수요의 89.3%는 소유자 없는 카테고리에 놓여 있었다. 반면 한 번 차지한 소유권은 90.4% 확률로 유지된다. 인용과 호명이 어긋나는 이유, 그리고 카테고리 선점을 위한 실무 순서를 정리한다.
AI가 우리 회사를 설명하지 못하는 이유 — 엔티티 발자국 6축 진단법 (2026)
AI에게 우리 회사를 설명해 보라고 하면 근거가 비어 있는 지점이 그대로 드러난다. 231,347개 LLM 응답을 분석한 연구에서 엔티티 권위·제3자 검증·커뮤니티 논의 세 신호를 모두 갖춘 대상은 그렇지 않은 대상보다 평균 7.8배 많이 언급됐다. AI가 조직을 이해하는 근거를 6개 축으로 나눠 채점하고 한국 시장 증거 채널에 매핑하는 진단 절차를 정리한다.