GEO 점수는 무엇을 측정하나 — 질문 모음·측정 모델·판정 방식이 점수를 바꾸는 구조 (2026)
같은 질문을 같은 날 물어도 측정 모델만 바꾸면 자사 브랜드 언급률이 43%와 5%로 크게 달랐습니다. 2026년 9월 공개된 GEO 측정 방법론 논문은 가시성 점수가 질문 모음·실행 조건·가중치·판정 규칙의 조합으로 정해진다고 정리합니다. GPT-6가 출시된 지금, 측정 도구와 리포트를 검토할 때 확인할 기준을 자사 실측과 함께 정리합니다.
AI 보조 작성 · RanketAI 편집팀 검수 후 발행 — 편집 정책 ›
핵심 요약: GEO 점수를 비교하기 전에 먼저 확인할 것은 그 점수를 만든 조건입니다. 2026년 9월 6일 공개된 방법론 논문(Martinez, arXiv:2609.06811, preprint)은 GEO 가시성 점수가 질문 모음·질문 표현·실행 조건·가중치·판정 규칙의 조합으로 정해지며, 판정 지시문만 바꿔도 같은 답변의 점수가 달라질 수 있다고 정리했습니다. RanketAI(랭킷AI)가 같은 질문 묶음을 같은 날 모델만 바꿔 측정했을 때도 자사 브랜드 언급률은 ChatGPT에서 43%와 5%, Gemini에서 74%와 40%로 크게 벌어졌습니다. GPT-6가 막 출시된 지금, 측정 조건을 확인하는 기준을 정리합니다.
3줄 요약
- GEO 점수는 에 대한 하나의 사실이 아니라 측정 설계의 결과입니다. 어떤 질문을 모았는지, 어떤 모델로 언제 물었는지, 무엇을 언급·인용으로 판정했는지가 모두 점수에 반영됩니다.
- 자사 실측에서는 측정 모델 하나만 바꿔도 언급률이 몇 배씩 달라졌습니다. 그래서 측정 모델은 최신 여부가 아니라 대표하려는 사용자가 실제로 보는 모델인가로 판단해야 합니다. 2026년 9월 22일 GPT-6 Sol·Luna가 출시됐지만, 9월 24일 무료 사용자 일반 채팅의 기본 모델은 GPT-5.6 Luna였습니다.
- 논문은 새 실험이 없는 방법론 서베이라 수치 근거로 인용하기는 어렵습니다. 대신 측정 도구와 리포트를 검토할 때 무엇을 물어야 하는지에 대한 기준으로 활용할 수 있습니다.
같은 질문, 같은 날 — 모델만 바꿨더니 언급률이 달라졌습니다
측정 조건이 점수를 얼마나 바꾸는지는 자사 실측에서 먼저 확인했습니다. RanketAI는 2026년 9월 4일 측정 조건을 점검하면서, 브랜드명을 포함하지 않은 카테고리 질문 묶음을 같은 날 모델만 바꿔 여러 회차 반복 측정했습니다. 측정 대상은 자사 브랜드이고, 분야는 AI 검색 가시성 진단입니다.
| AI 서비스 | 측정 모델 조건 | 자사 브랜드 언급률 |
|---|---|---|
| ChatGPT | 모델 A | 43% |
| ChatGPT | 모델 B (더 가벼운 모델) | 5% |
| Gemini | 버전 A | 74% |
| Gemini | 버전 B (더 새로운 버전) | 40% |
ChatGPT에서의 차이는 검색 깊이와 함께 움직였습니다. 답변당 평균 웹 검색 호출이 모델 A는 4.3회, 모델 B는 1.2회였고, 자사 브랜드가 언급된 답변은 모두 자사 페이지 인용을 동반했습니다. 검색을 더 깊게 할수록 더 많은 출처를 확인하고, 그만큼 후보 목록이 넓어진다는 해석이 가능합니다.
Gemini 결과는 다른 점을 보여줍니다. 새 버전으로 바꾼다고 점수가 오른다는 보장도 없습니다. 이 측정에서는 이전 버전의 언급률이 더 높았습니다. 두 값 모두 실제 AI 답변이므로 무엇이 "맞는" 값인지는 이 표만으로 정할 수 없고, 무엇을 대표하려는 측정인지가 먼저 정해져야 합니다.
이 수치에는 한계가 분명합니다. 자사 브랜드 하나, 분야 하나, 소표본, 하루 측정입니다. 언급률의 크기를 다른 브랜드나 분야로 일반화하면 안 되고, 이 표가 보여주는 것은 크기가 아니라 방향입니다. 측정 모델 선택만으로 같은 브랜드의 점수가 몇 배씩 달라질 수 있다는 점입니다.
논문이 정리한 GEO 점수의 5가지 구성 요소
이 현상을 체계로 정리한 것이 2026년 9월 6일 공개된 방법론 논문입니다. 저자 Olivier Martinez는 7월에 GEO 연구 45편을 증거 등급으로 분류한 비판적 서베이를 낸 연구자입니다. 이번 논문은 "GEO 기법이 효과가 있는가"에서 한 걸음 물러나 **"GEO 점수는 무엇을 측정하는가"**를 다룹니다.
논문은 GEO 가시성 점수를 만드는 측정 도구를 다섯 요소로 나눕니다.
| 구성 요소 | 정하는 것 | 바뀌면 생기는 일 |
|---|---|---|
| 상황 정의 | 질문이 대표하는 사용 상황과 그 분류 규칙 | 어떤 상황을 측정했는지에 따라 같은 점수의 의미가 달라집니다 |
| 질문 표현 | 그 상황을 어떤 문장으로 물을지 | 문장 표현이 검색 결과, 경쟁 출처, 답변 자체를 바꿉니다 |
| 실행 조건 | 모델·버전, 날짜·시각, 인터페이스, 이전 대화, 설정값 | 같은 질문도 모델이 바뀌면 다른 답변이 나옵니다(위 실측) |
| 가중치 | 상황별 상대적 중요도 | 가중치에 따라 두 브랜드의 순위가 뒤집힐 수 있습니다 |
| 판정 규칙 | 답변에서 언급·인용을 식별하는 방식, LLM 판정이면 모델·기준·지시문 | 같은 답변도 판정 지시문이 바뀌면 점수가 달라질 수 있습니다 |
이 표의 요지는 간단합니다. 점수가 다르다는 사실만으로는 가시성이 다르다고 말할 수 없습니다. 다섯 요소 가운데 하나라도 다르면 두 점수는 서로 다른 대상을 측정한 값일 수 있습니다.
"답변 시장" — 질문 모음이 측정 대상을 정합니다
논문의 핵심 개념은 '답변 시장(answer market)'입니다. 측정에 사용한 질문과 그 가중치가 곧 측정 대상 시장을 구성한다는 뜻입니다.
"We call this weighted set of answer opportunities an “answer market.” This constructed market does not necessarily represent actual user demand." (가중치가 붙은 이 답변 기회의 집합을 '답변 시장'이라 부른다. 이렇게 구성된 시장이 실제 사용자 수요를 대표한다는 보장은 없다.) — Martinez, Measuring GEO Visibility, arXiv:2609.06811 (2026-09-06)
저자는 같은 맥락에서 "어떤 출처가 답변의 40%에서 인용됐다"는 문장만으로는 부족하다고 적습니다. 그 답변이 열린 질문에 대한 것인지, 해당 출처의 이름이 포함된 질문에 대한 것인지, 비교 질문에 대한 것인지, 그리고 어떤 엔진·기간에서 나온 것인지가 함께 있어야 숫자를 해석할 수 있다는 것입니다.
이 블로그가 앞서 다룬 두 문제가 이 개념 하나로 묶입니다. 브랜드명 질의 글에서는 브랜드명이 포함된 질문이 웹 검색이 켜진 AI에서 사실상 항상 해당 브랜드를 언급해 성과 지표로서 정보량이 없다는 점을, 수요 측 데이터 글에서는 측정 질문이 실제 구매 검토 질문과 얼마나 가까운지 확인할 데이터가 없다는 점을 다뤘습니다. 둘 다 답변 시장이 실제 수요와 어긋나는 경우입니다.
실행 조건 — 모델 출시일과 기본 모델 전환일은 다릅니다
실행 조건 가운데 가장 자주 바뀌는 것이 모델입니다. OpenAI는 2026년 9월 22일 GPT-6 Sol과 GPT-6 Luna를 공개했습니다. 다만 공지를 보면 출시와 기본 모델 전환은 같은 사건이 아닙니다.
"GPT‑6 Sol and Luna roll out today in ChatGPT Work and Codex for Plus, Pro, Business, Enterprise, and Edu users." (GPT-6 Sol과 Luna는 오늘부터 ChatGPT Work와 Codex에서 Plus·Pro·Business·Enterprise·Edu 사용자에게 제공된다.) — OpenAI Developer Community 공지 (2026-09-22)
| 구분 (2026-09-24 확인) | 제공 모델 |
|---|---|
| ChatGPT 무료 사용자 일반 채팅의 기본 모델 | GPT-5.6 Luna |
| 무료·Go 사용자 데스크톱 앱 체험 | GPT-6 Luna |
| 유료 사용자(Plus·Pro·Business·Enterprise·Edu) ChatGPT Work·Codex | GPT-6 Sol·GPT-6 Luna |
GPT-5.6 Luna의 무료 사용자 제공은 OpenAI 발표에서, 9월 24일 현재 일반 채팅의 기본 모델은 무료 계정에서 직접 확인했습니다. 이 표는 모델이 바뀔 때마다 갱신합니다.
측정 모델을 정할 때는 대표하려는 사용자가 누구인지를 먼저 정해야 합니다. 무료 사용자가 보는 답변을 대표하려는 측정이라면 GPT-6 출시 자체는 조건을 바꿀 이유가 아니고, 무료 사용자 일반 채팅의 기본 모델이 바뀌는 날이 기준 변경 시점입니다. 유료 업무 환경의 사용자를 대표하려는 측정이라면 기준이 달라집니다. 어떤 기준이든 측정 도구가 기준을 정해 두고 있는지, 기준이 바뀐 시점을 기록하는지가 확인할 점입니다.
모델이 바뀐 뒤의 점수 해석에 대해서도 논문은 구체적으로 권고합니다.
"A stable identifier does not guarantee the absence of silent updates: interleave conditions, use sentinel controls, and segment collection if a break is suspected." (모델 식별자가 같아도 조용한 업데이트가 없다는 보장은 없다. 조건을 교차 배치하고, 기준 대조군을 두고, 단절이 의심되면 수집 구간을 나눠라.) — Martinez, arXiv:2609.06811, 측정 프로토콜 4단계
실무로 옮기면, 기본 모델 전환 전후의 점수는 하나의 추세선으로 이어 읽지 않는 편이 정확합니다. 전환 시점을 기록하고 그 뒤 몇 회차를 새 기준선으로 삼아야 전후 비교가 가능합니다.
날짜도 실행 조건입니다. 같은 모델이라도 회차마다 답변이 달라지기 때문입니다. 한국 B2B SaaS 12곳을 같은 날 두 번 측정한 재측정 실측에서 개별 점수 변동의 중앙값은 6점이었고, 20일 간격 변화의 중앙값은 5.5점이었습니다. 한 달 사이의 변화가 같은 날 재측정 변동 범위 안에 있었다는 뜻입니다. 몇 번을 반복해야 신뢰할 수 있는지는 세인트갈렌 연구 분석에서 다뤘습니다.
판정 방식 — 같은 답변도 판정 지시문이 바뀌면 점수가 달라집니다
답변을 받은 뒤에도 점수는 아직 정해지지 않았습니다. 답변에서 브랜드 언급과 인용을 식별하는 판정 단계가 남아 있고, 이 작업을 언어 모델에 맡기면 또 하나의 지시문이 측정에 들어옵니다.
"This instruction can change the scoring even when the evaluated answers remain identical." (이 지시문은 평가 대상 답변이 그대로여도 점수를 바꿀 수 있다.) — Martinez, arXiv:2609.06811
논문이 제시하는 대응은 세 가지입니다. LLM 판정을 사용한다면 판정 모델·기준·지시문을 공개하고, 답변 원문과 판정 규칙을 보관하며, 저장된 같은 답변에 판정만 바꿔 적용해 보는 교차 확인입니다. 사용자 입장에서 확인할 점은 하나로 정리됩니다. 점수가 바뀌었을 때 답변이 바뀐 것인지 판정이 바뀐 것인지 구분할 수 있는가입니다. 이를 구분하려면 측정 결과와 함께 답변 원문을 확인할 수 있어야 합니다.
가중치 — 점수 하나 대신 범위로 보고하는 방법
종합 점수에는 상황별 가중치가 숨어 있습니다. 논문은 가중치 선택만으로 순위가 뒤집히는 예시를 제시합니다. 저자가 명시한 가상 사례이며, 탐색 상황은 사용자가 처음 후보를 찾는 질문, 검증 상황은 이미 아는 대상을 확인하는 질문입니다.
| 구분 | 탐색 상황 성공률 | 검증 상황 성공률 | 탐색 가중치 0.2 | 탐색 가중치 0.8 |
|---|---|---|---|---|
| 시스템 A | 0.30 | 0.90 | 0.78 | 0.42 |
| 시스템 B | 0.50 | 0.60 | 0.58 | 0.52 |
탐색 가중치가 0.6보다 낮으면 A가, 높으면 B가 앞섭니다. 가중치를 0.20.8 사이에서 정하지 못했다면 논문의 권고대로 점수를 범위로 보고하는 편이 정확합니다. A는 0.420.78, B는 0.52~0.58입니다. A는 가중치에 따라 크게 흔들리고 B는 안정적이라는 정보가 단일 점수에서는 사라집니다.
실무에서 확인할 점은 종합 점수의 가중치가 우리 목표와 맞는가입니다. 신규 고객 확보가 목표라면 브랜드를 모르는 사용자가 후보를 찾는 탐색 상황의 비중이 커야 하고, 기존 고객 유지가 목표라면 검증 상황의 비중을 높게 볼 수 있습니다.
인용됐다고 기여한 것은 아닙니다
인용 수가 늘었다는 것과 그 출처가 답변에 기여했다는 것은 다른 주장입니다.
"The presence of a citation is insufficient to establish a source’s contribution to an answer." (인용이 있다는 사실만으로는 그 출처가 답변에 기여했다고 입증할 수 없다.) — Martinez, arXiv:2609.06811
논문은 기여를 확인하는 방법으로, 질문·조건·검색된 출처 목록을 고정한 상태에서 특정 출처 하나만 제외하고 다시 생성한 답변과 비교하는 설계를 제안합니다. 이때 "인용 여부"는 결과 지표가 될 수 없습니다. 출처를 빼면 그 출처의 인용은 기계적으로 사라지기 때문입니다. 비교해야 할 것은 답변이 담은 정보가 달라졌는가입니다.
이 구분은 앞서 다룬 두 관찰과 같은 방향입니다. 고스트 인용 글에서는 인용되고도 브랜드가 언급되지 않는 경우를, 비판적 서베이 분석에서는 답변 후보에 선택되는 단계와 답변 본문에 반영되는 단계가 별개의 문제라는 점을 다뤘습니다.
측정 도구와 리포트를 검토할 때 확인할 7가지
논문의 7단계 측정 프로토콜을 사용자가 확인할 질문으로 바꾸면 다음과 같습니다. 질문 설계 기준은 브랜드명 질의 글에서 다뤘으므로, 여기서는 그 밖의 조건을 중심으로 정리합니다.
| 확인할 질문 | 확인이 필요한 이유 |
|---|---|
| 질문 모음은 어떤 상황을 대표하나요? 브랜드명이 포함된 질문이 들어 있나요? | 질문 모음이 곧 측정 대상 시장입니다 |
| 측정 모델이 대표하려는 사용자(무료·유료)와 맞나요? | 모델만 바꿔도 언급률이 몇 배 달라졌습니다 |
| 기본 모델이 바뀐 시점이 기록되나요? | 전환 전후 점수는 같은 추세선으로 읽을 수 없습니다 |
| 같은 질문을 몇 회, 얼마 동안 반복했나요? | 같은 날 재측정 변동이 한 달 사이 변화와 비슷했습니다 |
| 언급·인용 판정 방식이 공개돼 있고 고정돼 있나요? | 판정 지시문만 바꿔도 점수가 달라질 수 있습니다 |
| 종합 점수의 가중치가 우리 목표와 맞나요? | 가중치에 따라 순위가 뒤집힐 수 있습니다 |
| 인용 수 증가를 성과로 해석하고 있지 않나요? | 인용은 기여의 증거가 아닙니다 |
RanketAI의 도구 구성도 이 순서를 따릅니다. 페이지 구조 진단으로 AI 크롤러가 페이지를 읽을 수 있는 상태인지 먼저 확인하고, AI 브랜드 가시성 분석으로 브랜드명을 포함하지 않은 질문에 대한 ChatGPT·Perplexity·Gemini 답변에서 언급·인용을 측정합니다. 경쟁 브랜드와 같은 조건에서 나란히 보려면 경쟁사 비교를 활용할 수 있습니다. 어떤 도구를 사용하든 위 7가지는 같은 기준으로 확인할 수 있습니다.
이 논문을 인용할 때 지켜야 할 선 3가지
이 논문의 가치는 수치가 아니라 측정 설계의 틀에 있습니다. 인용할 때는 다음 한계를 함께 밝혀야 합니다.
- 새 실험이 없습니다. 저자는 "No new experimental collection from users or generative systems is reported."라고 밝혔고, 순위 역전 예시도 가상 사례라고 명시했습니다. 본문의 수치를 실제 측정 결과로 인용하면 사실과 다른 주장이 됩니다.
- 동료심사를 거치지 않은 단독 저자 프리프린트입니다. 저자가 제안한 측정 프로토콜의 실증 타당성도 향후 과제로 남아 있습니다.
- 선별적이고 영어 중심인 서베이입니다. 저자는 여러 연구에서 같은 용어가 쓰이는 것이 독립적인 재현이 쌓였다는 뜻은 아니라고 적었습니다. 한국어 질문과 국내 AI 서비스에 그대로 적용된다는 근거는 아직 없습니다.
자사 실측도 같은 기준으로 읽어야 합니다. 앞의 표는 단일 브랜드·단일 분야·소표본·하루 측정의 결과이고, 보여주는 것은 측정 모델이 점수를 바꾸는 방향이지 특정 모델의 우열이 아닙니다.
자주 묻는 질문
가장 새로운 모델로 측정하면 더 정확하지 않나요?
정확도의 기준이 무엇인지에 따라 다릅니다. 측정 목적이 특정 사용자층이 보는 답변이라면, 그 사용자층이 사용하는 모델이 기준입니다. 자사 실측에서 Gemini의 새 버전은 이전 버전보다 언급률이 오히려 낮았습니다(40%와 74%). 새 모델은 새 모델의 답변을 보여줄 뿐, 대표하려는 사용자의 경험과 같다는 보장은 없습니다.
측정 모델이 바뀌면 기존 점수와 비교할 수 있나요?
전환 전후는 구간을 나눠 읽는 편이 안전합니다. 논문도 단절이 의심되면 수집 구간을 나누라고 권고합니다. 전환 직후 몇 회차를 새 기준선으로 삼고, 그 뒤의 변화부터 추세로 읽으면 됩니다.
도구마다 점수가 다른데 무엇을 믿어야 하나요?
점수 차이 자체는 이상 신호가 아닙니다. 질문 모음·측정 모델·판정 방식·가중치가 다르면 도구마다 다른 대상을 측정하고 있을 수 있습니다. 두 도구를 비교하려면 위 7가지 질문을 각각 확인하고, 조건이 같은 항목끼리만 비교하는 편이 정확합니다.
예산이 적으면 직접 측정해도 되나요?
가능합니다. 다만 조건을 기록해야 결과를 해석할 수 있습니다. 질문 원문, 날짜와 시각, 사용한 앱과 요금제(무료·유료), 화면에 표시된 모델명, 답변 원문을 함께 저장하고, 같은 조건으로 여러 번 반복하는 것이 최소 기준입니다.
인용 수가 늘었다면 성과가 난 것인가요?
인용 수만으로는 판단하기 어렵습니다. 인용은 기여의 증거가 아니기 때문입니다. 인용이 늘었을 때 답변 속 브랜드 서술이 구체적으로 바뀌었는지, 추천 목록에 포함됐는지를 함께 확인해야 성과로 볼 수 있습니다.
함께 읽으면 좋은 글
- GEO 기법 효과 40%의 조건 — 45편 연구를 검토한 2026 비판적 서베이 분석 — 같은 저자의 이전 서베이로, 기법 효과의 조건을 다룹니다.
- 브랜드명 질의로 AI 가시성을 측정하면 안 되는 이유 — 질문 모음 설계 기준을 다룹니다.
- 전월 대비 올랐다는 착각 — 재측정 변동폭이 월간 변화보다 컸다 — 날짜라는 실행 조건이 만드는 변동을 실측했습니다.
- AI 가시성, 하루 7회·2~4주는 측정해야 믿을 수 있다 — 반복 측정 횟수의 통계적 기준입니다.
- AI 가시성 측정에 빠진 수요 측 데이터 — 답변 시장이 실제 수요와 어긋나는 문제의 다른 측면입니다.
핵심 실행 요약
| 항목 | 실무 기준 |
|---|---|
| 핵심 주제 | GEO 점수는 무엇을 측정하나 — 질문 모음·측정 모델·판정 방식이 점수를 바꾸는 구조 (2026) |
| 적용 대상 | geo 업무에 우선 적용 |
| 우선 조치 | 입력 계약(목적·독자·자료·출력형식)부터 고정 |
| 리스크 체크 | 근거 없는 주장, 정책 위반, 형식 미준수 여부를 검증 |
| 다음 단계 | 실패 로그를 패턴 템플릿으로 축적해 재발을 줄임 |
자주 묻는 질문(FAQ)
"GEO 점수는 무엇을 측정하나 — 질문 모음·측정 모델·판정 방식이 점수를 바꾸는 구조…"을 읽고 나서 가장 먼저 취해야 할 행동은 무엇인가요?▾
요청 입력을 표준화해 목적, 대상 독자, 참고 자료, 출력 형식을 필수로 받는 입력 계약부터 도입하세요.
기존 geo 워크플로우에 GEO를 어떻게 통합할 수 있나요?▾
geo처럼 반복 업무와 품질 편차가 큰 팀에서 효과가 빠르게 나타납니다.
GEO와 함께 쓰면 효과적인 도구나 프레임워크는 무엇인가요?▾
프롬프트 문구보다 맥락 레이어 분리와 출력 검증 루프가 실제로 작동하는지 먼저 점검하세요.
분석 근거
- 1차 출처: Olivier Martinez, "Measuring GEO Visibility: Prompt Corpora Define the Answer Market" (arXiv:2609.06811, 2026-09-06) 본문 — 측정 구성 요소 5가지(상황 정의·질문 표현·실행 조건·가중치·판정 규칙), '답변 시장' 정의, 판정 지시문 효과, 가중치 범위 보고, 인용과 기여의 구분, 7단계 측정 프로토콜을 원문 기준으로 인용했다. 인용 블록의 영문은 원문 HTML 과 글자 단위로 대조했다. 새 실험이 없는 방법론 서베이이며 순위 역전 예시는 저자가 명시한 가상 사례다. 저자는 2026-07-15 GEO 비판적 서베이(arXiv:2607.14035)와 같은 연구자다.
- 자사 실측: 2026-09-04 RanketAI 측정 조건 점검 과정에서, 브랜드명을 포함하지 않은 카테고리 질문 묶음을 같은 날 모델만 바꿔 여러 회차 반복 측정했다(측정 대상 자사 브랜드, 분야 AI 검색 가시성 진단). 언급률은 완료된 답변 가운데 자사 브랜드가 언급된 답변의 비율이다. 단일 브랜드·단일 분야·소표본·하루 측정이라 수치의 크기를 일반화하지 않으며, 측정 모델 식별자와 질문 수는 공개하지 않는다.
- 모델 제공 현황: OpenAI 개발자 커뮤니티 공지(2026-09-22)의 GPT-6 Sol·Luna 제공 범위와, OpenAI 의 GPT-5.6 Luna 무료 사용자 확대 발표를 확인했다. 2026-09-24 무료 계정 일반 채팅의 기본 모델은 직접 확인했다.
- 반복 측정·재측정 변동 수치는 당 블로그 기존 글(2026-07-12 세인트갈렌 연구 분석, 2026-08-12 재측정 변동 실측)의 원문 기준 수치를 인용하고 상세는 내부 링크로 연결했다.
핵심 주장과 근거
이 섹션은 본문 핵심 주장과 근거 출처를 1:1로 대응해 빠르게 검증할 수 있도록 구성했습니다. 아래 항목에서 주장과 원문 링크를 함께 확인하세요.
주장:같은 카테고리 질문 묶음을 같은 날 측정했을 때 ChatGPT 모델 A에서는 자사 브랜드 언급률이 43%, 더 가벼운 모델 B에서는 5%였고 답변당 평균 웹 검색 호출은 4.3회와 1.2회였다
근거 출처:RanketAI 자사 실측 (2026-09-04, 이 글에서 첫 공개)주장:같은 조건에서 Gemini 이전 버전의 자사 브랜드 언급률은 74%, 새 버전은 40%였다
근거 출처:RanketAI 자사 실측 (2026-09-04, 이 글에서 첫 공개)주장:질문 선택과 가중치가 만든 답변 기회의 집합(답변 시장)은 실제 사용자 수요를 대표한다는 보장이 없다
근거 출처:Martinez (arXiv:2609.06811, preprint)주장:답변 판정을 언어 모델에 맡기면 평가 대상 답변이 그대로여도 판정 지시문에 따라 점수가 달라질 수 있다
근거 출처:Martinez (arXiv:2609.06811, preprint)주장:탐색·검증 두 상황의 성공률이 A 0.30·0.90, B 0.50·0.60인 가상 예시에서 탐색 가중치 0.2이면 A가 0.78로 앞서고 0.8이면 B가 0.52로 앞서며, 가중치 0.6을 경계로 순위가 뒤집힌다
근거 출처:Martinez (arXiv:2609.06811, 가상 예시)주장:GPT-6 Sol과 Luna는 2026년 9월 22일 ChatGPT Work와 Codex에서 Plus·Pro·Business·Enterprise·Edu 사용자에게 제공되기 시작했고, 무료·Go 사용자는 데스크톱 앱에서 GPT-6 Luna를 체험할 수 있다
근거 출처:OpenAI Developer Community 공지 (2026-09-22)주장:한국 B2B SaaS 12곳을 같은 날 두 번 측정한 개별 점수 변동의 중앙값은 6점, 20일 간격 개별 점수 변화의 중앙값은 5.5점이었다
근거 출처:RanketAI 재측정 변동 실측 (2026-08-12)
외부 인용 링크
아래 링크는 본문 수치와 주장에 직접 사용한 원문 출처입니다. 항목별 원문 맥락을 확인하면 해석 차이를 줄이고 재검증 속도를 높일 수 있습니다.
- Martinez — Measuring GEO Visibility: Prompt Corpora Define the Answer Market (arXiv:2609.06811, 2026-09-06, preprint)
- OpenAI Developer Community — Announcing GPT-6 Sol and GPT-6 Luna in the API, Codex and ChatGPT (2026-09-22)
- OpenAI — Introducing GPT-6 Sol and Luna
- OpenAI — Improving GPT-5.6 Sol in ChatGPT and expanding access to GPT-5.6 Luna for free users
- Martinez — Optimizing Visibility in Generative Engines: A Critical Survey of GEO (arXiv:2607.14035, 2026-07-15, preprint)
AI 검색에 내 사이트는 노출되고 있을까?
ChatGPT·Perplexity·Gemini가 내 브랜드를 어떻게 답하는지 무료로 확인해 보세요.
지금 진단 시작 →이어서 읽기
관련 포스트
관련 포스트는 현재 글의 선택 기준을 다른 상황에서 비교 검증할 수 있도록 선별했습니다. 관점을 확장하려면 아래 글을 순서대로 확인해 보세요.
AI 가시성 측정에 빠진 수요 측 데이터 — 고객이 신뢰하는 출처 유형
AI 답변 속 브랜드 가시성 측정은 대부분 공급 측, 즉 내 콘텐츠가 인용됐는지만 확인합니다. 2026년 8월 공개된 103만 건 규모 구매자 페르소나 코퍼스는 수요 측 데이터의 부재를 문제로 제기하며 페르소나마다 신뢰하는 출처 유형을 함께 기록했습니다. 이 축이 실무 측정에 무엇을 더하는지, 합성 코퍼스라는 한계는 무엇인지 정리합니다.
대형 브랜드는 73%, 소형은 11% — 브랜드 규모가 AI 답변 등장률을 나누는 구조 (2026)
브랜드명 없는 카테고리 질문에서 대형 브랜드는 답변의 73%, 중견은 44%, 소형은 11%에만 등장했다는 10만 응답 규모 연구가 공개됐습니다. 표본 편중이라는 한계와 함께, 한국 B2B SaaS 12곳 실측에서 확인된 엔진별 2.5배 격차를 나란히 놓고 소형 브랜드가 실제로 손댈 수 있는 지점을 정리합니다.
Perplexity는 어떤 질문에도 웹 검색을 생략하지 않는다 — 응답 스트림 관찰로 본 인용 선택 구조 (2026)
Perplexity의 응답 스트림을 관찰한 분석에서 7개 질의 전부 웹 검색이 실행됐고, 회수된 소스 10~15건 가운데 실제 인용은 5~9건에 그쳤습니다. 지역 질문은 장소 정보, 사용법 질문은 영상, 뉴스는 1차 발표처로 인용 대상이 결정되는 구조를 정리하고, 국내 브랜드가 어느 채널부터 정비해야 하는지까지 다룹니다.
GEO 기법 효과 40%의 조건 — 45편 연구를 검토한 2026 비판적 서베이 분석
GEO 최적화로 AI 답변 가시성이 최대 40% 개선된다는 수치는 소스가 이미 답변 컨텍스트에 포함된 조건에서 측정된 값이다. 2023~2026년 GEO 연구 45편을 증거 등급으로 가려낸 비판적 서베이를 바탕으로, 재현성이 확인된 레버(주제 적합성·컨텍스트 위치)와 역효과 사례(-16%), 그리고 실무에서 무엇을 멈추고 무엇을 측정해야 하는지 정리한다.
AI 노출 0에서 30일 만에 298회 — 콜드스타트 실험이 확인한 제3자 배치 85.8%
AI 답변에 한 번도 등장하지 않던 SaaS가 30일 만에 6개 AI에서 298회 노출됐고, 출처 언급 437건 중 85.8%는 제3자 리스티클에서 나왔습니다. 자사 리스티클은 첫 인용까지 18일이 소요됐고 비중은 14%였습니다. Search Engine Land에 실린 두 실험을 근거로 자사 콘텐츠와 제3자 배치의 역할을 나누고, 국내에서 실행할 절차를 정리합니다.