AI 봇은 무엇을 하러 오는가 — 24시간 로그 실측, 학습 수집 24건 vs 인용 조회 424건
운영 사이트의 24시간 서버 로그를 실측한 결과, AI 봇 트래픽의 대부분은 학습용 수집이 아니라 사용자 질문에 답하기 위한 실시간 인용 조회였다. GPTBot 4건 vs ChatGPT-User 390건. 학습·색인·인용 조회라는 세 가지 봇 유형의 차이, robots.txt 가 각각에 어떻게 다르게 작동하는지, 내 사이트 로그를 읽는 방법까지 실측 데이터로 정리한다.
AI 보조 작성 · RanketAI 편집팀 검수 후 발행 — 편집 정책 ›
핵심 요약: "AI 봇이 내 사이트를 긁어 간다"고 할 때 대부분은 학습용 수집을 떠올립니다. RanketAI 운영 사이트의 24시간 로그를 실측해 보니 반대였습니다 — 학습 수집(GPTBot·ClaudeBot)은 24건, 사용자 질문에 답하려고 그 순간 페이지를 열어 본 인용 조회(ChatGPT-User·Claude-User)는 424건이었습니다. AI 봇 트래픽의 실체는 "학습 데이터로 흡수되는 과정"이 아니라 "답변이 만들어지는 순간에 읽히는 과정" 에 가깝습니다. 이 구분에 따라 robots.txt 설정과 AI 가시성 전략의 방향이 달라집니다.
3줄 요약
- 24시간 동안 총 17,712 요청 중 AI 봇은 588건이었고, 그중 72%(424건)가 실시간 인용 조회, 24%(140건)가 AI 검색 색인, 학습 수집은 4%(24건) 에 그쳤습니다.
- 세 가지 봇은 목적이 다르고 robots.txt 가 작동하는 방식도 다릅니다 — 학습 봇 차단은 학습 제외 의사 표시일 뿐이고, 색인 봇을 차단하면 AI 검색 답변에서 사라지며, 인용 조회 봇은 사용자 행동 기반이라 robots.txt 가 적용되지 않을 수 있습니다.
- 단일 사이트·하루 표본이므로 비율 자체보다 내 사이트 로그에서 세 유형을 구분해 읽는 방법에 주목할 필요가 있습니다.
실측 — 24시간 동안 AI 봇이 남긴 기록
RanketAI 사이트(ranketai.com)의 2026년 7월 22~23일 24시간 요청 로그 17,712건에서 AI 봇 User-Agent 를 분류한 결과입니다.
| 목적 | 봇 (벤더) | 24시간 요청 수 |
|---|---|---|
| 실시간 인용 조회 | ChatGPT-User (OpenAI) | 390 |
| Claude-User (Anthropic) | 34 | |
| AI 검색 색인 | OAI-SearchBot (OpenAI) | 80 |
| PerplexityBot (Perplexity) | 60 | |
| 학습 수집 | ClaudeBot (Anthropic) | 20 |
| GPTBot (OpenAI) | 4 |
같은 기간 전통 검색엔진 봇(Googlebot 148 · bingbot 317 · 네이버 Yeti 66)은 별도로 531건이었습니다. AI 봇만 보면 구도가 선명합니다 — 인용 조회 424 : 색인 140 : 학습 24. OpenAI 와 Anthropic 양쪽 모두에서 사용자 요청 기반 봇이 학습 봇을 크게 앞섰습니다(OpenAI 390 vs 4, Anthropic 34 vs 20).
세 가지 봇 — 공식 정의로 확인하기
이 구분은 RanketAI 의 해석이 아니라 벤더 공식 문서의 구분입니다. OpenAI 는 크롤러 문서에서 세 봇의 목적을 명시합니다(OpenAI Crawlers).
"When users ask ChatGPT or a CustomGPT a question, it may visit a web page with a ChatGPT-User agent." (사용자가 ChatGPT 나 커스텀 GPT 에 질문하면, ChatGPT-User 에이전트로 웹 페이지를 방문할 수 있다) — OpenAI Crawlers 공식 문서
- GPTBot — 기반 모델 학습에 쓰일 수 있는 콘텐츠를 수집합니다. robots.txt 차단은 "학습에 포함하지 말라"는 의사 표시입니다.
- OAI-SearchBot — ChatGPT 검색 기능에서 사이트를 노출하기 위한 색인 봇입니다. 차단하면 ChatGPT 검색 답변에 사이트가 표시되지 않습니다.
- ChatGPT-User — 사용자가 질문한 그 순간 답을 만들기 위해 페이지를 열어 봅니다. 자동 크롤링이 아니라 사용자 행동 기반이어서 robots.txt 규칙이 적용되지 않을 수 있다고 OpenAI 가 직접 명시합니다.
Anthropic 도 같은 구조입니다 — 학습 수집용 ClaudeBot과 사용자 요청 기반 Claude-User 를 구분해 운영합니다. Perplexity 의 PerplexityBot 은 검색 노출용 색인 봇입니다.
해석 — AI 가시성은 "학습되는 것"보다 "읽히는 것"
인용 조회가 72%라는 사실은 AI 가시성의 작동 방식에 대한 통념 하나를 수정합니다. 학습 수집이 중심이라면 내 콘텐츠의 운명은 몇 달 주기의 학습 사이클에 갇힙니다. 그러나 실측에서 지배적인 것은 답변 생성 시점의 실시간 조회였습니다. 이것이 의미하는 바는 셋입니다.
- 지금 고치면 지금 반영될 수 있습니다. 인용 조회는 질문이 들어온 그 순간의 페이지를 읽습니다. 콘텐츠 갱신·구조 개선의 효과가 학습 사이클을 기다리지 않고 다음 질문부터 반영될 수 있는 경로가 열려 있다는 뜻입니다.
- 조회 시점에 읽히지 않으면 그 답변에서 빠집니다. 페이지가 느리거나, 봇이 읽을 수 없는 구조(JS 의존 본문)거나, 방화벽이 봇을 막고 있으면 — 모델이 나를 알고 있어도 그 순간의 인용에서 탈락할 수 있습니다.
- 학습 봇 차단과 AI 노출은 별개 문제입니다. GPTBot 을 차단한 사이트도 ChatGPT-User 의 인용 조회는 계속 받을 수 있습니다(사용자 행동 기반이라 robots.txt 적용 예외 가능 — 공식 문서 기준). 반대로 OAI-SearchBot 을 차단하면 ChatGPT 검색 답변 노출 자체가 사라집니다. "AI 봇 차단"을 한 덩어리로 결정하면 의도와 다른 결과가 나옵니다.
실무 — 내 사이트에서 세 유형을 구분해 읽는 법
- 로그에서 User-Agent 를 세 유형으로 나눠 집계하세요. 호스팅 콘솔의 요청 로그나 서버 액세스 로그에서
GPTBot·ClaudeBot(학습) /OAI-SearchBot·PerplexityBot(색인) /ChatGPT-User·Claude-User(인용 조회)를 나눠 세면 내 사이트의 구도가 나옵니다. 인용 조회가 잡히기 시작했다면 AI 답변의 소스 후보에 들어가 있다는 신호입니다. - robots.txt 는 봇별로 의도를 나눠 설정하세요. 학습 제외가 목적이면 GPTBot·ClaudeBot 만 차단해도 됩니다. AI 검색 노출이 목적이면 OAI-SearchBot·PerplexityBot 은 열어 두어야 합니다. 방화벽·봇 차단 솔루션이 이 봇들을 일괄 차단하고 있지 않은지도 함께 점검 대상입니다.
- 조회 시점에 읽히는 구조인지 진단하세요. 인용 조회 봇은 JS 렌더 없이 본문을 읽는 경우가 많아, 본문·핵심 정보가 초기 HTML 에 노출되는지가 중요합니다. 페이지 구조 진단으로 AI 크롤러 접근성과 구조 신호를 무료로 점검할 수 있고, 실제 AI 답변에서 브랜드가 어떻게 언급되는지는 AI 브랜드 가시성 분석으로 반복 측정해 확인하는 방법이 있습니다.
한 가지를 다시 밝혀 둡니다 — 위 수치는 단일 사이트의 하루 표본입니다. 콘텐츠 성격·트래픽 규모에 따라 비율은 달라질 수 있으므로, 숫자 자체보다 분류 방법과 함의를 참고하는 편이 안전합니다.
FAQ
GPTBot 을 차단하면 ChatGPT 답변에서 사라지나요?▾
아닙니다. GPTBot 차단은 학습 데이터 포함 제외 의사 표시이고, ChatGPT 검색 노출(OAI-SearchBot)과 사용자 질문 시 인용 조회(ChatGPT-User)는 별도 경로입니다. 다만 셋을 모두 차단하면 AI 답변에 노출될 경로가 사실상 사라집니다.
학습 수집이 4건뿐인 이유는 무엇인가요?▾
학습 크롤은 상시 반복이 아니라 저빈도로 도는 수집이고, 이미 수집된 사이트를 매일 다시 긁을 이유도 없습니다. 반면 인용 조회는 사용자 질문이 발생할 때마다 일어나므로, 질문의 근거로 쓰이는 사이트일수록 조회가 잦아집니다 — RanketAI 표본에서 두 수치의 격차가 컸던 배경으로 해석합니다.
인용 조회가 0건이면 어떻게 해야 하나요?▾
먼저 봇이 접근 가능한지(방화벽·robots.txt·JS 의존 구조) 점검하고, 다음으로 AI 가 인용할 만한 형태의 콘텐츠(질문에 정면으로 답하는 비교·정리형)가 있는지 살펴보는 순서를 권합니다. 접근성은 페이지 구조 진단으로, 실제 언급 여부는 AI 브랜드 가시성 분석으로 확인할 수 있습니다.
함께 읽으면 좋은 글
핵심 실행 요약
| 항목 | 실무 기준 |
|---|---|
| 핵심 주제 | AI 봇은 무엇을 하러 오는가 — 24시간 로그 실측, 학습 수집 24건 vs 인용 조회 424건 |
| 적용 대상 | geo 업무에 우선 적용 |
| 우선 조치 | 입력 계약(목적·독자·자료·출력형식)부터 고정 |
| 리스크 체크 | 근거 없는 주장, 정책 위반, 형식 미준수 여부를 검증 |
| 다음 단계 | 실패 로그를 패턴 템플릿으로 축적해 재발을 줄임 |
분석 근거
- 자사 실측: RanketAI 운영 사이트(ranketai.com)의 서버 요청 로그 24시간 표본(2026-07-22 16:54 ~ 07-23 16:52 KST, 총 17,712 요청). User-Agent 기준으로 AI 봇을 분류 — OpenAI 474건(GPTBot 4 · OAI-SearchBot 80 · ChatGPT-User 390), Anthropic 54건(ClaudeBot 20 · Claude-User 34), Perplexity 60건(PerplexityBot). 단일 사이트·단일 24시간 표본으로, 비율의 일반화가 아니라 로그를 읽는 방법론의 예시로 제시한다.
- 봇 정의: OpenAI·Anthropic·Perplexity 의 공식 크롤러 문서를 2026-07-23 기준으로 확인해 각 봇의 목적(학습 수집 / 검색 색인 / 사용자 요청 시 조회)과 robots.txt 적용 방식을 원문 기준으로 인용.
- 분류 한계: User-Agent 는 위조 가능하므로 본 집계는 공식 UA 문자열 기준 분류다. 위조 UA 트래픽은 브라우저형으로 별도 분류했고 AI 봇 수치에 포함하지 않았다.
핵심 주장과 근거
이 섹션은 본문 핵심 주장과 근거 출처를 1:1로 대응해 빠르게 검증할 수 있도록 구성했습니다. 아래 항목에서 주장과 원문 링크를 함께 확인하세요.
주장:GPTBot 은 생성형 AI 기반 모델 학습에 쓰일 수 있는 콘텐츠를 수집하며, robots.txt 로 차단하면 학습 포함 제외 의사를 표시한다
근거 출처:OpenAI Crawlers 공식 문서주장:OAI-SearchBot 은 ChatGPT 검색 기능의 결과 노출에 쓰이며, 차단 시 ChatGPT 검색 답변에 사이트가 표시되지 않는다
근거 출처:OpenAI Crawlers 공식 문서주장:ChatGPT-User 는 사용자가 질문할 때 웹 페이지를 방문하는 사용자 행동 기반 에이전트로, 자동 크롤링이 아니어서 robots.txt 규칙이 적용되지 않을 수 있다
근거 출처:OpenAI Crawlers 공식 문서주장:Anthropic 도 학습 수집용 ClaudeBot 과 사용자 요청 기반 Claude-User 를 구분해 운영한다
근거 출처:Anthropic 크롤러 공식 문서
외부 인용 링크
아래 링크는 본문 수치와 주장에 직접 사용한 원문 출처입니다. 항목별 원문 맥락을 확인하면 해석 차이를 줄이고 재검증 속도를 높일 수 있습니다.
AI 검색에 내 사이트는 노출되고 있을까?
ChatGPT·Perplexity·Gemini가 내 브랜드를 어떻게 답하는지 무료로 확인해 보세요.
지금 진단 시작 →이어서 읽기
관련 포스트
관련 포스트는 현재 글의 선택 기준을 다른 상황에서 비교 검증할 수 있도록 선별했습니다. 관점을 확장하려면 아래 글을 순서대로 확인해 보세요.
AI 가시성 측정에 빠진 수요 측 데이터 — 고객이 신뢰하는 출처 유형
AI 답변 속 브랜드 가시성 측정은 대부분 공급 측, 즉 내 콘텐츠가 인용됐는지만 확인합니다. 2026년 8월 공개된 103만 건 규모 구매자 페르소나 코퍼스는 수요 측 데이터의 부재를 문제로 제기하며 페르소나마다 신뢰하는 출처 유형을 함께 기록했습니다. 이 축이 실무 측정에 무엇을 더하는지, 합성 코퍼스라는 한계는 무엇인지 정리합니다.
구글 선호 소스(Preferred Sources) — 독자가 지정하는 AI 답변 노출과 한국어 지원 확인
구글이 Preferred Sources를 AI Overviews와 AI Mode로 확장하고 한국어를 포함한 전 언어로 롤아웃했습니다. 독자가 직접 지정한 사이트는 AI 답변에서 라벨과 함께 표시되며, 구글은 지정 이후 클릭이 두 배로 늘어난다고 밝혔습니다. 자격 조건과 설치 방법, 그리고 이 수치를 과신하면 안 되는 이유를 1차 출처로 정리합니다.
웹페이지 10%는 AI가 썼습니다 — 작성 주체 탐지와 GEO 탐지는 다른 질문입니다
Pew Research 가 웹페이지 49만 건을 분석해 2026년 7월 기준 10%, ChatGPT 이후 발행 페이지의 3분의 1 이상에서 AI 작성 흔적을 확인했습니다. 작성 주체를 판별하는 탐지와 GEO 최적화를 판별하는 탐지가 서로 다른 질문에 답한다는 점, 그리고 두 탐지 결과가 AI 답변 인용과 어떻게 연결되는지 정리합니다.
GEO(Generative Engine Optimization) 콘텐츠는 이제 탐지된다 — 웹페이지 8.9%가 이미 최적화 (2026)
AI 답변 인용을 노린 GEO 최적화 콘텐츠를 F1 0.944 정확도로 판별하는 탐지기가 등장했습니다. 실제 웹 10,095개 페이지 중 8.9%, 2026년 수정 페이지의 16.4%가 GEO 최적화로 판정된 연구(GEO-Flag)를 근거로, 탐지 대상이 되는 기계적 최적화와 지속가능한 최적화의 경계를 정리합니다.
AI 검색 9가지 속설 — 1,500만 데이터 포인트가 반박한 것과 남긴 것 (2026)
llms.txt는 97%가 한 번도 조회되지 않았고, 스키마 마크업의 인용 효과는 ±5% 안이었으며, AI 인용 페이지의 37.9%만 검색 상위 10위였습니다. 1,500만 데이터 포인트 규모의 Ahrefs 연구가 반박한 9가지 속설을 지름길·순위·새 승부처 3그룹으로 재구성하고, 속설이 무너진 자리에 남는 실무를 정리합니다.