본문으로 건너뛰기
목록으로 돌아가기
geo·작성: RanketAI Editorial Team·업데이트: 2026-07-23

AI 봇은 무엇을 하러 오는가 — 24시간 로그 실측, 학습 수집 24건 vs 인용 조회 424건

운영 사이트의 24시간 서버 로그를 실측한 결과, AI 봇 트래픽의 대부분은 학습용 수집이 아니라 사용자 질문에 답하기 위한 실시간 인용 조회였다. GPTBot 4건 vs ChatGPT-User 390건. 학습·색인·인용 조회라는 세 가지 봇 유형의 차이, robots.txt 가 각각에 어떻게 다르게 작동하는지, 내 사이트 로그를 읽는 방법까지 실측 데이터로 정리한다.

AI 보조 작성 · RanketAI 편집팀 검수 후 발행편집 정책 ›

핵심 요약: "AI 봇이 내 사이트를 긁어 간다"고 할 때 대부분은 학습용 수집을 떠올립니다. RanketAI 운영 사이트의 24시간 로그를 실측해 보니 반대였습니다 — 학습 수집(GPTBot·ClaudeBot)은 24건, 사용자 질문에 답하려고 그 순간 페이지를 열어 본 인용 조회(ChatGPT-User·Claude-User)는 424건이었습니다. AI 봇 트래픽의 실체는 "학습 데이터로 흡수되는 과정"이 아니라 "답변이 만들어지는 순간에 읽히는 과정" 에 가깝습니다. 이 구분에 따라 robots.txt 설정과 AI 가시성 전략의 방향이 달라집니다.


3줄 요약

  • 24시간 동안 총 17,712 요청 중 AI 봇은 588건이었고, 그중 72%(424건)가 실시간 인용 조회, 24%(140건)가 AI 검색 색인, 학습 수집은 4%(24건) 에 그쳤습니다.
  • 세 가지 봇은 목적이 다르고 robots.txt 가 작동하는 방식도 다릅니다학습 봇 차단은 학습 제외 의사 표시일 뿐이고, 색인 봇을 차단하면 AI 검색 답변에서 사라지며, 인용 조회 봇은 사용자 행동 기반이라 robots.txt 가 적용되지 않을 수 있습니다.
  • 단일 사이트·하루 표본이므로 비율 자체보다 내 사이트 로그에서 세 유형을 구분해 읽는 방법에 주목할 필요가 있습니다.

실측 — 24시간 동안 AI 봇이 남긴 기록

RanketAI 사이트(ranketai.com)의 2026년 7월 22~23일 24시간 요청 로그 17,712건에서 AI 봇 User-Agent 를 분류한 결과입니다.

목적 봇 (벤더) 24시간 요청 수
실시간 인용 조회 ChatGPT-User (OpenAI) 390
Claude-User (Anthropic) 34
AI 검색 색인 OAI-SearchBot (OpenAI) 80
PerplexityBot (Perplexity) 60
학습 수집 ClaudeBot (Anthropic) 20
GPTBot (OpenAI) 4

같은 기간 전통 검색엔진 봇(Googlebot 148 · bingbot 317 · 네이버 Yeti 66)은 별도로 531건이었습니다. AI 봇만 보면 구도가 선명합니다 — 인용 조회 424 : 색인 140 : 학습 24. OpenAI 와 Anthropic 양쪽 모두에서 사용자 요청 기반 봇이 학습 봇을 크게 앞섰습니다(OpenAI 390 vs 4, Anthropic 34 vs 20).

세 가지 봇 — 공식 정의로 확인하기

이 구분은 RanketAI 의 해석이 아니라 벤더 공식 문서의 구분입니다. OpenAI 는 크롤러 문서에서 세 봇의 목적을 명시합니다(OpenAI Crawlers).

"When users ask ChatGPT or a CustomGPT a question, it may visit a web page with a ChatGPT-User agent." (사용자가 ChatGPT 나 커스텀 GPT 에 질문하면, ChatGPT-User 에이전트로 웹 페이지를 방문할 수 있다) — OpenAI Crawlers 공식 문서

  • GPTBot — 기반 모델 학습에 쓰일 수 있는 콘텐츠를 수집합니다. robots.txt 차단은 "학습에 포함하지 말라"는 의사 표시입니다.
  • OAI-SearchBot — ChatGPT 검색 기능에서 사이트를 노출하기 위한 색인 봇입니다. 차단하면 ChatGPT 검색 답변에 사이트가 표시되지 않습니다.
  • ChatGPT-User — 사용자가 질문한 그 순간 답을 만들기 위해 페이지를 열어 봅니다. 자동 크롤링이 아니라 사용자 행동 기반이어서 robots.txt 규칙이 적용되지 않을 수 있다고 OpenAI 가 직접 명시합니다.

Anthropic 도 같은 구조입니다 — 학습 수집용 ClaudeBot과 사용자 요청 기반 Claude-User 를 구분해 운영합니다. Perplexity 의 PerplexityBot 은 검색 노출용 색인 봇입니다.

해석 — AI 가시성은 "학습되는 것"보다 "읽히는 것"

인용 조회가 72%라는 사실은 AI 가시성의 작동 방식에 대한 통념 하나를 수정합니다. 학습 수집이 중심이라면 내 콘텐츠의 운명은 몇 달 주기의 학습 사이클에 갇힙니다. 그러나 실측에서 지배적인 것은 답변 생성 시점의 실시간 조회였습니다. 이것이 의미하는 바는 셋입니다.

  1. 지금 고치면 지금 반영될 수 있습니다. 인용 조회는 질문이 들어온 그 순간의 페이지를 읽습니다. 콘텐츠 갱신·구조 개선의 효과가 학습 사이클을 기다리지 않고 다음 질문부터 반영될 수 있는 경로가 열려 있다는 뜻입니다.
  2. 조회 시점에 읽히지 않으면 그 답변에서 빠집니다. 페이지가 느리거나, 봇이 읽을 수 없는 구조(JS 의존 본문)거나, 방화벽이 봇을 막고 있으면 — 모델이 나를 알고 있어도 그 순간의 인용에서 탈락할 수 있습니다.
  3. 학습 봇 차단과 AI 노출은 별개 문제입니다. GPTBot 을 차단한 사이트도 ChatGPT-User 의 인용 조회는 계속 받을 수 있습니다(사용자 행동 기반이라 robots.txt 적용 예외 가능 — 공식 문서 기준). 반대로 OAI-SearchBot 을 차단하면 ChatGPT 검색 답변 노출 자체가 사라집니다. "AI 봇 차단"을 한 덩어리로 결정하면 의도와 다른 결과가 나옵니다.

실무 — 내 사이트에서 세 유형을 구분해 읽는 법

  1. 로그에서 User-Agent 를 세 유형으로 나눠 집계하세요. 호스팅 콘솔의 요청 로그나 서버 액세스 로그에서 GPTBot·ClaudeBot(학습) / OAI-SearchBot·PerplexityBot(색인) / ChatGPT-User·Claude-User(인용 조회)를 나눠 세면 내 사이트의 구도가 나옵니다. 인용 조회가 잡히기 시작했다면 AI 답변의 소스 후보에 들어가 있다는 신호입니다.
  2. robots.txt 는 봇별로 의도를 나눠 설정하세요. 학습 제외가 목적이면 GPTBot·ClaudeBot 만 차단해도 됩니다. AI 검색 노출이 목적이면 OAI-SearchBot·PerplexityBot 은 열어 두어야 합니다. 방화벽·봇 차단 솔루션이 이 봇들을 일괄 차단하고 있지 않은지도 함께 점검 대상입니다.
  3. 조회 시점에 읽히는 구조인지 진단하세요. 인용 조회 봇은 JS 렌더 없이 본문을 읽는 경우가 많아, 본문·핵심 정보가 초기 HTML 에 노출되는지가 중요합니다. 페이지 구조 진단으로 AI 크롤러 접근성과 구조 신호를 무료로 점검할 수 있고, 실제 AI 답변에서 브랜드가 어떻게 언급되는지는 AI 브랜드 가시성 분석으로 반복 측정해 확인하는 방법이 있습니다.

한 가지를 다시 밝혀 둡니다 — 위 수치는 단일 사이트의 하루 표본입니다. 콘텐츠 성격·트래픽 규모에 따라 비율은 달라질 수 있으므로, 숫자 자체보다 분류 방법과 함의를 참고하는 편이 안전합니다.

FAQ

GPTBot 을 차단하면 ChatGPT 답변에서 사라지나요?

아닙니다. GPTBot 차단은 학습 데이터 포함 제외 의사 표시이고, ChatGPT 검색 노출(OAI-SearchBot)과 사용자 질문 시 인용 조회(ChatGPT-User)는 별도 경로입니다. 다만 셋을 모두 차단하면 AI 답변에 노출될 경로가 사실상 사라집니다.

학습 수집이 4건뿐인 이유는 무엇인가요?

학습 크롤은 상시 반복이 아니라 저빈도로 도는 수집이고, 이미 수집된 사이트를 매일 다시 긁을 이유도 없습니다. 반면 인용 조회는 사용자 질문이 발생할 때마다 일어나므로, 질문의 근거로 쓰이는 사이트일수록 조회가 잦아집니다 — RanketAI 표본에서 두 수치의 격차가 컸던 배경으로 해석합니다.

인용 조회가 0건이면 어떻게 해야 하나요?

먼저 봇이 접근 가능한지(방화벽·robots.txt·JS 의존 구조) 점검하고, 다음으로 AI 가 인용할 만한 형태의 콘텐츠(질문에 정면으로 답하는 비교·정리형)가 있는지 살펴보는 순서를 권합니다. 접근성은 페이지 구조 진단으로, 실제 언급 여부는 AI 브랜드 가시성 분석으로 확인할 수 있습니다.

함께 읽으면 좋은 글

핵심 실행 요약

항목실무 기준
핵심 주제AI 봇은 무엇을 하러 오는가 — 24시간 로그 실측, 학습 수집 24건 vs 인용 조회 424건
적용 대상geo 업무에 우선 적용
우선 조치입력 계약(목적·독자·자료·출력형식)부터 고정
리스크 체크근거 없는 주장, 정책 위반, 형식 미준수 여부를 검증
다음 단계실패 로그를 패턴 템플릿으로 축적해 재발을 줄임

분석 근거

  • 자사 실측: RanketAI 운영 사이트(ranketai.com)의 서버 요청 로그 24시간 표본(2026-07-22 16:54 ~ 07-23 16:52 KST, 총 17,712 요청). User-Agent 기준으로 AI 봇을 분류 — OpenAI 474건(GPTBot 4 · OAI-SearchBot 80 · ChatGPT-User 390), Anthropic 54건(ClaudeBot 20 · Claude-User 34), Perplexity 60건(PerplexityBot). 단일 사이트·단일 24시간 표본으로, 비율의 일반화가 아니라 로그를 읽는 방법론의 예시로 제시한다.
  • 봇 정의: OpenAI·Anthropic·Perplexity 의 공식 크롤러 문서를 2026-07-23 기준으로 확인해 각 봇의 목적(학습 수집 / 검색 색인 / 사용자 요청 시 조회)과 robots.txt 적용 방식을 원문 기준으로 인용.
  • 분류 한계: User-Agent 는 위조 가능하므로 본 집계는 공식 UA 문자열 기준 분류다. 위조 UA 트래픽은 브라우저형으로 별도 분류했고 AI 봇 수치에 포함하지 않았다.

핵심 주장과 근거

이 섹션은 본문 핵심 주장과 근거 출처를 1:1로 대응해 빠르게 검증할 수 있도록 구성했습니다. 아래 항목에서 주장과 원문 링크를 함께 확인하세요.

외부 인용 링크

아래 링크는 본문 수치와 주장에 직접 사용한 원문 출처입니다. 항목별 원문 맥락을 확인하면 해석 차이를 줄이고 재검증 속도를 높일 수 있습니다.

AI 검색에 내 사이트는 노출되고 있을까?

ChatGPT·Perplexity·Gemini가 내 브랜드를 어떻게 답하는지 무료로 확인해 보세요.

지금 진단 시작 →

이어서 읽기

관련 포스트

관련 포스트는 현재 글의 선택 기준을 다른 상황에서 비교 검증할 수 있도록 선별했습니다. 관점을 확장하려면 아래 글을 순서대로 확인해 보세요.

AI 가시성 측정에 빠진 수요 측 데이터 — 고객이 신뢰하는 출처 유형

AI 답변 속 브랜드 가시성 측정은 대부분 공급 측, 즉 내 콘텐츠가 인용됐는지만 확인합니다. 2026년 8월 공개된 103만 건 규모 구매자 페르소나 코퍼스는 수요 측 데이터의 부재를 문제로 제기하며 페르소나마다 신뢰하는 출처 유형을 함께 기록했습니다. 이 축이 실무 측정에 무엇을 더하는지, 합성 코퍼스라는 한계는 무엇인지 정리합니다.

2026-09-06

구글 선호 소스(Preferred Sources) — 독자가 지정하는 AI 답변 노출과 한국어 지원 확인

구글이 Preferred Sources를 AI Overviews와 AI Mode로 확장하고 한국어를 포함한 전 언어로 롤아웃했습니다. 독자가 직접 지정한 사이트는 AI 답변에서 라벨과 함께 표시되며, 구글은 지정 이후 클릭이 두 배로 늘어난다고 밝혔습니다. 자격 조건과 설치 방법, 그리고 이 수치를 과신하면 안 되는 이유를 1차 출처로 정리합니다.

2026-09-02

웹페이지 10%는 AI가 썼습니다 — 작성 주체 탐지와 GEO 탐지는 다른 질문입니다

Pew Research 가 웹페이지 49만 건을 분석해 2026년 7월 기준 10%, ChatGPT 이후 발행 페이지의 3분의 1 이상에서 AI 작성 흔적을 확인했습니다. 작성 주체를 판별하는 탐지와 GEO 최적화를 판별하는 탐지가 서로 다른 질문에 답한다는 점, 그리고 두 탐지 결과가 AI 답변 인용과 어떻게 연결되는지 정리합니다.

2026-08-25

GEO(Generative Engine Optimization) 콘텐츠는 이제 탐지된다 — 웹페이지 8.9%가 이미 최적화 (2026)

AI 답변 인용을 노린 GEO 최적화 콘텐츠를 F1 0.944 정확도로 판별하는 탐지기가 등장했습니다. 실제 웹 10,095개 페이지 중 8.9%, 2026년 수정 페이지의 16.4%가 GEO 최적화로 판정된 연구(GEO-Flag)를 근거로, 탐지 대상이 되는 기계적 최적화와 지속가능한 최적화의 경계를 정리합니다.

2026-08-23

AI 검색 9가지 속설 — 1,500만 데이터 포인트가 반박한 것과 남긴 것 (2026)

llms.txt는 97%가 한 번도 조회되지 않았고, 스키마 마크업의 인용 효과는 ±5% 안이었으며, AI 인용 페이지의 37.9%만 검색 상위 10위였습니다. 1,500만 데이터 포인트 규모의 Ahrefs 연구가 반박한 9가지 속설을 지름길·순위·새 승부처 3그룹으로 재구성하고, 속설이 무너진 자리에 남는 실무를 정리합니다.

2026-08-20