본문으로 건너뛰기
목록으로 돌아가기
geo·작성: RanketAI Editorial Team·업데이트: 2026-07-23

AI 봇은 무엇을 하러 오는가 — 24시간 로그 실측, 학습 수집 24건 vs 인용 조회 424건

운영 사이트의 24시간 서버 로그를 실측한 결과, AI 봇 트래픽의 대부분은 학습용 수집이 아니라 사용자 질문에 답하기 위한 실시간 인용 조회였다. GPTBot 4건 vs ChatGPT-User 390건. 학습·색인·인용 조회라는 세 가지 봇 유형의 차이, robots.txt 가 각각에 어떻게 다르게 작동하는지, 내 사이트 로그를 읽는 방법까지 실측 데이터로 정리한다.

AI 보조 작성 · 편집팀 검수

이 블로그 콘텐츠는 AI 보조 도구를 활용해 초안/구조화를 수행할 수 있으며, RanketAI 편집팀 검수 후 발행됩니다.

핵심 요약: "AI 봇이 내 사이트를 긁어 간다"고 할 때 대부분은 학습용 수집을 떠올립니다. RanketAI 운영 사이트의 24시간 로그를 실측해 보니 반대였습니다 — 학습 수집(GPTBot·ClaudeBot)은 24건, 사용자 질문에 답하려고 그 순간 페이지를 열어 본 인용 조회(ChatGPT-User·Claude-User)는 424건이었습니다. AI 봇 트래픽의 실체는 "학습 데이터로 흡수되는 과정"이 아니라 "답변이 만들어지는 순간에 읽히는 과정" 에 가깝습니다. 이 구분에 따라 robots.txt 설정과 AI 가시성 전략의 방향이 달라집니다.


3줄 요약

  • 24시간 동안 총 17,712 요청 중 AI 봇은 588건이었고, 그중 72%(424건)가 실시간 인용 조회, 24%(140건)가 AI 검색 색인, 학습 수집은 4%(24건) 에 그쳤습니다.
  • 세 가지 봇은 목적이 다르고 robots.txt 가 작동하는 방식도 다릅니다학습 봇 차단은 학습 제외 의사 표시일 뿐이고, 색인 봇을 차단하면 AI 검색 답변에서 사라지며, 인용 조회 봇은 사용자 행동 기반이라 robots.txt 가 적용되지 않을 수 있습니다.
  • 단일 사이트·하루 표본이므로 비율 자체보다 내 사이트 로그에서 세 유형을 구분해 읽는 방법에 주목할 필요가 있습니다.

실측 — 24시간 동안 AI 봇이 남긴 기록

RanketAI 사이트(ranketai.com)의 2026년 7월 22~23일 24시간 요청 로그 17,712건에서 AI 봇 User-Agent 를 분류한 결과입니다.

목적 봇 (벤더) 24시간 요청 수
실시간 인용 조회 ChatGPT-User (OpenAI) 390
Claude-User (Anthropic) 34
AI 검색 색인 OAI-SearchBot (OpenAI) 80
PerplexityBot (Perplexity) 60
학습 수집 ClaudeBot (Anthropic) 20
GPTBot (OpenAI) 4

같은 기간 전통 검색엔진 봇(Googlebot 148 · bingbot 317 · 네이버 Yeti 66)은 별도로 531건이었습니다. AI 봇만 보면 구도가 선명합니다 — 인용 조회 424 : 색인 140 : 학습 24. OpenAI 와 Anthropic 양쪽 모두에서 사용자 요청 기반 봇이 학습 봇을 크게 앞섰습니다(OpenAI 390 vs 4, Anthropic 34 vs 20).

세 가지 봇 — 공식 정의로 확인하기

이 구분은 RanketAI 의 해석이 아니라 벤더 공식 문서의 구분입니다. OpenAI 는 크롤러 문서에서 세 봇의 목적을 명시합니다(OpenAI Crawlers).

"When users ask ChatGPT or a CustomGPT a question, it may visit a web page with a ChatGPT-User agent." (사용자가 ChatGPT 나 커스텀 GPT 에 질문하면, ChatGPT-User 에이전트로 웹 페이지를 방문할 수 있다) — OpenAI Crawlers 공식 문서

  • GPTBot — 기반 모델 학습에 쓰일 수 있는 콘텐츠를 수집합니다. robots.txt 차단은 "학습에 포함하지 말라"는 의사 표시입니다.
  • OAI-SearchBot — ChatGPT 검색 기능에서 사이트를 노출하기 위한 색인 봇입니다. 차단하면 ChatGPT 검색 답변에 사이트가 표시되지 않습니다.
  • ChatGPT-User — 사용자가 질문한 그 순간 답을 만들기 위해 페이지를 열어 봅니다. 자동 크롤링이 아니라 사용자 행동 기반이어서 robots.txt 규칙이 적용되지 않을 수 있다고 OpenAI 가 직접 명시합니다.

Anthropic 도 같은 구조입니다 — 학습 수집용 ClaudeBot과 사용자 요청 기반 Claude-User 를 구분해 운영합니다. Perplexity 의 PerplexityBot 은 검색 노출용 색인 봇입니다.

해석 — AI 가시성은 "학습되는 것"보다 "읽히는 것"

인용 조회가 72%라는 사실은 AI 가시성의 작동 방식에 대한 통념 하나를 수정합니다. 학습 수집이 중심이라면 내 콘텐츠의 운명은 몇 달 주기의 학습 사이클에 갇힙니다. 그러나 실측에서 지배적인 것은 답변 생성 시점의 실시간 조회였습니다. 이것이 의미하는 바는 셋입니다.

  1. 지금 고치면 지금 반영될 수 있습니다. 인용 조회는 질문이 들어온 그 순간의 페이지를 읽습니다. 콘텐츠 갱신·구조 개선의 효과가 학습 사이클을 기다리지 않고 다음 질문부터 반영될 수 있는 경로가 열려 있다는 뜻입니다.
  2. 조회 시점에 읽히지 않으면 그 답변에서 빠집니다. 페이지가 느리거나, 봇이 읽을 수 없는 구조(JS 의존 본문)거나, 방화벽이 봇을 막고 있으면 — 모델이 나를 알고 있어도 그 순간의 인용에서 탈락할 수 있습니다.
  3. 학습 봇 차단과 AI 노출은 별개 문제입니다. GPTBot 을 차단한 사이트도 ChatGPT-User 의 인용 조회는 계속 받을 수 있습니다(사용자 행동 기반이라 robots.txt 적용 예외 가능 — 공식 문서 기준). 반대로 OAI-SearchBot 을 차단하면 ChatGPT 검색 답변 노출 자체가 사라집니다. "AI 봇 차단"을 한 덩어리로 결정하면 의도와 다른 결과가 나옵니다.

실무 — 내 사이트에서 세 유형을 구분해 읽는 법

  1. 로그에서 User-Agent 를 세 유형으로 나눠 집계하세요. 호스팅 콘솔의 요청 로그나 서버 액세스 로그에서 GPTBot·ClaudeBot(학습) / OAI-SearchBot·PerplexityBot(색인) / ChatGPT-User·Claude-User(인용 조회)를 나눠 세면 내 사이트의 구도가 나옵니다. 인용 조회가 잡히기 시작했다면 AI 답변의 소스 후보에 들어가 있다는 신호입니다.
  2. robots.txt 는 봇별로 의도를 나눠 설정하세요. 학습 제외가 목적이면 GPTBot·ClaudeBot 만 차단해도 됩니다. AI 검색 노출이 목적이면 OAI-SearchBot·PerplexityBot 은 열어 두어야 합니다. 방화벽·봇 차단 솔루션이 이 봇들을 일괄 차단하고 있지 않은지도 함께 점검 대상입니다.
  3. 조회 시점에 읽히는 구조인지 진단하세요. 인용 조회 봇은 JS 렌더 없이 본문을 읽는 경우가 많아, 본문·핵심 정보가 초기 HTML 에 노출되는지가 중요합니다. 페이지 구조 진단으로 AI 크롤러 접근성과 구조 신호를 무료로 점검할 수 있고, 실제 AI 답변에서 브랜드가 어떻게 언급되는지는 AI 브랜드 가시성 분석으로 반복 측정해 확인하는 방법이 있습니다.

한 가지를 다시 밝혀 둡니다 — 위 수치는 단일 사이트의 하루 표본입니다. 콘텐츠 성격·트래픽 규모에 따라 비율은 달라질 수 있으므로, 숫자 자체보다 분류 방법과 함의를 참고하는 편이 안전합니다.

FAQ

GPTBot 을 차단하면 ChatGPT 답변에서 사라지나요?

아닙니다. GPTBot 차단은 학습 데이터 포함 제외 의사 표시이고, ChatGPT 검색 노출(OAI-SearchBot)과 사용자 질문 시 인용 조회(ChatGPT-User)는 별도 경로입니다. 다만 셋을 모두 차단하면 AI 답변에 노출될 경로가 사실상 사라집니다.

학습 수집이 4건뿐인 이유는 무엇인가요?

학습 크롤은 상시 반복이 아니라 저빈도로 도는 수집이고, 이미 수집된 사이트를 매일 다시 긁을 이유도 없습니다. 반면 인용 조회는 사용자 질문이 발생할 때마다 일어나므로, 질문의 근거로 쓰이는 사이트일수록 조회가 잦아집니다 — RanketAI 표본에서 두 수치의 격차가 컸던 배경으로 해석합니다.

인용 조회가 0건이면 어떻게 해야 하나요?

먼저 봇이 접근 가능한지(방화벽·robots.txt·JS 의존 구조) 점검하고, 다음으로 AI 가 인용할 만한 형태의 콘텐츠(질문에 정면으로 답하는 비교·정리형)가 있는지 살펴보는 순서를 권합니다. 접근성은 페이지 구조 진단으로, 실제 언급 여부는 AI 브랜드 가시성 분석으로 확인할 수 있습니다.

함께 읽으면 좋은 글

핵심 실행 요약

항목실무 기준
핵심 주제AI 봇은 무엇을 하러 오는가 — 24시간 로그 실측, 학습 수집 24건 vs 인용 조회 424건
적용 대상geo 업무에 우선 적용
우선 조치입력 계약(목적·독자·자료·출력형식)부터 고정
리스크 체크근거 없는 주장, 정책 위반, 형식 미준수 여부를 검증
다음 단계실패 로그를 패턴 템플릿으로 축적해 재발을 줄임

분석 근거

  • 자사 실측: RanketAI 운영 사이트(ranketai.com)의 서버 요청 로그 24시간 표본(2026-07-22 16:54 ~ 07-23 16:52 KST, 총 17,712 요청). User-Agent 기준으로 AI 봇을 분류 — OpenAI 474건(GPTBot 4 · OAI-SearchBot 80 · ChatGPT-User 390), Anthropic 54건(ClaudeBot 20 · Claude-User 34), Perplexity 60건(PerplexityBot). 단일 사이트·단일 24시간 표본으로, 비율의 일반화가 아니라 로그를 읽는 방법론의 예시로 제시한다.
  • 봇 정의: OpenAI·Anthropic·Perplexity 의 공식 크롤러 문서를 2026-07-23 기준으로 확인해 각 봇의 목적(학습 수집 / 검색 색인 / 사용자 요청 시 조회)과 robots.txt 적용 방식을 원문 기준으로 인용.
  • 분류 한계: User-Agent 는 위조 가능하므로 본 집계는 공식 UA 문자열 기준 분류다. 위조 UA 트래픽은 브라우저형으로 별도 분류했고 AI 봇 수치에 포함하지 않았다.

핵심 주장과 근거

이 섹션은 본문 핵심 주장과 근거 출처를 1:1로 대응해 빠르게 검증할 수 있도록 구성했습니다. 아래 항목에서 주장과 원문 링크를 함께 확인하세요.

외부 인용 링크

아래 링크는 본문 수치와 주장에 직접 사용한 원문 출처입니다. 항목별 원문 맥락을 확인하면 해석 차이를 줄이고 재검증 속도를 높일 수 있습니다.

AI 검색에 내 사이트는 노출되고 있을까?

ChatGPT·Perplexity·Gemini가 내 브랜드를 어떻게 답하는지 무료로 확인해 보세요.

지금 진단 시작 →

관련 포스트

관련 포스트는 현재 글의 선택 기준을 다른 상황에서 비교 검증할 수 있도록 선별했습니다. 관점을 확장하려면 아래 글을 순서대로 확인해 보세요.

AI는 검색하기 전에 후보를 정한다 — 한국 12개 카테고리 검색어 실측

AI 검색은 사용자 질문을 그대로 검색하지 않습니다. 검색 실행 전에 스스로 검색어를 만들고, 어떤 분야에서는 그 검색어에 사용자가 입력하지 않은 브랜드 이름을 포함시킵니다. 한국 12개 카테고리에서 실제 실행된 검색어 72건을 수집해, 어떤 시장에서 후보가 이미 정해져 있고 어떤 시장에서 아직 정해지지 않았는지 정리했습니다.

2026-08-17

전월 대비 올랐다는 착각 — 재측정 변동폭이 월간 변화보다 컸다 (2026년 8월 실측)

한국 B2B SaaS 12곳을 20일 간격으로 다시 측정하고, 같은 날 두 번 측정한 변동폭과 비교했습니다. 월간 개별 점수 변화의 중앙값은 5.5점, 같은 날 재측정 변동의 중앙값은 6점이었습니다. AI 가시성 리포트에서 무엇을 추세로 읽고 무엇을 노이즈로 버려야 하는지 실측 데이터로 정리합니다.

2026-08-12

질문 하나가 검색 12개가 된다 — 쿼리 팬아웃 시대의 하위 질문 커버리지 설계 (2026)

Google 검색 엔지니어링 디렉터가 공식 확인한 수치 — AI Mode는 검색 1회에 기본 12개의 하위 검색을 실행합니다. 노출이 사용자가 친 질문이 아니라 보이지 않는 하위 질문에서 결정되는 구조가 무엇을 바꾸는지, 하위 질문이 갈라지는 1차 분기·2차 분기 구조와 함께 브랜드 관점에서 정리합니다.

2026-08-06

Perplexity는 어떤 질문에도 웹 검색을 생략하지 않는다 — 응답 스트림 관찰로 본 인용 선택 구조 (2026)

Perplexity의 응답 스트림을 관찰한 분석에서 7개 질의 전부 웹 검색이 실행됐고, 회수된 소스 10~15건 가운데 실제 인용은 5~9건에 그쳤습니다. 지역 질문은 장소 정보, 사용법 질문은 영상, 뉴스는 1차 발표처로 인용 대상이 결정되는 구조를 정리하고, 국내 브랜드가 어느 채널부터 정비해야 하는지까지 다룹니다.

2026-07-31

AI 검색 수요의 89%는 명확한 소유 브랜드가 없다 — 1,094개 카테고리 실측으로 본 선점과 고착 (2026)

Kevin Indig가 ChatGPT 답변에서 미국 1,094개 카테고리를 6개월간 추적한 결과, 명확한 소유 브랜드가 있는 카테고리는 15.2%뿐이고 추정 수요의 89.3%는 소유자 없는 카테고리에 놓여 있었다. 반면 한 번 차지한 소유권은 90.4% 확률로 유지된다. 인용과 호명이 어긋나는 이유, 그리고 카테고리 선점을 위한 실무 순서를 정리한다.

2026-07-30