AI 봇은 무엇을 하러 오는가 — 24시간 로그 실측, 학습 수집 24건 vs 인용 조회 424건
운영 사이트의 24시간 서버 로그를 실측한 결과, AI 봇 트래픽의 대부분은 학습용 수집이 아니라 사용자 질문에 답하기 위한 실시간 인용 조회였다. GPTBot 4건 vs ChatGPT-User 390건. 학습·색인·인용 조회라는 세 가지 봇 유형의 차이, robots.txt 가 각각에 어떻게 다르게 작동하는지, 내 사이트 로그를 읽는 방법까지 실측 데이터로 정리한다.
이 블로그 콘텐츠는 AI 보조 도구를 활용해 초안/구조화를 수행할 수 있으며, RanketAI 편집팀 검수 후 발행됩니다.
핵심 요약: "AI 봇이 내 사이트를 긁어 간다"고 할 때 대부분은 학습용 수집을 떠올립니다. RanketAI 운영 사이트의 24시간 로그를 실측해 보니 반대였습니다 — 학습 수집(GPTBot·ClaudeBot)은 24건, 사용자 질문에 답하려고 그 순간 페이지를 열어 본 인용 조회(ChatGPT-User·Claude-User)는 424건이었습니다. AI 봇 트래픽의 실체는 "학습 데이터로 흡수되는 과정"이 아니라 "답변이 만들어지는 순간에 읽히는 과정" 에 가깝습니다. 이 구분에 따라 robots.txt 설정과 AI 가시성 전략의 방향이 달라집니다.
3줄 요약
- 24시간 동안 총 17,712 요청 중 AI 봇은 588건이었고, 그중 72%(424건)가 실시간 인용 조회, 24%(140건)가 색인, 학습 수집은 4%(24건) 에 그쳤습니다.
- 세 가지 봇은 목적이 다르고 robots.txt 가 작동하는 방식도 다릅니다 — 학습 봇 차단은 학습 제외 의사 표시일 뿐이고, 색인 봇을 차단하면 AI 검색 답변에서 사라지며, 인용 조회 봇은 사용자 행동 기반이라 robots.txt 가 적용되지 않을 수 있습니다.
- 단일 사이트·하루 표본이므로 비율 자체보다 내 사이트 로그에서 세 유형을 구분해 읽는 방법에 주목할 필요가 있습니다.
실측 — 24시간 동안 AI 봇이 남긴 기록
RanketAI 사이트(ranketai.com)의 2026년 7월 22~23일 24시간 요청 로그 17,712건에서 AI 봇 User-Agent 를 분류한 결과입니다.
| 목적 | 봇 (벤더) | 24시간 요청 수 |
|---|---|---|
| 실시간 인용 조회 | ChatGPT-User (OpenAI) | 390 |
| Claude-User (Anthropic) | 34 | |
| AI 검색 색인 | OAI-SearchBot (OpenAI) | 80 |
| PerplexityBot (Perplexity) | 60 | |
| 학습 수집 | ClaudeBot (Anthropic) | 20 |
| GPTBot (OpenAI) | 4 |
같은 기간 전통 검색엔진 봇(Googlebot 148 · bingbot 317 · 네이버 Yeti 66)은 별도로 531건이었습니다. AI 봇만 보면 구도가 선명합니다 — 인용 조회 424 : 색인 140 : 학습 24. OpenAI 와 Anthropic 양쪽 모두에서 사용자 요청 기반 봇이 학습 봇을 크게 앞섰습니다(OpenAI 390 vs 4, Anthropic 34 vs 20).
세 가지 봇 — 공식 정의로 확인하기
이 구분은 RanketAI 의 해석이 아니라 벤더 공식 문서의 구분입니다. OpenAI 는 크롤러 문서에서 세 봇의 목적을 명시합니다(OpenAI Crawlers).
"When users ask ChatGPT or a CustomGPT a question, it may visit a web page with a ChatGPT-User agent." (사용자가 ChatGPT 나 커스텀 GPT 에 질문하면, ChatGPT-User 에이전트로 웹 페이지를 방문할 수 있다) — OpenAI Crawlers 공식 문서
- GPTBot — 기반 모델 학습에 쓰일 수 있는 콘텐츠를 수집합니다. robots.txt 차단은 "학습에 포함하지 말라"는 의사 표시입니다.
- OAI-SearchBot — ChatGPT 검색 기능에서 사이트를 노출하기 위한 색인 봇입니다. 차단하면 ChatGPT 검색 답변에 사이트가 표시되지 않습니다.
- ChatGPT-User — 사용자가 질문한 그 순간 답을 만들기 위해 페이지를 열어 봅니다. 자동 크롤링이 아니라 사용자 행동 기반이어서 robots.txt 규칙이 적용되지 않을 수 있다고 OpenAI 가 직접 명시합니다.
Anthropic 도 같은 구조입니다 — 학습 수집용 ClaudeBot과 사용자 요청 기반 Claude-User 를 구분해 운영합니다. Perplexity 의 PerplexityBot 은 검색 노출용 색인 봇입니다.
해석 — AI 가시성은 "학습되는 것"보다 "읽히는 것"
인용 조회가 72%라는 사실은 AI 가시성의 작동 방식에 대한 통념 하나를 수정합니다. 학습 수집이 중심이라면 내 콘텐츠의 운명은 몇 달 주기의 학습 사이클에 갇힙니다. 그러나 실측에서 지배적인 것은 답변 생성 시점의 실시간 조회였습니다. 이것이 의미하는 바는 셋입니다.
- 지금 고치면 지금 반영될 수 있습니다. 인용 조회는 질문이 들어온 그 순간의 페이지를 읽습니다. 콘텐츠 갱신·구조 개선의 효과가 학습 사이클을 기다리지 않고 다음 질문부터 반영될 수 있는 경로가 열려 있다는 뜻입니다.
- 조회 시점에 읽히지 않으면 그 답변에서 빠집니다. 페이지가 느리거나, 봇이 읽을 수 없는 구조(JS 의존 본문)거나, 방화벽이 봇을 막고 있으면 — 모델이 나를 알고 있어도 그 순간의 인용에서 탈락할 수 있습니다.
- 학습 봇 차단과 AI 노출은 별개 문제입니다. GPTBot 을 차단한 사이트도 ChatGPT-User 의 인용 조회는 계속 받을 수 있습니다(사용자 행동 기반이라 robots.txt 적용 예외 가능 — 공식 문서 기준). 반대로 OAI-SearchBot 을 차단하면 ChatGPT 검색 답변 노출 자체가 사라집니다. "AI 봇 차단"을 한 덩어리로 결정하면 의도와 다른 결과가 나옵니다.
실무 — 내 사이트에서 세 유형을 구분해 읽는 법
- 로그에서 User-Agent 를 세 유형으로 나눠 집계하세요. 호스팅 콘솔의 요청 로그나 서버 액세스 로그에서
GPTBot·ClaudeBot(학습) /OAI-SearchBot·PerplexityBot(색인) /ChatGPT-User·Claude-User(인용 조회)를 나눠 세면 내 사이트의 구도가 나옵니다. 인용 조회가 잡히기 시작했다면 AI 답변의 소스 후보에 들어가 있다는 신호입니다. - robots.txt 는 봇별로 의도를 나눠 설정하세요. 학습 제외가 목적이면 GPTBot·ClaudeBot 만 차단해도 됩니다. AI 검색 노출이 목적이면 OAI-SearchBot·PerplexityBot 은 열어 두어야 합니다. 방화벽·봇 차단 솔루션이 이 봇들을 일괄 차단하고 있지 않은지도 함께 점검 대상입니다.
- 조회 시점에 읽히는 구조인지 진단하세요. 인용 조회 봇은 JS 렌더 없이 본문을 읽는 경우가 많아, 본문·핵심 정보가 초기 HTML 에 노출되는지가 중요합니다. 페이지 구조 진단으로 AI 크롤러 접근성과 구조 신호를 무료로 점검할 수 있고, 실제 AI 답변에서 브랜드가 어떻게 언급되는지는 AI 브랜드 가시성 분석으로 반복 측정해 확인하는 방법이 있습니다.
한 가지를 다시 밝혀 둡니다 — 위 수치는 단일 사이트의 하루 표본입니다. 콘텐츠 성격·트래픽 규모에 따라 비율은 달라질 수 있으므로, 숫자 자체보다 분류 방법과 함의를 참고하는 편이 안전합니다.
FAQ
GPTBot 을 차단하면 ChatGPT 답변에서 사라지나요?▾
아닙니다. GPTBot 차단은 학습 데이터 포함 제외 의사 표시이고, ChatGPT 검색 노출(OAI-SearchBot)과 사용자 질문 시 인용 조회(ChatGPT-User)는 별도 경로입니다. 다만 셋을 모두 차단하면 AI 답변에 노출될 경로가 사실상 사라집니다.
학습 수집이 4건뿐인 이유는 무엇인가요?▾
학습 크롤은 상시 반복이 아니라 저빈도로 도는 수집이고, 이미 수집된 사이트를 매일 다시 긁을 이유도 없습니다. 반면 인용 조회는 사용자 질문이 발생할 때마다 일어나므로, 질문의 근거로 쓰이는 사이트일수록 조회가 잦아집니다 — RanketAI 표본에서 두 수치의 격차가 컸던 배경으로 해석합니다.
인용 조회가 0건이면 어떻게 해야 하나요?▾
먼저 봇이 접근 가능한지(방화벽·robots.txt·JS 의존 구조) 점검하고, 다음으로 AI 가 인용할 만한 형태의 콘텐츠(질문에 정면으로 답하는 비교·정리형)가 있는지 살펴보는 순서를 권합니다. 접근성은 페이지 구조 진단으로, 실제 언급 여부는 AI 브랜드 가시성 분석으로 확인할 수 있습니다.
함께 읽으면 좋은 글
핵심 실행 요약
| 항목 | 실무 기준 |
|---|---|
| 핵심 주제 | AI 봇은 무엇을 하러 오는가 — 24시간 로그 실측, 학습 수집 24건 vs 인용 조회 424건 |
| 적용 대상 | geo 업무에 우선 적용 |
| 우선 조치 | 입력 계약(목적·독자·자료·출력형식)부터 고정 |
| 리스크 체크 | 근거 없는 주장, 정책 위반, 형식 미준수 여부를 검증 |
| 다음 단계 | 실패 로그를 패턴 템플릿으로 축적해 재발을 줄임 |
분석 근거
- 자사 실측: RanketAI 운영 사이트(ranketai.com)의 서버 요청 로그 24시간 표본(2026-07-22 16:54 ~ 07-23 16:52 KST, 총 17,712 요청). User-Agent 기준으로 AI 봇을 분류 — OpenAI 474건(GPTBot 4 · OAI-SearchBot 80 · ChatGPT-User 390), Anthropic 54건(ClaudeBot 20 · Claude-User 34), Perplexity 60건(PerplexityBot). 단일 사이트·단일 24시간 표본으로, 비율의 일반화가 아니라 로그를 읽는 방법론의 예시로 제시한다.
- 봇 정의: OpenAI·Anthropic·Perplexity 의 공식 크롤러 문서를 2026-07-23 기준으로 확인해 각 봇의 목적(학습 수집 / 검색 색인 / 사용자 요청 시 조회)과 robots.txt 적용 방식을 원문 기준으로 인용.
- 분류 한계: User-Agent 는 위조 가능하므로 본 집계는 공식 UA 문자열 기준 분류다. 위조 UA 트래픽은 브라우저형으로 별도 분류했고 AI 봇 수치에 포함하지 않았다.
핵심 주장과 근거
이 섹션은 본문 핵심 주장과 근거 출처를 1:1로 대응해 빠르게 검증할 수 있도록 구성했습니다. 아래 항목에서 주장과 원문 링크를 함께 확인하세요.
주장:GPTBot 은 생성형 AI 기반 모델 학습에 쓰일 수 있는 콘텐츠를 수집하며, robots.txt 로 차단하면 학습 포함 제외 의사를 표시한다
근거 출처:OpenAI Crawlers 공식 문서주장:OAI-SearchBot 은 ChatGPT 검색 기능의 결과 노출에 쓰이며, 차단 시 ChatGPT 검색 답변에 사이트가 표시되지 않는다
근거 출처:OpenAI Crawlers 공식 문서주장:ChatGPT-User 는 사용자가 질문할 때 웹 페이지를 방문하는 사용자 행동 기반 에이전트로, 자동 크롤링이 아니어서 robots.txt 규칙이 적용되지 않을 수 있다
근거 출처:OpenAI Crawlers 공식 문서주장:Anthropic 도 학습 수집용 ClaudeBot 과 사용자 요청 기반 Claude-User 를 구분해 운영한다
근거 출처:Anthropic 크롤러 공식 문서
외부 인용 링크
아래 링크는 본문 수치와 주장에 직접 사용한 원문 출처입니다. 항목별 원문 맥락을 확인하면 해석 차이를 줄이고 재검증 속도를 높일 수 있습니다.
AI 검색에 내 사이트는 노출되고 있을까?
ChatGPT·Perplexity·Gemini가 내 브랜드를 어떻게 답하는지 무료로 확인해 보세요.
지금 진단 시작 →관련 포스트
관련 포스트는 현재 글의 선택 기준을 다른 상황에서 비교 검증할 수 있도록 선별했습니다. 관점을 확장하려면 아래 글을 순서대로 확인해 보세요.
GEO 기법 효과 40%의 조건 — 45편 연구를 검토한 2026 비판적 서베이 분석
GEO 최적화로 AI 답변 가시성이 최대 40% 개선된다는 수치는 소스가 이미 답변 컨텍스트에 포함된 조건에서 측정된 값이다. 2023~2026년 GEO 연구 45편을 증거 등급으로 가려낸 비판적 서베이를 바탕으로, 재현성이 확인된 레버(주제 적합성·컨텍스트 위치)와 역효과 사례(-16%), 그리고 실무에서 무엇을 멈추고 무엇을 측정해야 하는지 정리한다.
AI 인용의 절반은 내 사이트 밖에서 나온다 — 경쟁사만 인용되는 출처를 찾는 소스 갭 공략법
OtterlyAI의 100만 건 인용 분석에서 커뮤니티 플랫폼이 인용의 52.5%를 가져갔다. 내 사이트를 아무리 다듬어도 AI 인용의 절반은 제3자 콘텐츠에서 나온다는 뜻이다. 경쟁사는 인용되는데 나는 없는 제3자 출처(소스 갭)를 도메인 단위로 식별하고, 진입 가능성으로 분류해 공략하는 절차를 국내 실측 사례와 함께 정리한다.
AI 검색은 답만 주고 내보내지 않는다 — ChatGPT 검색 대체 9.4%·외부 클릭 5.2%의 의미 (2026)
ChatGPT Search 접근 확대가 전통 검색 사용을 9.4% 줄였고, ChatGPT 대화에서 외부 사이트 클릭이 발생하는 세션은 5.2%에 그친다는 연구가 나왔다. "콘텐츠를 주면 트래픽을 돌려받는" 웹의 거래가 약해질 때, 방문 수 대신 AI 답변 안 노출을 측정해야 하는 이유와 실무 대응을 정리한다.
경쟁사는 AI 답변에 추천되는데 우리 브랜드만 누락될 때 — 원인 진단과 대응 (2026)
AI에게 "이 분야 최고의 도구는?"이라고 물으면 경쟁사는 추천되는데 우리 브랜드만 누락되는 일이 잦다. 문제해결형 질문에서 AI가 브랜드를 호명하는 빈도와 선택 기준을 2026년 데이터로 살펴보고, 경쟁사 대비 격차를 측정해 좁히는 4단계 대응을 정리한다.
AI 답변 속 브랜드 왜곡 — 오정보·부정 서술 진단과 교정 가이드 (2026)
AI 답변이 브랜드를 사실과 다르게, 오래된 정보로, 또는 부정적으로 서술하는 일이 늘고 있다. AI가 브랜드 정보를 웹의 여러 언급을 근거로 삼는 구조를 이해하고, 측정·출처 추적·권위 소스 정비·재측정의 4단계로 오정보를 교정하는 방법을 정리한다.