GPTBot·OAI-SearchBot·ChatGPT-User 차이와 robots.txt
AI 회사의 로봇은 학습용·검색용·사용자 요청용으로 나뉩니다. 병원 홈페이지에서 무엇을 허용하고 무엇을 선택할지 robots.txt 예시와 함께 설명합니다.
- 같은 회사의 로봇이라도 역할이 다릅니다. 학습용을 막는 것과 검색용을 막는 것은 결과가 다릅니다.
- AI 검색 답변에 병원이 후보로 오르려면 검색용 로봇(OAI-SearchBot, Claude-SearchBot, PerplexityBot 등)을 허용하는 것이 기본입니다.
- robots.txt를 열어 둬도 CDN·방화벽이 막고 있으면 소용이 없으므로 두 곳을 함께 확인해야 합니다.
OpenAI 로봇 세 가지
OpenAI는 용도별로 로봇 이름을 나눠 공개하고 있습니다.
- GPTBot — 모델 학습 자료 수집용입니다. 막아도 ChatGPT 검색 답변 노출과는 별개로 다뤄집니다.
- OAI-SearchBot — ChatGPT 검색 기능에 보여 줄 사이트를 수집합니다. OpenAI는 이 로봇을 막은 사이트는 ChatGPT 검색 답변에 표시되지 않는다고 안내합니다.
- ChatGPT-User — 사용자가 대화 중 특정 페이지를 열어 달라고 할 때처럼 사람의 요청으로 방문합니다. OpenAI는 이 방문에는 robots.txt 규칙이 적용되지 않을 수 있다고 밝히고 있습니다.
다른 AI 서비스의 로봇
- Anthropic(Claude) — ClaudeBot(학습), Claude-SearchBot(검색), Claude-User(사용자 요청). Anthropic은 세 로봇 모두 robots.txt를 따른다고 안내합니다.
- Perplexity — PerplexityBot(검색 색인), Perplexity-User(사용자 요청). 사용자 요청 방문은 robots.txt 판정 대상이 아니라고 안내합니다.
- Google — 구글 검색과 AI 개요(AI Overviews)는 일반 Googlebot 색인을 씁니다. Google-Extended는 Gemini 앱 등에서 사이트 내용을 쓰는 것을 제어하는 별도 토큰이며, 구글은 이 설정이 검색 순위와는 무관하다고 밝히고 있습니다.
병원 홈페이지에 권하는 기본 설정
검색용 로봇은 허용하고, 학습용 로봇은 병원 방침에 따라 선택하는 구성이 일반적입니다. 아래는 예시이며, 관리자 페이지·회원 영역처럼 공개하면 안 되는 경로는 별도로 막아야 합니다(robots.txt는 보안 장치가 아니므로 로그인 보호가 먼저입니다).
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
# 학습용 로봇은 병원 방침에 따라 선택
User-agent: GPTBot
Disallow: /
User-agent: *
Disallow: /admin/
Sitemap: https://병원주소/sitemap.xmlrobots.txt보다 먼저 막는 곳: CDN
Cloudflare는 2025년 7월 신규 도메인부터 AI 로봇을 기본 차단하기 시작했고, 2026년 9월 15일부터는 무료 요금제 전체로 넓힌다고 공지했습니다(출처: Cloudflare 블로그·AI Crawl Control 문서). 이런 설정은 robots.txt에 나타나지 않습니다. 제작사나 호스팅 업체에 'AI 봇 차단 설정이 켜져 있는지'를 확인해 달라고 요청하세요.
이 글은 2026-09-13 기준으로 확인한 내용입니다. 검색·AI 서비스의 정책과 법령은 바뀔 수 있으며, 법령 해석이 필요한 사안은 법률 자문이나 해당 기관 안내를 확인하세요.