가독성 진단AI 가독성이란지식그래프 참여GEO컨설팅요금안내연구 취지디봇GEO+문의하기
← AI 검색 인사이트

AI봇이 우리 사이트에 들어올 수 있나?

2026-09-10·디비나라 AI Lab

ChatGPT·Claude·퍼플렉시티는 각자의 크롤러로 웹을 읽습니다. 그 크롤러가 robots.txt에 막혀 있으면 다른 걸 아무리 잘 갖춰도 AI 답변에 등장할 수 없습니다. 확인하는 법과 고치는 법을 정리했습니다.


AI가 어떤 회사를 답변에 인용하려면, 먼저 그 회사 홈페이지를 읽을 수 있어야 합니다. 그리고 읽을 수 있는지 없는지를 정하는 파일이 사이트 최상단의 robots.txt 한 장입니다.

이 글은 AI 가독성 8지표 중 첫 번째인 AI봇 접근을 다룹니다. 순서상 첫 번째인 데는 이유가 있습니다.

왜 이게 가장 중요한가?

나머지 일곱 개 지표는 정도의 문제입니다. 구조화 데이터가 부족하면 덜 이해되고, 본문이 짧으면 인용할 재료가 적어집니다. 나쁘긴 해도 0은 아닙니다.

그런데 봇 접근은 0 아니면 1입니다. 크롤러가 문 앞에서 막히면 그 안에 무엇이 있든 상관이 없습니다. 스키마를 완벽하게 넣어도, 본문을 1만 자 써도, AI는 그것을 본 적이 없습니다.

그래서 우리는 이 지표에 8개 중 가장 큰 비중을 둡니다. 다른 걸 손대기 전에 여기부터 확인하는 게 맞습니다.

어떤 봇을 봐야 하나?

주요 AI 서비스는 각자 다른 이름의 크롤러를 씁니다. 그리고 중요한 건 — 한 회사가 여러 개를 운영하고, 그 역할이 서로 다르다는 점입니다.

세 회사 모두 학습 / 검색 노출 / 사용자 요청 세 갈래로 나눠 놓았습니다.

역할OpenAIAnthropicPerplexityGoogle
학습용 수집GPTBotClaudeBotGoogle-Extended
검색 노출용 색인OAI-SearchBotClaude-SearchBotPerplexityBotGooglebot
사용자 요청 시 방문ChatGPT-UserClaude-UserPerplexity-User

이 표에 없는 것 중 알아둘 만한 것:

  • CCBot — Common Crawl. 공개 크롤 데이터셋이고 여러 모델이 여기서 학습합니다.
  • OAI-AdsBot — ChatGPT에 광고로 제출된 페이지의 안전성 검증용. 콘텐츠 수집과는 목적이 다릅니다.

역할이 나뉘어 있다는 사실이 이 글에서 가장 실용적인 부분입니다. 뒤에서 다시 다룹니다.

사용자 요청 봇도 robots.txt로 막을 수 있나?

대체로 안 됩니다. 표 맨 아랫줄(ChatGPT-User·Claude-User·Perplexity-User)은 사람이 질문하면서 그 링크를 직접 요청한 상황에 움직입니다. 자동 수집이 아니라 사용자의 행동이라, robots.txt 규칙이 적용되지 않을 수 있습니다.

퍼플렉시티는 공식 문서에 이렇게 못 박아 두었습니다.

Since a user requested the fetch, this fetcher generally ignores robots.txt rules. — Perplexity Crawlers

OpenAI도 ChatGPT-User에 대해 robots.txt 규칙이 적용되지 않을 수 있다고 안내합니다.

그래서 "robots.txt로 AI를 완전히 차단했다"는 성립하지 않습니다. 반대로 좋은 소식이기도 합니다 — 설정이 어긋나 있어도 사용자가 직접 링크를 물으면 그 페이지는 읽힙니다.

Google-Extended를 막으면 구글 검색에서 사라지나?

아닙니다. 구글 공식 문서에 명시돼 있습니다.

Google-Extended does not impact a site's inclusion in Google Search nor is it used as a ranking signal in Google Search. — Google's common crawlers

Google-Extended는 Gemini 모델 학습·그라운딩과 Vertex AI 쪽에서 쓸지를 정하는 별도 스위치입니다. 구글 검색 노출은 여전히 Googlebot이 담당합니다.

거꾸로 주의할 점도 있습니다. Googlebot을 막으면 구글 검색은 물론 AI 개요(AI Overviews)를 포함한 검색 기능 전반에서 빠집니다. AI가 싫다고 Googlebot을 건드리면 검색까지 통째로 날아갑니다.

학습은 막고 AI 검색 노출은 허용할 수 있나?

할 수 있습니다. 그리고 실제로 많은 회사가 원하는 게 정확히 이것입니다.

우리 콘텐츠로 모델을 학습시키는 건 내키지 않는다. 그런데 고객이 ChatGPT에 물었을 때 우리 회사는 등장했으면 좋겠다.

앞의 표에서 역할이 갈라져 있는 이유가 여기 있습니다. 학습용 수집과 검색 노출용 색인이 다른 이름을 쓰기 때문에 따로 정할 수 있습니다.

# 학습용 수집은 거부
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

# 단, AI 검색 결과에는 노출되고 싶다
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

다만 이건 선택의 문제지 정답이 있는 게 아닙니다. 학습 데이터에 포함되는 것 자체가 장기적으로는 브랜드 인지에 유리하다고 보는 관점도 있습니다. 중요한 건 모르고 막혀 있는 상태를 피하는 것입니다.

우리 사이트는 어떤 상태인가요?

무료 진단에서 도메인을 넣으면 robots.txt를 읽어 주요 AI 크롤러별 허용 여부를 판정합니다. 결과는 세 가지 중 하나입니다.

  • 허용 — 주요 AI 크롤러가 모두 들어올 수 있는 상태
  • 일부 차단 — 어떤 봇이 막혀 있는지 리포트에 이름이 표시됩니다
  • robots.txt 없음 — 기본적으로는 허용이지만, 명시적으로 환영한 상태는 아닙니다

세 번째가 의외로 많습니다. 파일이 없으면 대부분의 크롤러는 허용으로 간주하고 들어옵니다. 그래서 당장 손해는 아닙니다. 다만 우리는 이 상태를 만점으로 보지 않습니다 — 규칙이 명시돼 있지 않으면 크롤러마다 해석이 갈릴 여지가 남고, 나중에 누군가 무심코 차단 규칙을 넣었을 때 알아채기도 어렵기 때문입니다.

어떻게 고치나?

1. 지금 상태부터 확인합니다

curl -s https://example.co.kr/robots.txt

여기서 User-agent: * 아래에 Disallow: / 가 있다면 모든 크롤러를 사이트 전체에서 막고 있는 것입니다.

2. 없으면 만들고, 있으면 AI 크롤러 규칙을 추가합니다

사이트 최상단(/robots.txt)에 텍스트 파일로 둡니다.

User-agent: *
Allow: /
Disallow: /admin/
Disallow: /cart/

# AI 검색 노출
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

# 학습용 수집 — 허용할지는 정책에 따라 결정
User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

Sitemap: https://example.co.kr/sitemap.xml

관리자 페이지나 장바구니처럼 공개할 필요가 없는 경로는 그대로 막아두면 됩니다. 전체를 여는 것과 필요한 곳만 여는 것은 다른 이야기입니다.

3. 파일이 실제로 나가는지 확인합니다

만들어 올렸는데 인식이 안 되는 경우가 꽤 있습니다.

# 200이어야 하고, content-type이 HTML이면 안 됩니다
curl -sI https://example.co.kr/robots.txt | grep -i '^content-type'

# 없는 경로와 응답이 같으면, 그 서버는 아무 경로에나 같은 걸 주고 있는 것입니다
curl -s https://example.co.kr/zzz-not-real-9182.txt | head -3

자주 틀리는 것

증상원인대응
전체가 막혀 있는데 아무도 몰랐다사이트 제작 중 걸어둔 Disallow: / 가 오픈 후에도 남음가장 흔한 사고입니다. 먼저 확인하세요
robots.txt를 올렸는데 인식이 안 된다서버가 .txt를 HTML로 서빙하거나 라우터가 가로챔위 3번으로 확인
AI 크롤러만 막으려다 검색까지 막힘User-agent: *Disallow: / 를 걸어버림봇 이름별로 그룹을 나눠 작성
막았는데도 계속 들어온다robots.txt는 강제가 아니라 요청입니다규칙을 지키지 않는 수집기는 서버·WAF 단에서 차단

마지막 항목은 짚고 넘어갈 만합니다. robots.txt는 기술적 잠금장치가 아니라 관례에 따른 의사 표시입니다. 주요 AI 회사의 공식 크롤러는 이를 따르지만, 그렇지 않은 수집기도 세상에는 있습니다. 확실히 막아야 하는 것이라면 robots.txt 하나에 기대면 안 됩니다.

출처

크롤러 이름과 역할은 각 사의 공식 문서를 기준으로 했습니다 (2026-09-10 확인).

⚠️ 크롤러 이름은 예고 없이 추가·변경됩니다. 실제 설정 전에는 위 문서를 다시 확인하시기 바랍니다.


다음 단계 — 봇이 들어올 수 있게 됐다면, 그다음은 들어와서 읽을 것이 있는가입니다.

AI 크롤러robots.txtGPTBotClaudeBotPerplexityBotAI 검색 최적화

우리 홈페이지는 AI에게 어떻게 보일까?

주소만 넣으면 8개 지표로 채점한 결과를 바로 보여드립니다. 가입도, 카드도 필요 없습니다.

무료 진단 시작하기 →