HackerNews AI
Cloudflare AI 크롤러 차단, 로컬 비즈니스 사이트 293곳 실측 결과
한마디로
AI 가시성 서비스를 파는 사람이 정작 자기 사이트가 Cloudflare 설정 때문에 GPTBot, ClaudeBot, PerplexityBot에게 403으로 막혀 있던 걸 발견하고, 로컬 업체 293곳을 다시 조사해보니 robots.txt에 안 적어놨는데도 방화벽이 조용히 AI 크롤러만 막는 사례가 훨씬 많았다는 이야기예요
무슨 내용인가
AI 가시성 컨설팅을 하는 필자가 자기 사이트를 스캔해보니 Cloudflare 계정 설정 때문에 GPTBot, ClaudeBot, PerplexityBot에게만 403이 뜨고 있었고, robots.txt에도 8개 AI 크롤러에 대한 Disallow와 Content-Signal: ai-train=no가 본인이 작성하지 않았는데도 들어가 있었어요. 이후 버지니아주 Fairfax, Loudoun, Arlington 지역 로컬 업체 310곳(치과, 미용실, 자동차 정비, 수의과, HVAC, 배관공, 지붕공, 주유소 등)을 대상으로 실제 크롤러 user agent로 재조사했는데, 293곳이 응답했고 그중 15곳(5.1%)만 robots.txt에 AI 크롤러 차단을 명시했습니다. 반면 robots.txt에 아무 규정이 없는데도 18곳이 브라우저나 Googlebot에는 정상 응답하면서 AI 크롤러만 403이나 429로 계속 막는 사실이 드러났어요. 이 18곳은 Cloudflare, nginx, LiteSpeed, Apache 등 다양한 설정을 쓰고 있어서 특정 벤더 하나의 기본값 문제가 아니라 봇 차단 제품들이 사이트 소유자도 모르는 사이 AI 크롤러를 막고 있다는 게 핵심 발견이었습니다.
에디터 노트 | FactStack
robots.txt만 보고 AI 크롤러 접근성을 판단하는 관행 자체가 틀렸다는 걸 보여주는 사례입니다. 방화벽 레이어에서 Cloudflare나 각종 봇 차단 제품이 사이트 소유자 동의 없이 AI 크롤러를 걸러내고 있다면, 이건 opt-out 정책 논쟁 이전에 소유자가 자기 사이트 상태조차 모르는 가시성의 문제예요. 실무적으로는 GA4나 서버 로그 분석만으로는 절대 안 잡히는 영역이라, AEO나 GEO 컨설팅을 한다면 robots.txt 점검에 curl로 실제 user agent 테스트를 필수 항목으로 넣어야 합니다. 다만 293곳 표본이 버지니아 세 개 카운티에 국한된 지역 데이터라 5.1%나 18곳이라는 숫자를 전국 단위로 일반화하기엔 이르고, Cloudflare 기본 설정이 언제 어떻게 바뀌었는지 시점 특정이 안 된 점도 한계로 짚어야 합니다.
실무 시사점
로컬 비즈니스나 대행사라면 robots.txt만 확인하지 말고 실제 GPTBot 등 user agent로 직접 curl 테스트를 해봐야 AI 어시스턴트 추천 노출 여부를 제대로 파악할 수 있다는 걸 시사합니다
태그
용어 풀이
- AI크롤러차단
- AI 서비스가 웹사이트 내용을 수집하지 못하게 막는 것
- Cloudflare
- 웹사이트 보안과 속도를 관리해주는 CDN 서비스
- robots.txt
- 웹사이트에서 어떤 크롤러가 접근 가능한지 알려주는 규칙 파일
- GEO
- AI 검색 답변에 내 콘텐츠가 노출되도록 최적화하는 것
공유
이 주의 다른 소식 - 2026년 9월 7일 - 9월 13일 트렌드 16건주간 라운드업 보기 →관련 용어
- AI 검색 (AI Search)검색창에 링크 목록 대신 AI가 종합한 답을 바로 주는 검색이에요. ChatGPT, Perplexity, 구글 AI Overviews가 대표적…
- 답변 엔진 최적화 (AEO (Answer Engine Optimization))AI 답변엔진이 질문에 답할 때 내 콘텐츠를 근거로 인용, 발췌하도록 최적화하는 거예요. 'AI가 우리 답을 가져가게' 만드는 전략이에요
- 생성형 엔진 최적화 (GEO (Generative Engine Optimization))대문자 GEO는 AI 답변엔진이 내 콘텐츠를 인용하게 만드는 최적화예요. 광고 세팅에서 만나는 소문자 geo(지역 타겟팅)와는 철자만 같은 다…