← 블로그로 돌아가기

테크니컬 GEO

마케팅 엔지니어를 위한 테크니컬 GEO — robots.txt·구조화 데이터·llms.txt

테크니컬 GEO는 접근과 초기 HTML의 핵심 콘텐츠에서 시작합니다. OAI-SearchBot·ChatGPT-User와 GPTBot, Claude-SearchBot·Claude-User와 ClaudeBot, Googlebot과 Google-Extended의 역할을 구분하세요. 스키마 효과는 관찰적 연관성이지 인용 보장이 아니며 llms.txt는 선택 사항이고 오래될 수 있습니다.

Maksim Gurchenkov (CEO, Apurichoumi Inc.)

GEO에서 엔지니어링이 담당하는 것

콘텐츠 전략은 마케팅이 맡을 수 있지만 접근과 렌더링은 인프라 문제입니다. 관련 검색 경로가 페이지를 가져오거나 분석하지 못하면 그 경로에서는 사용할 수 없습니다. 구조화 데이터는 리치 결과와 기계가 읽을 수 있는 사실에 유용하지만 일반 스키마는 신뢰할 만한 인용 증가를 보여 주지 못했습니다. llms.txt는 선택적 계층이지 랭킹 신호가 아닙니다.

1. AI 크롤러 받아들이기

리트리벌 봇과 학습용 스크레이퍼 구분

AI 크롤러가 모두 같은 일을 하는 것은 아닙니다. OpenAI의 OAI-SearchBot은 검색, ChatGPT-User는 사용자 요청 페치, GPTBot은 학습용입니다. Anthropic의 Claude-SearchBotClaude-User는 검색·사용자 요청용이고 ClaudeBot은 학습용입니다. PerplexityBot은 검색용입니다. Google의 Googlebot은 Search와 AI Overviews에 쓰이고, Google-Extended는 Gemini 관련 사용을 제어하지만 Google Search 포함 여부나 순위에는 영향을 주지 않습니다. 검색·사용자 봇을 차단하면 해당 시스템의 콘텐츠 검색 가능성이 낮아질 수 있지만 모든 플랫폼에서 같은 결과를 뜻하지는 않습니다.

이는 실무적으로 매우 중요합니다. Otterly가 100만 건 이상의 AI 인용을 분석한 결과(2026년), 73%의 사이트에 AI 크롤러 접근을 막는 기술적 장벽이 있는 것으로 나타났습니다.†

# 검색과 사용자 요청
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Googlebot
Allow: /

# 모델 학습
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /

# Gemini 용도 별도 제어. Google Search 제어가 아님
User-agent: Google-Extended
Allow: /

이는 용도를 분리하는 예시일 뿐 그대로 붙여 넣을 정책이 아닙니다. 공급업체별로 결정하고 비공개 경로를 보호하며 robots.txt 변경 전 최신 공식 문서를 다시 확인하세요.

주의할 점이 두 가지 있습니다. 첫째, robots.txt는 주요 봇은 존중하지만 모두가 그런 것은 아닙니다 — Bytespider는 무시합니다. 둘째, user agent는 위조됩니다. 실제 방문자를 확인하려면 로그 기록을 공식 IP 대역(예: OpenAI가 공개하는 searchbot.json)과 대조해 검증하세요.

CDN이나 WAF의 봇 보호가 AI 크롤러를 조용히 차단하고 있지 않은지도 확인하세요. 방화벽이 403을 반환하면 robots.txt의 허용 규칙은 의미가 없습니다.

JavaScript에 의존하지 않는 HTML

Vercel은 5억 건 이상의 GPTBot 요청에서 JavaScript 실행 흔적을 찾지 못했습니다. GPTBot에 한정된 관찰이므로 Claude·Perplexity 등 모든 페처로 일반화할 수 없습니다. Google은 차단되지 않은 크롤링 가능 JavaScript를 렌더링할 수 있습니다. 따라서 SSR·SSG·프리렌더링이 가장 안전한 기준입니다. 개별 크롤러의 기능과 무관하게 핵심 본문이 초기 HTML에 들어갑니다.

검증은 명령어 하나입니다:

curl -A "GPTBot" https://example.com/page/ | grep "핵심 문구"

초기 HTML에 본문이 없다면 렌더링 전략을 재검토해야 합니다.

2. 구조화 데이터 — 유용하지만, 기대와는 다른 지점에서

먼저 두 가지 사실부터. Google은 생성형 AI 검색에 구조화 데이터가 필수가 아니며, AI 기능을 위해 추가해야 할 특별한 schema.org 마크업은 존재하지 않는다고 공식적으로 밝히고 있습니다.*** 그리고 현재까지 가장 엄밀한 통제 실험 — Ahrefs가 JSON-LD를 추가한 1,885개 페이지를 대응 표본 대조군과 비교한 조사 — 에서도 어떤 AI 플랫폼에서도 인용 증가가 확인되지 않았습니다.††

다만 시험해 볼 수 있는 관찰적 신호가 하나 있습니다. 인과관계가 입증된 것은 아닙니다.

구현 후에는 리치 결과 테스트와 Schema.org 검증기 양쪽으로 확인하세요.

3. llms.txt — 게시는 하되, 정체를 알고

정직한 위치 정립부터 하겠습니다. llms.txt가 랭킹이나 인용 요인이라는 근거는 현재 없습니다. Google은 자사 AI 기능에 이 파일이 필요하지 않다고 밝히며, 일부 시스템은 파일을 요청할 수 있습니다.‡‡ 제품과 크롤러 동작은 변할 수 있으므로 최신 공식 문서를 확인하고 보장된 표준처럼 소개하지 마세요.

그런데도 게시하는 이유는 비용이 거의 들지 않기 때문입니다. 사이트 구조와 핵심 콘텐츠의 Markdown 요약을 루트에 두는 것은 자동 생성이라면 유지 비용이 없고, 향후 에이전트가 채택할 경우에 대한 대비도 됩니다.

운영 규칙은 하나입니다. 게시한다면 정식 콘텐츠 원본에서 자동 생성하세요. 수동 파일은 실제 콘텐츠와 달라질 수 있습니다. 빌드 생성은 위험을 줄이지만 결과가 최신인지 계속 확인해야 합니다.

검증 체크리스트

  1. robots.txt에서 OAI-SearchBot / ChatGPT-User, Claude-SearchBot / Claude-User, PerplexityBot, Googlebot을 각각 관리한다. GPTBot과 ClaudeBot은 학습용 선택이다
  2. WAF/CDN이 AI 크롤러 user agent에 403을 반환하지 않는다 (접근 로그 확인)
  3. 일반 HTTP 응답의 초기 HTML에 핵심 본문이 있다. GPTBot user agent 테스트는 해당 응답만 확인하며 모든 시스템의 렌더링을 재현하지 않는다
  4. 제품 페이지에 실제 가격·사양을 담은 속성 풍부한 Product/Offer 스키마가 있고, Organization 스키마에 sameAs 링크가 있다
  5. llms.txt가 빌드 시 생성된다 (저비용 추가 항목 — 인용 요인 아님)
  6. 서버 로그의 AI 크롤러 방문을 공식 IP 대역과 대조해 검증하고 정기적으로 검토한다

변경 후 접근과 구조를 다시 측정할 수 있습니다. 기술 점검 통과는 신호가 바뀌었다는 증거이지, 그 변경이 인용이나 성장을 일으켰다는 증거는 아닙니다.

* OpenAI, “Overview of OpenAI Crawlers” ** Vercel, “The rise of the AI crawler” *** Google Search Central, “AI Features and Your Website” † OtterlyAI, “The AI Citation Economy: 1+ Million Data Points” (2026년) †† Ahrefs, “We Tracked 1,885 Pages Adding Schema. AI Citations Barely Moved.” (2026년 5월) ‡ Vishwakarma et al., “What Gets Cited: Competitive GEO in AI Answer Engines”, SIGIR ‘26 ‡‡ Search Engine Land, “Google says normal SEO works … and LLMS.txt won’t be used” (2025년 7월)

참고·출처

  1. OpenAI, “Overview of OpenAI Crawlers”
  2. Vercel, “The rise of the AI crawler”
  3. Google Search Central, “AI Features and Your Website”
  4. Anthropic Help Center, “Does Anthropic crawl data from the web?”
  5. Google for Developers, “Google's common crawlers”
  6. Does Schema Markup Predict AI Citation? — cross-platform observational study
  7. Search Engine Land, “Google says normal SEO works … and LLMS.txt won't be used”
  8. Ahrefs, “We Tracked 1,885 Pages Adding Schema. AI Citations Barely Moved.”
  9. Vishwakarma et al. (Sprinklr), “What Gets Cited: Competitive GEO in AI Answer Engines” (SIGIR '26)
  10. OtterlyAI, “The AI Citation Economy: 1+ Million Data Points”
무료 진단 영업팀에 문의