← Назад в блог

Технический GEO

Техническая GEO для marketing-инженера: robots.txt, структурированные данные, llms.txt

Техническая GEO начинается с доступа и важного текста в исходном HTML. Различайте OAI-SearchBot и ChatGPT-User с GPTBot; Claude-SearchBot и Claude-User с ClaudeBot; Googlebot с Google-Extended. Эффект schema наблюдательный, а не гарантия цитат. llms.txt необязателен и может устаревать.

Maksim Gurchenkov (CEO, Apurichoumi Inc.)

Что в GEO принадлежит инженерам

Контент-стратегия может принадлежать маркетингу, но доступ и рендеринг — инфраструктурные задачи. Если нужный путь извлечения не может получить или разобрать страницу, он не сможет её использовать. Структурированные данные полезны для расширенных результатов и машиночитаемых фактов, но generic schema не показала надёжного прироста цитирований. llms.txt — необязательный слой, а не сигнал ранжирования.

1. Впустите AI-краулеров

Боты извлечения и скраперы для обучения

Не все AI-краулеры делают одну работу. У OpenAI OAI-SearchBot обслуживает поиск, ChatGPT-User выполняет фетчи по запросу пользователя, а GPTBot собирает данные для обучения. У Anthropic Claude-SearchBot и Claude-User поддерживают поиск и пользовательские запросы, а ClaudeBot — обучение. PerplexityBot относится к поиску. У Google Googlebot используется для Search и AI Overviews; Google-Extended — отдельный управляющий токен для применений Gemini, не влияющий на включение или ранг в Google Search. Блокировка поискового или пользовательского бота может снизить доступность контента для соответствующей системы, но не задаёт универсальный исход на всех платформах.

На практике это критично: анализ Otterly более чем миллиона AI-цитирований (2026) показал, что у 73% сайтов есть технические барьеры, блокирующие доступ AI-краулеров.†

# Поиск и запросы пользователей
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Googlebot
Allow: /

# Обучение моделей
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /

# Отдельный контроль Gemini; не управляет Google Search
User-agent: Google-Extended
Allow: /

Это только пример разделения назначений, а не блок для бездумной вставки. Определите политику по каждому вендору, всегда защищайте приватные пути и перепроверьте официальную документацию перед изменением robots.txt.

Две оговорки. Во-первых, robots.txt уважают основные боты, но не все — Bytespider его игнорирует. Во-вторых, user-agent’ы подделывают: чтобы знать, кто реально приходил, сверяйте записи логов с официальными IP-диапазонами (например, OpenAI публикует список IP своего поискового бота как searchbot.json).

Проверьте также, что бот-защита CDN или WAF не блокирует AI-краулеров втихую. Разрешение в robots.txt ничего не значит, если файрвол отвечает 403.

HTML, не зависящий от JavaScript

Анализ Vercel нашёл ноль следов исполнения JavaScript более чем в полумиллиарде запросов GPTBot. Это наблюдение о GPTBot, его нельзя переносить на Claude, Perplexity или все остальные фетчеры. Google умеет рендерить доступный JavaScript, если он не заблокирован. Поэтому SSR, SSG или пререндеринг остаются самой безопасной базой: важный текст уже есть в исходном HTML независимо от возможностей конкретного краулера.

Проверка — одна команда:

curl -A "GPTBot" https://example.com/page/ | grep "ключевой текст"

Если текста нет в начальном HTML — стратегию рендеринга нужно пересматривать.

2. Структурированные данные: полезны, но не там, где ожидаешь

Два факта сразу. Google официально заявляет: структурированные данные не требуются для генеративного AI-поиска, и никакой специальной schema.org-разметки для AI-функций не существует.*** А самый сильный контролируемый эксперимент на сегодня — Ahrefs отследил 1 885 страниц, добавивших JSON-LD, против сопоставленных контрольных групп — не нашёл прироста цитирований ни на одной AI-платформе.††

Есть наблюдательный сигнал, который можно проверить, но это не причинное доказательство:

После внедрения валидируйте и тестом расширенных результатов, и валидатором Schema.org.

3. llms.txt: публикуйте, но понимайте, что это

Честная рамка: llms.txt сегодня не доказан как фактор ранжирования или цитирования. Google заявляет, что для его AI-функций файл не нужен; отдельные системы могут его запрашивать.‡‡ Поведение продуктов и краулеров меняется, поэтому сверяйтесь с актуальной документацией и не называйте файл гарантированным стандартом.

Зачем тогда публиковать? Потому что это дёшево. Markdown-сводка структуры и ключевого контента сайта в корне ничего не стоит при автоматической генерации — и готовит вас к тому, что агенты всё-таки начнут её использовать.

Операционное правило: если публикуете llms.txt, генерируйте его автоматически из канонических источников. Ручной файл может разойтись с реальным контентом; сборка снижает риск, но результат всё равно нужно контролировать.

Чек-лист проверки

  1. robots.txt отдельно управляет нужными ботами: OAI-SearchBot / ChatGPT-User, Claude-SearchBot / Claude-User, PerplexityBot и Googlebot; GPTBot и ClaudeBot — выбор по обучению
  2. WAF/CDN не отвечает 403 на user-agent’ы AI-краулеров (смотрите логи доступа)
  3. обычный HTTP-ответ содержит важный текст в исходном HTML; user agent GPTBot проверяет только этот ответ, а не рендеринг всех систем
  4. Продуктовые страницы несут Product/Offer-схему с реальной ценой и характеристиками; в Organization-схеме есть ссылки sameAs
  5. llms.txt генерируется на сборке (дешёвое дополнение — не фактор цитирования)
  6. Визиты AI-краулеров в серверных логах сверяются с официальными IP-диапазонами и регулярно просматриваются

После изменений можно повторно проверить доступ и структуру. Пройденный технический чек доказывает изменение сигнала, но не доказывает, что именно оно вызвало цитирование или рост.

* OpenAI, «Overview of OpenAI Crawlers» ** Vercel, «The rise of the AI crawler» *** Google Search Central, «AI Features and Your Website» † OtterlyAI, «The AI Citation Economy: 1+ Million Data Points» (2026) †† Ahrefs, «We Tracked 1,885 Pages Adding Schema. AI Citations Barely Moved.» (май 2026) ‡ Vishwakarma et al., «What Gets Cited: Competitive GEO in AI Answer Engines», SIGIR ‘26 ‡‡ Search Engine Land, «Google says normal SEO works … and LLMS.txt won’t be used» (июль 2025)

Источники

  1. OpenAI, “Overview of OpenAI Crawlers”
  2. Vercel, “The rise of the AI crawler”
  3. Google Search Central, “AI Features and Your Website”
  4. Anthropic Help Center, “Does Anthropic crawl data from the web?”
  5. Google for Developers, “Google's common crawlers”
  6. Does Schema Markup Predict AI Citation? — cross-platform observational study
  7. Search Engine Land, “Google says normal SEO works … and LLMS.txt won't be used”
  8. Ahrefs, “We Tracked 1,885 Pages Adding Schema. AI Citations Barely Moved.”
  9. Vishwakarma et al. (Sprinklr), “What Gets Cited: Competitive GEO in AI Answer Engines” (SIGIR '26)
  10. OtterlyAI, “The AI Citation Economy: 1+ Million Data Points”
Бесплатная проверка Связаться с продажами