Технический GEO
Техническая GEO для marketing-инженера: robots.txt, структурированные данные, llms.txt
Техническая GEO начинается с доступа и важного текста в исходном HTML. Различайте OAI-SearchBot и ChatGPT-User с GPTBot; Claude-SearchBot и Claude-User с ClaudeBot; Googlebot с Google-Extended. Эффект schema наблюдательный, а не гарантия цитат. llms.txt необязателен и может устаревать.
Что в GEO принадлежит инженерам
Контент-стратегия может принадлежать маркетингу, но доступ и рендеринг — инфраструктурные задачи. Если нужный путь извлечения не может получить или разобрать страницу, он не сможет её использовать. Структурированные данные полезны для расширенных результатов и машиночитаемых фактов, но generic schema не показала надёжного прироста цитирований. llms.txt — необязательный слой, а не сигнал ранжирования.
1. Впустите AI-краулеров
Боты извлечения и скраперы для обучения
Не все AI-краулеры делают одну работу. У OpenAI OAI-SearchBot обслуживает поиск, ChatGPT-User выполняет фетчи по запросу пользователя, а GPTBot собирает данные для обучения. У Anthropic Claude-SearchBot и Claude-User поддерживают поиск и пользовательские запросы, а ClaudeBot — обучение. PerplexityBot относится к поиску. У Google Googlebot используется для Search и AI Overviews; Google-Extended — отдельный управляющий токен для применений Gemini, не влияющий на включение или ранг в Google Search. Блокировка поискового или пользовательского бота может снизить доступность контента для соответствующей системы, но не задаёт универсальный исход на всех платформах.
На практике это критично: анализ Otterly более чем миллиона AI-цитирований (2026) показал, что у 73% сайтов есть технические барьеры, блокирующие доступ AI-краулеров.†
# Поиск и запросы пользователей
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Googlebot
Allow: /
# Обучение моделей
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
# Отдельный контроль Gemini; не управляет Google Search
User-agent: Google-Extended
Allow: /
Это только пример разделения назначений, а не блок для бездумной вставки. Определите политику по каждому вендору, всегда защищайте приватные пути и перепроверьте официальную документацию перед изменением robots.txt.
Две оговорки. Во-первых, robots.txt уважают основные боты, но не все — Bytespider его игнорирует. Во-вторых, user-agent’ы подделывают: чтобы знать, кто реально приходил, сверяйте записи логов с официальными IP-диапазонами (например, OpenAI публикует список IP своего поискового бота как searchbot.json).
Проверьте также, что бот-защита CDN или WAF не блокирует AI-краулеров втихую. Разрешение в robots.txt ничего не значит, если файрвол отвечает 403.
HTML, не зависящий от JavaScript
Анализ Vercel нашёл ноль следов исполнения JavaScript более чем в полумиллиарде запросов GPTBot. Это наблюдение о GPTBot, его нельзя переносить на Claude, Perplexity или все остальные фетчеры. Google умеет рендерить доступный JavaScript, если он не заблокирован. Поэтому SSR, SSG или пререндеринг остаются самой безопасной базой: важный текст уже есть в исходном HTML независимо от возможностей конкретного краулера.
Проверка — одна команда:
curl -A "GPTBot" https://example.com/page/ | grep "ключевой текст"
Если текста нет в начальном HTML — стратегию рендеринга нужно пересматривать.
2. Структурированные данные: полезны, но не там, где ожидаешь
Два факта сразу. Google официально заявляет: структурированные данные не требуются для генеративного AI-поиска, и никакой специальной schema.org-разметки для AI-функций не существует.*** А самый сильный контролируемый эксперимент на сегодня — Ahrefs отследил 1 885 страниц, добавивших JSON-LD, против сопоставленных контрольных групп — не нашёл прироста цитирований ни на одной AI-платформе.††
Есть наблюдательный сигнал, который можно проверить, но это не причинное доказательство:
- Product / SoftwareApplication + Offer с реальными атрибутами — наблюдательное cross-platform исследование увидело цитирование у 61,7% Product/Review-страниц с ценой, рейтингом и характеристиками против 41,6% generic-типов. Это ассоциация, а не доказательство, что разметка вызвала цитату. Отдельно SIGIR ’26 на 252 000 пробах выделил явную цену как фактор отбора.‡ Практическая ценность — в корректных машиночитаемых фактах, а не в теге как обещании ранжирования.
- Organization — сущность канонизирует не сама разметка, а ссылки
sameAsна официальные профили плюс согласованность фактов о бренде по всему вебу. Используйте её как опору для юридического имени, адреса и вариантов написания. - FAQPage — сама обёртка не доказана как сигнал цитирования. Используйте её, когда структура помогает читателю и ответы содержат факты, а не как обязательную AI-разметку.
- Article + Person — авторство и даты поддерживают E-E-A-T, но учитывайте позицию самого Google: E-E-A-T — не прямой фактор ранжирования. Его ядро — доверие (trust), а вес максимален на YMYL-темах.
После внедрения валидируйте и тестом расширенных результатов, и валидатором Schema.org.
3. llms.txt: публикуйте, но понимайте, что это
Честная рамка: llms.txt сегодня не доказан как фактор ранжирования или цитирования. Google заявляет, что для его AI-функций файл не нужен; отдельные системы могут его запрашивать.‡‡ Поведение продуктов и краулеров меняется, поэтому сверяйтесь с актуальной документацией и не называйте файл гарантированным стандартом.
Зачем тогда публиковать? Потому что это дёшево. Markdown-сводка структуры и ключевого контента сайта в корне ничего не стоит при автоматической генерации — и готовит вас к тому, что агенты всё-таки начнут её использовать.
Операционное правило: если публикуете llms.txt, генерируйте его автоматически из канонических источников. Ручной файл может разойтись с реальным контентом; сборка снижает риск, но результат всё равно нужно контролировать.
Чек-лист проверки
- robots.txt отдельно управляет нужными ботами: OAI-SearchBot / ChatGPT-User, Claude-SearchBot / Claude-User, PerplexityBot и Googlebot; GPTBot и ClaudeBot — выбор по обучению
- WAF/CDN не отвечает 403 на user-agent’ы AI-краулеров (смотрите логи доступа)
- обычный HTTP-ответ содержит важный текст в исходном HTML; user agent
GPTBotпроверяет только этот ответ, а не рендеринг всех систем - Продуктовые страницы несут Product/Offer-схему с реальной ценой и характеристиками; в Organization-схеме есть ссылки
sameAs - llms.txt генерируется на сборке (дешёвое дополнение — не фактор цитирования)
- Визиты AI-краулеров в серверных логах сверяются с официальными IP-диапазонами и регулярно просматриваются
После изменений можно повторно проверить доступ и структуру. Пройденный технический чек доказывает изменение сигнала, но не доказывает, что именно оно вызвало цитирование или рост.
* OpenAI, «Overview of OpenAI Crawlers» ** Vercel, «The rise of the AI crawler» *** Google Search Central, «AI Features and Your Website» † OtterlyAI, «The AI Citation Economy: 1+ Million Data Points» (2026) †† Ahrefs, «We Tracked 1,885 Pages Adding Schema. AI Citations Barely Moved.» (май 2026) ‡ Vishwakarma et al., «What Gets Cited: Competitive GEO in AI Answer Engines», SIGIR ‘26 ‡‡ Search Engine Land, «Google says normal SEO works … and LLMS.txt won’t be used» (июль 2025)
Источники
- OpenAI, “Overview of OpenAI Crawlers”
- Vercel, “The rise of the AI crawler”
- Google Search Central, “AI Features and Your Website”
- Anthropic Help Center, “Does Anthropic crawl data from the web?”
- Google for Developers, “Google's common crawlers”
- Does Schema Markup Predict AI Citation? — cross-platform observational study
- Search Engine Land, “Google says normal SEO works … and LLMS.txt won't be used”
- Ahrefs, “We Tracked 1,885 Pages Adding Schema. AI Citations Barely Moved.”
- Vishwakarma et al. (Sprinklr), “What Gets Cited: Competitive GEO in AI Answer Engines” (SIGIR '26)
- OtterlyAI, “The AI Citation Economy: 1+ Million Data Points”