Технический GEO
JavaScript и AI-краулеры: почему исходный HTML — самая безопасная база
Vercel не обнаружил исполнения JavaScript более чем в полумиллиарде запросов GPTBot. Это наблюдение о GPTBot, а не обо всех краулерах; Google умеет рендерить доступный JavaScript. Самая безопасная межплатформенная база — важный контент в исходном HTML и отдельная проверка поисковых, пользовательских и обучающих ботов.
Что мы знаем наверняка
Vercel вместе с MERJ проанализировали трафик в своей сети. В этой выборке GPTBot генерировал более полумиллиарда запросов в месяц и не показывал исполнения JavaScript; около 11,5% запросов скачивали JS-файлы, но не исполняли их. Наблюдение относится к GPTBot. Оно не доказывает такое же поведение Claude, Perplexity или любого другого краулера.
Официальная таксономия помогает не смешивать назначения. У OpenAI OAI-SearchBot обслуживает поиск, ChatGPT-User выполняет переходы по запросу пользователя, а GPTBot собирает данные для обучения. У Anthropic Claude-SearchBot и Claude-User поддерживают поиск и пользовательские запросы, а ClaudeBot предназначен для обучения. У Google Googlebot используется для Search и AI Overviews; Google-Extended управляет отдельными применениями Gemini, но не присутствием и не рангом в Google Search.
Страница с чисто клиентским рендерингом может отдавать почти пустой исходный HTML тем фетчерам, которые не исполняют JavaScript. Для описания продукта и цены это реальный риск, но не значит, что контент «не существует для всего AI»: Google умеет рендерить доступный JavaScript. Полный исходный HTML остаётся наиболее осторожной и проверяемой базой.
Проверьте свой сайт за три минуты
- Отключите JavaScript в dev tools и перезагрузите ключевые страницы. Если основной текст остался, вы подтвердили хорошую базу в исходном HTML, но не симулировали каждый краулер.
- Или правый клик → «Просмотр кода страницы»: убедитесь, что основной текст есть в исходном HTML. Голый
<div id="root"></div>— тревожный сигнал. - Проверьте и настройки CDN/WAF. Даже когда AI-боты разрешены в robots.txt, некоторые CDN блокируют их по умолчанию — распространённая скрытая причина: анализ Otterly более миллиона AI-цитирований показал, что у 73% сайтов есть технические барьеры, блокирующие AI-краулеры.
Варианты решения
- Статическая генерация (SSG) — первый выбор для контентных сайтов: HTML полностью готов на этапе сборки, что выигрывает по краулерам, скорости и эксплуатации. Этот сайт работает именно так.
- Серверный рендеринг (SSR) — для страниц с данными в реальном времени; сервер возвращает HTML на каждый запрос.
- Изолировать интерактивность — вместо полного SPA выполнять на клиенте только виджеты, которым это нужно (islands-архитектура), чтобы основной текст всегда оставался в статическом HTML.
Google Search умеет рендерить доступный для обхода JavaScript, а его AI-функции используют индексируемые страницы, подходящие для сниппета. У других систем возможности и сроки рендеринга различаются, и их нельзя выводить из теста GPTBot. SSR, SSG или пререндеринг остаются самой безопасной базой: важный текст приходит уже в первом HTML-ответе.
Итог
Начальная проверка проста: важный текст есть в исходном HTML, а robots.txt, CDN и WAF не создают случайных блокировок. Это оценка технической готовности, а не гарантия индексации или цитирования.
Связанные термины: AI-краулер, RAG, GEO
Источники
- Vercel, “The rise of the AI crawler”
- OpenAI, “Overview of OpenAI Crawlers”
- Anthropic Help Center, “Does Anthropic crawl data from the web?”
- Google for Developers, “Google's common crawlers”
- OtterlyAI, “The AI Citation Economy: 1+ Million Data Points”
- Google Search Central, “AI features and your website”