← Назад в блог

Технический GEO

JavaScript и AI-краулеры: почему исходный HTML — самая безопасная база

Vercel не обнаружил исполнения JavaScript более чем в полумиллиарде запросов GPTBot. Это наблюдение о GPTBot, а не обо всех краулерах; Google умеет рендерить доступный JavaScript. Самая безопасная межплатформенная база — важный контент в исходном HTML и отдельная проверка поисковых, пользовательских и обучающих ботов.

Maksim Gurchenkov (CEO, Apurichoumi Inc.)

Что мы знаем наверняка

Vercel вместе с MERJ проанализировали трафик в своей сети. В этой выборке GPTBot генерировал более полумиллиарда запросов в месяц и не показывал исполнения JavaScript; около 11,5% запросов скачивали JS-файлы, но не исполняли их. Наблюдение относится к GPTBot. Оно не доказывает такое же поведение Claude, Perplexity или любого другого краулера.

Официальная таксономия помогает не смешивать назначения. У OpenAI OAI-SearchBot обслуживает поиск, ChatGPT-User выполняет переходы по запросу пользователя, а GPTBot собирает данные для обучения. У Anthropic Claude-SearchBot и Claude-User поддерживают поиск и пользовательские запросы, а ClaudeBot предназначен для обучения. У Google Googlebot используется для Search и AI Overviews; Google-Extended управляет отдельными применениями Gemini, но не присутствием и не рангом в Google Search.

Страница с чисто клиентским рендерингом может отдавать почти пустой исходный HTML тем фетчерам, которые не исполняют JavaScript. Для описания продукта и цены это реальный риск, но не значит, что контент «не существует для всего AI»: Google умеет рендерить доступный JavaScript. Полный исходный HTML остаётся наиболее осторожной и проверяемой базой.

Проверьте свой сайт за три минуты

  1. Отключите JavaScript в dev tools и перезагрузите ключевые страницы. Если основной текст остался, вы подтвердили хорошую базу в исходном HTML, но не симулировали каждый краулер.
  2. Или правый клик → «Просмотр кода страницы»: убедитесь, что основной текст есть в исходном HTML. Голый <div id="root"></div> — тревожный сигнал.
  3. Проверьте и настройки CDN/WAF. Даже когда AI-боты разрешены в robots.txt, некоторые CDN блокируют их по умолчанию — распространённая скрытая причина: анализ Otterly более миллиона AI-цитирований показал, что у 73% сайтов есть технические барьеры, блокирующие AI-краулеры.

Варианты решения

Google Search умеет рендерить доступный для обхода JavaScript, а его AI-функции используют индексируемые страницы, подходящие для сниппета. У других систем возможности и сроки рендеринга различаются, и их нельзя выводить из теста GPTBot. SSR, SSG или пререндеринг остаются самой безопасной базой: важный текст приходит уже в первом HTML-ответе.

Итог

Начальная проверка проста: важный текст есть в исходном HTML, а robots.txt, CDN и WAF не создают случайных блокировок. Это оценка технической готовности, а не гарантия индексации или цитирования.

Связанные термины: AI-краулер, RAG, GEO

Источники

  1. Vercel, “The rise of the AI crawler”
  2. OpenAI, “Overview of OpenAI Crawlers”
  3. Anthropic Help Center, “Does Anthropic crawl data from the web?”
  4. Google for Developers, “Google's common crawlers”
  5. OtterlyAI, “The AI Citation Economy: 1+ Million Data Points”
  6. Google Search Central, “AI features and your website”
Бесплатная проверка Связаться с продажами