GEO técnico
JavaScript y crawlers de IA: por qué el HTML inicial es la base más segura
Vercel no observó ejecución de JavaScript en más de 500 millones de peticiones de GPTBot: el dato se limita a GPTBot. Google puede renderizar JavaScript rastreable. La base más segura es servir el contenido esencial en el HTML inicial y distinguir los bots de búsqueda, usuario y entrenamiento.
Lo que sabemos con certeza
Vercel, junto con MERJ, analizó el tráfico de su red. En esa muestra, GPTBot generaba más de quinientos millones de peticiones al mes y no mostraba ejecución de JavaScript; alrededor del 11,5% de las peticiones descargaban archivos JS sin ejecutarlos. El dato se refiere a GPTBot. No demuestra que Claude, Perplexity o cualquier otro crawler se comporten igual.
La taxonomía oficial evita mezclar funciones. En OpenAI, OAI-SearchBot sirve la búsqueda, ChatGPT-User las visitas solicitadas por usuarios y GPTBot el entrenamiento. En Anthropic, Claude-SearchBot y Claude-User sirven búsqueda y solicitudes de usuario, mientras ClaudeBot se dedica al entrenamiento. En Google, Googlebot alimenta Search y AI Overviews; Google-Extended controla usos de Gemini, no la inclusión ni el ranking en Google Search.
Una página renderizada solo en el cliente puede entregar HTML inicial casi vacío a los fetchers que no ejecutan JavaScript. Es un riesgo real para descripciones y precios, pero no significa que el contenido «no exista para toda la IA»: Google puede renderizar JavaScript rastreable. El HTML inicial completo sigue siendo la base más prudente y verificable.
Comprueba tu sitio en tres minutos
- Desactiva JavaScript en las herramientas de desarrollo y recarga las páginas clave. Si el texto sigue visible, has comprobado una buena base en el HTML inicial; no has simulado todos los crawlers.
- O haz clic derecho → «Ver código fuente de la página» y confirma que el texto principal existe en el HTML fuente. Un
<div id="root"></div>vacío es la señal de alarma. - Revisa también la configuración de tu CDN/WAF. Aunque robots.txt permita los bots de IA, algunos CDN los bloquean por defecto: una causa oculta frecuente — un análisis de Otterly de más de un millón de citas de IA encontró que el 73% de los sitios tienen barreras técnicas que bloquean los crawlers de IA.
Tus opciones
- Generación estática (SSG) — la primera opción para sitios de contenido: el HTML queda completo en el build, lo que gana en crawlers, velocidad y operación. Este sitio funciona así.
- Renderizado en el servidor (SSR) — para páginas que necesitan datos en tiempo real; el servidor devuelve HTML en cada petición.
- Aísla la interactividad — en lugar de una SPA completa, ejecuta en el cliente solo los widgets que lo necesitan (arquitectura de islas), de modo que el texto principal permanezca siempre en HTML estático.
Google Search puede renderizar JavaScript rastreable, y sus funciones de IA usan páginas indexables y aptas para snippets. En otros sistemas, la capacidad y el tiempo de renderizado varían y no pueden deducirse del test de GPTBot. SSR, SSG o prerendering siguen siendo la base más segura para incluir el texto esencial en la primera respuesta HTML.
En resumen
La comprobación inicial es sencilla: texto esencial en el HTML inicial y ausencia de bloqueos involuntarios en robots.txt, CDN o WAF. Es una medida de preparación técnica, no una garantía de indexación ni de citas.
Términos relacionados: Crawler de IA, RAG, GEO
Fuentes
- Vercel, “The rise of the AI crawler”
- OpenAI, “Overview of OpenAI Crawlers”
- Anthropic Help Center, “Does Anthropic crawl data from the web?”
- Google for Developers, “Google's common crawlers”
- OtterlyAI, “The AI Citation Economy: 1+ Million Data Points”
- Google Search Central, “AI features and your website”