GEO técnico
GEO técnico para ingenieros de marketing: robots.txt, datos estructurados, llms.txt
El GEO técnico empieza por el acceso y el contenido esencial en el HTML inicial. Distingue OAI-SearchBot y ChatGPT-User de GPTBot; Claude-SearchBot y Claude-User de ClaudeBot; Googlebot de Google-Extended. El efecto del schema es observacional, no una garantía de citas. llms.txt es opcional y puede quedar obsoleto.
Qué parte de GEO pertenece a ingeniería
La estrategia de contenidos puede pertenecer a marketing, pero acceso y renderizado son cuestiones de infraestructura. Si la ruta de recuperación relevante no puede obtener o analizar una página, esa ruta no puede usarla. Los datos estructurados siguen siendo útiles para resultados enriquecidos y hechos legibles por máquina, pero el schema genérico no ha mostrado un aumento fiable de citas. llms.txt es una capa opcional, no una señal de ranking.
1. Admite los crawlers de IA
Bots de recuperación vs. scrapers de entrenamiento
No todos los crawlers de IA hacen el mismo trabajo. En OpenAI, OAI-SearchBot sirve la búsqueda, ChatGPT-User las recuperaciones solicitadas por usuarios y GPTBot el entrenamiento. En Anthropic, Claude-SearchBot y Claude-User sirven búsqueda y solicitudes de usuario, mientras ClaudeBot es de entrenamiento. PerplexityBot es de búsqueda. En Google, Googlebot alimenta Search y AI Overviews; Google-Extended es un token de control para usos de Gemini y no afecta a la inclusión ni al ranking en Google Search. Bloquear un bot de búsqueda o usuario puede reducir la recuperación en ese sistema, pero no determina un resultado universal en todas las plataformas.
Esto importa en la práctica: un análisis de Otterly de más de un millón de citas de IA (2026) encontró que el 73 % de los sitios tienen barreras técnicas que bloquean el acceso de los crawlers de IA.†
# Búsqueda y solicitudes de usuario
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Googlebot
Allow: /
# Entrenamiento de modelos
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
# Control separado para usos de Gemini; no gobierna Google Search
User-agent: Google-Extended
Allow: /
Es solo un ejemplo de separación de propósitos, no un bloque para pegar sin cambios. Decide la política por proveedor, protege siempre las rutas privadas y vuelve a revisar la documentación oficial antes de modificar robots.txt.
Dos salvedades. Primera: robots.txt es respetado por los bots principales, pero no por todos — Bytespider lo ignora. Segunda: los user agents se falsifican; para saber quién visitó de verdad, valida las entradas del log contra los rangos de IP oficiales (por ejemplo, OpenAI publica la lista de IP de su bot de búsqueda como searchbot.json).
Comprueba también que la protección anti-bots de tu CDN o WAF no esté bloqueando en silencio los crawlers de IA. Una regla de permiso en robots.txt no sirve de nada si el firewall devuelve un 403.
HTML que no depende de JavaScript
El análisis de Vercel encontró cero rastros de ejecución de JavaScript en más de quinientos millones de peticiones de GPTBot. Es una observación específica de GPTBot y no permite generalizar a Claude, Perplexity ni a todos los demás fetchers. Google puede renderizar JavaScript rastreable cuando no está bloqueado. SSR, SSG o prerendering siguen siendo la base más segura: el texto esencial ya está en el HTML inicial, con independencia de las capacidades del crawler.
La verificación es un solo comando:
curl -A "GPTBot" https://example.com/page/ | grep "key copy"
Si el copy no está en el HTML inicial, hay que revisar la estrategia de renderizado.
2. Datos estructurados: útiles, pero no donde esperarías
Dos hechos por delante. Google afirma oficialmente que los datos estructurados no son necesarios para la búsqueda generativa con IA y que no existe ningún marcado schema.org especial que añadir para las funciones de IA.*** Y el experimento controlado más sólido hasta la fecha — Ahrefs siguió 1.885 páginas que añadieron JSON-LD frente a controles emparejados — no encontró aumento de citas en ninguna plataforma de IA.††
Hay una señal observacional que puede probarse, pero no es evidencia causal:
- Product / SoftwareApplication + Offer con atributos reales — un estudio observacional entre plataformas encontró citas en el 61,7 % de las páginas Product/Review con precio, valoración y especificaciones, frente al 41,6 % de los tipos genéricos. Es una asociación, no una prueba de que el marcado causara la cita. Por separado, SIGIR ’26 identificó el precio explícito como factor de selección en 252.000 pruebas.‡ El valor operativo está en los hechos correctos y legibles por máquina, no en la etiqueta como promesa de ranking.
- Organization — lo que realmente canoniza la entidad no es el marcado en sí, sino los enlaces
sameAsa perfiles oficiales más la coherencia de los datos de marca en toda la web. Úsalo como ancla de la razón social, la dirección y las variantes de grafía. - FAQPage — el envoltorio por sí solo no está demostrado como señal de citación. Úsalo cuando la estructura ayude al lector y las respuestas contengan evidencia, no como marcado obligatorio para la IA.
- Article + Person — la autoría y las fechas apoyan el E-E-A-T, pero ten en cuenta el propio marco de Google: E-E-A-T no es un factor de ranking directo. Su núcleo es la confianza, y su peso es máximo en temas YMYL.
Tras la implementación, valida con el Rich Results Test y con el validador de Schema.org.
3. llms.txt: publícalo, pero sabiendo qué es
Primero, el marco honesto: llms.txt no está demostrado hoy como factor de ranking ni de citación. Google afirma que no es necesario para sus funciones de IA; algunos sistemas pueden recuperarlo.‡‡ El comportamiento de productos y crawlers puede cambiar, así que revisa la documentación vigente y no presentes el archivo como un estándar garantizado.
¿Por qué publicarlo entonces? Porque es barato. Un resumen en Markdown de la estructura del sitio y su contenido clave en la raíz no cuesta nada si se genera automáticamente, y te posiciona para lo que los agentes acaben adoptando.
Regla operativa: si lo publicas, genéralo automáticamente desde las fuentes canónicas. Un archivo manual puede divergir del contenido real; la generación en el build reduce el riesgo, pero el resultado debe seguir vigilándose.
Checklist de verificación
- robots.txt gestiona por separado OAI-SearchBot / ChatGPT-User, Claude-SearchBot / Claude-User, PerplexityBot y Googlebot; GPTBot y ClaudeBot son decisiones de entrenamiento
- El WAF/CDN no devuelve 403 a los user agents de crawlers de IA (revisa los logs de acceso)
- la respuesta HTTP contiene el texto esencial en el HTML inicial; usar el user agent
GPTBotverifica esa respuesta, no el renderizado de todos los sistemas - Las páginas de producto llevan schema Product/Offer rico en atributos con precio y especificaciones reales; el schema Organization tiene enlaces
sameAs - llms.txt se genera en el build (extra barato — no es un factor de citación)
- Las visitas de crawlers de IA en los logs del servidor se validan contra los rangos de IP oficiales y se revisan con regularidad
Después de una modificación puedes volver a medir acceso y estructura. Que pase una comprobación técnica demuestra que cambió la señal, no que esa modificación causara una cita o crecimiento.
* OpenAI, «Overview of OpenAI Crawlers» ** Vercel, «The rise of the AI crawler» *** Google Search Central, «AI Features and Your Website» † OtterlyAI, «The AI Citation Economy: 1+ Million Data Points» (2026) †† Ahrefs, «We Tracked 1,885 Pages Adding Schema. AI Citations Barely Moved.» (mayo de 2026) ‡ Vishwakarma et al., «What Gets Cited: Competitive GEO in AI Answer Engines», SIGIR ‘26 ‡‡ Search Engine Land, «Google says normal SEO works … and LLMS.txt won’t be used» (julio de 2025)
Fuentes
- OpenAI, "Overview of OpenAI Crawlers"
- Vercel, "The rise of the AI crawler"
- Google Search Central, "AI Features and Your Website"
- Anthropic Help Center, “Does Anthropic crawl data from the web?”
- Google for Developers, “Google's common crawlers”
- Does Schema Markup Predict AI Citation? — cross-platform observational study
- Search Engine Land, "Google says normal SEO works … and LLMS.txt won't be used"
- Ahrefs, "We Tracked 1,885 Pages Adding Schema. AI Citations Barely Moved."
- Vishwakarma et al. (Sprinklr), "What Gets Cited: Competitive GEO in AI Answer Engines" (SIGIR '26)
- OtterlyAI, "The AI Citation Economy: 1+ Million Data Points"