← Voltar ao blog

GEO técnico

GEO técnico para engenheiros de marketing: robots.txt, dados estruturados, llms.txt

O GEO técnico começa com acesso dos bots e conteúdo principal no HTML inicial. Separe os bots de busca OAI-SearchBot, Claude-SearchBot e Googlebot dos bots de treinamento GPTBot e ClaudeBot. Dados estruturados e llms.txt não são fatores gerais de citação. Prontidão técnica não garante citações.

Maksim Gurchenkov (CEO, Apurichoumi Inc.)

O que cabe à engenharia no GEO

Conteúdo é trabalho do marketing; se um determinado fetcher consegue buscar o site e ler o texto principal é um problema de infraestrutura. O lado técnico cuida sobretudo do acesso dos bots e da renderização. Dados estruturados ajudam a busca clássica e podem tornar fatos legíveis por máquina, mas não são um fator geral de citação em IA. O llms.txt é um extra opcional cujo status pode mudar. Essa base remove barreiras; não garante seleção nem citação.

1. Libere os crawlers de IA

Bots de recuperação vs. scrapers de treinamento

Nem todos os crawlers de IA fazem o mesmo trabalho. A OpenAI separa OAI-SearchBot para busca, ChatGPT-User para visitas solicitadas por usuários e GPTBot para treinamento potencial.* A Anthropic separa, da mesma forma, Claude-SearchBot, Claude-User e o bot de treinamento ClaudeBot. O Google Search, inclusive AI Overviews e AI Mode, usa o Googlebot. Já Google-Extended é um token de controle independente para certos usos de treinamento e grounding do Gemini; não é crawler da Busca e não afeta inclusão nem ranking no Google Search. As regras, portanto, devem ser decididas por função e pelo acesso desejado a cada produto.

Isso importa na prática: uma análise da Otterly de mais de um milhão de citações de IA constatou que 73% dos sites têm barreiras técnicas bloqueando o acesso de crawlers de IA.†

# Busca e visitas solicitadas por usuários — decida conforme o acesso desejado ao produto
User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: Googlebot
Allow: /

# Treinamento potencial — decisão separada
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

# Token independente de produto do Google; não controla o Google Search
User-agent: Google-Extended
Disallow: /

Uma ressalva: user agents podem ser falsificados. Para saber quem realmente visitou, valide as entradas de log contra as faixas de IP oficiais quando o fornecedor as publicar. Além disso, o robots.txt mostra o que é permitido; só os logs revelam se um bot de fato apareceu.

Verifique também se a proteção contra bots da sua CDN ou WAF não está bloqueando silenciosamente os crawlers de IA. Uma regra de permissão no robots.txt não vale nada se o firewall retorna 403.

HTML que não depende de JavaScript

A análise da Vercel não encontrou traços de execução de JavaScript em mais de meio bilhão de requisições do GPTBot. Isso documenta o comportamento observado do GPTBot, não o de todos os fetchers da OpenAI, do Claude ou do Perplexity. O Google consegue renderizar JavaScript rastreável e não bloqueado para a Busca e as AI Overviews. Ainda assim, SSR, SSG ou pré-renderização é a base multiplataforma mais segura para que o conteúdo essencial esteja no HTML inicial.

A verificação é um único comando:

curl -A "GPTBot" https://example.com/page/ | grep "key copy"

Esse comando verifica o que o servidor entrega no HTML inicial a um user agent GPTBot; não prova se um bot real executa JavaScript. Se o texto estiver ausente, verifique se ele precisa estar disponível nas plataformas-alvo sem depender de renderização no cliente.

2. Dados estruturados: úteis, mas não onde você esperaria

Dois fatos de saída. O Google afirma oficialmente que dados estruturados não são exigidos para a busca generativa com IA e que não existe nenhuma marcação schema.org especial a adicionar para os recursos de IA.*** E o experimento controlado mais forte até hoje — a Ahrefs acompanhou 1.885 páginas que adicionaram JSON-LD contra controles pareados — não encontrou aumento de citações em nenhuma plataforma de IA.††

Um estudo multiplataforma relata uma exceção observacional, que exige cautela:

Depois da implementação, valide com o Rich Results Test e com o validador do Schema.org.

3. llms.txt: publique, mas sabendo o que é

Primeiro, o enquadramento honesto: não há hoje efeito comprovado do llms.txt sobre ranking ou citações. O Google não o suporta; alguns sistemas podem rastrear o arquivo, mas rastreamento não prova que ele seja usado nas respostas.‡‡ Essas documentações dos fornecedores e os comportamentos observados são fontes vivas que podem mudar: verifique o status periodicamente, em vez de transformar a conclusão atual em regra permanente.

Por que publicá-lo então? Um resumo em Markdown da estrutura e do conteúdo principal do site custa pouco quando é gerado automaticamente e fica disponível caso um cliente realmente escolha usá-lo. Isso não produz, por si só, vantagem de ranking nem de citação.

Uma regra operacional: evite manutenção exclusivamente manual, porque o arquivo pode divergir do conteúdo real do site. Sempre que possível, gere-o no build a partir das suas coleções e confira o resultado — o llms.txt deste site é construído a partir dos artigos e termos do glossário.

Checklist de verificação

  1. O robots.txt trata conscientemente os bots de busca e de usuário desejados (OAI-SearchBot, ChatGPT-User, PerplexityBot, Claude-SearchBot, Claude-User, Googlebot)
  2. O WAF/CDN não retorna 403 para os user agents dos crawlers de IA (verifique os logs de acesso)
  3. curl -A "GPTBot" mostra o que o servidor entrega no HTML inicial, sem extrapolar para o comportamento de todos os bots
  4. Os dados estruturados correspondem ao texto visível; atributos de produto e links sameAs estão corretos, sem promessa de aumento de citações
  5. O llms.txt, se publicado, é gerado no build e revisto periodicamente conforme o status atual dos fornecedores
  6. As visitas de crawlers de IA nos logs do servidor são validadas contra as faixas de IP oficiais e revisadas regularmente

Com essa base no lugar, as barreiras técnicas conhecidas são reduzidas. Isso torna as melhorias de conteúdo mensuráveis, sem garantir recuperação nem citação. Uma mudança posterior nas métricas também não prova que uma alteração específica foi a causa.

* OpenAI, “Overview of OpenAI Crawlers” ** Vercel, “The rise of the AI crawler” *** Google Search Central, “AI Features and Your Website” † OtterlyAI, “The AI Citation Economy: 1+ Million Data Points” †† Ahrefs, “We Tracked 1,885 Pages Adding Schema. AI Citations Barely Moved.” ‡ Vishwakarma et al., “What Gets Cited: Competitive GEO in AI Answer Engines”, SIGIR ‘26 ‡‡ Search Engine Land, “Google says normal SEO works … and LLMS.txt won’t be used” § “Does Schema Markup Predict AI Citation?” — estudo multiplataforma

Fontes

  1. OpenAI, "Overview of OpenAI Crawlers"
  2. Anthropic Help Center, "Does Anthropic crawl data from the web, and how can site owners block the crawler?"
  3. Vercel, "The rise of the AI crawler"
  4. Google Search Central, "AI Features and Your Website"
  5. Google Search Central, "Google's common crawlers"
  6. Search Engine Land, "Google says normal SEO works … and LLMS.txt won't be used"
  7. Ahrefs, "We Tracked 1,885 Pages Adding Schema. AI Citations Barely Moved."
  8. Does Schema Markup Predict AI Citation? — cross-platform study
  9. Vishwakarma et al. (Sprinklr), "What Gets Cited: Competitive GEO in AI Answer Engines" (SIGIR '26)
  10. OtterlyAI, "The AI Citation Economy: 1+ Million Data Points"
Diagnóstico gratuito Falar com vendas