GEO técnico
GEO técnico para engenheiros de marketing: robots.txt, dados estruturados, llms.txt
O GEO técnico começa com acesso dos bots e conteúdo principal no HTML inicial. Separe os bots de busca OAI-SearchBot, Claude-SearchBot e Googlebot dos bots de treinamento GPTBot e ClaudeBot. Dados estruturados e llms.txt não são fatores gerais de citação. Prontidão técnica não garante citações.
O que cabe à engenharia no GEO
Conteúdo é trabalho do marketing; se um determinado fetcher consegue buscar o site e ler o texto principal é um problema de infraestrutura. O lado técnico cuida sobretudo do acesso dos bots e da renderização. Dados estruturados ajudam a busca clássica e podem tornar fatos legíveis por máquina, mas não são um fator geral de citação em IA. O llms.txt é um extra opcional cujo status pode mudar. Essa base remove barreiras; não garante seleção nem citação.
1. Libere os crawlers de IA
Bots de recuperação vs. scrapers de treinamento
Nem todos os crawlers de IA fazem o mesmo trabalho. A OpenAI separa OAI-SearchBot para busca, ChatGPT-User para visitas solicitadas por usuários e GPTBot para treinamento potencial.* A Anthropic separa, da mesma forma, Claude-SearchBot, Claude-User e o bot de treinamento ClaudeBot. O Google Search, inclusive AI Overviews e AI Mode, usa o Googlebot. Já Google-Extended é um token de controle independente para certos usos de treinamento e grounding do Gemini; não é crawler da Busca e não afeta inclusão nem ranking no Google Search. As regras, portanto, devem ser decididas por função e pelo acesso desejado a cada produto.
Isso importa na prática: uma análise da Otterly de mais de um milhão de citações de IA constatou que 73% dos sites têm barreiras técnicas bloqueando o acesso de crawlers de IA.†
# Busca e visitas solicitadas por usuários — decida conforme o acesso desejado ao produto
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Googlebot
Allow: /
# Treinamento potencial — decisão separada
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
# Token independente de produto do Google; não controla o Google Search
User-agent: Google-Extended
Disallow: /
Uma ressalva: user agents podem ser falsificados. Para saber quem realmente visitou, valide as entradas de log contra as faixas de IP oficiais quando o fornecedor as publicar. Além disso, o robots.txt mostra o que é permitido; só os logs revelam se um bot de fato apareceu.
Verifique também se a proteção contra bots da sua CDN ou WAF não está bloqueando silenciosamente os crawlers de IA. Uma regra de permissão no robots.txt não vale nada se o firewall retorna 403.
HTML que não depende de JavaScript
A análise da Vercel não encontrou traços de execução de JavaScript em mais de meio bilhão de requisições do GPTBot. Isso documenta o comportamento observado do GPTBot, não o de todos os fetchers da OpenAI, do Claude ou do Perplexity. O Google consegue renderizar JavaScript rastreável e não bloqueado para a Busca e as AI Overviews. Ainda assim, SSR, SSG ou pré-renderização é a base multiplataforma mais segura para que o conteúdo essencial esteja no HTML inicial.
A verificação é um único comando:
curl -A "GPTBot" https://example.com/page/ | grep "key copy"
Esse comando verifica o que o servidor entrega no HTML inicial a um user agent GPTBot; não prova se um bot real executa JavaScript. Se o texto estiver ausente, verifique se ele precisa estar disponível nas plataformas-alvo sem depender de renderização no cliente.
2. Dados estruturados: úteis, mas não onde você esperaria
Dois fatos de saída. O Google afirma oficialmente que dados estruturados não são exigidos para a busca generativa com IA e que não existe nenhuma marcação schema.org especial a adicionar para os recursos de IA.*** E o experimento controlado mais forte até hoje — a Ahrefs acompanhou 1.885 páginas que adicionaram JSON-LD contra controles pareados — não encontrou aumento de citações em nenhuma plataforma de IA.††
Um estudo multiplataforma relata uma exceção observacional, que exige cautela:
- Product / SoftwareApplication + Offer com atributos reais — no conjunto observado, páginas com schema Product/Review preenchido com atributos concretos foram citadas com mais frequência (61,7% contra 41,6% para tipos genéricos).§ É uma associação de um preprint, não prova de que a marcação causa citações. Preço explícito também apareceu entre quatro “porteiros” contextuais da citação num estudo do SIGIR ‘26 com 252.000 testes controlados.‡ O valor prático está em fatos corretos legíveis por máquina, não numa regra universal de que “schema aumenta citações”.
- Organization — o que de fato canoniza a entidade não é a marcação em si, mas os links
sameAspara perfis oficiais somados à consistência dos fatos da marca em toda a web. Use-a como âncora para razão social, endereço e variantes de grafia. - FAQPage — o invólucro por si só não é um fator de citação confirmado. Um FAQ pode melhorar a estrutura quando cada resposta traz números, definições ou comparações sólidas; apenas envolver o texto em perguntas e respostas não basta.
- Article + Person — autoria e datas sustentam o E-E-A-T, mas atente para o enquadramento do próprio Google: E-E-A-T não é um fator de ranqueamento direto. Seu núcleo é a confiança, e o peso é máximo em temas YMYL.
Depois da implementação, valide com o Rich Results Test e com o validador do Schema.org.
3. llms.txt: publique, mas sabendo o que é
Primeiro, o enquadramento honesto: não há hoje efeito comprovado do llms.txt sobre ranking ou citações. O Google não o suporta; alguns sistemas podem rastrear o arquivo, mas rastreamento não prova que ele seja usado nas respostas.‡‡ Essas documentações dos fornecedores e os comportamentos observados são fontes vivas que podem mudar: verifique o status periodicamente, em vez de transformar a conclusão atual em regra permanente.
Por que publicá-lo então? Um resumo em Markdown da estrutura e do conteúdo principal do site custa pouco quando é gerado automaticamente e fica disponível caso um cliente realmente escolha usá-lo. Isso não produz, por si só, vantagem de ranking nem de citação.
Uma regra operacional: evite manutenção exclusivamente manual, porque o arquivo pode divergir do conteúdo real do site. Sempre que possível, gere-o no build a partir das suas coleções e confira o resultado — o llms.txt deste site é construído a partir dos artigos e termos do glossário.
Checklist de verificação
- O robots.txt trata conscientemente os bots de busca e de usuário desejados (OAI-SearchBot, ChatGPT-User, PerplexityBot, Claude-SearchBot, Claude-User, Googlebot)
- O WAF/CDN não retorna 403 para os user agents dos crawlers de IA (verifique os logs de acesso)
curl -A "GPTBot"mostra o que o servidor entrega no HTML inicial, sem extrapolar para o comportamento de todos os bots- Os dados estruturados correspondem ao texto visível; atributos de produto e links
sameAsestão corretos, sem promessa de aumento de citações - O llms.txt, se publicado, é gerado no build e revisto periodicamente conforme o status atual dos fornecedores
- As visitas de crawlers de IA nos logs do servidor são validadas contra as faixas de IP oficiais e revisadas regularmente
Com essa base no lugar, as barreiras técnicas conhecidas são reduzidas. Isso torna as melhorias de conteúdo mensuráveis, sem garantir recuperação nem citação. Uma mudança posterior nas métricas também não prova que uma alteração específica foi a causa.
* OpenAI, “Overview of OpenAI Crawlers” ** Vercel, “The rise of the AI crawler” *** Google Search Central, “AI Features and Your Website” † OtterlyAI, “The AI Citation Economy: 1+ Million Data Points” †† Ahrefs, “We Tracked 1,885 Pages Adding Schema. AI Citations Barely Moved.” ‡ Vishwakarma et al., “What Gets Cited: Competitive GEO in AI Answer Engines”, SIGIR ‘26 ‡‡ Search Engine Land, “Google says normal SEO works … and LLMS.txt won’t be used” § “Does Schema Markup Predict AI Citation?” — estudo multiplataforma
Fontes
- OpenAI, "Overview of OpenAI Crawlers"
- Anthropic Help Center, "Does Anthropic crawl data from the web, and how can site owners block the crawler?"
- Vercel, "The rise of the AI crawler"
- Google Search Central, "AI Features and Your Website"
- Google Search Central, "Google's common crawlers"
- Search Engine Land, "Google says normal SEO works … and LLMS.txt won't be used"
- Ahrefs, "We Tracked 1,885 Pages Adding Schema. AI Citations Barely Moved."
- Does Schema Markup Predict AI Citation? — cross-platform study
- Vishwakarma et al. (Sprinklr), "What Gets Cited: Competitive GEO in AI Answer Engines" (SIGIR '26)
- OtterlyAI, "The AI Citation Economy: 1+ Million Data Points"