GEO tecnica
GEO tecnica per marketing engineer: robots.txt, dati strutturati, llms.txt
La GEO tecnica parte da accesso e contenuto essenziale nell’HTML iniziale. Distingui OAI-SearchBot e ChatGPT-User da GPTBot; Claude-SearchBot e Claude-User da ClaudeBot; Googlebot da Google-Extended. Lo schema mostra associazioni osservative, non una garanzia di citazione. llms.txt è opzionale e può diventare obsoleto.
Cosa possiede l’engineering nella GEO
La strategia dei contenuti può appartenere al marketing, ma accesso e rendering sono problemi infrastrutturali. Se il percorso di retrieval pertinente non riesce a recuperare o analizzare una pagina, quel percorso non può usarla. I dati strutturati restano utili per risultati avanzati e fatti leggibili dalla macchina, ma lo schema generico non mostra un aumento affidabile delle citazioni. llms.txt è uno strato opzionale, non un segnale di ranking.
1. Ammetti i crawler AI
Bot di retrieval vs scraper di training
Non tutti i crawler AI fanno lo stesso lavoro. Per OpenAI, OAI-SearchBot supporta la ricerca, ChatGPT-User effettua fetch richiesti dall’utente e GPTBot raccoglie dati per il training. Per Anthropic, Claude-SearchBot e Claude-User supportano ricerca e richieste utente, mentre ClaudeBot è il crawler di training. PerplexityBot è destinato alla ricerca. Per Google, Googlebot alimenta Search e AI Overviews; Google-Extended è un token di controllo per usi Gemini e non influisce su inclusione o ranking in Google Search. Bloccare un bot di ricerca o utente può ridurre la possibilità che quel sistema recuperi il contenuto; non equivale a un esito universale su tutte le piattaforme.
Non è teoria: un’analisi di Otterly su oltre un milione di citazioni AI (2026) ha rilevato che il 73% dei siti presenta barriere tecniche che bloccano l’accesso dei crawler AI.†
# Ricerca e richieste degli utenti
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Googlebot
Allow: /
# Training dei modelli
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
# Controllo separato per usi Gemini; non governa Google Search
User-agent: Google-Extended
Allow: /
Questo è solo un esempio di separazione degli scopi, non un blocco da incollare senza modifiche. Decidi la policy per ogni vendor, proteggi sempre i percorsi privati e ricontrolla la documentazione ufficiale prima di cambiare robots.txt.
Due avvertenze. Primo: il robots.txt è rispettato dai bot principali, ma non da tutti — Bytespider lo ignora. Secondo: gli user agent vengono falsificati; per sapere chi ha visitato davvero, valida le righe di log contro i range IP ufficiali (per esempio, OpenAI pubblica la lista IP del suo searchbot come searchbot.json).
Controlla anche che la protezione bot di CDN o WAF non stia bloccando silenziosamente i crawler AI. Una regola allow nel robots.txt non significa nulla se il firewall risponde 403.
HTML che non dipende da JavaScript
L’analisi di Vercel ha trovato zero tracce di esecuzione JavaScript in oltre mezzo miliardo di richieste GPTBot. È un’osservazione specifica di GPTBot e non autorizza a generalizzare a Claude, Perplexity o tutti gli altri fetcher. Google può renderizzare JavaScript crawlable quando non è bloccato. SSR, SSG o prerendering restano quindi la baseline più sicura: il testo essenziale è già nell’HTML iniziale, indipendentemente dalle capacità del singolo crawler.
La verifica è un comando:
curl -A "GPTBot" https://example.com/page/ | grep "testo chiave"
Se il testo non è nell’HTML iniziale, la strategia di rendering va rivista.
2. Dati strutturati: utili, ma non dove te lo aspetti
Due fatti in apertura. Google dichiara ufficialmente che i dati strutturati non sono richiesti per la ricerca generativa AI e che non esiste alcun markup schema.org speciale da aggiungere per le funzionalità AI.*** E l’esperimento controllato più solido a oggi — Ahrefs ha seguito 1.885 pagine che hanno aggiunto JSON-LD contro gruppi di controllo abbinati — non ha trovato alcun aumento di citazioni su nessuna piattaforma AI.††
C’è un segnale osservativo che può essere utile, ma non è una prova causale:
- Product / SoftwareApplication + Offer con attributi reali — uno studio cross-platform osservativo ha rilevato citazioni nel 61,7% delle pagine Product/Review ricche di prezzo, rating e specifiche, contro il 41,6% dei tipi generici. È un’associazione, non la prova che il markup causi la citazione. Separatamente, lo studio SIGIR ’26 su 252.000 probe ha individuato il prezzo esplicito tra i fattori di selezione.‡ Il punto operativo sono i fatti corretti e leggibili dalla macchina, non il tag come promessa di ranking.
- Organization — ciò che canonizza davvero l’entità non è il markup in sé, ma i link
sameAsai profili ufficiali più la coerenza dei fatti di brand su tutto il web. Usalo come ancora per ragione sociale, indirizzo e varianti di scrittura. - FAQPage — il wrapper da solo non è un segnale di citazione dimostrato. Usalo quando la struttura aiuta il lettore e le risposte contengono prove, non come markup obbligatorio per l’AI.
- Article + Person — autorialità e date sostengono l’E-E-A-T, ma tieni presente l’inquadramento di Google stesso: l’E-E-A-T non è un fattore di ranking diretto. Il suo nucleo è la fiducia, e il peso è massimo sui temi YMYL.
Dopo l’implementazione, valida sia con il test dei risultati avanzati sia con il validatore Schema.org.
3. llms.txt: pubblicalo, ma sapendo cos’è
Prima l’inquadramento onesto: llms.txt non è oggi un fattore di ranking o citazione dimostrato. Google dichiara che non è necessario per le sue funzionalità AI; alcuni sistemi possono comunque recuperarlo.‡‡ Il comportamento dei prodotti e dei crawler può cambiare, quindi verifica la documentazione corrente e non presentare il file come uno standard garantito.
Perché pubblicarlo allora? Perché costa poco. Un riassunto Markdown della struttura e dei contenuti chiave del sito alla root non costa nulla se generato automaticamente — e ti posiziona per qualunque adozione futura da parte degli agenti.
Regola operativa: se lo pubblichi, generalo automaticamente dalle fonti canoniche. Un file mantenuto a mano può divergere dai contenuti reali; la generazione in build riduce questo rischio, ma va comunque monitorata.
Checklist di verifica
- robots.txt gestisce separatamente i bot desiderati: OAI-SearchBot / ChatGPT-User, Claude-SearchBot / Claude-User, PerplexityBot e Googlebot; GPTBot e ClaudeBot sono scelte di training
- WAF/CDN non risponde 403 agli user agent dei crawler AI (controlla i log di accesso)
- una richiesta all’URL mostra il testo essenziale nell’HTML iniziale; usare
GPTBotcome user agent verifica solo quella risposta HTTP, non il rendering di ogni sistema - Le pagine prodotto portano schema Product/Offer ricco di attributi con prezzo e specifiche reali; lo schema Organization ha link
sameAs - llms.txt è generato in build (extra a basso costo — non un fattore di citazione)
- Le visite dei crawler AI nei log del server sono validate contro i range IP ufficiali e riviste regolarmente
Con queste fondamenta puoi rimisurare accesso e struttura dopo una modifica. Un check che passa dimostra che il segnale tecnico è cambiato; non prova che la modifica abbia causato una citazione o una crescita.
* OpenAI, «Overview of OpenAI Crawlers» ** Vercel, «The rise of the AI crawler» *** Google Search Central, «AI Features and Your Website» † OtterlyAI, «The AI Citation Economy: 1+ Million Data Points» (2026) †† Ahrefs, «We Tracked 1,885 Pages Adding Schema. AI Citations Barely Moved.» (maggio 2026) ‡ Vishwakarma et al., «What Gets Cited: Competitive GEO in AI Answer Engines», SIGIR ‘26 ‡‡ Search Engine Land, «Google says normal SEO works … and LLMS.txt won’t be used» (luglio 2025)
Fonti
- OpenAI, “Overview of OpenAI Crawlers”
- Vercel, “The rise of the AI crawler”
- Google Search Central, “AI Features and Your Website”
- Anthropic Help Center, “Does Anthropic crawl data from the web?”
- Google for Developers, “Google's common crawlers”
- Does Schema Markup Predict AI Citation? — cross-platform observational study
- Search Engine Land, “Google says normal SEO works … and LLMS.txt won't be used”
- Ahrefs, “We Tracked 1,885 Pages Adding Schema. AI Citations Barely Moved.”
- Vishwakarma et al. (Sprinklr), “What Gets Cited: Competitive GEO in AI Answer Engines” (SIGIR '26)
- OtterlyAI, “The AI Citation Economy: 1+ Million Data Points”