TL;DR L'accesso dei crawler AI è il prerequisito tecnico della visibilità AI, non un dettaglio da lasciare all'IT. robots.txt è solo il primo livello: WAF, CDN, cache e rendering JavaScript possono bloccare i bot senza lasciare traccia. Serve distinguere i bot di training (GPTBot, ClaudeBot, CCBot) da quelli di ricerca (OAI-SearchBot, PerplexityBot, Claude-SearchBot) e dai fetch su azione utente (ChatGPT-User, Perplexity-User). La verifica va fatta su tre fronti: file robots.txt, risposta del server alla stringa user-agent e log con IP ufficiali. Cambia il lavoro tra e-commerce (pagine prodotto, prezzo, checkout) e aziende di servizi (pagine servizio, lead-gen, contenuti dietro form). Dopo l'audit, il passo successivo è misurare citazioni e visibilità AI, ed è qui che entra in gioco Semly.
Introduzione
Hai un negozio WooCommerce ben posizionato su Google e chiedi a ChatGPT di consigliare un prodotto della tua categoria. Non ti nomina. Oppure gestisci un'azienda di servizi, ricevi contatti dall'organico, ma nessun lead arriva da una risposta AI. La prima domanda da farsi non è "come convinco il modello a parlare di me", ma una più semplice: i crawler AI riescono ad accedere al mio sito?
Se la risposta è no, tutto il resto è inutile. Nessun contenuto ottimizzato, nessun dato strutturato, nessuna strategia GEO/AEO funziona se i bot non riescono nemmeno a leggere le tue pagine. E il problema è che i blocchi più frequenti non si vedono: non compaiono in robots.txt, non generano errori visibili, non ti avvisa nessuno.
Questa guida ti accompagna in un audit pratico, passo dopo passo. Alla fine saprai controllare robots.txt, testare la risposta del server, leggere i log, scoprire i blocchi nascosti in WAF e CDN, e distinguere un blocco reale da un falso positivo.
Verificare se i crawler AI possono accedere al sito WordPress: cosa controllare prima di iniziare
Prima di toccare qualsiasi cosa, tieni a mente questo: un crawler può essere fermato a tre livelli diversi.
- robots.txt — la policy dichiarata. È una richiesta, non un firewall.
- WAF e CDN — regole di bot management, rate limit, challenge JavaScript. Qui i blocchi sono silenziosi.
- Rendering e cache — se il contenuto è generato lato client, il bot vede una pagina quasi vuota; se la CDN risponde dalla cache, l'origine non registra nulla.
Ecco i crawler che devi conoscere.
| User-agent | Scopo | Rispetta robots.txt |
|---|---|---|
| GPTBot | Training dei modelli OpenAI | Sì |
| OAI-SearchBot | Indicizzazione per ChatGPT Search | Sì |
| ChatGPT-User | Fetch su azione dell'utente | Generalmente no |
| PerplexityBot | Indicizzazione per le risposte Perplexity | Sì |
| Perplexity-User | Fetch su azione dell'utente | Generalmente no |
| ClaudeBot | Training dei modelli Anthropic | Sì |
| Claude-User | Fetch su azione dell'utente | Sì |
| Claude-SearchBot | Qualità dei risultati di ricerca Claude | Sì |
| CCBot | Dataset aperto Common Crawl, usato da molti LLM | Sì |
| Google-Extended | Token di controllo per Gemini/Vertex AI | Non è un crawler |
Attenzione: Google-Extended non è un crawler con un proprio user-agent HTTP. È un token che dichiari in robots.txt per controllare l'uso dei contenuti in Gemini e Vertex AI. Non lo troverai mai nei log e non è testabile con curl.
Prima di iniziare, procurati: accesso al file manager o SSH, pannello hosting, dashboard della CDN/WAF e accesso ai log del server. Senza questi quattro elementi l'audit si ferma a metà.
Passo 1 — Controllare il file robots.txt di WordPress
Su WordPress il robots.txt può essere un file fisico nella root oppure un file virtuale generato dal CMS o da un plugin SEO. Il secondo caso è il più insidioso: modifichi il file fisico, ma il plugin lo sovrascrive.
Comando rapido
curl -sS -D - https://tuosito.it/robots.txt
Cosa cercare:
- righe
Disallowche citano GPTBot, PerplexityBot, CCBot o altri bot AI; - un
User-agent: *seguito daDisallow: /, che blocca tutto e tutti; - redirect inattesi o un 404 (robots.txt mancante non è un blocco, ma è un segnale da sistemare).
Esempio di blocco involontario tipico:
User-agent: *
Disallow: /wp-admin/
Disallow: /
Quel Disallow: / finale esclude l'intero sito. Succede più spesso di quanto pensi, perché arriva da template, snippet copiati o configurazioni di plugin.
Per correggere, agisci nel punto giusto: se il file è virtuale, usa l'editor del plugin SEO; se è fisico, modificalo via file manager o SSH. Dopo la modifica, considera fino a circa 24 ore perché i bot OpenAI e Perplexity recepiscano la nuova policy.
Attenzione: il robots.txt ereditato da template o plugin è la causa più comune di blocco inconsapevole. Controllalo prima di dare la colpa a qualcun altro.
Passo 2 — Testare come risponde il server alla stringa del bot
Ora verifica cosa vede davvero un crawler che non esegue JavaScript.
Comando rapido
curl -sL -A "GPTBot" https://tuosito.it/ -o out.html
wc -c out.html
Se il file pesa pochi kilobyte, il contenuto è probabilmente generato lato client e il bot vede una pagina vuota. Se pesa come la pagina reale, il rendering non è un problema.
Poi leggi lo status code.
| Status | Significato |
|---|---|
| 200 | Pagina consegnata correttamente |
| 301/302 | Redirect: controlla che la catena porti a una pagina valida |
| 403 | Bloccato da WAF o server |
| 404 | Risorsa mancante |
| 429 | Rate limit: il bot viene rallentato o respinto |
| 503 | Server sotto carico o in manutenzione |
Attenzione: questo test dimostra solo come reagisce la tua infrastruttura alla stringa "GPTBot". Non prova che il crawler reale passi, perché l'IP non è verificato. Chiunque può inviare quella stringa.
Passo 3 — Leggere i log e verificare gli IP ufficiali
Qui arriva la conferma vera.
Comando rapido
grep -Ei "GPTBot|ClaudeBot|OAI-SearchBot|ChatGPT-User|PerplexityBot|CCBot" access.log
zgrep -Ei "GPTBot|PerplexityBot" access.log.*.gz
Poi verifica l'identità del bot con reverse DNS e confronto con gli IP ufficiali:
dig -x 20.171.207.1
Gli intervalli IP ufficiali sono pubblicati in JSON dai fornitori: OpenAI (gptbot, searchbot, chatgpt-user), Perplexity (perplexitybot, perplexity-user), Common Crawl e Anthropic. Se il reverse DNS non corrisponde al dominio del fornitore, stai guardando uno spoofing.
Un dettaglio da interpretare bene: se nei log vedi richieste solo a /robots.txt, il bot sta controllando la policy, non sta scaricando contenuti. È un segnale di attività, non di accesso effettivo alle pagine.
Attenzione: se usi una CDN, i bot possono essere serviti direttamente dall'edge. In quel caso l'origine non registra nulla e potresti concludere erroneamente che nessun crawler ti visita.
Passo 4 — Controllare WAF, CDN e plugin (i blocchi invisibili)
Questi sono i blocchi che non compaiono in robots.txt e che spesso nessuno ha configurato di proposito.
Checklist da spuntare:
- regole di bot management nella dashboard della CDN;
- blocchi attivi "by default" sui domini nuovi;
- conflitti tra plugin SEO e plugin di sicurezza;
- login wall, consent wall o contenuti dietro form;
- differenza tra
noindexeDisallow: non sono la stessa cosa.
Perplexity documenta esplicitamente regole WAF basate su combinazione di User-Agent e intervallo IP, sia su Cloudflare sia su AWS WAF. Vale la pena controllare che le tue regole non escludano i bot che vuoi far passare.
Attenzione: noindex e Disallow non sono equivalenti. noindex viene rispettato solo se il crawler riesce a leggere la pagina. Se la blocchi in robots.txt, il crawler non legge il noindex e la pagina può comunque comparire nei risultati se linkata altrove.
Cosa cambia tra e-commerce e aziende di servizi
| Modello | URL chiave da verificare | Bot prioritari | KPI di business |
|---|---|---|---|
| E-commerce | Home, categorie, pagine prodotto, prezzo, disponibilità | OAI-SearchBot, PerplexityBot, GPTBot | Prodotti citati, referral AI, conversioni |
| Servizi | Pagine servizio, casi studio, contatti | OAI-SearchBot, PerplexityBot, Claude-SearchBot | Lead da AI, richieste preventivo |
Per un e-commerce WooCommerce, le pagine che contano sono quelle che un modello può citare in una raccomandazione: prodotto, categoria, prezzo e disponibilità. Se il prezzo è caricato via JavaScript o la disponibilità è dietro un widget, il bot non lo vede.
Per un'azienda di servizi, il focus è su pagine servizio, casi studio e contatti. Attenzione ai contenuti dietro form o login: i crawler non hanno credenziali né cookie, quindi quei contenuti sono invisibili per definizione.
Semly supporta WooCommerce tramite connessione con chiave API e monitora le citazioni per entrambi i modelli di business, così puoi collegare il lavoro tecnico ai risultati reali. Se gestisci un negozio, puoi partire dalla visibilità prodotto in AI; se vendi servizi, il punto di partenza è il posizionamento della tua azienda in AI.
Errori comuni e falsi positivi (e come correggerli)
- robots.txt ereditato → sintomo: blocchi che non hai mai scritto → correzione: controlla l'editor del plugin SEO e il file fisico.
- Blocco WAF invisibile → sintomo: 403 nei log o nessun hit → correzione: esamina le regole di bot management.
- Cache CDN che nasconde i bot → sintomo: log origine vuoti → correzione: verifica i log della CDN, non solo quelli del server.
- Rendering client-side → sintomo: HTML di pochi KB → correzione: server-side rendering o prerendering.
- Login o consent wall → sintomo: contenuti mai crawlabili → correzione: esponi le informazioni chiave su pagine pubbliche.
Disallow: /conUser-agent: *→ sintomo: nessun motore ti indicizza → correzione: restringi le regole ai path giusti.- Confusione noindex/robots.txt → sintomo: pagina indicizzata nonostante il blocco → correzione: usa
noindexper escludere, robots.txt per gestire il crawl. - Spoofing dello user-agent → sintomo: hit "GPTBot" con IP sospetti → correzione: verifica reverse DNS e JSON ufficiali.
- Google-Extended → sintomo: non lo trovi nei log → correzione: è normale, è un token, non un crawler.
Drzewko decisionale: training o solo ricerca?
La scelta non è "tutto aperto" o "tutto chiuso". Chiediti cosa vuoi ottenere.
- Vuoi essere citato nelle risposte AI? Lascia passare i bot di ricerca: OAI-SearchBot, PerplexityBot, Claude-SearchBot.
- Vuoi anche contribuire al training dei modelli? Aggiungi GPTBot, ClaudeBot, CCBot.
- Vuoi solo visibilità immediata e nessun uso dei tuoi contenuti per il training? Consenti i bot di ricerca e valuta i training crawler caso per caso.
- Non vuoi comparire affatto? Blocca tutto, sapendo che sparire dalle risposte AI è la conseguenza diretta.
Ricorda un punto pratico: OpenAI dichiara che i siti esclusi da OAI-SearchBot non vengono mostrati nelle risposte di ChatGPT Search. Bloccare i bot di ricerca significa rinunciare alle citazioni.
Cosa fare dopo la verifica: dal crawl alle citazioni
L'accesso è la condizione necessaria, non il risultato. Dopo l'audit, monitora questi KPI:
- Crawl coverage per bot: percentuale di URL chiave con almeno un hit 200 negli ultimi 30 giorni.
- Distribuzione degli status code: quanti 200 rispetto a 403, 429 e 5xx per ogni bot.
- Referral AI: sessioni con referrer da chatgpt.com, perplexity.ai, claude.ai.
- Citation share: quanto spesso il tuo brand viene citato come fonte.
- Mention Rate vs Citation Rate: essere nominato non è la stessa cosa che essere citato come fonte.
Cosa fare dopo: con Semly puoi monitorare come il tuo marchio appare nelle risposte AI, analizzando prompt reali, fonti citate e concorrenti. I dati sono osservazionali e non garantiscono gli stessi risultati per ogni marchio, ma ti danno una base concreta per capire se il lavoro tecnico sta producendo effetto.
Checklist finale: audit in 30 minuti
- Apri
https://tuosito.it/robots.txte cercaDisallowsui bot AI. - Verifica se il file è fisico o generato da un plugin.
- Esegui il test curl con user-agent GPTBot e controlla la dimensione dell'HTML.
- Leggi lo status code e interpretalo con la tabella.
- Cerca i bot nei log con grep e zgrep.
- Verifica gli IP con reverse DNS e JSON ufficiali.
- Controlla le regole WAF e CDN.
- Controlla i conflitti tra plugin SEO e sicurezza.
- Verifica se i contenuti chiave sono dietro form o login.
- Collega il monitoraggio delle citazioni con Semly.
FAQ
Bloccare i bot AI fa perdere citazioni? Sì, se blocchi i bot di ricerca. OpenAI dichiara che i siti esclusi da OAI-SearchBot non compaiono nelle risposte di ChatGPT Search.
I crawler AI eseguono JavaScript?
In genere no. Se il tuo contenuto è generato lato client, il bot vede una pagina quasi vuota. Il test con curl e wc -c te lo mostra subito.
ChatGPT-User è un crawler automatico? No. È un fetch attivato dall'utente e generalmente non segue le regole di robots.txt.
Google-Extended è testabile? No. È un token di controllo in robots.txt, non un crawler con user-agent HTTP. Non lo troverai nei log.
Quanto tempo serve per vedere i bot nei log? Dipende dalla frequenza di crawl e dalla cache. OpenAI e Perplexity indicano fino a circa 24 ore per recepire le modifiche a robots.txt. Se usi una CDN, controlla anche i log dell'edge.
Conclusione
Tre punti da portarti a casa. Primo: la verifica va fatta su tre livelli, non solo su robots.txt. Secondo: distingui sempre bot di training, bot di ricerca e fetch su azione utente, perché le conseguenze sono diverse. Terzo: i falsi positivi sono la norma, dalla cache CDN al rendering client-side.
Esegui l'audit con la checklist qui sopra, sistema ciò che trovi e poi passa alla parte che conta davvero: misurare se il tuo marchio viene citato. Con Semly puoi monitorare la tua visibilità nelle risposte AI e capire se l'accesso dei crawler si sta trasformando in citazioni reali. Se vuoi confrontare i piani disponibili, dai un'occhiata ai pacchetti di visibilità AI.