La tua pagina non compare più su Google. Oppure compare, ma ChatGPT, Gemini e Perplexity non la citano mai quando qualcuno chiede informazioni sul tuo settore. In entrambi i casi il sospetto numero uno è lo stesso: un noindex rimasto attivo per errore.
Il problema è che il noindex non è un interruttore isolato. Spegne Google e, di conseguenza, spegne anche l'AI. I motori generativi si appoggiano in larga parte agli indici di Google e Bing: se la pagina non è indicizzata, non ha materiale su cui basarsi per citarti.
Questa guida è per redattori, SEO freelance e titolari di negozi WooCommerce che conoscono il pannello di WordPress ma non hanno mai aperto gli header HTTP. Ti mostriamo un audit in 7 passi, come distinguere il noindex da una blocco in robots.txt e come non tagliare fuori per sbaglio i bot AI.
TL;DR noindex e robots.txt non sono la stessa cosa: noindex è una direttiva di indicizzazione, robots.txt è una direttiva di crawl. Se un URL è bloccato in robots.txt, Google non vede il noindex e la pagina può restare nei risultati. WordPress genera il noindex tramite
wp_robotse l'opzioneblog_public("Discourage search engines"), non tramite robots.txt. L'header X-Robots-Tag spesso arriva da hosting, staging o CDN, non da WordPress: va individuato concurl -I. Per i bot AI distingui quelli "search" (OAI-SearchBot, Claude-SearchBot, PerplexityBot) da quelli "training" (GPTBot, ClaudeBot, CCBot): bloccare uno non blocca l'altro. Alla fine saprai fare l'audit e sbloccare Google e i bot AI senza perdere il controllo sui contenuti.
Noindex WordPress: cos'è e perché blocca anche l'AI
Il noindex è una direttiva di indicizzazione. Dice ai motori: "puoi leggere questa pagina, ma non inserirla nell'indice". Non impedisce la lettura, impedisce la pubblicazione nei risultati.
Il crawl è un'altra cosa. Il crawl è la visita del bot. L'indicizzazione è la decisione di archiviare e mostrare la pagina. Confondere i due livelli è l'errore che genera il 90% dei falsi allarmi in WordPress.
Perché questo conta per l'AI? Perché ChatGPT, Gemini e Perplexity non leggono tutto il web in tempo reale. Si appoggiano a indici di ricerca e a fonti citabili. Se il noindex tiene la pagina fuori da Google, quella pagina non entra nel bacino da cui i modelli generativi pescano le risposte. Blocchi Google, blocchi anche l'AI.
| Direttiva | Cosa blocca | Dove si imposta |
|---|---|---|
noindex |
L'inserimento nell'indice | Meta robots nel <head> o header HTTP |
nofollow |
Il passaggio di autorità sui link | Meta robots o attributo sul singolo link |
Disallow |
Il crawl del bot | File robots.txt |
X-Robots-Tag |
Come noindex, ma via header HTTP | Server, hosting, CDN, .htaccess |
| "Discourage search engines" | Aggiunge noindex, nofollow |
WordPress, Impostazioni > Lettura |
In breve: noindex e robots.txt non sono alternativi, sono complementari. E il noindex non cancella una pagina già indicizzata in modo istantaneo: la rimuove quando Google la rivede.
Dove WordPress genera il noindex (e dove no)
WordPress ha un punto di controllo preciso: il filtro wp_robots. È lui che stampa il meta robots nel <head>. La documentazione di Google dice genericamente "il tuo CMS potrebbe avere un'impostazione", ma non ti dice dove guardare. Ecco i punti reali.
Impostazioni > Lettura. La casella "Discourage search engines from indexing this site" imposta l'opzione blog_public a 0. Risultato: WordPress aggiunge noindex, nofollow nel <head>. Non tocca il robots.txt. Questo è il fraintendimento più comune.
Plugin SEO. Yoast e Rank Math permettono il noindex per singolo post, per tipo di contenuto (post type) e per tassonomia. Un tag o una categoria impostati a noindex possono sparire senza che tu tocchi nulla.
Tema o child theme. Un filtro wp_robots personalizzato in functions.php può aggiungere noindex a condizioni specifiche. Vale la pena controllare anche i plugin minori.
Attenzione: l'header X-Robots-Tag spesso non arriva da WordPress. Lo aggiungono hosting, ambienti di staging, LiteSpeed, Cloudflare o regole in .htaccess. Se il noindex non sparisce dopo aver sistemato WordPress, il problema è un livello più in basso.
Checklist: audit noindex in WordPress in 7 passi
Segui l'ordine. Ogni passo ha un risultato atteso.
- Impostazioni > Lettura. Controlla che "Discourage search engines" sia deselezionato. Risultato corretto: nessun
noindexgenerato dablog_public. - Plugin SEO. Verifica noindex per post, per post type e per tassonomia. Risultato corretto: solo le pagine che vuoi escludere sono a noindex.
- Filtro
wp_robots. Cerca infunctions.phpdel tema o child theme e nei plugin. Risultato corretto: nessuna regola che aggiunga noindex alle pagine pubbliche. - Header HTTP. Esegui
curl -I https://tuodominio.ite cercaX-Robots-Tag. Risultato corretto: l'header non contienenoindex. - Google Search Console. Vai su Indicizzazione pagine e filtra "Esclusa dal tag 'noindex'". Risultato corretto: nessun URL importante nell'elenco.
- Conflitto robots.txt vs noindex. Controlla che l'URL non sia
Disallownel robots.txt. Se lo è, il noindex non funziona e la pagina può restare nei risultati. - Log del server o GA4. Verifica la presenza dei bot AI: GPTBot, ClaudeBot, PerplexityBot, GoogleOther. Risultato corretto: i bot che ti interessano visitano il sito.
Na co uważać (attenzione a): ambienti di staging che ereditano regole di noindex, cache e CDN che servono header vecchi, propagazione delle modifiche a robots.txt che richiede fino a circa 24 ore su OpenAI e Perplexity.
Bot AI: quali blocchi e quali no (search vs training)
Qui si concentra l'errore più frequente. I bot AI non sono tutti uguali. Alcuni servono a cercare e citare, altri ad addestrare modelli. Bloccare un bot di training non blocca quello di ricerca.
| Token robots.txt | Proprietario | Scopo | Rispetta robots.txt |
|---|---|---|---|
| GPTBot | OpenAI | Training | Sì |
| OAI-SearchBot | OpenAI | Search | Sì |
| ChatGPT-User | OpenAI | Azioni utente | Regole robots.txt possono non applicarsi |
| OAI-AdsBot | OpenAI | Validazione annunci | Sì |
| ClaudeBot | Anthropic | Training | Sì |
| Claude-SearchBot | Anthropic | Search | Sì |
| Claude-User | Anthropic | Azioni utente | Sì |
| PerplexityBot | Perplexity | Search | Sì |
| Perplexity-User | Perplexity | Azioni utente | Generalmente ignora robots.txt |
| CCBot | Common Crawl | Training | Sì |
| Google-Extended | Token di controllo per training Gemini e grounding | Non influisce su Google Search |
Da ricordare: per la visibilità nelle risposte AI contano soprattutto i bot "search" e "user". Bloccare GPTBot non ti rimuove da ChatGPT, perché la ricerca passa da OAI-SearchBot. E Google-Extended non tocca il ranking su Google Search: è un token separato.
Come sbloccare (e restare visibili su Google e AI)
La procedura di riparazione segue l'ordine inverso dell'audit.
- Rimuovi il noindex nel plugin o in WordPress. Deseleziona "Discourage search engines" e riporta a index le pagine coinvolte.
- Correggi il filtro
wp_robots. Elimina o restringi la regola che aggiunge noindex alle pagine pubbliche. - Rimuovi l'X-Robots-Tag a livello server o CDN. Intervieni su hosting, staging, LiteSpeed, Cloudflare o
.htaccess. - Verifica con URL Inspection. Usa lo strumento di GSC per richiedere l'indicizzazione e reinvia la sitemap.
- Gestisci il whitelisting dei bot AI. Se vuoi essere citato, lascia passare GPTBot e Google-Extended dove è sensato farlo.
Qui entra in gioco Semly. La piattaforma GEO/AEO di Semly monitora come il tuo brand appare nelle risposte generate da ChatGPT, Gemini e altri sistemi AI: analizza i prompt reali dei clienti, le fonti citate e i concorrenti. Con le integrazioni WordPress e WooCommerce, Semly collega la crawlability tecnica alla visibilità reale nei modelli generativi. L'approccio è chiaro: la SEO solida è la base, la visibilità AI è il risultato. Nessuna garanzia di ranking o citazioni, ma dati concreti su cui lavorare.
Errori comuni e come rimediare
- noindex + Disallow in robots.txt. Sintomo: la pagina resta nei risultati nonostante il noindex. Causa: il bot non legge la direttiva. Rimedio: togli il
Disallowe lascia lavorare il noindex. - Confondere "Discourage search engines" con robots.txt. Sintomo: cerchi la voce nel robots.txt e non la trovi. Causa: WordPress usa
wp_robots. Rimedio: controlla Impostazioni > Lettura. - Bloccare GPTBot invece di OAI-SearchBot. Sintomo: nessuna citazione in ChatGPT. Causa: hai bloccato il bot sbagliato. Rimedio: sblocca i bot "search".
- X-Robots-Tag dimenticato dopo una migrazione. Sintomo: noindex persistente senza motivo. Causa: regola di staging rimasta attiva. Rimedio: controlla con
curl -I. - Cache o CDN con header vecchi. Sintomo: la modifica non ha effetto. Causa: la cache serve la versione precedente. Rimedio: svuota la cache e attendi la propagazione.
- Nessuna verifica dopo la modifica. Sintomo: non sai se hai risolto. Causa: manca il controllo. Rimedio: ripeti l'audit e monitora GSC.
Cosa fare dopo
Dopo la riparazione, monitora due cose: l'indicizzazione in GSC e le visite dei bot AI nei log. Poi decidi con calma cosa lasciare aperto.
Drzewko decyzji (quando usare cosa):
- noindex quando vuoi escludere pagine interne, tag, archivi o ambienti di staging dall'indice, ma lasciarle raggiungibili.
- robots.txt (Disallow) quando vuoi risparmiare crawl su aree inutili, sapendo che così il noindex non funzionerà.
- Lasciare aperto quando la pagina deve essere trovata da Google e citata dai sistemi AI.
Per i negozi WooCommerce il discorso si complica: paginazione, filtri e varianti di prodotto possono generare migliaia di URL. Qui il noindex mirato è spesso la scelta giusta, purché non tocchi le pagine prodotto e categoria che vuoi far trovare.
Il punto di partenza resta sempre lo stesso: senza crawl e indicizzazione non c'è visibilità, né su Google né sull'AI. Semly parte da questa base tecnica e ti mostra dove il tuo brand viene citato e dove no.
FAQ
Il noindex rimuove una pagina da Google? Sì, ma non subito. Google deve rivedere la pagina per rimuoverla dall'indice. Per le pagine visitate di rado possono volerci mesi.
Quanto tempo impiega il noindex a fare effetto? Dipende dalla frequenza di scansione. Puoi accelerare con URL Inspection e il reinvio della sitemap. Le modifiche a robots.txt richiedono fino a circa 24 ore su OpenAI e Perplexity.
Il noindex influisce sui chatbot AI? Sì. Se la pagina non è indicizzata, i motori generativi hanno meno materiale per citarla. Bloccare Google significa spesso bloccare anche l'AI.
Qual è la differenza tra noindex e robots.txt? noindex è una direttiva di indicizzazione, robots.txt è una direttiva di crawl. Se usi entrambi in modo conflittuale, il noindex non funziona.