Noindex su WordPress: come evitare di bloccare Google e i sistemi AI

La tua pagina non compare più su Google. Oppure compare, ma ChatGPT, Gemini e Perplexity non la citano mai quando qualcuno chiede informazioni sul tuo settore. In entrambi i casi il sospetto numero uno è lo stesso: un noindex rimasto attivo per errore.

Il problema è che il noindex non è un interruttore isolato. Spegne Google e, di conseguenza, spegne anche l'AI. I motori generativi si appoggiano in larga parte agli indici di Google e Bing: se la pagina non è indicizzata, non ha materiale su cui basarsi per citarti.

Questa guida è per redattori, SEO freelance e titolari di negozi WooCommerce che conoscono il pannello di WordPress ma non hanno mai aperto gli header HTTP. Ti mostriamo un audit in 7 passi, come distinguere il noindex da una blocco in robots.txt e come non tagliare fuori per sbaglio i bot AI.

TL;DR noindex e robots.txt non sono la stessa cosa: noindex è una direttiva di indicizzazione, robots.txt è una direttiva di crawl. Se un URL è bloccato in robots.txt, Google non vede il noindex e la pagina può restare nei risultati. WordPress genera il noindex tramite wp_robots e l'opzione blog_public ("Discourage search engines"), non tramite robots.txt. L'header X-Robots-Tag spesso arriva da hosting, staging o CDN, non da WordPress: va individuato con curl -I. Per i bot AI distingui quelli "search" (OAI-SearchBot, Claude-SearchBot, PerplexityBot) da quelli "training" (GPTBot, ClaudeBot, CCBot): bloccare uno non blocca l'altro. Alla fine saprai fare l'audit e sbloccare Google e i bot AI senza perdere il controllo sui contenuti.

Noindex WordPress: cos'è e perché blocca anche l'AI

Il noindex è una direttiva di indicizzazione. Dice ai motori: "puoi leggere questa pagina, ma non inserirla nell'indice". Non impedisce la lettura, impedisce la pubblicazione nei risultati.

Il crawl è un'altra cosa. Il crawl è la visita del bot. L'indicizzazione è la decisione di archiviare e mostrare la pagina. Confondere i due livelli è l'errore che genera il 90% dei falsi allarmi in WordPress.

Perché questo conta per l'AI? Perché ChatGPT, Gemini e Perplexity non leggono tutto il web in tempo reale. Si appoggiano a indici di ricerca e a fonti citabili. Se il noindex tiene la pagina fuori da Google, quella pagina non entra nel bacino da cui i modelli generativi pescano le risposte. Blocchi Google, blocchi anche l'AI.

Direttiva Cosa blocca Dove si imposta
noindex L'inserimento nell'indice Meta robots nel <head> o header HTTP
nofollow Il passaggio di autorità sui link Meta robots o attributo sul singolo link
Disallow Il crawl del bot File robots.txt
X-Robots-Tag Come noindex, ma via header HTTP Server, hosting, CDN, .htaccess
"Discourage search engines" Aggiunge noindex, nofollow WordPress, Impostazioni > Lettura

In breve: noindex e robots.txt non sono alternativi, sono complementari. E il noindex non cancella una pagina già indicizzata in modo istantaneo: la rimuove quando Google la rivede.

Dove WordPress genera il noindex (e dove no)

WordPress ha un punto di controllo preciso: il filtro wp_robots. È lui che stampa il meta robots nel <head>. La documentazione di Google dice genericamente "il tuo CMS potrebbe avere un'impostazione", ma non ti dice dove guardare. Ecco i punti reali.

Impostazioni > Lettura. La casella "Discourage search engines from indexing this site" imposta l'opzione blog_public a 0. Risultato: WordPress aggiunge noindex, nofollow nel <head>. Non tocca il robots.txt. Questo è il fraintendimento più comune.

Plugin SEO. Yoast e Rank Math permettono il noindex per singolo post, per tipo di contenuto (post type) e per tassonomia. Un tag o una categoria impostati a noindex possono sparire senza che tu tocchi nulla.

Tema o child theme. Un filtro wp_robots personalizzato in functions.php può aggiungere noindex a condizioni specifiche. Vale la pena controllare anche i plugin minori.

Attenzione: l'header X-Robots-Tag spesso non arriva da WordPress. Lo aggiungono hosting, ambienti di staging, LiteSpeed, Cloudflare o regole in .htaccess. Se il noindex non sparisce dopo aver sistemato WordPress, il problema è un livello più in basso.

Checklist: audit noindex in WordPress in 7 passi

Segui l'ordine. Ogni passo ha un risultato atteso.

  1. Impostazioni > Lettura. Controlla che "Discourage search engines" sia deselezionato. Risultato corretto: nessun noindex generato da blog_public.
  2. Plugin SEO. Verifica noindex per post, per post type e per tassonomia. Risultato corretto: solo le pagine che vuoi escludere sono a noindex.
  3. Filtro wp_robots. Cerca in functions.php del tema o child theme e nei plugin. Risultato corretto: nessuna regola che aggiunga noindex alle pagine pubbliche.
  4. Header HTTP. Esegui curl -I https://tuodominio.it e cerca X-Robots-Tag. Risultato corretto: l'header non contiene noindex.
  5. Google Search Console. Vai su Indicizzazione pagine e filtra "Esclusa dal tag 'noindex'". Risultato corretto: nessun URL importante nell'elenco.
  6. Conflitto robots.txt vs noindex. Controlla che l'URL non sia Disallow nel robots.txt. Se lo è, il noindex non funziona e la pagina può restare nei risultati.
  7. Log del server o GA4. Verifica la presenza dei bot AI: GPTBot, ClaudeBot, PerplexityBot, GoogleOther. Risultato corretto: i bot che ti interessano visitano il sito.

Na co uważać (attenzione a): ambienti di staging che ereditano regole di noindex, cache e CDN che servono header vecchi, propagazione delle modifiche a robots.txt che richiede fino a circa 24 ore su OpenAI e Perplexity.

Bot AI: quali blocchi e quali no (search vs training)

Qui si concentra l'errore più frequente. I bot AI non sono tutti uguali. Alcuni servono a cercare e citare, altri ad addestrare modelli. Bloccare un bot di training non blocca quello di ricerca.

Token robots.txt Proprietario Scopo Rispetta robots.txt
GPTBot OpenAI Training
OAI-SearchBot OpenAI Search
ChatGPT-User OpenAI Azioni utente Regole robots.txt possono non applicarsi
OAI-AdsBot OpenAI Validazione annunci
ClaudeBot Anthropic Training
Claude-SearchBot Anthropic Search
Claude-User Anthropic Azioni utente
PerplexityBot Perplexity Search
Perplexity-User Perplexity Azioni utente Generalmente ignora robots.txt
CCBot Common Crawl Training
Google-Extended Google Token di controllo per training Gemini e grounding Non influisce su Google Search

Da ricordare: per la visibilità nelle risposte AI contano soprattutto i bot "search" e "user". Bloccare GPTBot non ti rimuove da ChatGPT, perché la ricerca passa da OAI-SearchBot. E Google-Extended non tocca il ranking su Google Search: è un token separato.

Come sbloccare (e restare visibili su Google e AI)

La procedura di riparazione segue l'ordine inverso dell'audit.

  • Rimuovi il noindex nel plugin o in WordPress. Deseleziona "Discourage search engines" e riporta a index le pagine coinvolte.
  • Correggi il filtro wp_robots. Elimina o restringi la regola che aggiunge noindex alle pagine pubbliche.
  • Rimuovi l'X-Robots-Tag a livello server o CDN. Intervieni su hosting, staging, LiteSpeed, Cloudflare o .htaccess.
  • Verifica con URL Inspection. Usa lo strumento di GSC per richiedere l'indicizzazione e reinvia la sitemap.
  • Gestisci il whitelisting dei bot AI. Se vuoi essere citato, lascia passare GPTBot e Google-Extended dove è sensato farlo.

Qui entra in gioco Semly. La piattaforma GEO/AEO di Semly monitora come il tuo brand appare nelle risposte generate da ChatGPT, Gemini e altri sistemi AI: analizza i prompt reali dei clienti, le fonti citate e i concorrenti. Con le integrazioni WordPress e WooCommerce, Semly collega la crawlability tecnica alla visibilità reale nei modelli generativi. L'approccio è chiaro: la SEO solida è la base, la visibilità AI è il risultato. Nessuna garanzia di ranking o citazioni, ma dati concreti su cui lavorare.

Errori comuni e come rimediare

  1. noindex + Disallow in robots.txt. Sintomo: la pagina resta nei risultati nonostante il noindex. Causa: il bot non legge la direttiva. Rimedio: togli il Disallow e lascia lavorare il noindex.
  2. Confondere "Discourage search engines" con robots.txt. Sintomo: cerchi la voce nel robots.txt e non la trovi. Causa: WordPress usa wp_robots. Rimedio: controlla Impostazioni > Lettura.
  3. Bloccare GPTBot invece di OAI-SearchBot. Sintomo: nessuna citazione in ChatGPT. Causa: hai bloccato il bot sbagliato. Rimedio: sblocca i bot "search".
  4. X-Robots-Tag dimenticato dopo una migrazione. Sintomo: noindex persistente senza motivo. Causa: regola di staging rimasta attiva. Rimedio: controlla con curl -I.
  5. Cache o CDN con header vecchi. Sintomo: la modifica non ha effetto. Causa: la cache serve la versione precedente. Rimedio: svuota la cache e attendi la propagazione.
  6. Nessuna verifica dopo la modifica. Sintomo: non sai se hai risolto. Causa: manca il controllo. Rimedio: ripeti l'audit e monitora GSC.

Cosa fare dopo

Dopo la riparazione, monitora due cose: l'indicizzazione in GSC e le visite dei bot AI nei log. Poi decidi con calma cosa lasciare aperto.

Drzewko decyzji (quando usare cosa):

  • noindex quando vuoi escludere pagine interne, tag, archivi o ambienti di staging dall'indice, ma lasciarle raggiungibili.
  • robots.txt (Disallow) quando vuoi risparmiare crawl su aree inutili, sapendo che così il noindex non funzionerà.
  • Lasciare aperto quando la pagina deve essere trovata da Google e citata dai sistemi AI.

Per i negozi WooCommerce il discorso si complica: paginazione, filtri e varianti di prodotto possono generare migliaia di URL. Qui il noindex mirato è spesso la scelta giusta, purché non tocchi le pagine prodotto e categoria che vuoi far trovare.

Il punto di partenza resta sempre lo stesso: senza crawl e indicizzazione non c'è visibilità, né su Google né sull'AI. Semly parte da questa base tecnica e ti mostra dove il tuo brand viene citato e dove no.

FAQ

Il noindex rimuove una pagina da Google? Sì, ma non subito. Google deve rivedere la pagina per rimuoverla dall'indice. Per le pagine visitate di rado possono volerci mesi.

Quanto tempo impiega il noindex a fare effetto? Dipende dalla frequenza di scansione. Puoi accelerare con URL Inspection e il reinvio della sitemap. Le modifiche a robots.txt richiedono fino a circa 24 ore su OpenAI e Perplexity.

Il noindex influisce sui chatbot AI? Sì. Se la pagina non è indicizzata, i motori generativi hanno meno materiale per citarla. Bloccare Google significa spesso bloccare anche l'AI.

Qual è la differenza tra noindex e robots.txt? noindex è una direttiva di indicizzazione, robots.txt è una direttiva di crawl. Se usi entrambi in modo conflittuale, il noindex non funziona.

Sources

Controlla se vede il tuo marchio

Inserisci il tuo sito web per ricevere un report gratuito sulla Visibilità AI