ApprofondimentiLetture lunghe, per chi ha tempo e voglia.

Bloccare i crawler AI: la decisione più importante sul vostro sito l'ha presa un plugin

Lasciar passare o bloccare i crawler degli assistenti AI è una scelta con conseguenze commerciali. Su molti siti l'ha presa un'estensione, con un'impostazione predefinita. Come si controlla in due minuti.

Redazione Drimz AI6 min di lettura

Immagine di apertura dell'articolo Bloccare i crawler AI: la decisione più importante sul vostro sito l'ha presa un plugin

Cosa fa davvero una riga di robots.txt

Il file robots.txt è un file di testo nella radice del sito che dichiara quali crawler possono leggere quali percorsi. È una convenzione volontaria, formalizzata dalla IETF nella RFC 9309 (Robots Exclusion Protocol, 2022): i crawler che la rispettano la rispettano perché hanno scelto di farlo, non perché siano tenuti tecnicamente a farlo.

Due conseguenze pratiche che vengono confuse spesso.

  • Non è un controllo di accesso. Una pagina bloccata in robots.txt resta raggiungibile da chiunque conosca l'indirizzo. Se un contenuto deve essere protetto, serve un'autenticazione, non una riga in un file pubblico.
  • Vale per un dominio alla volta. Il file vale per lo schema, l'host e la porta in cui si trova. Un sottodominio ha il suo, e sul sottodominio quello del dominio principale non conta.

I bot che alimentano gli assistenti AI si possono bloccare esattamente così, con poche righe. Diverse estensioni per la gestione dei contenuti offrono l'opzione con un interruttore, e alcune la propongono come buona pratica. Chiedendo alle aziende perché l'hanno attivata, la risposta più frequente è che non sapevano di averla attivata.

Quali sono i crawler degli assistenti AI

L'elenco cambia nel tempo e la fonte da controllare è sempre la documentazione del singolo fornitore, non un articolo. Questi sono i nomi che si incontrano più spesso in un robots.txt italiano nel 2026.

  • GPTBot (OpenAI): raccolta di contenuti per l'addestramento. La stessa documentazione elenca anche altri identificativi usati per la ricerca e per le pagine aperte su richiesta di un utente durante una conversazione.
  • ClaudeBot (Anthropic): raccolta di contenuti, con identificativi separati per le richieste avviate da un utente.
  • PerplexityBot (Perplexity): raccolta per un motore che cita le fonti nella risposta.
  • CCBot (Common Crawl): archivio pubblico del web, usato come materia prima da molti dataset di terze parti.
  • Google-Extended: non è un crawler ma un token di controllo. Regola l'uso dei contenuti già raccolti da Googlebot per i prodotti AI di Google, e nella documentazione di Google è dichiarato indipendente dall'inclusione e dal posizionamento in Google Search.
  • Applebot-Extended: token con funzione analoga per i servizi Apple.

La distinzione fra crawler di addestramento e recupero avviato dall'utente è la parte che sfugge più spesso, ed è quella che conta per chi vuole essere citato: il secondo è il meccanismo con cui un assistente apre una pagina nel momento in cui qualcuno gli fa una domanda.

Le due facce della decisione

È una decisione con due facce, e nessuna delle due è ovvia.

  • Chi vive di contenuti a pagamento ha ottime ragioni per bloccare. Un archivio giornalistico, un database di ricerca, una piattaforma didattica vendono esattamente quello che il crawler porterebbe via. Bloccare è coerente con il modello di business, e in diversi casi la stessa azienda negozia una licenza a parte.
  • Chi vende servizi e blocca sta facendo l'opposto di quello che gli serve. Un'azienda che vuole essere citata quando qualcuno chiede a un assistente chi si occupa di una certa cosa, e nel frattempo tiene la porta chiusa, si toglie dalle risposte. Non perde traffico: perde la possibilità di essere nominata.

Come si controlla in due minuti

  1. Aprite https://ilvostrodominio.it/robots.txt nel browser. È pubblico, non serve accedere a niente.

  2. Cercate i nomi dell'elenco sopra, e cercate Disallow: / sotto un User-agent che non sia il vostro motore di ricerca abituale.

  3. Guardate anche il blocco generico. Una regola come questa vale per tutti i crawler che non hanno un blocco dedicato:

    User-agent: *
    Disallow: /
    
  4. Chiedete chi l'ha scritta. Se nessuno lo sa, è arrivata con un aggiornamento, con un'impostazione predefinita o con un consiglio letto di sfuggita.

  5. Decidete e mettete la decisione a verbale, con una data. È l'unico modo perché il prossimo aggiornamento del plugin non la ribalti in silenzio.

Cosa robots.txt non fa, e cosa serve al posto suo

  • Non rimuove quello che è già stato raccolto. Bloccare oggi vale da oggi. I contenuti già acquisiti restano dove sono.
  • Non è la stessa cosa di noindex. Il blocco in robots.txt impedisce la lettura della pagina; noindex chiede di non mostrarla nei risultati. Una pagina bloccata in robots.txt non può nemmeno far leggere il proprio noindex, ed è il motivo per cui usarli insieme produce l'effetto opposto a quello atteso.
  • Non fa da contratto. Se il contenuto ha un valore economico, la sede della tutela sono i termini d'uso e, quando serve, una licenza. Il file di testo è una richiesta, non un vincolo.
  • Non basta per farsi citare. Lasciar passare i crawler è una condizione necessaria, non sufficiente. Servono contenuti che rispondano in modo netto e una struttura leggibile: è il lavoro che chiamiamo GEO, e ne abbiamo scritto a parte.

Domande frequenti

  • Bloccare GPTBot fa perdere posizioni su Google? No. GPTBot è un crawler di OpenAI e non ha rapporto con l'indicizzazione di Google. Il token che riguarda i prodotti AI di Google è Google-Extended, e la documentazione di Google dichiara che non incide su inclusione e posizionamento in Google Search.
  • Se blocco i crawler AI, sparisco dalle risposte degli assistenti? Non subito e non del tutto: potete essere nominati sulla base di contenuti già acquisiti, o di quello che altri siti dicono di voi. Ma smettete di poter aggiornare quella descrizione, che è la parte che fa più male nel tempo.
  • Conviene bloccare l'addestramento e lasciare passare il recupero su richiesta dell'utente? È la configurazione più sensata per chi ha contenuti di valore e vuole comunque essere citato. Richiede di distinguere gli identificativi nel robots.txt e di rileggerla periodicamente, perché i nomi cambiano.
  • Ogni quanto va riguardato il file? Almeno a ogni aggiornamento importante del CMS o dei plugin SEO, che sono i due momenti in cui la riga cambia senza che nessuno l'abbia deciso.

La posizione di Drimz AI

Su questo sito il robots.txt è aperto ai crawler degli assistenti e la decisione è scritta, non ereditata: Drimz AI è una creative tech company italiana con sede a Genova che vende servizi, non archivi, e per un'azienda così essere leggibile vale più di quello che si perde a farsi leggere.

Vale la pena aprire il vostro file e guardare cosa dice. Sono due minuti, e nel frattempo è diventata una delle poche righe del sito che decidono se esistete dentro le risposte di qualcun altro.

Guardiamo il vostro robots.txt
Il Journal, via email

Un articolo ogni tanto, solo quando vale.

Ti scriviamo quando esce qualcosa di nuovo nel Journal, e basta.

// Approfondimenti

Altri articoli in Approfondimenti.

Letture lunghe, per chi ha tempo e voglia.

Vai a tutto il Journal

// Prossimo passoIniziamo un progetto

Questo problema ce l'hai anche tu?

Quello che hai appena letto viene da un progetto che abbiamo fatto. Scrivici come si presenta da te: ti rispondiamo con una prima lettura del caso e con il primo passo che faremmo. Poi decidi tu.