Cosa fa davvero una riga di robots.txt
Il file robots.txt è un file di testo nella radice del sito che dichiara
quali crawler possono leggere quali percorsi. È una convenzione volontaria,
formalizzata dalla IETF nella RFC 9309 (Robots Exclusion Protocol, 2022): i
crawler che la rispettano la rispettano perché hanno scelto di farlo, non
perché siano tenuti tecnicamente a farlo.
Due conseguenze pratiche che vengono confuse spesso.
- Non è un controllo di accesso. Una pagina bloccata in
robots.txtresta raggiungibile da chiunque conosca l'indirizzo. Se un contenuto deve essere protetto, serve un'autenticazione, non una riga in un file pubblico. - Vale per un dominio alla volta. Il file vale per lo schema, l'host e la porta in cui si trova. Un sottodominio ha il suo, e sul sottodominio quello del dominio principale non conta.
I bot che alimentano gli assistenti AI si possono bloccare esattamente così, con poche righe. Diverse estensioni per la gestione dei contenuti offrono l'opzione con un interruttore, e alcune la propongono come buona pratica. Chiedendo alle aziende perché l'hanno attivata, la risposta più frequente è che non sapevano di averla attivata.
Quali sono i crawler degli assistenti AI
L'elenco cambia nel tempo e la fonte da controllare è sempre la documentazione
del singolo fornitore, non un articolo. Questi sono i nomi che si incontrano
più spesso in un robots.txt italiano nel 2026.
- GPTBot (OpenAI): raccolta di contenuti per l'addestramento. La stessa documentazione elenca anche altri identificativi usati per la ricerca e per le pagine aperte su richiesta di un utente durante una conversazione.
- ClaudeBot (Anthropic): raccolta di contenuti, con identificativi separati per le richieste avviate da un utente.
- PerplexityBot (Perplexity): raccolta per un motore che cita le fonti nella risposta.
- CCBot (Common Crawl): archivio pubblico del web, usato come materia prima da molti dataset di terze parti.
- Google-Extended: non è un crawler ma un token di controllo. Regola l'uso dei contenuti già raccolti da Googlebot per i prodotti AI di Google, e nella documentazione di Google è dichiarato indipendente dall'inclusione e dal posizionamento in Google Search.
- Applebot-Extended: token con funzione analoga per i servizi Apple.
La distinzione fra crawler di addestramento e recupero avviato dall'utente è la parte che sfugge più spesso, ed è quella che conta per chi vuole essere citato: il secondo è il meccanismo con cui un assistente apre una pagina nel momento in cui qualcuno gli fa una domanda.
Le due facce della decisione
È una decisione con due facce, e nessuna delle due è ovvia.
- Chi vive di contenuti a pagamento ha ottime ragioni per bloccare. Un archivio giornalistico, un database di ricerca, una piattaforma didattica vendono esattamente quello che il crawler porterebbe via. Bloccare è coerente con il modello di business, e in diversi casi la stessa azienda negozia una licenza a parte.
- Chi vende servizi e blocca sta facendo l'opposto di quello che gli serve. Un'azienda che vuole essere citata quando qualcuno chiede a un assistente chi si occupa di una certa cosa, e nel frattempo tiene la porta chiusa, si toglie dalle risposte. Non perde traffico: perde la possibilità di essere nominata.
Come si controlla in due minuti
-
Aprite
https://ilvostrodominio.it/robots.txtnel browser. È pubblico, non serve accedere a niente. -
Cercate i nomi dell'elenco sopra, e cercate
Disallow: /sotto unUser-agentche non sia il vostro motore di ricerca abituale. -
Guardate anche il blocco generico. Una regola come questa vale per tutti i crawler che non hanno un blocco dedicato:
User-agent: * Disallow: / -
Chiedete chi l'ha scritta. Se nessuno lo sa, è arrivata con un aggiornamento, con un'impostazione predefinita o con un consiglio letto di sfuggita.
-
Decidete e mettete la decisione a verbale, con una data. È l'unico modo perché il prossimo aggiornamento del plugin non la ribalti in silenzio.
Cosa robots.txt non fa, e cosa serve al posto suo
- Non rimuove quello che è già stato raccolto. Bloccare oggi vale da oggi. I contenuti già acquisiti restano dove sono.
- Non è la stessa cosa di
noindex. Il blocco inrobots.txtimpedisce la lettura della pagina;noindexchiede di non mostrarla nei risultati. Una pagina bloccata inrobots.txtnon può nemmeno far leggere il proprionoindex, ed è il motivo per cui usarli insieme produce l'effetto opposto a quello atteso. - Non fa da contratto. Se il contenuto ha un valore economico, la sede della tutela sono i termini d'uso e, quando serve, una licenza. Il file di testo è una richiesta, non un vincolo.
- Non basta per farsi citare. Lasciar passare i crawler è una condizione necessaria, non sufficiente. Servono contenuti che rispondano in modo netto e una struttura leggibile: è il lavoro che chiamiamo GEO, e ne abbiamo scritto a parte.
Domande frequenti
- Bloccare GPTBot fa perdere posizioni su Google?
No. GPTBot è un crawler di OpenAI e non ha rapporto con l'indicizzazione di
Google. Il token che riguarda i prodotti AI di Google è
Google-Extended, e la documentazione di Google dichiara che non incide su inclusione e posizionamento in Google Search. - Se blocco i crawler AI, sparisco dalle risposte degli assistenti? Non subito e non del tutto: potete essere nominati sulla base di contenuti già acquisiti, o di quello che altri siti dicono di voi. Ma smettete di poter aggiornare quella descrizione, che è la parte che fa più male nel tempo.
- Conviene bloccare l'addestramento e lasciare passare il recupero su
richiesta dell'utente?
È la configurazione più sensata per chi ha contenuti di valore e vuole
comunque essere citato. Richiede di distinguere gli identificativi nel
robots.txte di rileggerla periodicamente, perché i nomi cambiano. - Ogni quanto va riguardato il file? Almeno a ogni aggiornamento importante del CMS o dei plugin SEO, che sono i due momenti in cui la riga cambia senza che nessuno l'abbia deciso.
La posizione di Drimz AI
Su questo sito il robots.txt è aperto ai crawler degli assistenti e la
decisione è scritta, non ereditata: Drimz AI è una creative tech company
italiana con sede a Genova che vende servizi, non archivi, e per un'azienda
così essere leggibile vale più di quello che si perde a farsi leggere.
Vale la pena aprire il vostro file e guardare cosa dice. Sono due minuti, e nel frattempo è diventata una delle poche righe del sito che decidono se esistete dentro le risposte di qualcun altro.
Guardiamo il vostro robots.txt

