Se il tuo sito passa da Cloudflare, il tuo robots.txt potrebbe non essere più scritto da te. Si chiama Bot Preference Sync: Cloudflare genera il file a partire da tre interruttori del pannello — Search, Agent, Training — e lo antepone a quello che avevi già. Per i nuovi domini è attivo di default. E dal 15 settembre 2026 c’è una seconda novità che pesa di più: l’opzione Block sui crawler di addestramento ora colpisce anche Googlebot, Bingbot e Applebot. Tradotto: un interruttore che pensavi difendesse i tuoi contenuti dall’AI oggi può toglierti dalla ricerca. Dieci minuti di verifica e sei a posto. Sotto ti spiego cosa guardare.

In questo articolo

Cosa è successo, in tre righe

Il 21 agosto 2026 Cloudflare ha annunciato Bot Preference Sync: una funzione che tiene allineato il tuo robots.txt con le preferenze sui bot AI che hai impostato nel pannello. Disponibile su tutti i piani, dal gratuito all’Enterprise. Per i nuovi clienti è attiva di default.

Il 15 settembre è arrivato il seguito, ed è la parte che cambia davvero le carte: Cloudflare ha introdotto una nuova impostazione chiamata Disallow AI Training, ha ridefinito cosa fa il pulsante Block, e ha deprecato sia il vecchio “Block AI Bots” sia il vecchio “Managed Robots.txt”.

Non è marketing. È infrastruttura. Cloudflare sta davanti a una fetta enorme del web italiano — ci passano siti aziendali, e-commerce WooCommerce, gestionali, landing page — e ha deciso di trasformare un file di testo statico in un output generato da un pannello di controllo.

Ne avevo già scritto a inizio agosto, quando si è capito che bloccare i bot AI su Cloudflare poteva bloccare anche Googlebot: Bloccare i bot AI su Cloudflare: dal 15 settembre blocchi anche Google. Quella data è arrivata. Questo articolo è quello che è successo dopo.

Come funziona Bot Preference Sync

Il meccanismo è semplice, ed è proprio la semplicità il punto interessante e il punto critico allo stesso tempo.

Tre interruttori, un file

Nel pannello Cloudflare, sotto Security Settings, trovi le impostazioni per i bot AI divise per comportamento, non per nome del bot. Cloudflare classifica i crawler in tre categorie:

  • Search — scansionano per costruire un indice di ricerca.
  • Training — scansionano per addestrare o rifinire un modello.
  • Agent — agenti guidati da un utente che visitano una pagina per conto di una persona: i bot di recupero delle chat, gli agenti che navigano al posto tuo.

Quello che decidi su queste tre voci diventa il tuo robots.txt. Cloudflare prende la lista dei bot che traccia nella sua directory pubblica, la traduce in righe User-agent e Disallow, e la scrive nel file.

Cosa succede al file che avevi già

Questa è la parte che tranquillizza: il contenuto generato viene anteposto, non sostituito. Cloudflare verifica se il tuo server di origine ha già un robots.txt (risposta HTTP 200) e, se c’è, mette il blocco generato sopra e lascia intatto il tuo sotto.

Il blocco è delimitato da due commenti:

# BEGIN Cloudflare Bot Preference Sync
...
# END Cloudflare Bot Preference Sync

Quindi le tue righe Disallow storiche restano, e la tua Sitemap resta. Se non avevi un robots.txt, Cloudflare ne crea uno da zero.

Il Content Signals Policy

C’è un dettaglio che molti scopriranno solo aprendo il file. Cloudflare aggiunge in testa al robots.txt un blocco di commenti chiamato Content Signals Policy: un testo legale che definisce tre segnali — search, ai-input, ai-train — e li presenta come riserva espressa di diritti ai sensi dell’articolo 4 della Direttiva europea 2019/790 sul copyright.

Sui domini in piano gratuito che non hanno un proprio robots.txt e non usano la funzione gestita, quella policy viene mostrata comunque quando un crawler chiede il file. È solo la definizione dei termini, non esprime una preferenza: per esprimerla devi attivare la funzione.

Cloudflare sta anche testando un quarto segnale, content-use, con tre valori: use=immediate (interagisci ma non conservare nulla), use=reference (indicizza, cita un estratto, linka) e use=full (riassumi e riproduci). Per chi ha la funzione attiva, il valore impostato è use=reference.

Tradotto per chi non fa questo di mestiere: il tuo sito sta dicendo ai motori generativi “puoi citarmi e linkarmi, non puoi riprodurmi per intero”. Per la maggior parte delle aziende è esattamente la posizione giusta. Ma è una posizione, ed è stata scritta da qualcun altro.

Il cambio del 15 settembre: “Block” ora ferma anche Google

Qui sta la cosa che può costare traffico vero, quindi la scrivo in grande.

Prima del 15 settembre, le opzioni Block e Block on pages with ads non si applicavano ai crawler cosiddetti mixed-use — quelli che fanno ricerca e addestramento con lo stesso user agent, cioè Googlebot, Bingbot e Applebot. Cloudflare li risparmiava apposta, perché bloccarli avrebbe danneggiato la visibilità organica.

Dal 15 settembre, Block e Block on pages with ads si applicano a tutti i crawler di addestramento, mixed-use inclusi. Le parole di Cloudflare sono chiare: se vuoi che i crawler mixed-use spariscano del tutto, adesso devi dirlo — selezioni Block e fermi Applebot, Bingbot e Googlebot, ricerca compresa.

La nuova opzione: Disallow AI Training

Per non costringere nessuno a quella scelta, Cloudflare ha creato una quarta impostazione, disponibile solo sulla categoria Training:

  • Allow — tutti i crawler passano, salvo altre regole.
  • Disallow AI Training — nel robots.txt viene pubblicata la preferenza “niente addestramento”. I crawler mixed-use riconosciuti come affidabili restano ammessi per la ricerca. Tutti gli altri crawler di addestramento vengono bloccati, inclusi quelli dedicati di Amazon, Anthropic, Meta e OpenAI — e bloccare quelli non tocca la ricerca.
  • Block on pages with ads — blocco solo sulle pagine su cui Cloudflare rileva pubblicità.
  • Block — blocco totale, mixed-use inclusi.

Se hai già configurato qualcosa, la migrazione è automatica e conserva l’effetto pratico: chi aveva Training su Block o Block on pages with ads passa a Disallow AI Training. Chi non aveva mai toccato nulla e aveva il vecchio “Block AI Bots” attivo si ritrova con Search su Allow, Training su Disallow AI Training e Agent su Block on pages with ads.

Cloudflare scrive che, in quasi tutti i casi, non devi fare niente. Ed è vero. Il problema non è la migrazione: il problema è chi tocca quel pannello dopo, convinto che “Block” significhi ancora quello che significava a luglio.

La designazione “Accountable”: Apple, Google, Microsoft

Perché alcuni crawler mixed-use restano ammessi e altri no? Perché Cloudflare ha creato una designazione chiamata Accountable e ha scritto i requisiti per ottenerla. Un operatore deve fornire — o impegnarsi con tempi definiti a fornire — quattro cose:

  1. Un meccanismo per rifiutare l’addestramento, via robots.txt o standard simile.
  2. Un meccanismo per rifiutare i riassunti AI, impostabile direttamente con l’operatore.
  3. Visibilità a livello di singolo URL su quali pagine sono state rese disponibili per l’addestramento, più metriche su come il contenuto è apparso nella ricerca.
  4. La garanzia pubblica che rifiutare l’addestramento non peggiora i risultati nella ricerca tradizionale.

Apple, Google e Microsoft risultano Accountable. Non tutte allo stesso modo, e la differenza conta:

  • Googlebot: puoi rifiutare l’addestramento con una regola Disallow per Google-Extended, e Google dichiara che farlo non influisce sul ranking. La trasparenza a livello di URL per Google-Extended è annunciata come in arrivo nelle prossime settimane.
  • Applebot: si rifiuta l’addestramento con Applebot-Extended; l’ispezione a livello di URL non c’è ancora, Apple ha condiviso con Cloudflare la soluzione prevista per il prossimo anno.
  • Bingbot: oggi la preferenza si esprime con il tag NOARCHIVE nell’HTML. Il supporto al “no training” via robots.txt a livello di sito è previsto per inizio 2027. Fino ad allora, selezionare Disallow AI Training non comunica automaticamente nulla a Bing.

Questo terzo punto è quello che nessuno ti dirà in un post da tre righe su LinkedIn. Se attivi Disallow AI Training pensando di aver chiuso la porta a tutti, con Microsoft non l’hai chiusa. Serve il tag NOARCHIVE, oppure gli strumenti di rimozione contenuti di Bing.

I preset per i nuovi domini (e perché quasi nessuna PMI dovrebbe scegliere quello dei publisher)

Dal 15 settembre, chi porta un dominio nuovo su Cloudflare si vede proporre una di due configurazioni preimpostate, in base a una domanda: il sito guadagna con la pubblicità?

Impostazione Sito senza pubblicità Sito monetizzato con pubblicità
Preference Sync Attivo Attivo
Search Allow Allow
Training Allow Disallow AI Training
Agent Allow Block on pages with ads

La logica di Cloudflare è corretta: il ricavo pubblicitario dipende da un essere umano che vede la pagina. L’addestramento sostituisce quella visita con una risposta; gli agenti scaricano la pagina senza nessuno che guardi i banner.

Ma applica questa logica a un’azienda italiana tipo. Un produttore di macchinari con un catalogo online. Un e-commerce di integratori. Uno studio tecnico. Un’azienda alimentare con la scheda prodotto e la storia della famiglia.

Nessuna di queste guadagna con la pubblicità. Guadagna perché qualcuno trova il prodotto, si convince e compra o chiama. Per loro il preset giusto è quello di sinistra: tutto Allow. Vuoi che ChatGPT conosca il tuo catalogo. Vuoi che Gemini sappia che esisti. Vuoi che l’agente che fa la ricerca per conto del cliente arrivi fino alla scheda.

Cloudflare lo dice con l’esempio più chiaro possibile nel suo post: un e-commerce può volere che tutto venga scansionato e usato per l’addestramento, così i suoi prodotti escono quando qualcuno chiede a un chatbot “il miglior divano per un appartamento piccolo”.

La trappola è la domanda in fase di onboarding. “Monetizzo da pagine con pubblicità su questo dominio” sembra una casella innocua. È una domanda sul tuo modello di business la cui risposta diventa una posizione pubblicata sul tuo sito. Chi la spunta per distrazione — magari perché ha un banner affiliato in fondo al blog — si porta a casa Training su Disallow e gli agenti bloccati.

Il limite vero: non puoi fare eccezioni per singolo bot

Bot Preference Sync ragiona per categoria, non per nome. E questa è la critica più solida che ho letto, sollevata da Slobodan Manic su Search Engine Journal il 18 settembre.

La sua politica sui crawler, che è anche la mia su diversi clienti, è una decisione presa azienda per azienda: lascio passare chi mi mette davanti a persone che fanno domande, blocco chi prende e non restituisce niente. È una scelta commerciale, un crawler alla volta.

Bot Preference Sync non sa esprimerla. Metti Training su Disallow e il file dice di non addestrarsi anche a chi ti fa comodo che si addestri. Metti Allow e nel file non c’è niente che distingua chi ti manda traffico da chi non te ne manda.

La risposta documentata di Cloudflare a chi vuole un controllo più fine è: spegni il sync e mantieni il file a mano. Che è una risposta onesta, ma significa tornare esattamente al lavoro manuale che la funzione doveva togliere.

E qui aggiungo una cosa che dico sempre, perché continua a servire: il robots.txt è una richiesta, non una serratura. Funziona sui crawler che scelgono di rispettarlo. Sul resto non fa niente. L’ho già raccontato con i dati: robots.txt e ChatGPT: perché non blocca i bot AI. Il blocco vero avviene al livello di rete, non nel file di testo. Il file è documentazione dell’intenzione, e serve dopo, in una contestazione.

Chi deve controllare subito, e chi può stare tranquillo

Facciamo l’unica cosa che conta: capire se questa notizia ti riguarda.

Controlla oggi se

  • Il tuo sito passa da Cloudflare (anche solo per il DNS e il certificato, che è il caso della maggior parte delle PMI italiane con un sito WordPress).
  • Negli ultimi due anni qualcuno — tu, l’agenzia precedente, il ragazzo che ti ha sistemato il sito — ha attivato “Block AI Bots” o il vecchio “Managed Robots.txt”.
  • Hai portato un dominio nuovo su Cloudflare dopo il 15 settembre.
  • Hai notato un calo di pagine indicizzate o di impression in Search Console senza una causa evidente. Sul tema ho scritto qui: Calo di impression in Search Console: come capire se è un bug o sei tu.

Puoi stare tranquillo se

  • Non usi Cloudflare.
  • Usi Cloudflare ma non hai mai aperto le impostazioni dei bot, il dominio è vecchio, e il sync non è attivo.

Nota che il secondo caso è temporaneo. Cloudflare ha scritto che i clienti esistenti con il vecchio Managed Robots.txt verranno invitati a rivedere e confermare le preferenze per passare al nuovo sistema. Quando arriva quella mail, non cliccare “conferma” senza guardare.

Cosa farei io, in ordine

Dieci minuti, in questo ordine. Non serve un tecnico per i primi tre punti.

1. Apri il tuo robots.txt

Vai su tuosito.it/robots.txt dal browser. Leggilo tutto, anche le righe che hai scritto nel 2023 e non ricordi. Cerca le due stringhe BEGIN Cloudflare e Content Signals. Se ci sono, il sync sta già lavorando sul tuo dominio.

2. Apri il pannello Cloudflare e confronta

Security Settings, filtra per traffico bot, apri la configurazione delle policy sui bot AI. Guarda cosa dicono Search, Agent e Training. Poi confronta con quello che hai letto nel file. Se i due non coincidono, hai un disallineamento — ed è esattamente il problema che Bot Preference Sync esiste per risolvere.

3. Rispondi a una domanda sola

Il tuo sito guadagna mostrando pubblicità a esseri umani, oppure guadagna facendoti trovare?

Se guadagna facendoti trovare — ed è il caso del 95% delle aziende con cui lavoro — la configurazione sensata oggi è Search su Allow, Agent su Allow, Training su Allow. Vuoi essere nell’indice, vuoi essere nelle risposte, vuoi che gli agenti arrivino alle tue pagine.

Se hai davvero un modello editoriale con pubblicità display, Disallow AI Training ha senso: resti nella ricerca, esci dall’addestramento.

4. Se hai bisogno di eccezioni, spegni il sync

Se la tua politica è per singolo operatore — apri a chi ti manda traffico, chiudi a chi no — spegni Bot Preference Sync e scrivi il file a mano. Non è una sconfitta: è l’unica strada, e Cloudflare stessa lo documenta.

5. Se hai scelto Disallow AI Training, aggiungi NOARCHIVE per Bing

Perché fino a inizio 2027 Bing non legge quella preferenza dal robots.txt. Se ti interessa davvero chiudere anche lì, serve il meta tag nell’HTML.

6. Rimetti un promemoria fra tre mesi

Questo settore si muove ogni sei settimane. Un file di policy che non rileggi è una dichiarazione che qualcun altro sta facendo al posto tuo.

Cosa cambia nella misurazione SEO e GEO

Un blocco sbagliato qui non si vede subito, e questo è il motivo per cui fa danni.

Se blocchi Googlebot oggi, non crolli domani. Le pagine restano nell’indice per giorni o settimane, poi iniziano a uscire. Quando te ne accorgi dal fatturato, sei già indietro di un mese.

Quindi, nella pratica, questi sono i controlli da mettere in piedi.

In Search Console. Guarda il report Pagine: se la voce “Bloccata da robots.txt” inizia a salire, apri subito il file. Usa lo strumento di controllo URL su tre o quattro pagine commerciali importanti e verifica che la scansione sia consentita.

Sui log del server. È la verifica che nessuno fa e che risolve tutto. Se Googlebot smette di passare, lo vedi nei log prima che nei dati di Search Console. Se non hai accesso ai log, il pannello AI Crawl Control di Cloudflare ti dice quali bot stanno arrivando e quali stanno prendendo un 403.

Sulla visibilità nei motori generativi. Qui il segnale è diverso: non cali di posizione, smetti di essere citato. Il metodo lo trovi in come misurare la visibilità del tuo sito nelle AI. In sintesi: una lista fissa di venti domande che un cliente farebbe, ripetute ogni mese su ChatGPT, Gemini e Perplexity, e il conteggio di quante volte esci tu.

E una cosa sui numeri di Cloudflare, che vale la pena riportare perché sono dati loro, misurati sulla loro rete: meno dell’1% dei siti sceglie di bloccare i bot della ricerca, mentre il 17% attiva qualche meccanismo per bloccare l’addestramento. Significa che quasi tutti vogliono essere trovati, e circa un sito su sei ha un problema con l’addestramento. La distinzione fra le due cose è tutta la partita.

Quello che ancora non sappiamo

Tre cose, dette onestamente.

Quando arriva davvero sul tuo dominio. Cloudflare ha annunciato la disponibilità su tutti i piani, ma il rollout è graduale e passa dal changelog. Alla data del 13 settembre un osservatore attento come Slobodan Manic segnalava di non aver ancora visto il blocco generato comparire sul proprio file. Quindi: annunciato sì, ovunque non ancora.

Quanto pesa davvero il segnale content-use. È in test, è una estensione dei Content Signals, e nessun motore generativo ha dichiarato pubblicamente di rispettarlo. Metterlo nel file non fa male. Contarci sopra sarebbe un errore.

Se i quattro requisiti “Accountable” reggeranno. Sono condizioni scritte da un fornitore privato, applicate sulla sua rete, e accettate da siti che nella stragrande maggioranza dei casi hanno cliccato un interruttore senza leggerle. Funziona finché tutti hanno interesse a starci dentro. È un equilibrio, non una legge.

Domande frequenti

Cloudflare può modificare il mio robots.txt senza avvisarmi?

Sul tuo server di origine il file resta intatto: Cloudflare non lo riscrive lì. Quello che cambia è la risposta che la rete di Cloudflare dà quando un crawler chiede il robots.txt del tuo dominio: il blocco generato viene anteposto al tuo contenuto. Per i domini nuovi la funzione è attiva di default; per quelli esistenti che usavano il vecchio Managed Robots.txt, Cloudflare dichiara che chiederà conferma prima della transizione.

Se attivo Disallow AI Training perdo posizioni su Google?

Secondo la documentazione di Google, no: rifiutare l’addestramento con Google-Extended non influisce sull’inclusione nella Ricerca né è un segnale di ranking, e questa dichiarazione pubblica è uno dei requisiti che Cloudflare chiede per la designazione Accountable. Attenzione però a non confondere le due cose: Disallow AI Training non tocca la ricerca, Block sì, perché dal 15 settembre si applica anche a Googlebot.

Ho un e-commerce: cosa dovrei impostare?

Se non vendi spazi pubblicitari, nel dubbio tutto su Allow. Il tuo problema non è che ChatGPT conosca le tue schede prodotto: è che non le conosca. Le schede sono il contenuto che i motori generativi usano per rispondere a “qual è il miglior X per Y”, e quella risposta oggi vale più di una posizione in SERP. Su come strutturarle: schede prodotto e citazioni AI.

Bloccare i bot AI protegge davvero i miei contenuti?

Solo in parte, ed è meglio saperlo. Il robots.txt è una preferenza dichiarata: la rispettano i crawler che scelgono di rispettarla. L’unico blocco che funziona sempre è quello applicato al livello di rete — AI Crawl Control nel caso di Cloudflare, o regole sul server. Le due cose si usano insieme: il file dichiara l’intenzione, la rete la fa rispettare.

Non uso Cloudflare: questa notizia mi riguarda lo stesso?

Indirettamente sì. Cloudflare sta di fatto scrivendo uno standard di comportamento per i crawler AI e sta ottenendo impegni pubblici da Apple, Google e Microsoft. Le quattro condizioni della designazione Accountable — opt-out dall’addestramento, opt-out dai riassunti, visibilità per URL, garanzia sul ranking — sono quelle che fra un anno pretenderai anche tu, ovunque sia ospitato il tuo sito.

Cosa significa per le aziende italiane

Te la metto giù senza giri.

La decisione più importante sulla tua visibilità nelle AI, in questo momento, rischia di prenderla un fornitore di infrastruttura che nel tuo organigramma mentale non è nemmeno nella lista dei fattori SEO. Non un consulente, non il tuo webmaster: un pannello che qualcuno ha configurato una volta e non ha più riaperto.

Nella pratica italiana il rischio ha due facce, e sono opposte.

La prima: il blocco ereditato. Nel 2024 e nel 2025 tanti siti hanno attivato “Block AI Bots” sull’onda emotiva del “l’AI ci ruba i contenuti”. Era una casella facile da spuntare e faceva sentire protetti. Oggi quella casella, migrata nelle nuove impostazioni, può significare essere fuori dai dataset che alimentano le risposte di ChatGPT e Gemini. E se qualcuno, guardando il pannello dopo il 15 settembre, decide di “stringere ancora un po’” scegliendo Block, si porta via anche Googlebot. Per un’azienda che fa il 60% dei contatti dal traffico organico è un colpo che si vede in bilancio, con due mesi di ritardo.

La seconda: la porta lasciata aperta senza saperlo. Chi ha contenuti proprietari veri — ricerche, dati di settore, manuali tecnici, un archivio costruito in dieci anni — oggi li sta dando in pasto all’addestramento senza aver mai deciso di farlo. Non è per forza sbagliato. Ma deve essere una scelta.

La cosa che accomuna le due facce è che nessuna delle due è stata decisa. È questo il punto, non quale impostazione sia giusta.

E c’è un dato di Cloudflare che tengo lì perché ribalta il modo in cui si guarda a questa partita: oltre la metà dei consumatori legge i riassunti generati nella ricerca, e chi li legge ha oltre il 40% di probabilità in più di chiudere lì la ricerca senza cliccare. Ma chi arriva sul sito passando dalla ricerca AI converte da tre a oltre cinque volte più di chi arriva dalla ricerca tradizionale.

Meno visite, molto più intento. Per un editore che vive di volume è un problema. Per un’azienda che vende macchinari a 80.000 euro o consulenza a PMI è la notizia migliore degli ultimi tre anni. Sono due business diversi con due configurazioni diverse, e Cloudflare ha ragione a non scegliere al posto tuo.

Quindi, se dovessi ridurre tutto a una cosa sola da fare questa settimana: apri il robots.txt del tuo sito e leggilo. Ci metti due minuti. Se dentro c’è qualcosa che non hai scritto tu, adesso sai da dove arriva — e sai che il pannello per cambiarlo ce l’hai.

Un file di policy che non hai letto è una dichiarazione che qualcun altro sta facendo a nome tuo. E in questo momento quella dichiarazione decide se esisti dentro le risposte che i tuoi clienti stanno leggendo.

0