Formattare un contenuto con titoletti, elenchi e tabelle non aumenta in modo dimostrato la probabilità che un’AI ti citi. Aumenta quanto spazio ti dà quando ti ha già scelto. È la conclusione di CITECHOICE, pubblicato su arXiv il 14 settembre 2026: il primo test in cui qualcuno ha cambiato una variabile alla volta dentro conversazioni reali di un agente di ricerca, invece di guardare correlazioni. Numeri: la versione strutturata della stessa pagina ha ottenuto +0,50 citazioni per risposta. La probabilità di essere citati almeno una volta è salita di 4,5 punti percentuali, ma il dato non è conclusivo. E il 15% delle decisioni “ti cito / non ti cito” è cambiato rifacendo la stessa identica domanda. Tradotto: gran parte di quello che ti hanno venduto come regola GEO non è mai stato testato.
In questo articolo
- Cosa hanno fatto, in concreto
- Risultato 1: la struttura concentra il credito, non apre la porta
- Risultato 2: la posizione conta molto meno di quanto sembra
- Risultato 3: c’è un pavimento di rumore, ed è alto
- Le tre frasi sul GEO che questo studio ridimensiona
- Ammissione e allocazione: due problemi, due leve
- Cosa farei io, in ordine
- Cosa cambia nella misurazione SEO e GEO
- I limiti dello studio, detti onestamente
- Domande frequenti
- Cosa significa per le aziende italiane
Cosa hanno fatto, in concreto
Sriram Selvam e Anneswa Ghosh hanno affrontato una domanda che nel GEO nessuno aveva ancora isolato: quando un motore di risposta recupera più fonti che dicono la stessa cosa, perché ne cita una e non l’altra?
Loro la chiamano citation allocation: allocazione della citazione. Non è “essere trovati”. È il passaggio dopo: sei già nel mucchio delle pagine recuperate, dici la stessa identica cosa del concorrente, e il modello deve decidere a chi attribuire il merito.
Il metodo, semplificato:
- Hanno fatto rispondere un agente di ricerca basato su GPT-5.4 (con Exa come motore di recupero) a 130 domande comuni. Ne ha affrontate 129, e di ognuna hanno salvato l’intera conversazione: messaggi, chiamate di ricerca, risultati.
- Da quei transcript hanno estratto 113 coppie di pagine comparse nella stessa chiamata di ricerca e verificate, in cieco, come portatrici dello stesso fatto. Selezione fatta senza guardare né le posizioni né chi fosse poi stato citato. Una revisione umana successiva ha confermato 103 coppie su 113 come “gemelle” vere.
- Poi il replay: ogni conversazione salvata è stata rigiocata quattro volte, incrociando due variabili. Prima variabile: la pagina bersaglio sta sopra o sotto la gemella. Seconda variabile: il testo della pagina bersaglio è in paragrafi discorsivi oppure riscritto con titoletti, elenchi o tabella. Tutto il resto del transcript resta congelato, con verifica hash. Si rigenera solo la risposta finale.
Questa è la differenza che conta. Tutti gli studi GEO che avete letto finora sono osservazionali: prendono le pagine citate dalle AI e guardano cosa hanno in comune. Trovano che il 70% ha lo schema markup, che le pagine citate sono più strutturate, e concludono “fai così”. Ma è la vecchia trappola: le pagine strutturate sono anche, in media, pagine fatte meglio, da siti più autorevoli, su argomenti più curati. Non sai mai cosa stai misurando.
CITECHOICE cambia una cosa sola e lascia ferma tutta la scena. È il primo audit causale su questo pezzo di catena. Ed è anche il motivo per cui i risultati sono più piccoli e più scomodi di quelli che girano nei webinar.
Risultato 1: la struttura concentra il credito, non apre la porta
Il dato più solido dello studio. La versione strutturata della stessa pagina, a parità di fatti, ha ottenuto +0,50 citazioni per risposta rispetto alla versione in prosa. Intervallo di confidenza al 95% da +0,20 a +0,84, p corretto = 0,033. Statisticamente regge.
Ma qui viene il punto che quasi nessuno riporterà correttamente: il numero totale di citazioni nella risposta non è aumentato, e il credito tolto al concorrente è rimasto sostanzialmente invariato. Gli autori lo dicono chiaro: la presentazione ridistribuisce il credito visibile, non ne crea di nuovo.
E la domanda che a un imprenditore interessa davvero — “sono citato sì o no?” — ha una risposta molto meno entusiasmante. L’effetto sulla semplice incidenza (comparire almeno una volta) è di +4,5 punti percentuali, con intervallo da −1,4 a +10,4 e p = 0,168. Cioè: potrebbe essere un piccolo vantaggio, potrebbe essere zero, potrebbe perfino essere un minimo svantaggio. Lo studio non è in grado di distinguere. Gli autori scrivono che il test poteva rilevare con affidabilità solo effetti dall’8,5% in su: sotto quella soglia sono ciechi.
C’è un test ancora più severo, dentro lo studio: stesse identiche parole, cambiato solo il layout, una frase per riga di elenco. Su tutte e 113 le coppie il tasso di citazione sale. Ripetuto su un sottoinsieme, l’effetto si inverte. Che è il modo educato per dire: non fateci un piano editoriale sopra.
La frase che gli autori mettono nella discussione meriterebbe di stare stampata sopra la scrivania di chiunque venda consulenza GEO in Italia: si tratta di un avvertimento sulla sensibilità dell’attribuzione, non di una tattica di ottimizzazione.
Risultato 2: la posizione conta molto meno di quanto sembra
Questo è il risultato che fa più male a chi ha costruito un servizio su “portiamo la tua pagina in cima ai risultati che l’AI recupera”.
Nei transcript salvati, le pagine in prima posizione tra i cinque risultati restituiti da una singola chiamata di ricerca sono state citate l’85,1% delle volte. Quelle in quinta posizione, il 42,8%. Divario: 42,3 punti percentuali. Enorme. Il tipo di numero che finisce in una slide con la freccia rossa.
Poi i ricercatori hanno preso la stessa pagina e l’hanno spostata più in alto dentro la sua coppia. Effetto sulla probabilità di essere citata: +7,9 punti percentuali, e non statisticamente significativo dopo la correzione per test multipli. Su un secondo gruppo di 56 coppie, tenuto da parte e con il solo ordine invertito, l’effetto stimato è 0,0 punti, intervallo da −5,4 a +5,4.
Da 42,3 a zero. La differenza tra i due numeri non è un errore: è la definizione stessa del problema. Il divario osservato misura posizione più qualità, perché i motori di recupero mettono in cima le pagine che ritengono più pertinenti. Quando isoli la sola posizione, il vantaggio si sgonfia.
Precisazione necessaria, perché qui si generano fraintendimenti costosi: “posizione” in questo studio significa l’ordine dei cinque risultati restituiti da una chiamata interna dell’agente. Non è la posizione su Google. Essere primi su Google resta un’ottima idea, anche perché è il modo più affidabile di entrare in quel mucchio di cinque. Ma una volta dentro, l’ordine pesa molto meno di quanto il grafico lasci credere.
Risultato 3: c’è un pavimento di rumore, ed è alto
Il terzo risultato è quello che ho girato immediatamente a due clienti che pagano un tool di AI visibility.
I ricercatori hanno rifatto 120 risposte con gli stessi identici input. Risultato: nel 15% dei casi la decisione binaria “citato / non citato” è cambiata. Circa una su sette. Stimano che il 45% della varianza osservata in una singola generazione sia attribuibile alla casualità del modello, non a quello che hai fatto tu.
L’effetto medio sul conteggio delle citazioni invece regge alle ripetizioni. Ed è un’informazione preziosa: le metriche di volume sono più stabili delle metriche binarie. Ma la metrica che tutti guardano nei cruscotti è proprio quella binaria — “ci sei o non ci sei su questo prompt”.
Non è un caso isolato. A gennaio 2026 SparkToro aveva già rilevato che ChatGPT e gli AI Overview di Google, interrogati ripetutamente con lo stesso prompt, restituiscono la stessa lista di brand meno dell’1% delle volte.
Quindi: se il vostro fornitore vi manda un report mensile in cui “questo mese siamo entrati su 3 prompt e usciti da 2”, una parte consistente di quel movimento è rumore. Non malafede, necessariamente. Semplicemente una misura fatta una volta sola su un sistema che non è deterministico. È lo stesso problema che ho raccontato quando ho spiegato come si misura davvero la visibilità nelle AI: il numero c’è, è ben confezionato, e non regge a una seconda esecuzione.
Le tre frasi sul GEO che questo studio ridimensiona
“Aggiungi elenchi puntati e H2 e ChatGPT ti cita.” Ridimensionata. La struttura sposta il credito quando sei già nella risposta. Sull’entrarci, il dato non è conclusivo. Continuate a scrivere ordinato — fa bene ai lettori e non costa niente — ma smettete di venderlo come leva di visibilità.
“Devi essere il primo risultato che l’AI recupera.” Ridimensionata. Il 42,3% di divario che citano tutti è correlazione. Controllato, va a zero.
“Abbiamo aggiunto lo schema markup e le citazioni sono salite.” Stessa categoria di errore. Un report di Ahrefs di maggio 2026 ha mostrato che le pagine citate dalle AI hanno circa tre volte più probabilità di contenere JSON-LD. Ma quando lo schema è stato aggiunto in test, l’aumento delle citazioni non è emerso in modo chiaro. Correlazione forte, causalità non dimostrata.
La domanda che da oggi vale la pena fare a chiunque vi proponga una tattica GEO è una sola: qualcuno ha mai cambiato solo quella variabile e rimisurato? Nella quasi totalità dei casi la risposta è no. Non perché siano tutti in malafede, ma perché fare un test causale costa e il mercato premia le certezze.
Ammissione e allocazione: due problemi, due leve
Il contributo più utile di questo studio non è un numero. È un modello mentale che secondo me va adottato subito, perché separa due cose che in Italia vengono vendute insieme.
Problema 1 — Ammissione. La tua pagina entra o no nel gruppo di fonti che il modello recupera per quella domanda? Questo è un problema di recupero: indicizzazione, accessibilità ai crawler AI, pertinenza, autorevolezza topica, e soprattutto presenza su fonti terze che il modello già pesca. Le leve sono quelle di sempre, più quelle off-site. Ed è qui che si gioca la partita grossa: l’ho documentato con i numeri parlando di quanto pesano le fonti esterne rispetto al tuo sito.
Problema 2 — Allocazione. Una volta dentro, quanto credito ti viene attribuito rispetto a chi dice la stessa cosa? Qui — e solo qui — la formattazione ha un effetto causale misurato.
Chi confonde i due problemi fa questo errore: rifà tutti i contenuti del sito in elenchi puntati, aspetta tre mesi, non succede niente, e conclude che il GEO è una truffa. Non è una truffa: ha usato la leva dell’allocazione su un problema di ammissione. Se non entri nel mucchio, puoi formattare quanto vuoi.
Vale anche il contrario, ed è la parte incoraggiante. Se sei già una fonte che le AI recuperano — perché hai contenuti solidi e qualcuno ti nomina in giro — allora sistemare la struttura delle pagine è un intervento a basso costo che ti fa pesare di più nella risposta. Mezza citazione in più per risposta non cambia la vita, ma su volumi seri è la differenza tra essere una nota a piè di pagina ed essere la fonte principale del paragrafo.
Cosa farei io, in ordine
Se domani mattina un cliente mi chiedesse cosa fare alla luce di questo studio, questo è l’ordine. Non è l’ordine più eccitante, è quello che regge.
1. Prima di tutto, smettete di decidere su un solo test. Qualsiasi verifica su ChatGPT, Gemini o Perplexity va ripetuta almeno cinque volte, in giorni diversi, e riportata come frequenza — “compariamo in 4 risposte su 5” — non come sì/no. Costa dieci minuti in più e vi evita di riscrivere una pagina che stava già funzionando.
2. Verificate l’ammissione prima dell’allocazione. Domanda secca: per le dieci domande che contano nel vostro settore, le AI recuperano una vostra pagina? Se la risposta è no per otto su dieci, il problema non è la formattazione. È che non esistete come fonte. In quel caso il budget va sulle menzioni esterne e sulla copertura degli argomenti, non sul restyling dei contenuti.
3. Sulle pagine che già compaiono, fate il lavoro di struttura. Un fatto per riga. Titoletti che sono domande vere. Tabelle dove ci sono confronti. Le cifre chiave scritte per esteso vicino al termine a cui si riferiscono, non in un grafico. Questo è il caso d’uso in cui l’effetto è stato misurato, ed è anche l’intervento più economico che esista.
4. Non spostate budget dalla SEO classica. Essere trovabili resta la condizione di ingresso. Il recupero delle fonti passa ancora, in larghissima parte, per gli indici dei motori. Chi ha tagliato la SEO per finanziare il GEO ha finanziato la seconda leva avendo rotto la prima.
5. Chiedete al fornitore la metodologia, non il punteggio. Tre domande: quante volte avete interrogato ogni prompt? Riportate la variabilità tra le esecuzioni? Quando dite che una modifica ha funzionato, avete cambiato solo quella? Se le risposte sono “una”, “no” e “no”, state comprando un numero, non una misura.
Cosa cambia nella misurazione SEO e GEO
Dal punto di vista operativo, questo studio ha una conseguenza precisa sul modo in cui si imposta il monitoraggio.
Le piattaforme serie di monitoraggio AI — in Italia la più usata dalle agenzie è SeoZoom con il suo AI Prompt Tracker — restituiscono metriche come citation rate, mention rate, share of answer e prominenza. Sono metriche di frequenza e di volume, non decisioni binarie su una singola esecuzione. Alla luce di CITECHOICE questa è esattamente la forma giusta: il conteggio regge alle ripetizioni, il sì/no no.
Tre indicazioni pratiche per chi imposta il tracking:
- Leggete le serie storiche, non le singole rilevazioni. Un prompt che vi vede comparire e sparire settimana su settimana probabilmente non sta raccontando nulla. Un prompt su cui salite per sei rilevazioni consecutive sta raccontando qualcosa.
- Misurate la prominenza oltre alla presenza. “Quante volte siamo citati dentro la risposta” è la metrica su cui la formattazione agisce davvero. “Ci siamo sì o no” è la metrica più rumorosa che esista.
- Tenete separati i due imbuti. Un cruscotto per l’ammissione (quante domande recuperano una nostra pagina), uno per l’allocazione (quando ci siamo, quanto pesiamo). Sono due problemi con due budget diversi.
Sul fronte contenuti, la conseguenza è meno drammatica di quello che sembra: un contenuto solido nella SERP tradizionale ha più probabilità di essere recuperato e citato dalle AI. Non c’è un secondo sito da costruire. C’è lo stesso sito, scritto in modo che un fatto sia estraibile da solo — che poi è anche il modo in cui lo legge una persona di fretta sul telefono.
I limiti dello studio, detti onestamente
Sarei incoerente se usassi uno studio sul rigore metodologico senza dichiararne i limiti. Sono parecchi, e gli autori li elencano per primi.
Non è peer-reviewed: è un preprint pubblicato su arXiv il 14 settembre 2026. Copre un solo agente (GPT-5.4 con Exa come fornitore di ricerca), con una verifica secondaria su Grok 4.3 in cui la direzione dell’effetto si conferma, ma meno della metà delle prime risposte di Grok rispetta il formato di citazione richiesto.
Soprattutto: le riscritture sono avvenute dentro transcript congelati, su testo già recuperato. Nessuna pagina reale è stata modificata online. Quindi lo studio non dimostra che riformattare una pagina viva aumenti le citazioni: crawling, recupero e ranking restano fuori dall’esperimento. È un pezzo della catena, non la catena.
E le due versioni del testo — prosa e strutturata — sono entrambe riscritture generate da AI (quasi tutte da Grok 4.3, con GPT-5.4 come riserva su una coppia, e un controllo di fedeltà dei fatti). Le parole differiscono tra le due versioni, quindi il confronto non isola la sola formattazione in senso stretto. Gli autori lo scrivono.
Detto tutto questo: resta il tentativo più serio fatto finora di trasformare il GEO da collezione di aneddoti a qualcosa di misurabile. E il fatto che i risultati siano piccoli e incerti non è un difetto dello studio. È probabilmente com’è fatta la realtà.
Domande frequenti
Devo riscrivere tutti i contenuti del sito in elenchi puntati?
No. Lo studio non dimostra che la struttura vi faccia entrare nelle risposte AI: quell’effetto è stimato a +4,5 punti percentuali ma non è conclusivo. Dimostra che, quando siete già citati, la versione strutturata ottiene circa mezza citazione in più per risposta. Quindi l’intervento ha senso sulle pagine che già compaiono, non come rifacimento generalizzato. E scrivere ordinato conviene comunque per i lettori.
Allora la posizione su Google non serve più a niente?
Serve eccome. Lo studio parla dell’ordine dei risultati interni restituiti da una chiamata di ricerca dell’agente, non del ranking su Google. Essere ben posizionati su Google resta il modo più affidabile di finire tra le fonti che il modello recupera. Quello che lo studio ridimensiona è il vantaggio di stare primo dentro quel gruppetto, una volta che ci sei.
Perché la mia visibilità nelle AI cambia da un giorno all’altro?
Perché una parte è rumore. Rifacendo la stessa domanda con gli stessi input, il 15% delle decisioni “citato / non citato” è cambiato, e gli autori stimano che circa il 45% della variabilità di una singola esecuzione dipenda dalla casualità del modello. La lettura corretta è su più esecuzioni e su serie storiche, mai su una rilevazione singola.
I tool di monitoraggio AI sono inutili?
No, ma vanno letti per quello che sono. Le metriche di frequenza e di volume (quante volte siete citati, con che prominenza) sono più stabili e più affidabili delle metriche binarie su un singolo prompt. Chiedete sempre al fornitore quante volte interroga ciascun prompt e se riporta la variabilità. Se interroga una volta sola, il numero che ricevete ha un margine di errore che nessuno vi sta dichiarando.
Lo schema markup serve per farsi citare dalle AI?
I dati disponibili dicono che le pagine citate dalle AI contengono JSON-LD circa tre volte più spesso delle altre, ma nei test in cui lo schema è stato aggiunto l’aumento delle citazioni non è emerso chiaramente. È una correlazione forte con una causalità non dimostrata. Mettetelo perché serve ai rich result su Google e costa poco, non perché vi garantisca una citazione.
Cosa significa per le aziende italiane
Tre implicazioni concrete, per una PMI italiana che sta decidendo dove mettere il budget nei prossimi sei mesi.
Primo: rimandate il rifacimento dei contenuti, anticipate la verifica. Un restyling editoriale completo su un sito da duecento pagine costa decine di migliaia di euro e, alla luce di questi dati, non ha un effetto dimostrato sull’entrare nelle risposte AI. Prima spendete un pomeriggio: prendete le dieci domande che i vostri clienti fanno davvero, ponetele cinque volte a ChatGPT e a Gemini, e segnate su quante risposte compare una vostra pagina. Se compare raramente, il problema è a monte e il restyling sarebbe soldi buttati. Questa verifica costa zero e vi dice dove siete.
Secondo: pretendete metodo dai fornitori, anche piccoli. In Italia si stanno vendendo pacchetti GEO a PMI da tre a cinque milioni di fatturato con promesse basate su correlazioni che nessuno ha mai testato. Non serve diventare statistici: bastano tre domande in riunione. Quante volte avete misurato? Riportate la variabilità? Quando dite che una modifica ha funzionato, avete cambiato solo quella? Un fornitore serio risponde volentieri. Chi si irrita, vi sta vendendo un punteggio.
Terzo: la leva vera per voi resta l’ammissione, e passa da fuori. Lo dico da mesi ed è coerente con questo studio: per un’azienda italiana di media dimensione la partita si vince entrando nel gruppo di fonti che le AI recuperano, e quel gruppo si costruisce con presenza su siti di settore, dati propri che valga la pena citare, e contenuti che coprono davvero un argomento. La formattazione è il rifinitore, non il motore. È anche una buona notizia sul piano dei costi: sistemare la struttura di venti pagine chiave è un intervento da poche giornate, mentre diventare una fonte riconosciuta è il lavoro lungo. Metteteli nell’ordine giusto e il budget rende. Al contrario — struttura prima, autorevolezza poi — spendete bene su un problema che non avete.
Il messaggio di fondo è questo: il GEO sta uscendo dalla fase in cui bastava una slide con una freccia per vendere un progetto. Chi porta metodo, adesso, ha un vantaggio competitivo reale. Chi porta certezze no.
