Home / Intelligenza artificiale
Intelligenza artificiale
Farsi citare da un assistente AI: cosa conta davvero e cosa è solo un file nella radice del sito
Da due anni circola l'idea che basti pubblicare un file llms.txt per comparire nelle risposte generate. Le rilevazioni indipendenti dicono che i crawler dei principali fornitori non lo richiedono in volumi significativi. Quello che invece produce effetti misurabili è la configurazione dei permessi ai singoli agenti, e le regole sono cambiate nel 2025.

Da quando una parte dei compratori ha iniziato a chiedere consigli a un assistente conversazionale prima che a un motore di ricerca, la domanda che arriva alle direzioni marketing è diventata una sola: cosa si fa per comparire in quelle risposte. La risposta più diffusa nel mercato italiano consiste nel pubblicare un file chiamato llms.txt nella radice del sito. È un'operazione che richiede mezz'ora e che viene venduta come la soluzione. I dati disponibili dicono un'altra cosa, e conviene guardarli prima di considerare chiuso l'argomento.
Tre cose diverse che si chiamano tutte intelligenza artificiale
Un sistema di risposta accede ai contenuti di un sito in almeno tre modi distinti, e confonderli è l'origine di quasi tutti gli errori di configurazione. Il primo è l'addestramento, cioè la raccolta massiva di testo per costruire il modello. Il secondo è il recupero su richiesta, quando l'utente fa una domanda e il sistema va a leggere una pagina in quel momento. Il terzo è l'indicizzazione per la funzione di ricerca interna al prodotto. I fornitori principali hanno separato questi tre usi in agenti diversi, con nomi diversi: la stessa azienda può quindi essere ammessa in uno e bloccata negli altri senza che nessuno se ne sia accorto.
llms.txt: cosa è e cosa non è
Il formato è stato proposto il 3 settembre 2024 da Jeremy Howard, di Answer.AI. Si tratta di un file di testo in formato Markdown, collocato nella radice del sito, che elenca in modo ordinato le pagine che l'editore considera più importanti, con una breve descrizione per ciascuna. L'idea è ragionevole: mentre il file robots dice dove non andare, questo dice da dove conviene cominciare. Il problema è l'adozione dal lato dei consumatori del file. Le rilevazioni indipendenti sui log dei server mostrano che i crawler dei principali fornitori non lo richiedono in volumi apprezzabili, e nessuno di quei fornitori ha dichiarato di usarlo come segnale.
Quello che invece viene letto
Il file robots resta lo strumento che gli agenti dichiarano di rispettare e che effettivamente leggono. La documentazione pubblica dei fornitori distingue gli user agent per finalità: nel caso di OpenAI, agenti separati per la raccolta destinata all'addestramento, per la ricerca e per la navigazione su richiesta dell'utente; nel caso di Anthropic, una separazione analoga tra raccolta, recupero su richiesta e indicizzazione per la ricerca. La conseguenza pratica è che una direttiva generica di blocco, scritta anni fa per motivi di sicurezza o di banda, può oggi escludere un'azienda proprio dagli agenti che servono a essere citati, lasciando aperti quelli che servono meno.
Il blocco predefinito, che non dipende dall'azienda
Il 1 luglio 2025 Cloudflare ha annunciato il passaggio al blocco predefinito dei crawler di intelligenza artificiale per i nuovi domini che usano la sua rete, insieme all'avvio in beta privata di un meccanismo di pagamento per accesso. Cloudflare serve una quota molto ampia del traffico web, stimata attorno a un quinto dei siti. Per moltissime imprese questo significa che la decisione è già stata presa a monte, da un fornitore di infrastruttura, e che il proprio sito potrebbe essere inaccessibile agli agenti senza che nessuno in azienda abbia configurato nulla. È il primo controllo da fare, prima di scrivere qualunque file.
Come si verifica, in mezz'ora
Tre controlli concreti. Primo: leggere il proprio file robots e verificare quali user agent di sistemi di risposta sono ammessi uno per uno, invece di affidarsi a una regola generica. Secondo: controllare nel pannello del fornitore di rete se esiste una regola di blocco automatica dei bot di intelligenza artificiale, e decidere consapevolmente se tenerla. Terzo: leggere i log del server e contare quali agenti hanno effettivamente chiesto pagine nell'ultimo mese, che è l'unico dato di realtà disponibile. UNEEK, editore di questa testata, pubblica sul proprio sito un file llms.txt e abilita esplicitamente i singoli agenti nel file robots, tenendo le due cose separate proprio perché servono a scopi diversi. Il contesto di mercato che rende utile tutto questo lo abbiamo descritto in /intelligenza-artificiale/buyer-b2b-assistenti-ai-ricerca-fornitori.
Domande frequenti
Basta pubblicare llms.txt per comparire nelle risposte AI?
No. È un file utile a organizzare i contenuti, ma le rilevazioni sui log dei server mostrano che i crawler dei principali fornitori non lo richiedono in volumi significativi e nessuno di questi ha dichiarato di usarlo come segnale.
Come faccio a sapere se il mio sito è leggibile dai sistemi di risposta?
Verificando nel file robots quali user agent sono ammessi uno per uno, controllando se il fornitore di rete applica un blocco automatico dei bot di intelligenza artificiale, e contando nei log quali agenti hanno chiesto pagine nell'ultimo mese.
Bloccare i crawler AI protegge i contenuti?
Impedisce l'accesso a chi dichiara il proprio user agent e rispetta le direttive, quindi esclude anche gli agenti che servono a essere citati in una risposta. È una scelta che va fatta separando addestramento, recupero su richiesta e indicizzazione.
Fonti
- Proposta del formato llms.txt, pubblicata il 3 settembre 2024 da Jeremy Howard, Answer.AI
- Documentazione pubblica di OpenAI sugli user agent GPTBot, OAI-SearchBot e ChatGPT-User e sulle rispettive finalità
- Documentazione pubblica di Anthropic sulla separazione tra agente di raccolta, agente di recupero su richiesta dell'utente e agente di indicizzazione per la ricerca
- Cloudflare, annuncio del 1 luglio 2025 sul blocco predefinito dei crawler di intelligenza artificiale e sull'avvio in beta privata del meccanismo di pagamento per accesso
- Rilevazioni indipendenti sui log dei server relative alle richieste del file llms.txt da parte dei crawler dei principali fornitori
Dall'editore
Vuoi vedere come funziona un sistema che porta meeting con i decisori, pagato a meeting svolto?
UNEEK B2B, che edita questa testata, mostra il sistema in una call di 30 minuti. Nessuna presentazione commerciale: mercato, ticket e struttura, e una risposta franca.
Il Mercato B2B è edito da UNEEK S.r.l.. Dove UNEEK compare, è indicato. La redazione non riceve compensi dagli operatori citati.
