
llms.txt, Schema.org e altro: come far citare il vostro sito web dai sistemi di ricerca basati su IA
Affinché ChatGPT, Perplexity o Google AI Overviews citino il vostro sito web, servono soprattutto tre cose: pagine crawlable e veloci, contenuti chiaramente strutturati con risposte dirette e dati strutturati puliti (Schema.org). Una llms.txt può essere un’integrazione, ma non è uno standard ufficiale – secondo quanto dichiarato da Google, non viene utilizzata.
Il più importante in breve
- I sistemi di ricerca basati su IA citano le pagine che riescono a raggiungere, comprendere e classificare come affidabili.
- Tre livelli: Crawlabilità, contenuti orientati alla risposta, dati Schema.org.
- llms.txt non è uno standard; Google, secondo quanto afferma, non la utilizza.
- I dati strutturati devono corrispondere al contenuto visibile – altrimenti si verificano errori.
I sistemi di ricerca basati su IA come ChatGPT, Perplexity o Google AI Overviews citano siti web che possono raggiungere tecnicamente, comprendere nei contenuti e classificare come affidabili. A tal fine contano tre livelli: indicizzabilità e velocità, contenuti chiaramente strutturati con risposte dirette e dati strutturati secondo Schema.org. Un llms.txt può integrare, ma non è uno standard ufficiale – e Google ha dichiarato di non utilizzarlo.
Questo articolo è il complemento tecnico a GEO invece di SEO e al Guida pratica GEO. Il significato fondamentale di GEO è spiegato nella voce del glossario Generative Engine Optimization.
Livello 1: accessibilità per i crawler IA
Prima che un sistema di IA possa citare i vostri contenuti, deve poterli leggere. Verificate tre punti:
- robots.txt: I crawler come GPTBot (OpenAI), ClaudeBot (Anthropic), PerplexityBot o Google-Extended vengono bloccati? Molti siti web li bloccano inconsapevolmente tramite regole generiche.
- Rendering lato server: I contenuti che vengono generati solo tramite JavaScript nel browser non sono visibili a molti crawler. I testi importanti devono essere inclusi direttamente nell’HTML fornito.
- Velocità e accessibilità: Le pagine lente o con errori vengono rilevate meno spesso e in modo incompleto.
Un esempio dal nostro sito web: in passato le risposte delle FAQ espandibili venivano visualizzate solo tramite JavaScript – i crawler vedevano quindi solo una parte delle risposte. Dopo il passaggio a elementi HTML nativi, tutte le risposte sono presenti direttamente nel codice sorgente.

Livello 2: contenuti che si possono citare
I sistemi di IA riprendono preferibilmente passaggi che rispondono a una domanda in modo diretto e completo. Da ciò derivano semplici regole di scrittura:
- Risposta prima:La domanda centrale viene risposta nelle prime due o tre frasi, poi segue l’approfondimento.
- Domande come sottotitoli:Così come le persone le porrebbero a un chatbot.
- Fatti concreti con fonte:Numeri, scadenze, condizioni – documentati e con data di riferimento.
- Elenchi e tabelle:Confronti e passaggi strutturati invece di essere nascosti nel testo continuo.
- Termini chiari: Spiegare i termini tecnici una volta, poi usarli in modo coerente.
- Autorialità riconoscibile: Chi scrive, con quale esperienza? È un segnale di fiducia.
Livello 3: Dati strutturati secondo Schema.org
Dati strutturati descrivono i contenuti in formato JSON-LD leggibile dalle macchine. Aiutano i motori di ricerca a capire chi offre qualcosa, cosa è una pagina e quali domande risponde. Tipi importanti per i siti web aziendali:
- Organization / LocalBusiness: nome, indirizzo, contatto, profili in altri network (sameAs).
- Person: autrici e autori con qualifiche.
- Servizio: Prestazioni con fornitore e ambito di utilizzo.
- Articolo / BlogPosting: Articoli con autore, data e aggiornamento.
- FAQPage: Domande e risposte.
- BreadcrumbList: l'inquadramento di una pagina nella struttura del sito web.
Importante: i dati strutturati devono corrispondere al contenuto visibile ed essere completi. Un markup di prodotto senza prezzo, ad esempio, genera errori nella Google Search Console – chi non pubblica prezzi descrive meglio le proprie offerte come servizio.
E la llms.txt?
Il llms.txt è un file di testo proposto nel 2024 nella directory principale di un sito web, che spiega ai sistemi di IA in forma compatta di cosa tratta il sito e quali pagine sono le più importanti – maggiori informazioni nel glossario sotto llms.txt. Non è uno standard ufficiale. I rappresentanti di Google hanno dichiarato pubblicamente che Google Search non la utilizza; se e come altri fornitori di IA la valutino non è documentato in modo affidabile.
La nostra valutazione: una llms.txt non fa male ed è rapida da creare, ma non dovrebbe essere la prima misura. La crawlabilità, contenuti di qualità e dati strutturati corretti hanno un effetto comprovato – la llms.txt è un piccolo complemento.
Checklist in sette punti
- verificare in robots.txt la presenza di crawler IA bloccati.
- Contenuti importanti nell’HTML consegnato invece che solo tramite JavaScript.
- Per ogni pagina un H1 chiaro e domande come sottotitoli.
- Rispondere subito nelle prime frasi.
- Verificare lo schema Organization, Service, Article e FAQPage e correggere gli errori nella Search Console.
- Rendere visibili autrici e autori, indicare data e aggiornamento.
- Opzionale: creare un file llms.txt con le pagine più importanti.
Quanto è ben posizionato il vostro sito web per i sistemi di ricerca basati su IA, lo mostra il gratuito controllo SEO-/GEO in pochi minuti.
Come è strutturato un llms.txt
La proposta prevede un semplice file Markdown sotto /llms.txt:
- un titolo con il nome del sito web o dell’azienda
- un breve riassunto in un paragrafo
- sezioni con elenchi delle pagine più importanti, ciascuna con link e una frase di descrizione
- una versione più dettagliata opzionale (llms-full.txt) con più contenuti
Chi crea un llms.txt dovrebbe mantenerlo aggiornato: link e descrizioni obsoleti sono peggiori di nessun file. bettersorted.de mette a disposizione un file di questo tipo, ma lo considera un complemento, non il nucleo dell’ottimizzazione.
E-E-A-T: perché i segnali di fiducia contano
Google lo descrive con E-E-A-T (Experience, Expertise, Authoritativeness, Trustworthiness) i segnali con cui si può valutare la qualità dei contenuti. Per la ricerca tramite IA valgono criteri simili: i sistemi citano preferibilmente fonti di cui si fidano. In concreto aiutano:
- Autrici e autori riconoscibili con profilo e qualifiche
- Riferimento alla pratica: esperienze proprie, esempi, referenze
- Prove: Fonti e data di riferimento per i fatti
- Impressum, contatto, protezione dei dati completi e facilmente reperibili
- Menzioni su altri siti web: elenchi, portali di settore, stampa, reti
Come misurare se i sistemi di IA citano il vostro sito
- Porre le domande tipiche del vostro target in ChatGPT, Perplexity e Google e verificare quali fonti vengono citate.
- Nell’analisi web osservare le visite provenienti da servizi di IA (domini di riferimento).
- In Google Search Console monitorare le impressioni per le query di ricerca in forma di domanda.
- Ripetere il controllo a intervalli regolari, perché le risposte cambiano.
Errori tecnici frequenti
- Crawler IA bloccati accidentalmente tramite robots.txt o firewall
- Contenuti importanti presenti solo in immagini o PDF
- Risposte in elementi espandibili che vengono caricati solo tramite JavaScript
- Dati strutturati errati o incompleti
- Pagine duplicate senza indicazione canonical
Domande frequenti
Che cos’è una llms.txt?
Un file di testo nella directory principale di un sito web che spiega ai sistemi di IA, in forma compatta, di cosa tratta il sito e quali pagine sono importanti. È stata proposta nel 2024 e non è uno standard ufficiale.
Google utilizza la llms.txt?
No. Rappresentanti di Google hanno spiegato che Google Search non utilizza la llms.txt. Per Google contano la crawlabilità, i contenuti e i dati strutturati.
Quali dati strutturati sono più importanti per la ricerca con IA?
Organization o LocalBusiness per l’azienda, Person per gli autori, Service per i servizi, Article per gli articoli, FAQPage per le domande e BreadcrumbList per la struttura delle pagine.
Dovrei consentire i crawler IA nel file robots.txt?
Se i vostri contenuti devono comparire nelle risposte dell’IA, sì. Chi blocca GPTBot, ClaudeBot o PerplexityBot non può essere citato da questi sistemi. La decisione è un compromesso tra visibilità e controllo sui propri contenuti.
Aggiornato: ottobre 2026.

Muhamed Alahmed
Con oltre 10 anni di esperienza nell’IT, sviluppo soluzioni che non solo funzionano dal punto di vista tecnico, ma creano anche un valore aggiunto concreto e aprono nuovi spazi di manovra.
Più su bettersorted →Altri articoli

GEO invece di solo SEO: perché il vostro sito web non compare nelle risposte dell’IA
Perché un buon posizionamento su Google non basta: i cinque motivi più frequenti per cui ChatGPT e Perplexity ignorano il vostro sito web — più un controllo gratuito.

Come le aziende vengono trovate in ChatGPT e Perplexity: GEO per le PMI
Come le aziende diventano una fonte citabile per i sistemi di ricerca basati sull’IA: passi concreti oltre la semplice raggiungibilità tecnica.

Obbligo di etichettatura dell’IA da agosto 2026: cosa devono sapere ora le aziende
Obbligo di etichettatura dell’IA dal 2 agosto 2026: cosa va etichettato, chi è interessato e quali sanzioni sono previste in caso di violazioni.
Rimanete aggiornati sui temi dell'IA
Aggiornamenti brevi su automazione IA, finanziamenti e nuovi articoli — niente spam, disiscrivibile in qualsiasi momento.