
llms.txt, Schema.org y compañía: así cita su sitio web los sistemas de búsqueda con IA
Para que ChatGPT, Perplexity o Google AI Overviews citen su sitio web, hacen falta sobre todo tres cosas: páginas rastreables y rápidas, contenidos claramente estructurados con respuestas directas y datos estructurados limpios (Schema.org). Un llms.txt puede complementar, pero no es un estándar oficial; según Google, no lo utiliza.
Lo más importante en breve
- Los sistemas de búsqueda con IA citan páginas que pueden rastrear, comprender y clasificar como fiables.
- Tres niveles: rastreo, contenido orientado a la respuesta, datos de Schema.org.
- llms.txt no es un estándar; según Google, no la utiliza.
- Los datos estructurados deben coincidir con el contenido visible; de lo contrario, se producen errores.
Los sistemas de búsqueda con IA como ChatGPT, Perplexity o Google AI Overviews citan sitios web que pueden rastrear técnicamente, comprender en cuanto a contenido y clasificar como fiables. Para ello cuentan tres niveles: rastreabilidad y velocidad, contenidos claramente estructurados con respuestas directas y datos estructurados según Schema.org. Una llms.txt puede complementar, pero no es un estándar oficial, y Google ha explicado que no la utiliza.
Este artículo es el complemento técnico de GEO en lugar de SEO y del Guía práctica de GEO. Qué significa GEO en términos generales lo explica la entrada del glosario Generative Engine Optimization.
Nivel 1: accesibilidad para los rastreadores de IA
Antes de que un sistema de IA pueda citar sus contenidos, debe poder leerlos y tener permiso para hacerlo. Compruebe tres puntos:
- robots.txt:¿Se bloquean rastreadores como GPTBot (OpenAI), ClaudeBot (Anthropic), PerplexityBot o Google-Extended? Muchos sitios web los bloquean sin darse cuenta mediante reglas generales.
- Renderizado del lado del servidor: Los contenidos que solo se generan en el navegador mediante JavaScript no los ven muchos rastreadores. Los textos importantes deben ir directamente en el HTML entregado.
- Velocidad y accesibilidad: Las páginas lentas o con errores se rastrean con menos frecuencia y de forma más incompleta.
Un ejemplo de nuestra propia web: las respuestas desplegables de las FAQ antes solo se mostraban mediante JavaScript; así, los rastreadores solo veían una parte de las respuestas. Desde el cambio a elementos HTML nativos, todas las respuestas están directamente en el código fuente.

Nivel 2: contenidos que se pueden citar
Los sistemas de IA adoptan preferentemente pasajes que responden a una pregunta de forma directa y completa. De ello se derivan reglas de redacción sencillas:
- Respuesta primero:La pregunta central se responde en las dos o tres primeras frases; después sigue el desarrollo.
- Preguntas como subtítulos intermedios:Tal como las plantearían las personas a un chatbot.
- Datos concretos con fuente:Cifras, plazos, condiciones: documentados y con fecha de referencia.
- Listas y tablas:Comparaciones y pasos estructurados en lugar de ocultos en el texto corrido.
- Términos claros: Explicar los términos técnicos una vez y luego utilizarlos de forma uniforme.
- Autoría reconocible: ¿Quién escribe, con qué experiencia? Esto es una señal de confianza.
Nivel 3: Datos estructurados según Schema.org
Datos estructurados describen contenidos de forma legible por máquinas en formato JSON-LD. Ayudan a los motores de búsqueda a entender quién ofrece algo, qué es una página y qué preguntas responde. Tipos importantes para sitios web de empresas:
- Organization / LocalBusiness: nombre, dirección, contacto, perfiles en otras redes (sameAs).
- Person: autoras y autores con cualificaciones.
- Servicio: Servicios con proveedor y ámbito de aplicación.
- Article / BlogPosting: Entradas con autor, fecha y actualización.
- FAQPage: Preguntas y respuestas.
- BreadcrumbList: la clasificación de una página dentro de la estructura del sitio web.
Importante: los datos estructurados deben coincidir con el contenido visible y estar completos. Un marcado de producto sin precio, por ejemplo, genera errores en Google Search Console: quien no publica precios, describe mejor sus ofertas como servicio.
¿Y el llms.txt?
La llms.txt es un archivo de texto propuesto en 2024 en el directorio raíz de un sitio web que explica a los sistemas de IA, de forma compacta, de qué trata el sitio web y cuáles son las páginas más importantes; más en el glosario sobre llms.txt. No es ningún estándar oficial. Representantes de Google han declarado públicamente que Google Search no la utiliza; si otros proveedores de IA la evalúan y cómo lo hacen, no está documentado de forma fiable.
Nuestra valoración: una llms.txt no hace daño y se crea rápidamente, pero no debería ser la primera medida. La rastreabilidad, los buenos contenidos y los datos estructurados correctos tienen un efecto demostrado; la llms.txt es un pequeño complemento.
Lista de verificación en siete puntos
- Comprobar en robots.txt si hay rastreadores de IA bloqueados.
- Contenido importante en el HTML entregado y no solo mediante JavaScript.
- Una H1 clara por página y preguntas como subtítulos.
- Responder primero en las primeras frases.
- Revisar el esquema Organization, Service, Article y FAQPage y corregir los errores en Search Console.
- Mostrar de forma visible a las autoras y autores, e indicar la fecha y la actualización.
- Opcional: crear un llms.txt con las páginas más importantes.
Qué tan bien está preparada su propia web para los sistemas de búsqueda con IA lo muestra el gratuito chequeo SEO/GEO en pocos minutos.
Cómo está estructurado un llms.txt
La propuesta prevé un archivo Markdown sencillo en /llms.txt:
- un encabezado con el nombre del sitio web o de la empresa
- un breve resumen en un párrafo
- secciones con listas de las páginas más importantes, cada una con enlace y una frase de descripción
- una versión más detallada opcional (llms-full.txt) con más contenido
Quien cree un llms.txt debería mantenerlo actualizado: los enlaces y descripciones obsoletos son peor que no tener ningún archivo. bettersorted.de pone a disposición un archivo de este tipo, pero lo considera un complemento, no el núcleo de la optimización.
E-E-A-T: por qué cuentan las señales de confianza
Google lo describe con E-E-A-T (Experience, Expertise, Authoritativeness, Trustworthiness) las señales con las que se puede medir la calidad de los contenidos. Para la búsqueda con IA se aplican criterios similares: los sistemas citan preferentemente fuentes en las que confían. En concreto, ayudan:
- Autoras y autores identificables con perfil y cualificaciones
- Relevancia práctica: experiencias propias, ejemplos, referencias
- Pruebas: Fuentes y fecha de referencia en los datos
- Aviso legal, contacto, protección de datos completos y fáciles de encontrar
- Menciones en otros sitios web: directorios, portales especializados, prensa, redes
Cómo medir si los sistemas de IA citan su sitio
- Plantear las preguntas típicas de su público objetivo en ChatGPT, Perplexity y Google y comprobar qué fuentes se mencionan.
- En la analítica web, observar las visitas procedentes de servicios de IA (dominios de referencia).
- En Google Search Console, seguir las impresiones de consultas de búsqueda en forma de pregunta.
- Repetir la comprobación a intervalos regulares, porque las respuestas cambian.
Errores técnicos frecuentes
- Crawlers de IA bloqueados por error mediante robots.txt o firewall
- Contenido importante solo en imágenes o PDFs
- Respuestas en elementos desplegables que solo se cargan mediante JavaScript
- Datos estructurados incorrectos o incompletos
- Páginas duplicadas sin indicación de canonical
Preguntas frecuentes
¿Qué es una llms.txt?
Un archivo de texto en el directorio raíz de un sitio web que explica a los sistemas de IA, de forma compacta, de qué trata el sitio web y qué páginas son importantes. Fue propuesto en 2024 y no es un estándar oficial.
¿Google utiliza la llms.txt?
No. Representantes de Google han explicado que Google Search no utiliza la llms.txt. Para Google cuentan la capacidad de rastreo, el contenido y los datos estructurados.
¿Qué datos estructurados son los más importantes para la búsqueda con IA?
Organization o LocalBusiness para la empresa, Person para autores, Service para servicios, Article para publicaciones, FAQPage para preguntas y BreadcrumbList para la estructura de la página.
¿Debería permitir los rastreadores de IA en el robots.txt?
Si desea que sus contenidos aparezcan en respuestas de IA, sí. Quien bloquee a GPTBot, ClaudeBot o PerplexityBot no podrá ser citado por estos sistemas. La decisión es un equilibrio entre visibilidad y control sobre los propios contenidos.
Estado: octubre de 2026.

Muhamed Alahmed
Con más de 10 años de experiencia en TI, desarrollo soluciones que no solo funcionan técnicamente, sino que generan un valor real y abren margen de maniobra.
Más sobre bettersorted →Más artículos

GEO en lugar de solo SEO: por qué su sitio web no aparece en las respuestas de IA
Por qué no bastan unas buenas posiciones en Google: las cinco razones más frecuentes por las que ChatGPT y Perplexity pasan por alto su sitio web — además de una comprobación gratuita.

Cómo encontrar empresas en ChatGPT y Perplexity: GEO para pymes
Cómo las empresas se convierten en una fuente citable para los sistemas de búsqueda con IA: pasos concretos más allá de la accesibilidad técnica.

Obligación de etiquetado de IA a partir de agosto de 2026: lo que las empresas deben saber ahora
A partir del 2 de agosto de 2026, el artículo 50 del Reglamento de IA de la UE obliga a las empresas a etiquetar de forma clara las imágenes,…
Manténgase al día sobre temas de IA
Actualizaciones breves sobre automatización con IA, subvenciones y nuevos artículos — sin spam, puede darse de baja en cualquier momento.