Dominio en Búsqueda

Auditamos 63 agencias de visibilidad en IA: la mitad publica llms.txt

Medimos robots.txt, llms.txt y datos estructurados en las 63 webs que rankean para agencia GEO y AEO. Un tercio de esos llms.txt no cumple el formato.

Por Kevin Urrea 7 min de lectura

TL;DR

El 18 de agosto de 2026 medimos las 63 webs de empresa que ocupan el top 20 de cuatro consultas comerciales de GEO y AEO en España y Estados Unidos. La mitad, 32 de 63, publica un archivo llms.txt. Solo 22 cumplen el mínimo que define la especificación, un encabezado y al menos un enlace, y uno está vacío. Diez los generó un plugin de WordPress en lugar de una persona. En España la adopción es de 16 de 34, y siete de las nueve empresas del top 10 de "agencia geo" no lo publican. Mientras tanto, el riesgo que más se vende casi no existe: solo 2 de 63 bloquean a algún rastreador de IA. Siete webs ni siquiera entregan un robots.txt legible. Y hay un detalle que ordena el resto: ocho webs escribieron una regla para GPTBot, que entrena modelos, y solo cuatro para OAI-SearchBot, que es el rastreador del que salen las citaciones de ChatGPT.

Qué medimos, y qué no demuestra esto

El 18 de agosto de 2026 tomamos el top 20 orgánico de cuatro consultas comerciales: agencia geo y agencia aeo en España, generative engine optimization agency y aeo agency en Estados Unidos. Quitamos redes sociales, foros, directorios y enciclopedias, así que queda la web de una empresa que vende el servicio o publica sobre él. Son 63 dominios, 34 españoles y 29 estadounidenses.

A cada uno le hicimos las tres preguntas que hace cualquier rastreador, que es el programa que descarga páginas para un buscador o un asistente: qué dice tu /robots.txt, existe un /llms.txt, y qué datos estructurados hay en la portada. Sin ejecutar JavaScript. Leemos lo que recibe un rastreador en la respuesta.

Declaramos dos controles en vez de esconderlos: nuestra propia web y Hyperdot Australia, una agencia con el mismo posicionamiento. Ninguno cuenta en los porcentajes.

Qué no demuestra. No mide si el llms.txt funciona, porque eso hoy no lo puede medir nadie fuera de los proveedores de asistentes. No mide calidad de contenido. Y una muestra construida desde cuatro SERP es una muestra de quién rankea, no del sector. Publicamos el método para que se pueda discutir con datos.

En España, siete de las nueve primeras no lo tienen

Empezamos por el dato que más nos sorprendió, y es local.

Del top 10 de agencia geo en España, siete de las nueve empresas medidas no publican ningún llms.txt, incluidos los puestos 1 y 3. Solo una, en el puesto 4, publica uno válido.

El llms.txt es un archivo de texto opcional en la raíz del dominio que lista y resume tus páginas importantes para los modelos de lenguaje. Se vende en España como parte del paquete de posicionamiento en IA. Y quien ocupa las primeras posiciones de la consulta que vende ese paquete, en su mayoría, no lo tiene puesto.

En Estados Unidos pasa lo contrario: seis de las ocho empresas medidas del top 10 sí lo publican. Ni un patrón ni el otro separa a quien rankea de quien no, que es exactamente lo que cabe esperar de un archivo que Google declara que su Búsqueda no usa.

Esto no es un argumento para borrar el tuyo. Es un argumento para dejar de venderlo como requisito de posicionamiento, y para dejar de comprarlo como tal.

La mitad lo publica y un tercio de esos archivos está roto

En el total de la muestra, 32 de 63 webs publican llms.txt: 16 de 34 en España y 16 de 29 en Estados Unidos. Es una adopción altísima para un archivo sin efecto demostrado.

La calidad es donde se cae:

ComprobaciónResultado
Publican un llms.txt32 de 63
Cumplen el formato mínimo (encabezado y al menos un enlace)22 de 32
Sin encabezado8
Sin un solo enlace4
Generados por un plugin de WordPress10 de 32

Cuatro archivos no tienen ni un enlace. Un fichero cuyo único trabajo es llevar al modelo hasta tus páginas, sin páginas dentro. Uno de los sitios, tercero en Estados Unidos para generative engine optimization agency, sirve un llms.txt vacío, de 0 bytes.

Diez de los treinta y dos llevan la firma de Rank Math o Yoast: lo generó el plugin y nadie lo abrió después. El más grande que encontramos pesa 59 KB, que no es un índice de una web, es la web entera pegada en un archivo de texto.

Si quieres esta comprobación sobre tu dominio, nuestro verificador de acceso de rastreadores de IA lee tu robots.txt con las reglas de precedencia reales, y el verificador de visibilidad en IA puntúa las señales que deciden si un asistente te nombra.

El miedo que se vende no ocurre

La advertencia más repetida del sector es que estás bloqueando a la IA sin saberlo. En esta muestra es prácticamente ficción.

Dos webs de 63 bloquean a algún rastreador de IA, y las dos lo hicieron a propósito, con reglas propias para GPTBot y ClaudeBot. Nadie bloqueó a nadie por accidente con un comodín despistado.

Lo que sí encontramos vale más que el miedo. Mira a qué rastreador se le escriben reglas:

RastreadorQué haceWebs con regla propia
GPTBotRecoge contenido que puede entrenar modelos de OpenAI8
OAI-SearchBotDescarga páginas para que ChatGPT responda y cite4

El doble de webs le escribe reglas al rastreador que no puede citarlas que al que sí. Si de todo este estudio te llevas una sola distinción, que sea esa. Bloquear GPTBot es una decisión sobre entrenamiento. Bloquear OAI-SearchBot es decidir quedarte fuera de la respuesta.

Siete webs no entregan sus propias reglas

El once por ciento de la muestra, 7 de 63, no devuelve reglas legibles a un cliente HTTP normal. Cinco responden con una página HTML de desafío antibots en vez de texto, una da 404 porque el archivo no existe y otra da un 403 seco.

Dos de esas siete llaman la atención. Una ocupa el puesto 3 de agencia geo en España. Otra publica uno de los listados de "mejores agencias GEO" que enlaza el resto del sector.

La salvedad honesta, porque nos corrigió a mitad del estudio: una capa antibots suele llevar lista blanca de rastreadores de IA conocidos, así que esto no demuestra que GPTBot reciba la misma página de desafío. Demuestra que el archivo no es legible de forma universal y que nadie lo ha comprobado. Comprobarlo es una petición.

También corregimos un defecto nuestro. La primera pasada daba 23 archivos válidos porque el detector de encabezado no era multilínea, así que fallaba con cualquier archivo que tuviera una línea encima del #, que es justo lo que genera la plantilla de Rank Math. La cifra corregida es 22 de 32, y se movió en la dirección que menos favorecía a nuestro titular. Las dos correcciones están escritas en el documento fuente.

Los datos estructurados están mejor de lo que esperábamos

55 de 63 portadas llevan algún bloque JSON-LD, que es el formato con el que una web le declara a un buscador qué es cada cosa, y 53 declaran Organization o equivalente. Es mejor resultado del que habríamos apostado.

  • 8 webs no llevan ningún dato estructurado.
  • 2 publican JSON-LD que no parsea. Un bloque roto no se degrada con elegancia: sencillamente no existe para quien lo lee. Una de las dos publica su propio ranking de agencias GEO.
  • 15 usan FAQPage, el tipo que más recomienda la literatura de AEO, o sea que la mayoría de quienes lo recomiendan no lo tienen puesto.

Un patrón más, porque coincide con algo que ya habíamos medido. Nueve de las 34 webs españolas ponen ciudad en el título de portada. En Estados Unidos, dos de 29. Las agencias españolas compiten por agencia geo más ciudad mientras las estadounidenses pelean el término nacional, y las españolas tienen razón: el modificador geográfico es la manera más barata de llegar a un SERP que se puede ganar.

Cinco comprobaciones para tu web esta semana

  1. Pide tu propio robots.txt desde fuera del navegador. Si responde HTML, tienes una capa antibots delante de tus reglas.
  2. Decide GPTBot y OAI-SearchBot por separado. Son dos decisiones distintas: entrenamiento y citación.
  3. Si publicas llms.txt, ábrelo. Confirma que tiene encabezado y enlaces reales, y que no lo escribió un plugin por ti.
  4. Valida tu JSON-LD. No "existe", sino "parsea".
  5. Apunta las cifras de hoy. Lo que no puedas medir más adelante, al menos tendrá línea base.

Qué nos gustaría que te llevaras

La capa táctica de la visibilidad en IA se vende con más seguridad de la que aguantan las pruebas, y las empresas que la venden no siguen su propio consejo en su propia web. No es un escándalo, es una disciplina joven. Pero sí es motivo para preguntarle a cualquier proveedor, nosotros incluidos, qué parte de lo que recomienda la ha medido y qué parte la heredó.

Si prefieres las decisiones de fondo antes que la lista de archivos, escribimos sobre lo que Google documentó de verdad para la búsqueda con IA, para qué sirve el llms.txt y cómo elegir agencia para este trabajo. Y si prefieres que esta medición la hagamos sobre tu dominio en vez del nuestro, cuéntanos qué vendes y a quién.

Repetimos el estudio en noviembre de 2026 con la misma muestra. Si tu web está dentro y crees que la cifra está mal, escríbenos y la revisamos en público.

Preguntas frecuentes

  • ¿Sirve de algo publicar un archivo llms.txt?

    Cuesta una hora y no está demostrado, que es un trato razonable solo si aceptas las dos mitades de la frase. El llms.txt es un archivo de texto opcional en la raíz de tu dominio que resume tus páginas importantes para los modelos de lenguaje. Google declara por escrito que su Búsqueda no lo usa, y ningún proveedor de asistentes ha publicado pruebas de que cambie la citación. Lo que añade nuestra medición es que tenerlo no acompaña al posicionamiento: de las nueve empresas del top 10 de "agencia geo" en España, siete no lo publican. Trátalo como una apuesta barata hacia los asistentes que no son Google, no como un requisito para posicionar. Y si lo publicas, que sea válido: 10 de los 32 archivos que encontramos incumplen el formato mínimo.

  • ¿Google usa el llms.txt?

    No. La guía de Google para sus funciones de IA generativa dice que no hace falta crear archivos legibles por máquinas ni ficheros de texto para IA para aparecer en la Búsqueda, y que la propia Búsqueda de Google no los usa. Eso cubre los AI Overviews y el AI Mode, porque los dos se apoyan en el índice normal de Google y no en uno aparte. No dice nada sobre ChatGPT, Perplexity o Claude, que tienen sus propios rastreadores y su propia recuperación de información. Así que la frase exacta es estrecha: dentro de Google no hace nada, y fuera de Google está sin comprobar, que no es lo mismo que descartado.

  • ¿Cómo sé si mi web bloquea a los rastreadores de IA?

    Abre tudominio.com/robots.txt y busca grupos que nombren a GPTBot, OAI-SearchBot, ClaudeBot o PerplexityBot, y mira si el grupo que le aplica a cada uno lleva un Disallow general. Hay dos trampas. Un rastreador sin grupo propio cae en el grupo comodín, así que una regla general ahí bloquea a robots que nunca nombraste. Y una capa antibots puede responder con una página HTML de desafío en vez de tus reglas, que es lo que encontramos en cinco de los sesenta y tres sitios. Nuestro verificador de acceso de rastreadores aplica las reglas de precedencia reales y te dice quién llega.

  • ¿Qué diferencia hay entre GPTBot y OAI-SearchBot?

    Son dos rastreadores distintos de OpenAI con dos trabajos distintos. GPTBot recoge contenido que puede usarse para entrenar modelos. OAI-SearchBot descarga páginas para que ChatGPT responda con fuentes en vivo y las nombre, que es justo la citación que intentas conseguir. Bloquear GPTBot te saca del entrenamiento y no toca la citación. Bloquear OAI-SearchBot te saca de las respuestas. En nuestra muestra, ocho sitios escribieron una regla para GPTBot y solo cuatro para OAI-SearchBot: el sector le pone reglas al rastreador que no cita más que al que sí.

  • ¿Vais a repetir el estudio?

    Sí, en noviembre de 2026, con la misma muestra y el mismo script, porque una medición suelta es una foto y dos son una tendencia. El método está escrito para que cualquiera lo repita antes: coge el top 20 orgánico de cuatro consultas comerciales de GEO y AEO en España y Estados Unidos, quita redes sociales, directorios y enciclopedias, y pide el robots.txt, el llms.txt y la portada de cada dominio. Si tus cifras no coinciden con las nuestras, preferimos enterarnos.

¿Quieres el playbook antes que tu competencia?

Documentamos cada técnica que aplicamos con clientes. Posts nuevos sobre GEO, AEO y velocidad web cada mes, sin paja, solo método.