¿ChatGPT puede leer tu web? Cuatro comprobaciones que lo deciden
Cuatro cosas deciden si ChatGPT puede usar tu web: acceso del rastreador, renderizado, estructura y datos para apoyarse. Cómo comprobar cada una, en el orden que importa.
TL;DR
Que ChatGPT pueda leer tu web depende de cuatro cosas distintas, y casi todo el mundo comprueba solo la primera. El rastreador tiene que poder descargar la página, que es una cuestión de robots.txt y de los agentes de OpenAI. El contenido tiene que estar en el HTML y no aparecer solo después de que corra el JavaScript, porque la mayoría de rastreadores de IA no renderizan. La página tiene que decir con claridad de qué va, en su título, sus encabezados y pasajes que se sostengan solos, para que el modelo sepa qué estaría citando. Y tiene que haber algo en lo que apoyarse, como schema o un resumen llms.txt, para que tu negocio quede descrito con tus propias palabras. Compruébalas en ese orden. Reescribir una página que el rastreador nunca pudo descargar no cambia nada.
"Leer tu web" significa cuatro cosas distintas
Cuando alguien pregunta si ChatGPT puede leer su web, normalmente quiere decir una sola cosa: si el bot está bloqueado. Esa es la primera comprobación, no la pregunta entera.
Hay cuatro puertas, y una página tiene que pasarlas todas antes de que un asistente pueda nombrarte en una respuesta. El rastreador tiene que descargar la página. El contenido tiene que existir en lo que llega. El modelo tiene que poder saber de qué va. Y tiene que haber algo en lo que apoyarse para describir tu negocio con precisión.
Esto importa porque los cuatro fallos se ven idénticos desde tu lado. No salta ningún error, no aparece nada en tus analíticas y no cae ninguna posición. El tráfico desde asistentes simplemente no arranca nunca. Así que hay que ir a mirar.
Comprobación 1: ¿puede descargarte el rastreador?
Abre tudominio.com/robots.txt y léelo. Busca grupos que nombren a los agentes de OpenAI, que son GPTBot, OAI-SearchBot y ChatGPT-User. Hacen trabajos distintos: uno alimenta y fundamenta el modelo, otro sirve resultados de búsqueda dentro de ChatGPT, y otro descarga una página porque alguien acaba de preguntar por ella.
Aquí está lo que pilla a casi todo el mundo. Los rastreadores siguen una regla de precedencia según la cual el bot obedece al grupo que lo nombra específicamente y solo cae al comodín User-agent: * cuando no existe un grupo con su nombre. Un comodín generoso no anula un grupo restrictivo con nombre propio. Así es exactamente como una web acaba pareciendo abierta de par en par mientras bloquea a OpenAI del todo.
Leer eso bien en una docena de agentes es tedioso, y por eso hicimos una herramienta que lo hace. El verificador de acceso para IA descarga tu robots.txt, aplica las reglas reales de precedencia e informa permitido o bloqueado bot por bot.
Comprobación 2: ¿existe tu contenido sin JavaScript?
Googlebot renderiza JavaScript. La mayoría de rastreadores de IA descargan el HTML y trabajan con lo que reciben.
Esa diferencia es invisible hasta que te cuesta dinero. Si tus precios, descripciones de producto o textos de servicio los inyecta un script después de cargar, el rastreador puede recibir un armazón con el menú y poco más. La página se ve perfecta para ti y casi vacía para el modelo.
La prueba de dos segundos: botón derecho y ver código fuente, no inspeccionar elemento. Inspeccionar te enseña la página después de que corriera el JavaScript. Ver código fuente te enseña aproximadamente lo que recibió el rastreador. Busca ahí una frase que sepas que está en la página. Si no aparece, el asistente tampoco la está leyendo.
Comprobación 3: ¿puede el modelo saber de qué va la página?
Los asistentes citan pasajes, no páginas. Así que una página puede ser descargable y renderizar perfecta y aun así no servirle de nada.
Lo que hace citable a un pasaje es que se sostenga solo. Si un párrafo solo se entiende después de los dos anteriores, el modelo no puede levantarlo a una respuesta sin arrastrar contexto, así que busca una fuente donde alguien escribió la respuesta completa en un bloque. Tu título y tu meta descripción hacen lo mismo a nivel de página: deberían decir sin rodeos quién eres y qué cubre esa página, no insinuarlo.
Aquí también pierden muchas webs por lo demás sólidas. La redacción es buena y la estructura es un montón de encabezados que no corresponden a preguntas que alguien haga.
Comprobación 4: ¿hay algo en lo que apoyarse?
La última puerta es si el modelo puede describir tu negocio con precisión una vez ha decidido mencionarte.
Dos cosas cargan con esto. El schema en JSON-LD nombra tus entidades de forma explícita: esto es una Organization, esto es un Service, estas son preguntas frecuentes con respuestas reales. Sin eso el modelo deduce tu negocio del texto corrido, y ahí es donde se equivoca con tu nombre, tu ciudad o lo que vendes. Un archivo llms.txt es un resumen en texto plano en la raíz de tu dominio, con tus palabras, que el rastreador puede pedir en el momento de responder.
Ninguna de las dos hace que un asistente te visite. Las dos hacen que acierte contigo cuando lo hace. Si todavía no tienes llms.txt, nuestro generador lo crea en tu navegador en unos minutos.
Arréglalas en este orden
Si fallan varias, el orden no es negociable, porque las puertas de antes vuelven irrelevantes a las de después.
| Orden | Puerta | Causa habitual | Qué cuesta arreglarlo |
|---|---|---|---|
| 1 | Acceso del rastreador | Una plantilla de robots.txt, el valor por defecto de un plugin, una regla de pruebas que pasó a producción | Minutos |
| 2 | Renderizado | Contenido inyectado en el navegador por un framework o un maquetador | De horas a semanas, según el stack |
| 3 | Estructura de página | Encabezados que no corresponden a preguntas reales, pasajes que necesitan contexto | Una reescritura por página |
| 4 | Datos de apoyo | Sin schema, sin llms.txt, datos del negocio inconsistentes por la web | Días, y después mantenimiento |
Reescribir tus páginas de servicio mientras GPTBot sigue bloqueado es el trabajo desperdiciado que más vemos. Las páginas mejoran y no cambia absolutamente nada, porque el rastreador sigue sin llegar.
La forma rápida de comprobar las cuatro
Hacerlo a mano se lleva una tarde. Nuestro verificador de visibilidad en IA puntúa una web de 0 a 100 en nueve señales concretas que cubren las cuatro puertas: acceso de rastreo, datos estructurados, llms.txt, título y meta, estructura de encabezados, canonical y HTTPS, sitemap, y señales de entidad y contacto.
Es gratis, no pide registro y devuelve las carencias concretas en vez de una nota. Es además la misma auditoría con la que abrimos un proyecto de SEO para IA, que es la razón honesta de que exista: sale mejor enseñarte las carencias que describírtelas.
Preguntas frecuentes
-
¿ChatGPT puede leer mi web?
Puede si se cumplen cuatro cosas: que tu robots.txt permita a los agentes de OpenAI, que tu contenido esté en el HTML y no solo después de que corra el JavaScript, que tus páginas digan con claridad de qué van, y que haya algo en lo que apoyarse como schema o un archivo llms.txt. Si falla cualquiera de las cuatro, el síntoma es el mismo: nunca te mencionan. No salta ningún error ni ningún aviso. Compruébalas en ese orden, porque mejorar la redacción de una página que el rastreador no puede descargar no cambia absolutamente nada.
-
¿Cómo sé si GPTBot está bloqueado?
Abre tudominio.com/robots.txt en el navegador y busca un grupo que nombre a GPTBot, OAI-SearchBot o ChatGPT-User con un Disallow debajo. Ojo con la trampa de precedencia: un rastreador obedece al grupo que lo nombra por su nombre y solo cae al grupo comodín User-agent asterisco cuando no existe uno con su nombre. O sea que un comodín permisivo no anula un grupo restrictivo con nombre propio, y una web puede parecer completamente abierta mientras bloquea a OpenAI del todo. Un verificador que aplique las reglas reales de precedencia te quita la adivinanza.
-
¿ChatGPT ve el contenido que carga con JavaScript?
Da por hecho que no. Los rastreadores de buscadores como Googlebot ejecutan un paso de renderizado; la mayoría de rastreadores de IA descargan el HTML y trabajan con lo que llega. Si tus descripciones de producto, precios o textos de servicio los inyecta un script después de cargar, el asistente puede recibir una página casi vacía. La prueba de dos segundos es abrir "ver código fuente" en vez de "inspeccionar elemento" y buscar una frase que sepas que está en la página. Inspeccionar muestra la página después del JavaScript; ver código fuente muestra lo que recibió el rastreador.
-
¿Conviene bloquear a los rastreadores de IA para proteger mi contenido?
Solo si lo has decidido a conciencia, y solo para los bots correctos. Los rastreadores de búsqueda y respuesta como GPTBot, OAI-SearchBot y PerplexityBot son los que te citan, normalmente con enlace de vuelta. Bloquearlos no protege tu contenido: le regala la cita a un competidor que sí los permitió. Los rastreadores de puro entrenamiento como CCBot son una decisión aparte, que algunos editores toman por temas de licencias. El error es tratar a los dos grupos como uno solo y heredar la respuesta de una plantilla de robots.txt. Dos correcciones añadidas el 12 de agosto de 2026. Google-Extended no es la palanca de las respuestas de IA de Google: cubre entrenamiento fuera de la Búsqueda, así que no decide si apareces en los AI Overviews. La que sí lo decide es el control de IA generativa de Search Console, que te saca de AI Overviews y AI Mode y que Google declara que no es señal de posicionamiento ni de inclusión en el resto de la búsqueda. Nuestra recomendación no cambia, y ahora existe un instrumento acotado si tienes un motivo de licencias para usarlo.
-
¿Un archivo llms.txt hace que ChatGPT lea mi web?
No, y conviene ser preciso. Un llms.txt es un resumen en texto plano en la raíz de tu dominio que le dice al modelo qué hace tu negocio y qué páginas importan. Ayuda a que un rastreador que ya tiene acceso te entienda bien y rápido. No hace nada si tu robots.txt bloquea a ese rastreador, y no obliga a ningún asistente a visitarte. Piénsalo como el resumen que le das a una visita que ya dejaste entrar, no como una invitación.
¿Quieres el playbook antes que tu competencia?
Documentamos cada técnica que aplicamos con clientes. Posts nuevos sobre GEO, AEO y velocidad web cada mes, sin paja, solo método.
Más artículos
- GEODominio en Búsqueda
Auditamos 63 agencias de visibilidad en IA: la mitad publica llms.txt
Medimos robots.txt, llms.txt y datos estructurados en las 63 webs que rankean para agencia GEO y AEO. Un tercio de esos llms.txt no cumple el formato.
Ver artículo - GEODominio en Búsqueda
GEO para empresas B2B: qué cambia cuando compra un comité
En B2B el volumen de búsqueda es mínimo y el contrato es grande, así que la página que se lleva la citación casi nunca es tu blog. Qué construir en su lugar.
Ver artículo - GEODominio en Búsqueda
Cuánto cuesta una agencia GEO: rangos reales y qué mueve tu presupuesto
Los rangos publicados en España y Estados Unidos, con fuente y fecha, las tres variables que deciden en qué extremo caes, y lo que deberías estar ahorrando.
Ver artículo - GEODominio en Búsqueda
Reglas de Google para la búsqueda con IA: cómo excluirte y qué dejar de hacer
Google documentó un control para excluirte de los AI Overviews, un informe de impresiones y una lista de cosas que no hacen falta. Qué significa cada una para tu sitio.
Ver artículo - GEODominio en Búsqueda
Cómo elegir una agencia de generative engine optimization (GEO)
Guía del comprador para contratar una agencia GEO: qué hace, cinco cosas que verificar, qué preguntar y las señales de alerta de una agencia SEO disfrazada.
Ver artículo - GEODominio en Búsqueda
Cómo hacer generative engine optimization: guía paso a paso
Ya sabes qué es el GEO y ahora quieres el cómo. Es un ciclo de cuatro pasos: páginas citables, schema y llms.txt, acceso para los crawlers de IA y medir la tasa de citación.
Ver artículo - GEODominio en Búsqueda
Ejemplos de llms.txt y una plantilla lista para copiar
Un archivo llms.txt real y anotado, luego una plantilla para rellenar y cómo validarla. Los ejemplos salen del mismo archivo que servimos en este sitio.
Ver artículo - GEODominio en Búsqueda
Novedades de búsqueda con IA: qué cambió en el Q2 2026 y qué significa para ti
Los AI Overviews ya cubren casi la mitad de las búsquedas y ChatGPT estrenó anuncios. Qué cambió este trimestre y las tres jugadas para que tu marca siga visible y citada.
Ver artículo - GEODominio en Búsqueda
Mejores herramientas de generative engine optimization (2026): guía por criterios
¿Buscas herramientas de generative engine optimization? Júzgalas por una cosa: ¿miden si la IA te cita? Un marco neutral para elegir, y cuándo todavía no necesitas ninguna.
Ver artículo