Mira a qué rastreadores de IA deja entrar tu sitio
Un asistente de IA solo puede citar las páginas que sus rastreadores tienen permitido leer. Escribe tu dominio y revisamos tu robots.txt (el archivo de reglas que los rastreadores obedecen) contra los bots detrás de ChatGPT, Gemini, Perplexity y más.
¿Bloqueaste un rastreador sin querer? Así se arregla
El acceso vive en un solo archivo de texto. Cambiarlo toma minutos y no necesita código.
-
Abre tu robots.txt
Está en tuempresa.com/robots.txt. Busca un "Disallow: /" bajo el bot bloqueado o bajo "User-agent: *".
-
Permite los rastreadores que quieres
Borra esa línea "Disallow", o agrega un grupo con el nombre del bot y deja el "Disallow:" vacío. Una regla con nombre siempre gana al comodín.
-
Publica y vuelve a revisar
Sube el archivo actualizado a la raíz de tu sitio y corre esta revisión otra vez para confirmar que los rastreadores ya entran.
Cómo leer el resultado
Bloquear un rastreador de IA es una decisión de negocio, no un valor por defecto.
Los bots de esta lista hacen trabajos distintos, y tratarlos como un solo grupo es la forma más común de desaparecer de las respuestas de IA sin darte cuenta. Unos descargan una página porque alguien acaba de preguntar algo. Otros recogen texto para entrenar un modelo dentro de varios meses. La decisión correcta casi nunca es la misma para los dos.
Los bots de búsqueda y respuesta son los que te citan
GPTBot, OAI-SearchBot, PerplexityBot, ClaudeBot y Google-Extended descargan páginas para que un asistente sostenga su respuesta en algo real, casi siempre con un enlace de vuelta. Bloquearlos no protege tu contenido: te saca de la respuesta y le deja la cita a un competidor que sí los permitió.
Los rastreadores de entrenamiento sí son una elección
CCBot, Bytespider y agentes parecidos recogen texto que termina en el entrenamiento de modelos futuros, sin tráfico de vuelta. Hay editores que los bloquean a propósito por temas de licenciamiento, y es una postura defendible. Lo importante es tomar la decisión a conciencia y no heredarla de una plantilla de robots.txt.
La precedencia en robots.txt no es por orden
Los rastreadores siguen el RFC 9309: cada bot obedece al grupo que lo nombra específicamente, y solo cae al grupo comodín si no existe uno con su nombre. Un bloque permisivo de User-agent: * no anula uno restrictivo con nombre propio, y por eso un sitio puede parecer abierto y seguir bloqueando a GPTBot.
Esto falla en silencio
Un rastreador de IA bloqueado no produce error, ni aviso, ni caída de posiciones. El tráfico desde asistentes simplemente nunca empieza, así que no hay nada raro que investigar en tus analíticas. Suele entrar por el valor por defecto de un plugin, por una configuración de pruebas que pasó a producción, o por una regla de seguridad escrita antes de que estos bots existieran.
Qué cambiar
-
Desbloquea los bots de respuesta
Si GPTBot, OAI-SearchBot, PerplexityBot o Google-Extended salieron bloqueados y quieres aparecer en respuestas de IA, quita esas reglas. Es el arreglo de mayor impacto de toda la lista.
-
Decide el entrenamiento por separado
Mantén o levanta el bloqueo de los rastreadores de puro entrenamiento según lo que pienses del licenciamiento, no con la misma regla que gobierna a los bots de respuesta. Son tratos distintos.
-
Vuelve a revisar tras cada despliegue
Los cambios en robots.txt llegan por plugins, actualizaciones de plataforma y reglas de infraestructura que nadie revisa como contenido. Pasa esta comprobación otra vez después de cualquier migración o publicación grande.
Sigue por aquí
- Verificador de visibilidad en IA El acceso es una de nueve señales. Puntúa también las otras ocho.
- Generador de llms.txt Cuando los bots ya pueden entrar, dales un resumen que valga la pena leer.
- ¿ChatGPT puede leer tu web? El acceso es la comprobación uno de cuatro. Aquí están las otras tres.
- SEO para IA Revisamos el acceso de punta a punta, aplicamos los ajustes y mostramos el avance.
Acceso para IAs:
preguntas frecuentes
-
¿Qué significa "bloqueado" en esta revisión?
Significa que tu robots.txt le dice a ese rastreador que no lea tus páginas, con una regla "Disallow: /" para su user-agent (el nombre con que se identifica) o para el comodín "*". Un rastreador bloqueado no puede leer tu contenido, así que el asistente al que alimenta no te puede citar.
-
¿Debería permitir a todos los rastreadores de IA?
No necesariamente. Permitir a los bots de búsqueda y respuesta (GPTBot, OAI-SearchBot, PerplexityBot, Google-Extended) es lo que te hace aparecer en las respuestas de IA. Algunos equipos igual bloquean a rastreadores de puro entrenamiento como CCBot o Bytespider por control de su contenido: esa es una decisión de negocio, no un ajuste técnico por defecto.
-
¿Bloquear un bot me saca por completo de ChatGPT?
Evita que ese rastreador lea contenido nuevo, así que tus páginas recientes no se leen ni se citan. No borra lo que un modelo ya aprendió en entrenamientos pasados. Para la visibilidad de aquí en adelante, lo que importa es el acceso abierto.
-
¿Es gratis? ¿Guardan los dominios que reviso?
Es gratis y sin cuenta. Solo leemos el robots.txt y el llms.txt públicos del dominio que escribes y te devolvemos el resultado; no guardamos los dominios que revisas.
¿No sabes qué rastreadores te conviene dejar entrar?
Revisamos tu acceso de punta a punta (robots.txt, renderizado y datos estructurados), implementamos los ajustes y te mostramos el avance con datos.