Rastreadores de IA y llms.txt: qué bloquea realmente a los bots
Abre tu robots.txt y mira. Rastreadores de entrenamiento y recuperadores en tiempo real son dos decisiones distintas, y muchos sitios bloquean ambas por error.
Antes de seguir leyendo esto, haz la comprobación. Abre una pestaña nueva, escribe tu dominio seguido de /robots.txt, y lee lo que aparece. Tarda diez segundos, y es una de las pocas partes de la visibilidad en IA que da una respuesta definitiva.
Busca líneas como User-agent: GPTBot seguida de Disallow: /. También ClaudeBot, PerplexityBot, Google-Extended. Si están ahí, alguien de tu equipo las puso, y hoy probablemente nadie recuerde quién ni por qué: estas reglas se propagaron durante el pánico por el scraping, en guías de endurecimiento y plugins que nadie ha vuelto a abrir. Una regla añadida una vez para mantener fuera a las máquinas las sigue manteniendo fuera, y ahora las máquinas son donde parte de tus compradores hace su primera pregunta sobre tu categoría.
El caso más difícil es el del sitio cuyo robots.txt permite todo, y cuyos bots igualmente son rechazados en la puerta por un CDN que ni siquiera consulta ese archivo.
La distinción que cambia la decisión
Casi todas las discusiones sobre este tema tratan a los rastreadores de IA como una sola cosa que permitir o denegar. En realidad se dividen en dos categorías, y bloquear es defendible para una y contraproducente para la otra.
Los rastreadores que recopilan datos de entrenamiento
Estos descargan páginas en bloque, según su propio calendario, y el texto acaba en el corpus con el que se entrenará un futuro modelo. GPTBot es de OpenAI, ClaudeBot de Anthropic. Nadie espera esa página al otro lado, en ese momento. Es el rastreador en el que se piensa cuando se habla de empresas de IA que toman contenido sin pagarlo, y bloquearlo es una postura legítima sobre la propiedad de lo que escribes. Un editor con un archivo que merece la pena licenciar tiene un argumento real para el bloqueo.
Lo que pierdes es difuso, y vale menos de lo que sugiere la mayoría de los consejos sobre visibilidad en IA: un modelo entrenado con toda la red ya ha leído sobre ti, por fuentes que de todos modos nunca controlaste.
Los que recuperan una página en tiempo real
Aquí es donde el daño ocurre en silencio. Cuando el asistente decide que una pregunta necesita información actual, un agente distinto va a buscar páginas, justo en ese momento, para escribir la respuesta delante de la persona que preguntó. OpenAI envía OAI-SearchBot y ChatGPT-User, Anthropic usa user agents separados para las solicitudes de un usuario, y Perplexity gestiona su propio sistema de recuperación.
Bloquear estos no protege tu derecho de autor en ningún sentido concreto: el contenido no entra en ningún conjunto de entrenamiento, se lee para responder una pregunta que alguien hace justo ahora, quizá sobre ti. Deniega esa solicitud y el asistente recurre a quien sí lo permitió, y escribe su nombre en lugar del tuyo. No has defendido nada, te has quitado de la frase.
Son dos decisiones separadas, tómalas por separado. Bloquear el entrenamiento mientras permites la recuperación es coherente, probablemente la opción correcta por defecto para quien vende algo en vez de publicarlo. No bloquees ambos solo porque una línea en un archivo de plantilla lo decidió por ti.
El que no es en absoluto un rastreador
Google-Extended no recupera nada. Es un token de control: Googlebot rastrea tu sitio como siempre, y Google-Extended determina si ese contenido ya rastreado puede usarse para Gemini. Desactivarlo no te saca de la búsqueda. Activarlo no añade ningún rastreador nuevo en tus registros. Es un permiso dentro de un archivo pensado para otra cosa, de ahí la confusión habitual.
Los bloqueos que no ves desde un navegador
Una empresa revisa su robots.txt, lo encuentra permisivo, y sigue adelante. Mientras tanto, las solicitudes nunca llegan a la aplicación. La gestión de bots, la limitación de tasa y los cortafuegos de aplicación trabajan con la cadena del user agent, con la reputación de la red y con firmas de comportamiento, con reglas pensadas para scrapers que los rastreadores de IA imitan en sentido técnico. La solicitud se rechaza, o recibe un reto que no sabe resolver, sin que nada de esto aparezca en un archivo inspeccionable. Tu robots.txt es un aviso educado en la puerta. Tu CDN decide quién entra, y los dos no se hablan.
El renderizado es el otro elemento silencioso. Los agentes de recuperación normalmente no son navegadores completos: si una página compone su contenido principal con JavaScript, lo que la descarga puede recibir solo una cáscara vacía.
llms.txt, con honestidad
llms.txt es una convención propuesta: un archivo markdown sencillo en la raíz de tu dominio, que ofrece un mapa limpio y ordenado de tu contenido importante, para que un modelo no tenga que abrirse paso entre la navegación y el diseño para encontrar la sustancia. La idea tiene sentido, y escribir uno te obliga a decir con claridad qué es tu producto.
Y ahora la parte honesta, porque este archivo se está vendiendo mal. Es una propuesta, no un estándar. Nadie se ha comprometido a cumplirla, ningún asistente importante se ha comprometido a leerla, y puede que el soporte nunca llegue de los proveedores que te importan. No otorga permisos, no elimina bloqueos, no obliga a nadie a citarte. Un modelo que lo ignora no se está portando mal, porque no hay ninguna regla que romper. Publicarlo cuesta una tarde y podría ayudar. Tratarlo como la llave que desbloquea la visibilidad en IA es una afirmación insostenible.
Un protocolo de verificación que puedes ejecutar esta semana
Todo esto es falsable: o encuentras el problema, o lo descartas.
Lee el archivo. Busca en tudominio.es/robots.txt cada agente por su nombre: GPTBot, ClaudeBot, PerplexityBot, Google-Extended, además de los rastreadores iniciados por el usuario que documenta cada proveedor. Después averigua quién añadió el bloqueo, y por qué.
Pide tus propias páginas como lo harían los bots. Desde una terminal, descarga una página clave enviando la cadena user agent de cada rastreador de IA, y compárala con lo que recibe un navegador normal. Si el navegador obtiene la página y el bot recibe un rechazo, un reto, o un cuerpo vacío, el bloqueo no está en el robots.txt: está en tu perímetro, el fallo invisible más común en todo esto.
Carga tus páginas sin JavaScript. Abre tu página de producto, precios y documentación con los scripts desactivados. Si el contenido que explica qué vendes no está, un agente de recuperación podría ver esa misma ausencia.
Mira los registros. Es la verdad de campo, y casi nadie lo hace. Revisa tus registros de acceso buscando los user agents de IA. ¿Llegan? ¿Por qué rutas? ¿Reciben la página o un rechazo? Un sitio que permite todo y aun así no ve tráfico de rastreadores de IA tiene un problema distinto al de un sitio que los bloquea.
Vuelve a comprobarlo después de cualquier cambio de infraestructura. Un CDN nuevo, un plugin de seguridad, una migración. Las reglas sobre bots vuelven por configuraciones predeterminadas, no por decisiones tomadas conscientemente.
Qué consigues, y qué no
Desbloquear los rastreadores es necesario, no suficiente. Te hace recuperable, no recomendado. Un modelo que puede llegar a tu página todavía tiene que decidir si merece la pena llegar hasta ella, y eso depende de lo que diga de ti toda la red, en cada idioma, a lo largo de años. El acceso es el suelo del edificio, no el edificio.
Por eso la comprobación debe ir acompañada de medición: arreglar un bloqueo solo significa algo si sabes si los asistentes te nombraban antes, y si te nombran después. Eso es lo que hace PSentry: ejecuta tu conjunto de prompts en ChatGPT, Claude, Gemini y Perplexity, en cada idioma en el que vendes, y muestra dónde te han nombrado, dónde te han citado como fuente, y a quién han recomendado en tu lugar. No optimiza ni manipula lo que dicen los modelos. No promete que desbloquear un rastreador cambiará tu posición. Te dirá si lo hizo.
Preguntas Frecuentes
Si bloqueo GPTBot, ¿desaparece mi marca de ChatGPT?
No. Bloquear un rastreador de entrenamiento no borra lo que un modelo ya absorbió, y no impide que el asistente te describa a partir de prensa y reseñas. Eliminas solo tu propio sitio como futura fuente directa. Bloquear los agentes de recuperación en vivo es la pérdida más inmediata: recuperan páginas mientras un usuario espera.
¿Realmente leen llms.txt ChatGPT, Claude, Gemini o Perplexity?
No existe ningún compromiso de los proveedores que lo confirme. Trátalo como una apuesta de bajo coste con un resultado incierto: quien te diga que los asistentes principales ya lo leen hoy está afirmando más de lo que se puede saber.
Mi robots.txt permite todo. ¿Por qué no veo bots de IA en mis registros?
Lo más probable es que algo delante de tu aplicación los esté rechazando: una regla de bots del CDN, una firma de cortafuegos, un límite de tasa agresivo. Descarga tu página presentándote como un user agent de IA, y compárala con una solicitud normal. Si son diferentes, has encontrado la causa. Si no, en tu sitio todavía no hay nada que merezca la pena recuperar.
¿Con qué rapidez se refleja el desbloqueo en las respuestas de las IA?
Despacio, y de forma desigual. La recuperación en vivo puede empezar a tenerte en cuenta en cuanto desaparece el bloqueo. Todo lo que depende del entrenamiento absorbe tu contenido según un ciclo que ni controlas ni observas: un cambio que se mide en meses, no en días.