Volver al blog Cómo se ve un rastreador de IA en tus logs

Cómo se ve un rastreador de IA en tus logs

Tu registro de accesos ya sabe qué sistemas de IA han leído el sitio. Y si está en silencio, puede que la página que leen no sea la tuya.

PSentry no lee tus logs. Mide lo que los asistentes dicen sobre tu marca, que es una pregunta distinta de qué han descargado, y ningún panel convierte una cosa en la otra. El lado del registro tienes que mirarlo tú. Merece la pena, porque es el único punto de todo este asunto donde tienes un hecho en vez de una estimación, y porque el archivo ya existe en una máquina que controlas.

Lo que sigue es un procedimiento. Solo hace falta poder abrir un registro de accesos, desde el panel del alojamiento o por SSH.

Separar el rastreo masivo de la pregunta real

Empiezo por aquí y no por los comandos, porque es la distinción que hace que el ejercicio valga la hora que cuesta, y casi nadie la hace.

GPTBot, ClaudeBot y PerplexityBot son rastreadores masivos. Recorren el sitio cuando lo deciden ellos, recogiendo páginas para entrenamiento o para un índice. Su visita te dice que la puerta está abierta. No te dice nada sobre la demanda.

ChatGPT-User, Claude-User y Perplexity-User son otra cosa. Se disparan cuando una persona, en mitad de una conversación, pregunta algo que empuja al asistente a ir a buscar una página en ese momento. Una de esas líneas es un ser humano con una duda, en tu página, en ese segundo. Es lo más parecido a una intención de compra que vas a encontrar en toda esta categoría.

Cuéntalos por separado. Una subida del rastreo masivo y una subida de las peticiones disparadas por un usuario significan cosas opuestas, y promediarlas en un único número llamado tráfico de IA tira el único dato que había en el archivo.

Si estás detrás de una CDN, el registro del origen es el archivo equivocado: muestra lo que la CDN reenvió, no lo que llegó. En alojamiento normal busca access.log o su equivalente en el panel. El campo que importa por encima de todo es la cadena del user agent; conviene tener también la dirección del cliente y el código de estado.

Ese último guarda las sorpresas. Un muro de 403 significa que algo los está bloqueando: una regla del cortafuegos de aplicación o una protección antibots, normalmente puesta por otra persona, en otro momento, y no revisada desde entonces. Una tanda de 404 sobre páginas de producto suele venir de una migración que dejó las rutas viejas en el índice de alguien.

Los nombres que existen de verdad

Son más de los que sugieren las listas que circulan, y no significan todos lo mismo. Busca en el campo del user agent:

  • GPTBot, OAI-SearchBot y ChatGPT-User, todos de OpenAI
  • ClaudeBot, Claude-User y Claude-SearchBot, de Anthropic
  • PerplexityBot y Perplexity-User
  • Bingbot, que pesa más de lo que parece: varios asistentes obtienen sus resultados web por esa vía en lugar de rastrearte directamente

Un nombre que no vas a encontrar, y que puedes dejar de buscar: Google-Extended no es un rastreador. Es una etiqueta para poner en el robots.txt y decirle a Google que no use tus contenidos para Gemini ni para entrenar sus modelos. Bajo ese nombre no pasa nada a buscar nada, así que no aparecerá jamás en un registro de accesos.

Verificar a quien dice ser un rastreador

La cadena del user agent es texto. Cualquiera puede mandar GPTBot en una cabecera, y los raspadores lo hacen constantemente, porque los sitios tienden a dejarlos pasar. Una línea del registro es una declaración, no un hecho.

La comprobación es la misma que ya aplicas a Googlebot. OpenAI, Anthropic y Perplexity publican los rangos de direcciones de sus rastreadores como archivos JSON en sus propios dominios, y varios admiten además resolución DNS inversa hacia su infraestructura. Contrasta las direcciones del registro con esos rangos y descarta las que no cuadren. Si nunca lo has hecho, espera que el recuento de visitas auténticas salga más bajo de lo que sugería la búsqueda en bruto.

Cuando la página que leen no es la tuya

Aquí llega la situación más habitual en el tejido industrial de habla hispana, y es la que deja el registro engañosamente tranquilo.

Buena parte de los fabricantes vende a través de representantes y distribuidores, y el distribuidor tiene su propio dominio, su propio catálogo y sus propias fichas de producto. Cuando un asistente sale a buscar quién suministra algo, es esa página la que puede acabar leyendo. Tu registro no muestra nada, y la conclusión natural, que ningún sistema de IA se interesa por ti, es falsa: se interesan por tu producto a través de otro dominio.

La comprobación es directa. Pregunta a un asistente quién suministra lo que suministras tú y mira qué páginas cita, si es que cita alguna. Si aparece el sitio de tu distribuidor y no el tuyo, sabes dos cosas de golpe: que la demanda existe, y que la descripción de tu producto que llega al comprador la ha escrito otro. Eso segundo importa más de lo que parece, porque esa ficha suele estar desactualizada y casi nunca menciona tu marca en la primera frase.

Lo que el log no te dice

Dos límites, y explican por qué esto acompaña a la medición en lugar de sustituirla.

Un modelo puede describir tu empresa largamente sin descargar nada, a partir de lo que absorbió durante el entrenamiento. En el registro no aparece nada, y puedes ser visible exactamente así.

Y al revés: un rastreador puede leerte cada página y el asistente seguir nombrando a un competidor cuando alguien pregunta quién fabrica lo que fabricas tú. Que te descarguen no es que te recomienden. El registro mide el acceso. Lo que se dice en la respuesta es otra medición, y es la que hace PSentry, sobre 4 asistentes y en cada idioma en el que vendes.