Por qué el PDF de tu ficha técnica es invisible para la IA
Tus tablas de tolerancias y certificaciones pueden estar en un PDF que ninguna IA sabe leer. El test exacto para comprobar el tuyo esta misma tarde.
Abre el PDF de la ficha técnica de tu producto estrella. Amplía la tabla de tolerancias: parece completa, columnas ordenadas, un apunte de materiales, un sello de certificación en la esquina. Ahora haz clic dentro de un párrafo del texto que la rodea e intenta seleccionarlo con el cursor, como harías para copiar una frase en un correo. Si no se resalta nada, o si lo que acaba en el portapapeles es una ristra de caracteres revueltos, acabas de encontrar la razón por la que un asistente de IA no sabe describir tu producto con precisión. Nunca leyó esa página. Vio una fotografía de ella.
Un PDF no es automáticamente un documento
Detrás de la misma apariencia visual, un PDF puede contener dos cosas completamente distintas: texto real, guardado como datos de caracteres que una máquina puede extraer, o una imagen de texto, guardada como píxeles que a un ojo humano le parecen letras. En pantalla, el resultado es idéntico. Solo el primer caso puede leerlo un sistema que indexa la web para construir la base de conocimiento de un asistente de IA.
Hay tres maneras habituales por las que una ficha técnica acaba en la segunda categoría. La más evidente es el documento escaneado: la hoja impresa pasa por un escáner, y el PDF resultante es la fotografía de una página, sin un solo carácter guardado en ningún sitio. La segunda es una página exportada como imagen desde un programa de CAD e insertada en un PDF que, por lo demás, contiene páginas reales: la ficha parece coherente, pero una página en medio es, en silencio, una imagen. La tercera es más sutil: texto convertido en trazados vectoriales, lo que algunos programas de diseño llaman «curvas», cuando una fuente no está bien incrustada o alguien aplana el PDF para impedir que lo editen. Las letras siguen pareciendo letras, pero detrás de la forma no hay ningún carácter, solo un polígono que se parece a una M. Un sistema de recuperación de información extrae texto, no formas: sin capa de texto no tiene nada que extraer, y esa página bien podría no existir para una respuesta de IA.
Haz la prueba tú mismo, esta misma tarde
No hace falta ningún software especial. Abre el PDF, haz clic dentro de un párrafo, arrastra para seleccionar una frase y pégala en un editor de texto sencillo.
- No se selecciona nada. La página es una imagen: es el caso del documento escaneado o del trazado aplanado.
- Algo se selecciona, pero sale confuso o desordenado. Existe una capa de texto, pero la estructura está rota. Más abajo se explica por qué.
- Un párrafo limpio, en el orden correcto. Esa página está bien. Prueba igualmente otra página: las fichas técnicas suelen mezclar una portada con texto real con una tabla de tolerancias en imagen dos páginas más adelante.
Para una segunda comprobación, abre el PDF en una pestaña del navegador e intenta Ctrl+F o Cmd+F para buscar una palabra que sepas que está impresa en la página, como el nombre del producto o «temperatura». Si la búsqueda no encuentra nada, esa página no tiene capa de texto, sin más.
Tener una capa de texto no es todo el problema
Un PDF puede superar la prueba de copiar y pegar en su portada y aun así fallar donde de verdad importa. La tabla de tolerancias, la que un comprador o un asistente de IA busca primero, acaba pegada muchas veces como imagen, exportada directamente de una herramienta CAD o heredada de una versión escaneada anterior, dentro de un documento por lo demás textual. Nadie se da cuenta, porque la página sigue pareciendo completa.
Los diseños a varias columnas causan un daño distinto. Una ficha a dos o tres columnas se lee de forma natural de arriba abajo, columna izquierda y luego derecha. La mayoría de las herramientas de extracción, sin etiquetas de estructura, leen de izquierda a derecha a lo ancho de toda la página: una frase empieza en la primera columna y termina, a mitad de palabra, con un fragmento de la segunda, cosido en un dato sin relación con la frase original.
El tercer problema tiene que ver con dónde viven los datos, no con cómo están codificados. Imagina una fabricante de válvulas industriales que exporta a Alemania y a Francia: temperatura de servicio, presión nominal y norma de materiales están correctamente indicadas, pero solo en el pie de un plano técnico, en ningún otro sitio del texto. Un modelo que extrae texto de esa página se queda con los párrafos sobre instalación, con ninguno de los datos que distinguen esa válvula de la de un competidor.
Qué hace que una ficha técnica sea legible por una máquina
Tres cosas, todas comprobables con la prueba de antes:
- Texto real y seleccionable. Ni un escaneo, ni una imagen exportada, ni trazados aplanados. Si puedes seleccionar y copiar un párrafo sin problemas, este punto está resuelto.
- Tablas como texto estructurado, no como gráficos. Una tabla de tolerancias debería extraerse como filas y valores interpretables, no como una imagen sin texto detrás.
- Los datos clave escritos en frases normales, fuera del plano. Material, rango de tolerancia, temperatura de servicio, la designación ISO o ASTM correspondiente: cada uno como frase corriente en el cuerpo del texto, no solo como etiqueta dentro de un plano.
Nada de esto necesita software nuevo. Una ficha creada de forma normal en un programa de maquetación moderno, exportada a PDF con las fuentes incrustadas, ya supera el primer requisito. El segundo y el tercer punto son cuestión editorial: decidir que vale la pena escribir la tabla también como texto, y que el rango de temperatura vaya en una frase, no solo en una nota.
La segunda forma, más simple, de perder este contenido
Incluso una ficha que supera todas las pruebas sigue siendo, por sí sola, más difícil de alcanzar para un sistema de recuperación de información que una página web corriente. Los sistemas construidos para indexar la web están pensados ante todo para HTML. Un PDF es un formato que tienen que decidir ir a buscar y analizar aparte, y cada paso adicional es un punto donde el intento puede saltarse. Muchos fabricantes publican las especificaciones solo como PDF descargable y nunca reflejan la misma tabla en una página HTML real de su sitio: una segunda forma de perder este contenido, independiente de la primera.
La solución no tiene nada de vistoso: coger lo que ya está bien en el PDF, el material, el rango de tolerancia, la certificación, y ponerlo también en una página HTML, como texto y tabla normales. Más trabajo que subir un archivo una sola vez, pero la versión con más probabilidades de que la lean de verdad.
Dónde encaja esto, y qué no soluciona
Esto difiere de si tu marca se reconoce como una entidad que un modelo sabe nombrar, o de cómo se sostiene la visibilidad entre mercados e idiomas, temas tratados en otro sitio. Una ficha ilegible para un sistema de recuperación es un fallo más concreto: el contenido existe, simplemente es inalcanzable por su estructura.
Revisar tus PDF de esta manera te dice si este fallo te afecta. No te dice si los asistentes de IA mencionan hoy tu marca, ni qué dicen de ti frente a la competencia, lo cual es un problema de medición, no de formato. Eso es lo que vigila PSentry: si tu marca aparece en las respuestas de las IA y cómo lo hace, en distintas plataformas e idiomas. No audita ni reescribe tus PDF: eso sigue siendo un trabajo aparte, seguramente más fundamental.
Preguntas Frecuentes
Si convierto mi PDF a HTML con una herramienta automática, ¿se resuelve el problema?
Solo si el PDF de origen ya tiene texto real que convertir. Si metes un PDF escaneado en un conversor, normalmente ejecuta un OCR por detrás, con su propio margen de error. Haz la prueba de copiar y pegar sobre el resultado antes de fiarte de él.
¿Puedo añadir texto OCR a una ficha ya escaneada?
Sí, y eso añade una capa de texto donde antes no había ninguna, mejor que nada. Pero el OCR adivina los caracteres a partir de la forma de los píxeles, y una tabla de tolerancias densa es justo donde sus errores son más frecuentes.
¿Un PDF protegido contra copia o con contraseña causa el mismo problema?
Puede causarlo, con independencia de si existe capa de texto. Un intento de extracción automática puede ser rechazado por permisos, aunque el texto subyacente sea real.
¿Esto es solo un viejo problema de indexación con un nombre nuevo?
En gran parte sí, el mecanismo de fondo es muy anterior a la IA generativa. Lo que ha cambiado es la consecuencia: un resultado de búsqueda tradicional todavía puede mostrar tu PDF ilegible como un enlace que alguien quizá abra igualmente. Una respuesta generativa que no puede extraer tu texto no muestra nada: cita los datos de un competidor en lugar de los tuyos.
Mi ficha tiene un plano CAD detallado. ¿Necesito hacer legible el plano en sí?
No, y normalmente tampoco es realista. El objetivo es dejar los mismos datos clave, materiales, tolerancias, certificaciones, en frases normales en otra parte de la página, para que exista una fuente textual aunque el plano nunca vaya a serlo.
¿Tengo que arreglar todas las páginas de una ficha larga?
No. Prioriza las páginas con datos que alguien buscaría de verdad: dimensiones, tolerancias, materiales, certificaciones, rangos de funcionamiento. Una portada bien diseñada como imagen importa poco. Una tabla de tolerancias en ese mismo PDF, si es imagen, importa mucho.