El peligro oculto en un formato de archivo de confianza
Los archivos PDF se encuentran entre los formatos de documento que gozan de mayor confianza y son más utilizados en entornos empresariales. Se intercambian a diario a través del correo electrónico, las plataformas para compartir archivos y las herramientas de colaboración. Precisamente debido a esa confianza, se han convertido en uno de los vectores más utilizados de forma sistemática para campañas de phishing, distribución de malware y ataques de ingeniería social.
Según Check Point Research, el 22 % de los ciberataques basados en archivos utilizan archivos PDF como mecanismo de distribución, y el 68 % de todos los ciberataques se originan en la bandeja de entrada. Lo que no se suele tener tan en cuenta es que los archivos PDF no son simplemente contenedores de contenido visible. Se trata de documentos estructurados con una arquitectura interna definida, y la forma en que se analiza esa arquitectura varía según los lectores, las herramientas de seguridad y los sistemas de inteligencia artificial.
Esta variabilidad no es un error. Se trata de una característica de diseño, y los ciberdelincuentes más sofisticados han aprendido a aprovecharla sin necesidad de vulnerabilidades, kits de explotación ni herramientas avanzadas.
Comprender la estructura de los archivos PDF
Para comprender cómo funciona un ataque de concatenación, primero hay que entender cómo leen un documento los analizadores sintácticos de PDF.
Cuando un lector de PDF abre un archivo, sigue una secuencia definida: localiza el último marcador de fin de archivo, lee el puntero startxref, lo utiliza para localizar la tabla de referencias cruzadas (xref) y el trailer, y a continuación reconstruye el documento resolviendo las coordenadas de los objetos. Este diseño es intencionado, ya que permite a los lectores localizar al instante los objetos en documentos de gran tamaño sin tener que escanear todo el archivo.

La especificación PDF también define un mecanismo denominado «actualizaciones incrementales», que permite modificar los documentos sin necesidad de reescribir el archivo completo. Los cambios se añaden al final del documento, y cada actualización incorpora nuevos objetos, una nueva tabla de referencias cruzadas, un nuevo trailer y un nuevo marcador de fin de archivo.

Debido a este diseño, un PDF válido puede contener legítimamente varias tablas de referencias cruzadas, varios trailers y varios marcadores de fin de archivo. La mayoría de los analizadores sintácticos modernos gestionan esta estructura correctamente. Sin embargo, esta misma flexibilidad estructural también crea una oportunidad tangible para la manipulación.
La técnica de concatenación
Durante una investigación sobre seguridad interna, OPSWAT que al unir dos archivos PDF totalmente independientes en un solo archivo se obtiene un documento que los distintos analizadores sintácticos interpretan de formas radicalmente diferentes. Lo que comenzó como una curiosidad estructural reveló una técnica de evasión significativa y reproducible que, hasta entonces, apenas se había estudiado. El archivo resultante contiene dos estructuras de documento independientes, cada una con su propio encabezado, tabla de referencias cruzadas, colofón y marcador de fin de archivo.
Esto es similar, en términos conceptuales , a las técnicas de explotación de analizadores sintácticos que ya se han observado en archivos comprimidos, en las que se aprovecha la ambigüedad estructural para ocultar contenido malicioso a las herramientas de seguridad. En el caso de los archivos PDF, las consecuencias van más allá: no solo los escáneres de seguridad discrepan sobre el contenido del archivo, sino que la versión que los usuarios ven finalmente en su lector de PDF puede ser totalmente diferente de la versión que se inspeccionó.

Dado que los distintos lectores de PDF utilizan estrategias de análisis diferentes, un mismo archivo concatenado puede mostrar un contenido totalmente distinto según la aplicación con la que se abra.
Diferentes aplicaciones, diferentes contenidos
Se creó una prueba de concepto utilizando dos secciones de un archivo PDF: la primera indicaba que se dibujara un rectángulo y la segunda, que se dibujara un círculo.
Los lectores de PDF más habituales, como Adobe Reader, Foxit Reader, Chrome y Microsoft Edge, localizan el último puntero «startxref» del archivo, que hace referencia a la estructura del documento adjunto (el segundo). Estos programas representan la instrucción «circle».

Microsoft Word y Teams Preview aplican una estrategia de análisis sintáctico diferente y determinan la estructura inicial del documento. Muestran la instrucción del rectángulo, que el usuario no puede ver en Adobe Reader.

Impacto cuantificado en la detección antivirus
Las implicaciones de seguridad derivadas de esta ambigüedad estructural se verificaron mediante pruebas directas realizadas con la plataforma OPSWAT , que agrupa los resultados de múltiples motores antivirus.
Paso 1: PDF original de phishing
Se envió un archivo PDF que contenía contenido de phishing y enlaces maliciosos a 34 motores antivirus. Ocho de ellos identificaron correctamente el contenido malicioso.

Paso 2: PDF concatenado con un documento limpio añadido al principio
Se añadió un PDF limpio y en blanco al principio del PDF de phishing para crear un documento concatenado. El archivo combinado se envió a los mismos 34 motores.

La tasa de detección se redujo a 5 de 34 motores. Tres motores antivirus dejaron de detectar la amenaza. La explicación más probable es que esos motores solo procesaran la primera estructura del documento, que contenía el PDF limpio, y no analizaran la segunda estructura, donde se encontraba el contenido malicioso.
Sin embargo, desde el punto de vista del usuario, el riesgo no había variado en absoluto. Al abrir el archivo concatenado en Adobe Reader, la página de phishing se mostraba exactamente como pretendía el atacante.

Cómo interpretan los sistemas de IA los documentos concatenados
A medida que el procesamiento de documentos basado en la inteligencia artificial se va integrando en los flujos de trabajo de las empresas, esta ambigüedad estructural introduce una categoría de riesgo distinta, que va más allá de la distribución convencional de malware. Las organizaciones recurren cada vez más a los grandes modelos de lenguaje para analizar documentos, extraer información y facilitar la toma de decisiones. Si esos sistemas interpretan una versión del documento diferente a la que ve un usuario humano, las consecuencias van mucho más allá de pasar por alto un enlace de phishing.
Las pruebas realizadas con el mismo PDF concatenado demostraron que las principales plataformas de IA interpretan el archivo siguiendo la misma lógica dependiente del analizador sintáctico que se observa en las aplicaciones de lectura tradicionales.
GPT: Interpreta la primera sección
GPT determinó la estructura del primer documento del archivo y extrajo el contenido de la sección oculta situada al principio. Leyó y aplicó la instrucción del rectángulo, que no forma parte del contenido visible para un usuario que abra el archivo en Adobe Reader.

Gemini y Claude: Interpretación de la segunda sección (visible)
Tanto Gemini como Claude analizaron la estructura del segundo documento y extrajeron el contenido tal y como lo ven los usuarios en Adobe Reader. Aunque este es el comportamiento esperado desde el punto de vista de la experiencia del usuario, demuestra que los sistemas de IA están sujetos a las mismas diferencias de análisis estructural que los lectores convencionales.


Esta discrepancia tiene consecuencias directas para varios escenarios de riesgo de alta prioridad:
- Inyección de comandos: un atacante incrusta instrucciones ocultas en la primera sección oculta de un PDF concatenado. El usuario ve un documento normal. Un sistema de IA que analiza la primera estructura recibe comandos que anulan su comportamiento previsto, sin que el usuario o el revisor perciban ningún indicio visible.
- Contaminación de los datos de entrenamiento: los documentos utilizados para ajustar o ampliar los modelos de IA pueden contener una sección oculta que introduce contenido adversario en el corpus de entrenamiento sin que se active la detección.
- Deficiencias en materia de cumplimiento normativo y auditoría: los sistemas de inteligencia artificial utilizados para la revisión de documentos, el análisis de contratos o la presentación de informes reglamentarios pueden procesar una versión de un documento que difiera sustancialmente de la revisada por los asesores jurídicos o el personal de cumplimiento normativo, lo que genera una brecha silenciosa en la gobernanza.
Para los asesores jurídicos y corporativos, los responsables de protección de datos y los equipos de cumplimiento normativo, la situación en la que un sistema de inteligencia artificial actúa sobre contenidos que ningún humano ha revisado y que ninguna herramienta de seguridad ha detectado no es meramente teórica. La técnica de concatenación hace que sea muy fácil de llevar a cabo.
Cómo OPSWAT el ataque mediante archivos PDF concatenados
Tecnología Deep CDR™: limpieza de archivos que elimina la amenaza antes de que se produzca
La tecnologíaOPSWAT CDR™ trata cada archivo como si fuera potencialmente malicioso. En lugar de intentar detectar patrones maliciosos específicos, la tecnología Deep CDR™ descompone cada archivo, comprueba su estructura interna con respecto a las especificaciones oficiales del formato, elimina todos los elementos que no se ajustan a ellas o que incumplen la política definida, y regenera un archivo limpio y totalmente utilizable. Este enfoque aborda el ataque de archivos PDF concatenados desde su raíz estructural.
La tecnología Deep CDR™ previene esta técnica de ataque gracias a su función de verificación de la estructura de archivos. Al procesar un PDF concatenado, la tecnología Deep CDR™ identifica la anomalía estructural: la presencia de múltiples estructuras de documento independientes, múltiples tablas de referencias cruzadas, múltiples colofones y múltiples marcadores de fin de archivo en una configuración que no se ajusta a un único documento PDF válido. A continuación, elimina los elementos conflictivos y reconstruye el documento basándose únicamente en la capa de contenido verificada y segura.
Lo que realmente elimina la tecnología Deep CDR™
La siguiente captura de pantalla deMetaDefender el resultado del análisis realizado con la tecnología Deep CDR™ del archivo PDF de phishing concatenado. Con la tecnología Deep CDR™ configurada y aplicada, el sistema identificó y tomó medidas respecto a cada elemento que infringía la estructura de archivo prevista o la política de seguridad.

Como se muestra, la tecnología Deep CDR™ realizó las siguientes acciones en el PDF concatenado:
- Se han eliminado dos hipervínculos: los enlaces maliciosos de phishing incluidos en el documento se eliminaron antes de que el archivo llegara al usuario.
- Imagen 1 depurada: la imagen incrustada, que se utilizó como cebo visual en el mensaje de phishing, ha sido depurada.
- Se han eliminado 3 objetos no utilizados: se han identificado y eliminado los objetos huérfanos de la estructura del primer documento oculto, que ya no pertenecían a ninguna capa de documento válida.
El resultado es un PDF con una estructura limpia que conserva el contenido relevante para la empresa y supera las comprobaciones de las especificaciones del formato de archivo. Lo más importante es que lo que recibe el usuario, lo que analizan los motores antivirus y lo que procesa cualquier sistema de IA posterior es idéntico: un único documento verificado, sin estructuras ocultas, sin enlaces maliciosos y sin elementos que incumplan las políticas.
Modo de desinfección flexible
En entornos en los que es necesario mantener la usabilidad sin descuidar la seguridad, la tecnología Deep CDR™ funciona en «modo de saneamiento flexible». El sistema no bloquea el archivo. En su lugar, lleva a cabo una reconstrucción estructural: se eliminan las secciones conflictivas del documento, se suprimen todos los objetos activos y potencialmente maliciosos, y se regenera un PDF limpio y conforme a las políticas, que se entrega al usuario. De este modo, se preserva la experiencia del usuario al tiempo que se elimina la superficie de ataque.
Informe sobre los detalles de la desinfección
Cada archivo procesado por la tecnología Deep CDR™ genera un informe de depuración forense en el que se documenta qué objetos se identificaron, qué medidas se tomaron y por qué. Tal y como se ilustra en la figura 11, este informe ofrece un registro de auditoría completo de todas las anomalías estructurales y las infracciones de las políticas que se han abordado. Para los responsables de cumplimiento normativo, los responsables de privacidad y los asesores jurídicos, este informe constituye la prueba documentada de que los archivos que ingresan al entorno se procesaron de acuerdo con una política de seguridad coherente y verificable, y de que cualquier desviación de la estructura de archivos esperada se registró y se corrigió.
SandboxAdaptive : análisis que tiene en cuenta la estructura y no deja ningún punto ciego
Mientras que la tecnología Deep CDR™ mitiga el riesgo mediante la limpieza y la reconstrucción del documento, OPSWAT Adaptive Sandbox Aether) aborda el problema desde un ángulo fundamentalmente diferente: lleva a cabo un análisis conductual en profundidad de todas las estructuras de documento posibles dentro del archivo. Mientras que la tecnología Deep CDR™ elimina la amenaza antes de que el archivo llegue al usuario, Adaptive Sandbox el archivo en un entorno controlado y observa exactamente para qué ha sido diseñado.
En el caso de los PDF concatenados, Adaptive Sandbox basa en una única interpretación del analizador sintáctico. En su lugar, realiza un análisis que tiene en cuenta la estructura para identificar que el archivo contiene realmente varios documentos PDF válidos anexados entre sí. Esto impide directamente que los atacantes oculten contenido malicioso tras inconsistencias del analizador sintáctico. El análisis se desarrolla en tres etapas:
1.Extracción: Cada documento PDF incrustado se extrae individualmente de la estructura concatenada. Ninguna capa del documento se considera definitiva. Se identifica y aísla cada sección presente en el flujo binario para su inspección independiente.

2.Análisis: Cada documento extraído se analiza de forma independiente en un entorno emulado y controlado. Adaptive Sandbox el contenido, supervisa el comportamiento en tiempo de ejecución y detecta cualquier actividad maliciosa, incluidas las llamadas de red, la ejecución de scripts, la descarga de cargas útiles y los intentos de explotar la aplicación de visualización, independientemente de la capa del documento en la que se origine dicho comportamiento.

Correlación: Los resultados de cada análisis independiente se correlacionan con el archivo original, lo que da lugar a una conclusión unificada que refleja la verdadera intención de comportamiento del documento concatenado completo. Los indicadores de compromiso extraídos de cada capa se consolidan en un único informe forense, lo que facilita la inteligencia sobre amenazas, la respuesta a incidentes y los flujos de trabajo del SOC.

El resultado es un panorama analítico completo, sin puntos ciegos. Se analiza cada documento incrustado. Se inspecciona cada cadena de objetos. No hay lugar para trucos de análisis sintáctico. Un atacante no puede confiar en que una aplicación detecte una capa limpia mientras que una capa maliciosa quede sin examinar, ya que Adaptive Sandbox esa distinción. Lo examina todo.

Detección por capas para una defensa integral
La tecnología Deep CDR™ y Adaptive Sandbox la amenaza de los archivos PDF concatenados desde perspectivas opuestas y, juntas, no dejan ninguna vía de ataque viable. La tecnología Deep CDR™ elimina la amenaza antes de que se entregue el archivo: el usuario recibe un documento estructuralmente limpio, sin secciones ocultas, sin enlaces maliciosos y sin objetos que incumplan las políticas. Adaptive Sandbox la intención de la amenaza antes o durante la entrega: se ejecuta cada capa del documento, se observa cada comportamiento y se extraen y registran todos los indicadores de compromiso.
Para las organizaciones que operan en entornos de alto riesgo, esta combinación resulta especialmente eficaz. La tecnología Deep CDR™ garantiza que los documentos que llegan a los usuarios no puedan ejecutar lógica oculta. Adaptive Sandbox que se comprenda la intención de comportamiento de cada documento, incluidas todas las capas de un archivo concatenado. Ninguna de estas tecnologías requiere un conocimiento previo de la técnica de ataque específica para ser eficaz. Ambas operan sobre la estructura del archivo y el comportamiento de su contenido, y no sobre firmas conocidas o fuentes de inteligencia sobre amenazas.
Reflexiones finales
La técnica de ataque mediante archivos PDF concatenados pone de manifiesto un tipo de amenaza para el que la seguridad basada en la detección no fue concebida. No hay ninguna firma de malware que detectar. No hay ningún exploit que identificar. Solo se trata de una disposición estructural de un formato de archivo legítimo que hace que distintos sistemas lo interpreten de forma diferente.
Para los responsables y directores de TI, las implicaciones operativas son claras: es posible que las herramientas de escaneo actualmente en uso estén analizando una versión del documento distinta a la que abren los usuarios.
Para los responsables de cumplimiento normativo y gestión de riesgos, esto supone una deficiencia en la gobernanza: es posible que el registro de auditoría relativo a la seguridad de los archivos no refleje el contenido real que se ha entregado.
Para los altos directivos, el riesgo financiero es considerable, ya que el coste medio de una brecha de seguridad por phishing que tiene éxito supera actualmente los 4,88 millones de dólares, y los ataques que eluden los controles estándar se encuentran entre los más costosos de solucionar.
Para los asesores jurídicos y corporativos, así como para los responsables de protección de datos, los sistemas de inteligencia artificial que actúan sobre el contenido oculto de los documentos sin revisión humana ni visibilidad en materia de seguridad representan un riesgo emergente y significativo.
La tecnología OPSWAT CDR™ y Adaptive Sandbox esta deficiencia desde ambos frentes. La tecnología Deep CDR™ elimina las condiciones estructurales que permiten la existencia de tales amenazas al verificar la estructura de los archivos, eliminar todas las secciones ocultas y conflictivas de los documentos y regenerar un resultado limpio y verificado, lo que garantiza que cada archivo que entra en el entorno contenga exactamente el contenido que se inspeccionó. Adaptive Sandbox que nada quede sin examinar: al realizar un análisis que tiene en cuenta la estructura en cada capa de los documentos incrustados, ejecutando cada una de forma independiente y correlacionando los resultados con el archivo original, expone la intención de comportamiento de las amenazas que ningún truco de análisis sintáctico puede ocultar. Juntas, estas tecnologías garantizan que lo que reciben los usuarios es seguro y que se comprende plenamente lo que los atacantes diseñaron que hiciera el archivo.
Recursos adicionales
- Ver la carteraOPSWAT
- Descargar ficha técnica: Tecnología Deep CDR™ y Adaptive Sandbox
