Envío de registros, alertas y datos de telemetría a través de un diodo de datos

Descubre cómo
Utilizamos inteligencia artificial para traducir el sitio web y, aunque nos esforzamos por garantizar la precisión, es posible que las traducciones no sean siempre 100 % exactas. Agradecemos tu comprensión.

Riesgos de seguridad de los modelos LLM derivados de archivos «pickle» y cargas útiles apiladas

Los modelos de IA preentrenados descargados de plataformas públicas son código ejecutable que MetaDefender el proceso de cinco capas de Aether™ inspecciona antes de que crucen tu límite de confianza.
Por Triet Tran Minh, analista de detección de amenazas
Comparte esta publicación

La seguridad de los modelos LLM (modelos de lenguaje a gran escala) consiste en inspeccionar los archivos de modelos de IA preentrenados en busca de código malicioso incrustado antes de que se carguen en un entorno. Los archivos de modelos en formatos como pickle, PyTorch, TensorFlow y Keras pueden ejecutar código en el momento en que se cargan, lo que los convierte en un riesgo para la cadena de suministro equivalente a la ejecución de software no verificado.

Resumen / Puntos clave

  • Los modelos preentrenados descargados de Hugging Face, Kaggle o PyPI son código ejecutable, no datos inertes.
  • Según el informe «Software » de JFrog Supply Chain «State of the Union 2026», el 53 % de las organizaciones obtienen modelos directamente de registros públicos, en los que los investigadores identificaron aproximadamente 495 modelos maliciosos capaces de robar credenciales y comprometer por completo el sistema.
  • Los formatos basados en Pickle (.pt, .pth, .bin, .pkl) ejecutan funciones arbitrarias mediante la instrucción REDUCE durante la carga, el mismo fallo estructural que presentan los grafos de TensorFlow y las capas Lambda de Keras.
  • Safetensors elimina por completo el motor de ejecución, pero siguen circulando cientos de miles de modelos en formato heredado, y el hecho de que un archivo de un repositorio sea seguro no garantiza que el resto del repositorio también lo sea.
  • MetaDefender Aether™ examina los archivos de modelos en cinco niveles de análisis, detectando amenazas como las cargas útiles «pickle» apiladas que pasan desapercibidas en los escáneres tradicionales.

Los modelos de IA preentrenados son código ejecutable que traspasa un límite de confianza

Crear un modelo de lenguaje a gran escala desde cero requiere datos, recursos informáticos y tiempo de los que la mayoría de las organizaciones carecen. Por ello, los equipos suelen descargar modelos preentrenados de plataformas públicas como Hugging Face, Kaggle y PyPI. Esa dependencia ha creado un vector de ataque en la cadena de suministro que muchos programas de seguridad siguen pasando por alto.

Las organizaciones ya someten a un proceso de verificación las bibliotecas de código abierto y las imágenes de contenedores que incorporan a sus entornos. Son pocas las que aplican ese mismo nivel de escrutinio a los modelos de IA que descargan sus equipos, a pesar de que un archivo de modelo no es simplemente una hoja de cálculo con números. Dependiendo de su formato, un archivo de modelo puede ser un programa que se ejecuta en el momento en que se carga.

Solo Hugging Face aloja más de un millón de modelos, la mayoría de los cuales nunca se han sometido a una revisión de seguridad. Según el informe «Software » de JFrog Supply Chain «State of the Union 2026», el 53 % de las organizaciones obtienen ahora los modelos directamente de registros públicos, y los investigadores identificaron aproximadamente 495 modelos maliciosos en dichos registros capaces de robar credenciales, ejecutar código y comprometer por completo el sistema. Un modelo LLM es un software ejecutable que traspasa un límite de confianza.

Cómo las amenazas basadas en modelos pasaron de ser una teoría a convertirse en una técnica de evasión

La amenaza se desarrolló por etapas: alertas académicas, pruebas de concepto, abusos en la cadena de suministro en el mundo real y técnicas de evasión diseñadas para burlar los escáneres.

La evolución de las amenazas relacionadas con los modelos, 2018-2026

Fase

Plazo

Qué ha cambiado

Pruebas representativas

Teoría

2018

Los expertos advierten de que los modelos reutilizados y preentrenados procedentes de fuentes no fiables pueden ser manipulados

Ataques basados en la reutilización de modelos contra sistemas de aprendizaje profundo

Prueba de concepto

2023-2024

Aparecen modelos realmente maliciosos; se ha demostrado que los formatos basados en «pickle» contienen cargas útiles activas

star23/baller13, un modelo que utiliza una «concha inversa», apareció en Hugging Face

En su hábitat natural

2024-2025

El volumen aumenta, gracias a la cadena de suministro a través de los registros de paquetes

Los paquetes de PyPI con la marca Alibaba marcan la llegada de los ataques a la cadena de suministro de los modelos de lenguaje a gran escala (LLM)

Evasión avanzada

2024-2025

Cargas útiles dispuestas en capas y apiladas, diseñadas para eludir una inspección rápida

Una prueba de concepto de «stacked pickle» obtuvo una puntuación de 0/70 en VirusTotal

Un formato más seguro

2023-2026

Se introduce un formato exclusivamente de datos que no permite transportar código, pero los modelos antiguos siguen utilizándose ampliamente

Safetensors se convierte en la opción predeterminada para los nuevos modelos que salgan al mercado

Los archivos Pickle y PyTorch ejecutan código en el momento en que se cargan

Pickle es el formato de serialización nativo de Python y fue durante años la forma estándar de guardar modelos en disco. PyTorch basó sus archivos .pt, .pth y .bin en este formato, y muchos modelos se publicaron en esos formatos. Hoy en día existen opciones más seguras, aunque se han eliminado como lenguaje empresarial abstracto. Una gran parte de los modelos que aún circulan en los repositorios públicos siguen basándose en Pickle, y los equipos los cargan a diario.

El formato Pickle se utiliza ampliamente para almacenar modelos LLM

Pickle almacena algo más que datos. Se trata de un flujo de instrucciones que una máquina virtual ejecuta mientras carga el archivo y reconstruye los objetos de Python. El flujo puede llamar a funciones arbitrarias, por lo que al cargar un modelo basado en Pickle también se puede ejecutar código.

Los atacantes aprovechan la instrucción «REDUCE» de «pickle», que indica al cargador que llame a una función específica con los argumentos elegidos por el atacante durante el proceso de «unpickling». Esto permite iniciar un shell inverso, instalar una carga útil de segunda fase o sobrescribir una clave SSH, mientras que el modelo sigue cargándose y comportándose como un archivo legítimo.

TensorFlow y Keras presentan riesgos similares. Los grafos maliciosos de TensorFlow pueden introducir de forma encubierta operadores de escritura de archivos u operadores de red en el grafo de cálculo, mientras que las capas Lambda de Keras pueden contener código byte de Python marshalizado que se deserializa al cargarse. Cada formato permite que un archivo contenga código ejecutable. Este riesgo es estructural, por lo que corregir un único error no basta para eliminarlo. Esa limitación obligó al sector a buscar un formato más seguro.

Un shell inverso integrado en un archivo de modelo basado en «pickle»

Los incidentes reales convirtieron la teoría en una amenaza « Supply Chain »

Las advertencias sobre los ataques de reutilización de modelos aparecieron por primera vez en 2018. Posteriormente, los investigadores demostraron que el riesgo se materializaba en la práctica. En enero de 2024, apareció en Hugging Face un modelo llamado «star23/baller13» que contenía un shell inverso dentro de un archivo de PyTorch. Este modelo podía proporcionar acceso remoto sin dejar de parecer un modelo válido.

Advertencia sobre Star23/baller13 en Hugging Face. Fuente: https://huggingface.co/star23/baller13
Paquete malicioso de PyPi
Paquete malicioso de PyPi

En mayo de 2025, la amenaza se trasladó al ámbito clásico de la cadena de suministro. Los atacantes publicaron paquetes en PyPI denominados «aliyun-ai-labs-snippets-sdk», «ai-labs-snippets-sdk» y «aliyun-ai-labs-sdk» que se hacían pasar por un kit de herramientas de IA de Alibaba y cargaban de forma silenciosa un modelo malicioso durante su uso. Los paquetes permanecieron activos menos de 24 horas, pero se descargaron unas 1.600 veces; lo que nos recuerda que un breve periodo de exposición es más que suficiente cuando la descarga la realiza la resolución automática de dependencias.

Máster en Derecho (LLM) sobre ataques a la cadena de suministro

Las cargas útiles «Stacked Pickle» burlan los escáneres tradicionales

En 2024, los atacantes ya tenían en el punto de mira los escáneres diseñados para detectar modelos maliciosos. El ejemplo más claro es la técnica «Stacked Pickle», que anida varios objetos «pickle» y distribuye instrucciones maliciosas por las distintas capas, para luego envolverlas mediante compresión y codificación.

Cada capa parece inofensiva cuando se examina por separado, por lo que los escáneres y las revisiones manuales que se limitan a la superficie no detectan nada. Cuando se carga el modelo, las capas se descomprimen en secuencia y vuelven a ensamblar la carga útil. Una muestra de prueba de concepto creada con esta técnica no registró ninguna detección en ninguno de los motores de VirusTotal.

Un escáner que solo comprueba la capa visible puede pasar por alto una carga útil oculta en una capa más profunda del archivo. Así es como la muestra logró pasar todos los motores de análisis.

Stacked Pickle evita el uso de los escáneres tradicionales

Safetensors elimina por completo el motor de ejecución

Safetensors almacena los pesos de los modelos sin un motor de ejecución. Cada archivo contiene una cabecera de metadatos compacta que describe la forma, el tipo de datos y el desplazamiento en bytes de cada tensor, seguida de los bytes sin procesar del tensor. No cuenta con un flujo de instrucciones, una máquina virtual ni ningún equivalente a la función REDUCE de pickle, por lo que no es posible indicar al cargador que llame a una función.

Un archivo Safetensors es un conjunto de datos inertes que lee el cargador. Ni siquiera un archivo creado con fines maliciosos puede ejecutar código al cargarse, ya que el formato no ofrece ninguna vía para que dicho código se ejecute.

Estructura de archivos de Safetensors frente a la de Pickle

Por qué se creó Safetensors y por qué se popularizó

El problema de los formatos tradicionales nunca fueron los propios pesos. El problema era que el archivo también podía contener instrucciones ejecutables. Hugging Face, en colaboración con EleutherAI y Stability AI, ha desarrollado Safetensors como un sustituto diseñado específicamente para eliminar esa capacidad, al tiempo que conserva lo que los equipos necesitan de un archivo de pesos.

Safetensors también es práctico. Se carga rápidamente mediante un acceso mapeado en memoria y sin copia, funciona con PyTorch, TensorFlow, JAX y otros marcos de trabajo, y se ha convertido en la opción predeterminada para la mayoría de los nuevos lanzamientos de modelos. Estas ventajas han contribuido a su difusión sin necesidad de imposiciones.

Safetensors es un estándar más seguro para los archivos de modelos de aprendizaje automático

Una auditoría independiente respalda la afirmación sobre la seguridad

Los responsables del mantenimiento no son la única fuente que respalda esta afirmación sobre la seguridad. La biblioteca está escrita en Rust, cuyo compilador evita toda una serie de errores de análisis sintáctico. En 2023, Hugging Face, EleutherAI y Stability AI encargaron conjuntamente una auditoría independiente del formato a Trail of Bits.

La auditoría no detectó ningún fallo crítico que pudiera dar lugar a la ejecución arbitraria de código. Se identificaron algunas imprecisiones en las especificaciones y una validación que faltaba, lo que había permitido la existencia de archivos poliglotas. Los responsables del mantenimiento corrigieron y publicaron todas estas correcciones y, a continuación, establecieron Safetensors como opción predeterminada.

Los datos registrados desde entonces respaldan la conclusión de la auditoría. Los formatos heredados han dado lugar a incidentes reales desde 2024, mientras que durante ese mismo periodo no se ha demostrado ningún ataque de ejecución de código dirigido contra el propio formato Safetensors. Safetensors no ofrece a los atacantes ningún mecanismo de ejecución para el tipo de ataque que hace que los archivos basados en «pickle» sean peligrosos. El riesgo restante proviene de los formatos heredados que siguen utilizándose ampliamente.

El modelo « Supply Chain » sigue necesitando una compuerta de inspección

El riesgo radica en si el formato de un archivo de modelo puede contener código además de sus pesos. Los formatos Pickle, PyTorch, TensorFlow y Keras sí pueden; Safetensors, por su diseño, no. Los responsables de la seguridad deben considerar los formatos de modelo ejecutables como un riesgo, inspeccionar todos los modelos que entren en el entorno y orientar a los equipos hacia formatos seguros siempre que sea posible.

En los repositorios públicos siguen existiendo millones de modelos en formatos heredados, y los equipos siguen descargándolos. Un repositorio también puede incluir un archivo en formato «pickle» junto con uno seguro, por lo que la presencia de pesos de Safetensors no garantiza que todo el repositorio sea seguro. La cadena de suministro de modelos necesitará un control de calidad hasta que se retiren los formatos heredados.

En la práctica, esto se traduce en una lista de comprobación breve con pocos falsos positivos:

  • Da prioridad a los archivos «Safetensors» y considera que los formatos antiguos deben someterse a una inspección antes de su uso. Cualquier modelo con extensión .pt, .pth, .bin, .pkl, .pb o .h5 procedente de un editor no verificado debe analizarse antes de cargarlo.
  • Considera la carga de un modelo en formato heredado como un evento de ejecución. Una carga de modelo que genere un shell, abra una conexión saliente desde un intérprete de Python o escriba en una ruta sensible es una señal de comportamiento que debe incluirse en la telemetría del host, del mismo modo que lo haría cualquier ejecución de código.
  • Analiza todo el artefacto, no solo el archivo de pesos. La unidad de análisis es el paquete del modelo tal y como se entrega, ya que el formato de un repositorio es una afirmación, no una garantía, hasta que se verifique.

Cómo el proceso de cinco etapas de « MetaDefender » de Aether inspecciona los archivos de los modelos LLM

MetaDefender Aether™, la solución unificada de detección de amenazas de día cero de OPSWAT, ofrece una eficacia de detección del 99,9 % gracias a un proceso de inspección de cinco capas. Cada archivo enviado se somete primero a un análisis del tipo de archivo, que identifica el archivo en sí en lugar de basarse únicamente en su extensión. Cada capa de análisis puede determinar el veredicto de forma independiente. En cuanto una capa llega a una respuesta definitiva, el análisis se detiene, por lo que la mayoría de los archivos evitan pasar por las etapas más profundas y costosas.

  1. Reputación de amenazas. El hash del archivo y los indicadores relacionados se comparan con la inteligencia global sobre amenazas de OPSWAT, que se basa en más de 50 000 millones de indicadores. Un hash ya vinculado a una subida maliciosa conocida se bloquea en menos de un segundo, y un archivo que se sabe que es seguro se aprueba con la misma rapidez, de modo que solo pasan los archivos desconocidos.
  2. Análisis estático. Antes de que se ejecute nada, Predictive Alin AI evalúa el archivo junto con un análisis estático y un escaneo del motor antivirus. Predictive Alin AI ofrece veredictos basados en aprendizaje automático en milisegundos sin necesidad de detonación en entorno aislado, entrenado con conjuntos de datos empresariales seleccionados y que respetan la privacidad, y mejorado continuamente a través de un ciclo de reentrenamiento de día cero alimentado por las detecciones confirmadas de Aether, de MetaDefender . En el caso de los archivos de modelo, es aquí donde se detecta un «pickle» sospechoso con códigos de operación de carga útil reconocibles antes de que se dedique tiempo de emulación al mismo.
  3. Análisis dinámico. La emulación a nivel de instrucción resuelve el problema «Stacked Pickle» al revelar el comportamiento de un archivo sin necesidad de arrancar una máquina virtual completa para cada muestra. Supera los controles anti-VM y los retrasos temporales que eluden los entornos de pruebas tradicionales, completando el análisis en segundos en lugar de minutos, con una velocidad hasta 20 veces superior y un volumen hasta 100 veces mayor que las herramientas de sandboxing tradicionales.
  4. Puntuación de amenazas. Esta capa combina las funciones invocadas, las conexiones intentadas, las señales de reputación y otros hallazgos de las tres primeras capas. Se basa en más de 900 indicadores de comportamiento para generar una puntuación útil y una huella de similitud para la fase final.
  5. Búsqueda de amenazas. La búsqueda de similitudes mediante aprendizaje automático correlaciona la huella digital con la base de datos de inteligencia sobre amenazas de OPSWAT y con los comportamientos mapeados por MITRE para identificar variantes y campañas. Un modelo malicioso reempaquetado o renombrado puede tener un nuevo hash, pero esta capa sigue siendo capaz de detectar su similitud con un antecesor malicioso conocido.

Todo el proceso se desarrolla de forma automática. El resultado es un veredicto consolidado y un informe de pruebas que relaciona cada indicador con el comportamiento que lo ha generado.

MetaDefender Aether revisa los archivos de modelos en cada punto de entrada

Los modelos llegan a través de descargas web, correo electrónico, plataformas de transferencia de archivos y flujos automatizados. Un punto de control debe abarcar todas las vías de acceso sin obligar a las organizaciones a rediseñar la infraestructura que transporta el tráfico.

En el caso de los canales de red, MetaDefender Aether se integra a través de ICAP, el protocolo estándar que ya utilizan los servidores proxy, las pasarelas de correo electrónico y las plataformas de transferencia de archivos para enviar archivos a un servicio de inspección. Cuando el tráfico no pasa por ningún dispositivo de red, se puede acceder al mismo análisis a través de una interfaz REST API .

  • Descargas web. Cuando un desarrollador descarga un modelo de Hugging Face o Kaggle, el proxy o la pasarela web segura redirige la descarga a MetaDefender Aether a través de ICAP, y se bloquea un archivo «pickle» malicioso antes de que llegue al punto final.
  • Correo electrónico. Los archivos de modelos y las herramientas de IA compartidos como archivos adjuntos se extraen y analizan a través del mismo proceso que cualquier otro archivo adjunto, lo que elimina la vía de ingeniería social que elude los controles a nivel del registro.
  • Transferencias de archivos. Los archivos intercambiados con socios y proveedores, o que se transfieren entre zonas internas mediante un sistema de transferencia gestionada de archivos, se analizan durante la transmisión, por lo que el límite de confianza se mantiene incluso en el caso de los archivos que nunca pasan por un nodo público.
  • Flujos de trabajo automatizados y registros. Crea tareas de compilación y plataformas de aprendizaje automático que obtengan los modelos de forma programada y los envíen a través de API antes de que nada se publique en un registro interno, cerrando así la vía exacta que explotaron los paquetes de Alibaba PyPI, en la que la resolución de dependencias se encarga de la descarga y nadie ve nunca ningún archivo que pueda parecer sospechoso.

Todas las rutas utilizan el mismo proceso de inspección y la misma lógica de decisión, por lo que no queda ningún canal sin supervisar que un atacante pueda aprovechar.

Seguridad sin ralentizar a los desarrolladores

Los equipos de seguridad suelen dejar sin gestionar el riesgo asociado a los modelos, ya que prohibir las descargas desde hubs públicos resulta poco práctico. MetaDefender Aether permite a los desarrolladores mantener sus flujos de trabajo actuales, mientras que el proceso de análisis examina los modelos en tiempo real a la velocidad de emulación. Las descargas bloqueadas incluyen un informe de pruebas en el que se explica el veredicto.

Descubre cómo MetaDefender Aether analiza los archivos de los modelos LLM antes de que traspasen tu límite de confianza.

Preguntas frecuentes

¿Qué es la seguridad de los modelos LLM?
La seguridad de los modelos LLM consiste en inspeccionar los archivos de modelos de IA preentrenados en busca de código malicioso incrustado antes de que se carguen en un entorno. Considera que los modelos descargados de plataformas públicas son software ejecutable que traspasa un límite de confianza, y no datos inertes.

¿Por qué son peligrosos los archivos «pickle» para los modelos de IA?
Una máquina virtual ejecuta la secuencia de instrucciones de un archivo «pickle» a medida que se carga el archivo. La instrucción REDUCE permite a un atacante llamar a funciones arbitrarias durante ese proceso, por lo que cargar un modelo basado en «pickle» puede ejecutar código controlado por el atacante sin previo aviso.

¿Qué es Safetensors y en qué se diferencia de pickle?
Safetensors es un formato de archivo exclusivamente de datos destinado al almacenamiento de pesos de modelos, que contiene una cabecera de metadatos y bytes de tensores sin procesar, sin motor de ejecución ni nada equivalente a la instrucción REDUCE de pickle. Mientras que un archivo pickle es un programa que ejecuta el cargador, un archivo Safetensors es datos inertes que lee el cargador.

¿Puede un archivo de Safetensors seguir siendo malicioso?
Un archivo de Safetensors no puede ejecutar código al cargarse, ya que el formato no ofrece ninguna vía de ejecución. Sin embargo, un repositorio puede incluir un archivo heredado basado en «pickle» junto con los pesos seguros de Safetensors, por lo que es necesario inspeccionar el repositorio al completo.

¿Cómo detecta Aether, de MetaDefender , los modelos LLM maliciosos?
MetaDefender Aether analiza los archivos de los modelos a través de cinco capas: reputación de amenazas, análisis estático, análisis dinámico, puntuación de amenazas y búsqueda de amenazas. Detiene la mayoría de los archivos antes de que lleguen a las etapas más profundas y costosas, y es capaz de detectar cargas útiles «pickle» apiladas que pasan desapercibidas para los escáneres tradicionales de una sola capa.

Revisa cada modelo antes de que traspase tu límite de confianza

Los equipos recurren ahora a modelos reutilizados y preentrenados, pero cada descarga de una fuente pública plantea la misma pregunta: ¿el archivo contiene solo datos o puede ejecutar código? MetaDefender Aether da respuesta antes de que se cargue el modelo, aplicando cinco capas de análisis a las descargas web, el correo electrónico, las transferencias de archivos y los flujos de trabajo automatizados.

¡Mantente al día con OPSWAT!

Regístrate hoy mismo para recibir las últimas novedades de la empresa, historias, información sobre eventos y mucho más.