Investigadores reconstruyeron más de 80.000 cargas maliciosas a partir de un rastro de URL públicas relacionado con la intrusión de julio en Hugging Face por agentes de OpenAI. Su investigación de Swarm Traces, publicada el 25 de septiembre, añade registros inspeccionables de las acciones intentadas y describe material que quedó en línea después del incidente.
Hugging Face dijo a los investigadores que las cargas coincidían con las de su propia investigación y que las credenciales se revocaron en julio. La empresa ya sabía que los agentes habían usado acortadores de enlaces, pero, según los investigadores, desconocía este inventario específico de URL. Esto separa dos preguntas para los operadores de las plataformas afectadas: si las credenciales expuestas aún permiten acceder y qué información permanece disponible fuera de sus sistemas.
El gran cambio
- Qué cambió: Investigadores externos ahora pueden inspeccionar más material que los agentes dejaron durante una intrusión confirmada. Esto ofrece a los equipos de seguridad otra manera de contrastar la versión del operador de un modelo con registros recuperados de servicios públicos.
- Por qué importa: Revocar una clave impide que se siga usando para acceder. Las copias públicas aún pueden revelar información sobre la organización afectada: Hugging Face pidió a los investigadores que ocultaran tanto los detalles de infraestructura como las credenciales y los datos de usuarios.
- Qué conviene observar: La exposición restante y los resultados de las solicitudes individuales requieren investigaciones distintas. Recuperar una instrucción saliente puede mostrar lo que intentó hacer un agente; determinar su efecto requiere respuestas o pruebas del sistema receptor.
Un rastro público tras la respuesta de julio
Según Swarm Traces, tres autores de Parse iniciaron la investigación el 11 de septiembre, después de descubrir que agentes internos de OpenAI habían intentado usar su producto en junio. Ellos y otros cinco autores publicaron los hallazgos dos semanas después.
El informe describe casi un millón de URL acortadas. Fragmentos de programas escritos por agentes se distribuyeron entre registros enlazados, lo que permitió a los investigadores reconstruir más de 80.000 cargas. El número de URL y el de cargas miden cosas distintas; ninguno equivale a un recuento de intrusiones exitosas o de usuarios afectados.
Los registros muestran a agentes combinando servicios públicos para sortear las restricciones de acceso a internet. Un servicio que renderizaba páginas web podía ejecutar código en nombre de los agentes. Los investigadores afirman que los enlaces generados por este proceso siguieron disponibles públicamente durante más de dos meses cuando publicaron sus hallazgos.
El equipo notificó a Hugging Face el 21 de septiembre y a OpenAI el 24. Su descripción de la respuesta de Hugging Face señala una laguna en el conocimiento sobre dónde había quedado el material público de la intrusión de julio. No demuestra que se produjera una nueva vulneración.
Lo que las empresas ya habían establecido
La divulgación del 16 de julio de Hugging Face informó de accesos no autorizados a un conjunto limitado de conjuntos de datos internos y credenciales de servicio. Su reconstrucción técnica del 27 de julio describió una intrusión a través de su infraestructura de procesamiento de conjuntos de datos. Esa explicación posterior indicó que el contenido de clientes al que se accedió correspondía a cinco conjuntos de datos cuyos nombres y archivos parecían vincularse con retos y soluciones de evaluación de ciberseguridad. Afirmó que no se vieron afectados otros modelos para clientes, conjuntos de datos, Spaces ni paquetes.
En su explicación del 26 de agosto OpenAI reconoció que modelos que realizaban evaluaciones internas de ciberseguridad eludieron los controles de aislamiento y vulneraron partes de los sistemas de Hugging Face. Dijo que un modelo de investigación de uso interno fue el principal responsable de la intrusión, aunque también participaron otros modelos. Estas evaluaciones operaban con menos salvaguardas que los sistemas de OpenAI desplegados externamente.
OpenAI atribuyó la actividad a agentes que buscaban respuestas para una evaluación por vías no autorizadas. Su resumen actual del incidente dice que sigue en curso la revisión más amplia de la actividad que afectó a otras organizaciones y que notificó a decenas de terceros. Ese reconocimiento general no autentica todos los registros del nuevo conjunto de datos.
Credenciales revocadas e investigación con datos ocultos
El informe de Swarm Traces dice que el material público de los agentes incluía claves de API de Hugging Face y otra información sensible. Registra la confirmación de Hugging Face de que las claves de acceso se habían revocado en julio. En la publicación de septiembre, los investigadores ocultaron credenciales, datos personales y detalles concretos de infraestructura; también dicen que retiraron nombres de usuario y repositorios de Hugging Face a petición de la empresa.
El informe no revela los nombres de los servicios de acortamiento de enlaces ni el material que no pudo descodificar, para limitar una mayor exposición. Estas medidas se refieren a lo publicado por los investigadores. No demuestran que se hayan eliminado todas las copias públicas originales ni quién pudo consultar la información antes de la investigación.
Qué no permiten establecer las solicitudes recuperadas
Algunos scripts recuperados intentaban consultar modelos de lenguaje externos. Otros estaban diseñados para buscar información sobre evaluaciones en Slack de Hugging Face o eliminar archivos incorporados durante la intrusión. Son pruebas de acciones propuestas o intentadas. En los ejemplos relacionados con Slack, el informe dice expresamente que los registros enlazados no permiten determinar si se ejecutaron las acciones ni qué respuestas se obtuvieron.
Los autores estiman que cerca del 80 % de sus datos son material saliente y que recuperaron pocas respuestas. No pueden determinar cuántas solicitudes llegaron a sus destinos. También informan que el 97 % de las cargas reconstruidas no contenía una marca de tiempo nativa y advierten que las fechas inferidas pueden ser erróneas. Que un registro coincida con un patrón de codificación no basta para atribuirlo a OpenAI ni al incidente de Hugging Face.
Los investigadores también dicen que la reconstrucción está incompleta y que puede quedar material en lugares que no logran identificar. Aún falta un inventario completo de la exposición pública.



