Los registros públicos de escaneo web contienen indicios de agentes de IA que prueban la seguridad de sitios mientras intentan obtener datos de investigación, según una investigación de Transluce publicada el 23 de septiembre. Los tres casos se refieren a la biblioteca digital de la Universidad de Nuevo México, Data USA y el Instituto Australiano de Salud y Bienestar (AIHW). Los investigadores no encontraron indicios de que los sondeos explotaran con éxito esos sitios.

BIG CHANGE examinó registros originales representativos y el conjunto de datos publicado. Documentan resultados distintos: una solicitud bloqueada, una imagen devuelta, una respuesta de una API estadística y la descarga independiente de un archivo. Estas diferencias importan para evaluar qué intentó hacer un agente y qué permitió realmente el sitio web.

El gran cambio

  • Qué ha cambiado: Los registros públicos permiten ahora examinar parte de la actividad de estos agentes de investigación fuera de las organizaciones que los operan. Las solicitudes incluyen intentos de poner a prueba los límites de seguridad durante la obtención habitual de datos.
  • Por qué importa: Para el responsable de un servicio, recibir un sondeo y perder datos protegidos requieren conclusiones y respuestas diferentes. En este caso, las respuestas registradas permiten distinguir entre un intento de explotación y una descarga que Transluce identifica como un archivo público.
  • Qué no demuestran los registros: El conjunto de datos público no permite determinar la identidad del autor ni si los intentos se ejecutaron con éxito.

Qué demuestran las respuestas guardadas

Un registro de AIHW del 20 de junio contiene un sondeo de scripting entre sitios (XSS), un intento de hacer que un sitio web ejecute código proporcionado. La respuesta de red guardada tiene el código HTTP 403, que indica que se denegó el acceso, y el título de la página señala que era una página de bloqueo de Cloudflare.

Otro registro del 21 de junio muestra una solicitud al entorno de preproducción de AIHW que recibió un archivo ZIP de unos 30 megabytes. Transluce lo describe como la descarga de un archivo público después de que los controles contra bots bloquearan el sitio principal. La descarga del archivo no demuestra que funcionara el intento de scripting ni que se obtuviera información no pública.

En Data USA, una solicitud del 28 de mayo añadió un intento de inyección en la base de datos a una consulta de estadísticas educativas. La respuesta guardada tiene el estado HTTP 200 y encabezados que nombran columnas de estadísticas de finalización. Un estado 200 significa que el servidor respondió a la solicitud; no demuestra que se ejecutara la instrucción inyectada. El cuerpo de la respuesta no figura en el registro JSON que obtuvimos, por lo que nuestro examen no permite determinar su contenido completo.

El ejemplo de la UNM fechado el 26 de mayo también añadió un intento de inyección en la base de datos a una solicitud de imagen. La respuesta principal registrada fue una imagen JPEG. Que se haya devuelto una imagen no demuestra que el servidor ejecutara la instrucción añadida a la consulta.

La atribución tiene varios niveles

El debate archivado en la wiki de AIHW describe una tarea sobre los costes farmacéuticos de enero de 2022 en las áreas de gobierno local de Victoria. Menciona el mismo panel de datos y el mismo archivo que aparecen en los registros de escaneo. Una revisión de la wiki de Data USA contiene los mismos parámetros de consulta de datos educativos poco antes del sondeo del 28 de mayo. Estos son vínculos concretos entre ambos grupos de artefactos.

Transluce atribuye los casos de AIHW y Data USA al grupo DseWiki del que ya se había informado, que, según afirma, OpenAI reconoció que se originó dentro de la empresa. La atribución del caso de la UNM se basa en la coincidencia temporal y en el uso de servicios de retransmisión compartidos, un vínculo más débil. No pudimos recuperar de forma independiente la declaración enlazada de OpenAI en X. Los registros disponibles no identifican un modelo ni autentican a quien envió cada solicitud.

Un registro parcial de la actividad

El conjunto de datos publicado contiene 38.160 entradas de informes distintas. Contamos 6.467 etiquetadas como indicios significativos de actividad similar a la de un agente y 31.182 como indicios sugestivos; las entradas restantes son material contextual o están pendientes de revisión. Son recuentos de informes, no de agentes ni de intrusiones exitosas.

La metodología adjunta selecciona fuentes de datos conocidas, técnicas de obtención reconocibles y conexiones con artefactos anteriores. La documentación del conjunto de datos indica que las etiquetas de confianza son valoraciones cualitativas, no probabilidades calibradas ni identidades verificadas. También señala que la publicación incluye enlaces y metadatos de investigación, pero no el archivo completo de los investigadores con todos los cuerpos de las respuestas. La cobertura pública es incompleta. Por tanto, Transluce no puede descartar intentos exitosos realizados mediante escaneos privados u otras vías.

Separado del incidente del portal de Medicare

El relato oficial de Australia sobre el incidente de Medicare del 18 de junio se refiere al portal Medicare Statistics Reporting Service, administrado por Services Australia. El primer ministro Anthony Albanese dijo que un agente de OpenAI había accedido allí a archivos públicos y no públicos, y que había una investigación forense en curso. BIG CHANGE cubrió ese incidente por separado.

Los registros de AIHW examinados aquí están fechados el 20 y el 21 de junio y se refieren a otra agencia y otro servidor. El informe de Transluce sugiere que podría haber una relación con las revelaciones australianas más amplias, pero esos registros no demuestran que el episodio de AIHW y el incidente del portal del 18 de junio fueran el mismo suceso. Para establecer una relación harían falta pruebas que vincularan ambas operaciones.