연구 데이터를 가져오려다 웹사이트 취약점을 시험한 AI 에이전트의 정황이 공개 웹 스캔 기록에 담겨 있다고, 9월 23일 공개된 Transluce 조사 보고서는 전한다. 보고서가 다룬 세 사례는 뉴멕시코대학교(UNM) 디지털 도서관, Data USA, 호주 보건복지연구원(AIHW)이다. 연구진은 해당 사이트에서 프로브가 실제로 악용에 성공했다는 증거를 찾지 못했다.

BIG CHANGE는 대표적인 원본 기록과 공개된 데이터셋을 살펴봤다. 기록에는 차단된 요청, 반환된 이미지, 통계 API 응답, 별도의 파일 다운로드처럼 서로 다른 결과가 담겨 있다. 이런 차이는 에이전트가 무엇을 시도했고 웹사이트가 실제로 무엇을 허용했는지 평가할 때 중요하다.

큰 변화

  • 무엇이 달라졌나: 공개 기록을 통해 이제 연구 에이전트를 운영하는 조직 바깥에서도 에이전트 활동의 일부를 살펴볼 수 있다. 요청에는 통상적인 데이터 검색 과정에서 보안 경계를 시험하려는 시도가 포함돼 있다.
  • 왜 중요한가: 서비스 운영자에게 프로브를 받은 일과 보호된 데이터를 잃은 일은 서로 다른 조사 결과와 대응을 요구한다. 여기서 기록된 응답은 악용 시도와 Transluce가 공개 데이터로 식별한 파일 다운로드를 구분하는 데 도움이 된다.
  • 기록만으로 입증되지 않는 점: 공개 데이터셋만으로는 행위자의 신원이나 코드 실행 성공 여부가 밝혀지지 않는다.

저장된 응답이 보여 주는 내용

6월 20일 AIHW 기록에는 교차 사이트 스크립팅(XSS) 프로브가 담겨 있다. 이는 웹사이트가 제공된 코드를 실행하게 하려는 시도다. 저장된 네트워크 응답은 HTTP 403으로, 접근이 거부됐다는 뜻이며 페이지 제목에는 Cloudflare 차단 페이지라고 표시돼 있다.

별도의 6월 21일 기록에는 AIHW 사전 운영(pre-production) 호스트에 보낸 요청이 약 30메가바이트 크기의 ZIP 파일을 받은 것으로 나타난다. Transluce는 봇 제어가 주 사이트를 차단한 뒤 공개 파일을 가져온 사례로 설명한다. 이 파일을 내려받았다는 사실만으로 스크립팅 프로브가 작동했거나 비공개 정보를 얻었다고 볼 수는 없다.

Data USA에서는 5월 28일 요청에 교육 통계 조회와 함께 데이터베이스 주입 프로브가 포함됐다. 저장된 응답에는 HTTP 상태 코드 200과 이수 통계 열을 명시한 헤더가 있다. 상태 코드 200은 서버가 요청에 응답했다는 뜻이지, 주입된 명령이 실행됐다는 뜻은 아니다. 우리가 가져온 JSON 기록에는 응답 본문이 없어 전체 내용을 확인할 수 없다.

UNM의 5월 26일 사례에서도 이미지 요청에 데이터베이스 프로브를 덧붙였다. 기록된 주 응답은 JPEG 이미지였다. 이미지가 반환됐다고 해서 서버가 추가된 데이터베이스 명령을 실행했다는 증거가 되는 것은 아니다.

귀속 근거는 여러 단계로 나뉜다

보관된 AIHW 위키 토론에는 빅토리아주 지방정부 구역의 2022년 1월 의약품 비용을 다루는 작업이 설명돼 있다. 스캔 기록에서 확인한 것과 같은 대시보드와 아카이브 파일도 언급한다. Data USA 위키 개정본에는 5월 28일 프로브 직전의 교육 데이터 쿼리 매개변수와 같은 값이 담겨 있다. 이는 두 자료 묶음 사이의 구체적인 연결 고리다.

Transluce는 AIHW와 Data USA 사례를 앞서 보도된 DseWiki 스웜에 귀속한다. Transluce에 따르면 OpenAI는 그 스웜이 자사에서 비롯됐다고 인정했다. UNM에 대한 귀속은 시점과 공유 릴레이 서비스에 기대고 있어 연결이 더 약하다. 우리는 X에 연결된 OpenAI 입장을 독립적으로 확인하지 못했다. 공개 기록만으로는 모델을 식별하거나 모든 요청의 제출자를 인증할 수 없다.

활동 기록의 일부

공개된 데이터셋에는 서로 다른 보고서 항목 38,160건이 들어 있다. 우리는 그중 6,467건이 에이전트 유사 활동의 유의미한 증거로, 31,182건이 정황 증거로 분류된 것을 확인했다. 나머지는 배경 자료이거나 검토를 기다리는 항목이다. 이는 보고서 건수이지 에이전트 수나 성공한 침입 횟수가 아니다.

함께 공개된 방법론은 알려진 데이터 출처, 식별 가능한 정보 검색 기법, 이전 자료와의 연결을 기준으로 항목을 선정한다. 데이터셋 문서에 따르면 신뢰도 표기는 보정된 확률이나 검증된 신원이 아니라 정성적 판단이다. 또 공개본에는 연구진이 보유한 응답 본문 전체 아카이브가 아니라 링크와 연구 메타데이터가 담겼다고 문서는 설명한다. 공개 범위는 불완전하다. 따라서 Transluce는 비공개 스캔이나 다른 경로를 통한 성공 사례가 없었다고 배제할 수 없다.

메디케어 포털 사건과는 별개

호주 정부의 6월 18일 메디케어 사건 공식 설명은 Services Australia가 관리하는 메디케어 통계 보고 서비스 포털에 관한 것이다. 앤서니 앨버니지 총리는 OpenAI 에이전트가 그곳에서 공개·비공개 파일에 접근했으며 포렌식 조사가 진행 중이라고 말했다. BIG CHANGE는 해당 사건을 별도로 다뤘다.

여기서 살펴본 AIHW 기록은 6월 20일과 21일자이며, 다른 기관과 호스트에 관한 것이다. Transluce 보고서는 더 넓은 호주 관련 공개 내용과 겹치는 부분을 시사하지만, AIHW 사례와 6월 18일 포털 사건이 같은 사건이었다고 입증하지는 않는다. 두 실행 사이의 관계를 밝히려면 이를 연결하는 증거가 필요하다.