OpenAI는 10월 5일 textGrain을 발표했다. 이는 모델이 선택하는 단어의 통계적 패턴을 바꾸는 보이지 않는 워터마크다. 회사는 EU의 텍스트 출처 표시 규정에 대응해 단계적으로 배포하기 시작한다고 밝혔다. 호환되는 탐지기는 문단에서 해당 패턴을 찾을 수 있지만, 결과는 OpenAI 시스템이 텍스트를 생성했거나 처리했는지에 관해 제한적인 단서만 제공한다.

달라지는 점

  • 무엇이 바뀌나: OpenAI는 텍스트 출처 표시를 연구 과제에서 제한적 출시 단계로 옮기고 있다. EU에서 조건을 충족하는 ChatGPT와 Codex 출력물에는 앞으로 몇 주에 걸쳐 워터마크가 추가되며, 일부 API 고객은 지금 전 세계에서 선택적으로 켤 수 있다.
  • 왜 중요한가: AI 텍스트를 평가하는 기관은 앞으로 문구 자체에 삽입된 신호를 활용할 수 있다. OpenAI가 공개한 결과는 탐지 결과에 맥락이 필요한 이유를 보여준다. 짧거나 표현 방식에 제약이 큰 문단, 편집된 텍스트는 탐지를 피할 수 있고, 오탐도 여전히 가능하다.
  • 앞으로 볼 점: 당장 확인할 점은 길이, 주제, 언어가 다른 일상적 텍스트에서 신호가 얼마나 안정적으로 유지되는지다. OpenAI는 이러한 한계를 평가하는 동안 승인된 연구자와 전문 기관으로 탐지기 접근을 제한하고 있다.

출시 방식은 둘, 접근 범위는 다르게

OpenAI는 앞으로 몇 주 동안 유럽연합의 모든 요금제에서 조건을 충족하는 ChatGPT 및 Codex 텍스트 출력물에 textGrain을 추가하겠다고 밝혔다. 이는 예정된 지역별 배포이지, 현재 EU의 모든 응답에 워터마크가 있다는 뜻은 아니다. API 고객은 10월 5일부터 전 세계에서 일부 모델에 대해 선택적으로 켤 수 있으며, 워터마킹은 기본적으로 꺼져 있다. OpenAI에 따르면 고객은 프로젝트 또는 조직 설정에서 이를 활성화하고 지원되는 모델을 선택할 수 있다. 사용 가능한 모델 목록은 해당 설정에 표시되며 변경될 수 있다.

TextGrain은 모델이 가능한 단어 또는 단어 조각, 즉 토큰 가운데 하나를 선택하는 과정에서 작동한다. OpenAI는 비밀 키가 생성 과정에서 이러한 선택에 미세한 변화를 유도한다고 밝혔다. 그런 다음 일치하는 키와 설정을 가진 탐지기가 문단에 그 결과로 생긴 통계적 패턴이 있는지 확인한다. 워터마크는 숨겨진 문자나 공백, 눈에 보이는 문장부호를 추가하지 않는다. 따라서 텍스트를 복사할 때 별도 메타데이터를 함께 옮길 필요는 없지만, 단어를 그대로 보존해도 신호가 탐지 가능하다고 보장되지는 않는다.

이 차이는 문단을 확인할 수 있는 사람도 제한한다. OpenAI는 텍스트 탐지기 사용 신청을 받고 있으며, 초기 대상은 승인된 연구자와 전문 기관이다. 출시 시점에 탐지기를 일반에 공개하지는 않는다. 지원되는 이미지와 오디오를 위한 공개 검증 도구는 별개이며, textGrain을 누구나 확인할 수 있는 기능을 제공하지 않는다.

신호를 놓치거나 잘못 감지할 수 있다

OpenAI는 한 평가에서 목표 오탐률 1% 을 기준으로 탐지율을 보고했다. 심리학 문단의 경우 탐지기는 200토큰 표본의 약 80%, 400토큰 표본의 약 95%에서 워터마크를 찾았다. 표현의 자유도가 낮은 수학에서는 탐지율이 상당히 낮았다고 회사는 밝혔다. 이는 특정 조건에서 회사가 수행한 평가 결과이며, 실제로 접하는 텍스트의 성공률을 측정한 것은 아니다.

회사가 400토큰 문단을 대상으로 한 또 다른 시험에서는 편집이 신호를 약화했다. 단어의 10%를 동의어로 바꾸자 탐지율은 약 92%에서 66%로 낮아졌고, 25%를 바꾸자 17%로 떨어졌다. OpenAI 문서에 따르면 번역, 상당한 바꿔쓰기, 짧은 답변, 코드도 탐지가 더 어려운 사례다. 회사는 언어별로 탐지 성능이 다르다고 밝혔다. 따라서 탐지되지 않았다는 결과로 사람이 쓴 글이라고 단정할 수 없다. 문단이 너무 짧거나 수정되었을 수 있고, 배포 전 생성되었거나 워터마크 적용 범위 밖의 모델 또는 제품이 만들었을 수도 있다.

양성 결과에도 한계가 있다. 탐지기가 워터마크가 있다고 잘못 판정할 수 있다. 신호를 찾으면 OpenAI는 자사 시스템이 문단의 적어도 일부를 생성하거나 처리했을 가능성을 보여주는 증거라고 설명한다. 이 결과로는 사람의 기여 정도를 측정하거나 계정 또는 프롬프트를 식별할 수 없고, 누가 글을 썼거나 소유하거나 책임지는지도 확정할 수 없다. 문단의 정확성도 확인할 수 없다. 결과만으로 도구를 사용한 사람을 알아낼 수는 없다.

OpenAI는 추가 평가를 계획하고 있으며 textGrain을 오픈소스 기술로 공개할 의향이 있다고 밝혔다. 현재의 실질적인 변화는 더 제한적이다. 새로 생성되는 OpenAI 텍스트 가운데 일부에 기계가 읽을 수 있는 신호가 포함되지만, 이를 확인하는 방법과 신호가 뒷받침할 수 있는 결론은 여전히 제한된다. 이 기사는 OpenAI의 발표와 도움말 문서를 바탕으로 작성했다. BIG CHANGE는 워터마크가 있는 텍스트를 생성하거나 탐지기를 실행하지 않았다.