5 октября OpenAI объявила о textGrain — невидимом водяном знаке, который меняет статистическую закономерность выбора слов её моделями. Компания сообщает о поэтапном запуске в ответ на правила ЕС о происхождении текста. Совместимый детектор может искать такую закономерность в отрывке, но результат лишь в ограниченной степени указывает на то, что текст сгенерировала или обработала система OpenAI.

Главное изменение

  • Что изменилось: OpenAI переходит от исследования происхождения текста к ограниченному запуску. В ближайшие недели водяной знак появится в подходящих ответах ChatGPT и Codex в ЕС; отдельные клиенты API уже могут включить его по всему миру.
  • Почему это важно: У организаций, проверяющих тексты ИИ, со временем может появиться встроенный в формулировки сигнал. Опубликованные результаты OpenAI показывают, почему выводам детектора нужен контекст: короткие или жёстко ограниченные по формулировкам фрагменты и отредактированный текст могут не пройти проверку, а ложные срабатывания по-прежнему возможны.
  • За чем следить: Сначала предстоит проверить, насколько надёжно сигнал сохраняется при обычном использовании текстов разной длины, тематики и на разных языках. Пока OpenAI оценивает ограничения, доступ к детектору получают только одобренные исследователи и профильные организации.

Два запуска — разные условия доступа

OpenAI сообщает, что добавит textGrain к ответам ChatGPT и Codex которые соответствуют требованиям на всех тарифах в Европейском союзе в ближайшие недели. Это планируемое региональное внедрение, а не утверждение, что водяной знак уже есть в каждом ответе в ЕС. Клиенты API по всему миру могут включать его для отдельных моделей с 5 октября; по умолчанию функция выключена. По словам OpenAI, её можно включить в настройках проекта или организации и выбрать поддерживаемые модели. Список подходящих моделей отображается в этих настройках и может меняться.

TextGrain работает за счёт выбора модели из возможных слов или частей слов, которые называются токенами. По словам OpenAI, секретный ключ направляет небольшие изменения такого выбора во время генерации. Затем детектор с соответствующим ключом и настройками проверяет, присутствует ли в отрывке получившаяся статистическая закономерность. Водяной знак не добавляет скрытых символов, пробелов или видимых знаков препинания. Поэтому при копировании текста не нужно переносить отдельные метаданные, однако сохранение всех слов без изменений не гарантирует, что сигнал удастся обнаружить.

Это различие также ограничивает круг тех, кто может проверить отрывок. OpenAI принимает заявки на доступ к текстовому детектору, первоначально — от одобренных исследователей и профильных организаций. На старте компания не откроет его для широкой публики. Её общедоступные инструменты проверки поддерживаемых изображений и аудио работают отдельно и не позволяют свободно проверить textGrain.

Сигнал можно пропустить или обнаружить ошибочно

OpenAI сообщает о показателях обнаружения при целевом уровне ложных срабатываний 1% в одной оценке. В психологических текстах детектор находил водяной знак примерно в 80% образцов длиной 200 токенов и примерно в 95% образцов длиной 400 токенов. По данным компании, для математики, где меньше свободы в формулировках, показатель обнаружения был заметно ниже. Это результаты внутренней оценки компании в заданных условиях, а не измеренная доля успеха на текстах из реального мира.

В другом тесте компании на отрывках длиной 400 токенов правки ослабляли сигнал: замена 10% слов синонимами снизила обнаружение примерно с 92% до 66%, а замена 25% — до 17%. В документации OpenAI также отмечает, что сложнее проверять переводы, существенный пересказ, короткие ответы и код. Компания говорит, что точность обнаружения зависит от языка. Поэтому отрицательный результат не доказывает, что текст написал человек. Отрывок мог быть слишком коротким, изменённым, созданным до запуска функции или сгенерированным моделью либо продуктом, на который водяной знак не распространяется.

У положительного результата тоже есть ограничения. Детектор может ошибочно сообщить о водяном знаке. Если сигнал найден, OpenAI считает это свидетельством того, что её система, вероятно, сгенерировала или обработала хотя бы часть отрывка. Результат не измеряет вклад человека, не устанавливает аккаунт или запрос и не определяет, кто написал текст, кому он принадлежит и кто за него отвечает. Проверить точность отрывка он тоже не может. По одному результату нельзя установить, кто пользовался инструментом.

OpenAI планирует продолжить оценку и заявляет о намерении выпустить textGrain как технологию с открытым исходным кодом. Пока практическое изменение скромнее: некоторые новые тексты, сгенерированные OpenAI, будут содержать машиночитаемый сигнал, но способы его проверки и выводы, которые он позволяет сделать, остаются ограниченными. Наш материал основан на объявлении и справочной документации OpenAI; BIG CHANGE не генерировал текст с водяным знаком и не запускал детектор.