По словам Tavus, во время минутных видеозвонков с новой моделью Griffin-Lite 26 из 54 человек решили, что разговаривали с настоящим человеком. Это заметный результат исследования самой Tavus, но он отражает реакцию на конкретный звонок и вопрос. Griffin-Lite остаётся исследовательской предварительной версией для отдельных тестировщиков. Tavus сообщает, что разрабатывает меры, позволяющие раскрывать пользователям присутствие ИИ, прежде чем предоставить модель клиентам.

Главное изменение

  • Что изменилось: Tavus продвигает исследования видеоассистентов в сторону системы, которая одновременно слушает, наблюдает и генерирует лицо и голос в ходе одного разговора. В коротких звонках, проведённых компанией, 26 из 54 участников приняли модель за человека.
  • Почему это важно: Для команд, разрабатывающих видеоагентов, подходящий темп беседы и выразительное видео могут сделать взаимодействие удобнее. То же исследование показывает, почему нельзя откладывать на потом уведомление собеседников о том, что они общаются с ИИ.
  • За чем следить: Griffin-Lite доступна только отдельным участникам исследовательского тестирования. Tavus говорит, что разрабатывает способы раскрытия информации и дополнительные процедуры безопасности; их форма и эффективность, доступ для клиентов и специальная цена Griffin пока не объявлены.

Что именно измерял результат 26 из 54

В отчёте Tavus от 1 октября участникам говорили, что их соединят с другим участником для минутного видеозвонка о том, чего они ждут в этом году. Однако собеседником становилась ИИ-персона Tavus на базе Griffin-Lite. После звонка люди оценивали разговор и отвечали, возникало ли у них подозрение, что собеседник ненастоящий. Затем Tavus сообщала, что собеседником был ИИ.

Из 54 участников звонков с Griffin-Lite 26 сказали, что их собеседником был реальный человек, то есть около 48%. Tavus сообщает, что использовала тот же протокол для своих прежних систем Phoenix-4.5, Sparrow-2 и Raven-1; в той группе один из 41 участника сказал, что разговаривал с человеком. Это разные группы звонивших, а не сравнение результатов одних и тех же людей до и после. Объявление не показывает, как ответы изменились бы при более долгих звонках, других темах или обычном использовании, когда люди знают, что им может ответить ИИ-агент.

Tavus называет этот результат прохождением теста Тьюринга для видео в реальном времени. Это описание компанией своего минутного исследования, а не универсальный сертификат человекоподобного общения. В независимом обзоре запуска RuntimeWire число 48% также рассматривается как небольшой результат исследования самой компании; издание отмечает, что предварительная версия ещё недоступна клиентам. Исследование свидетельствует о суждениях участников в заявленных условиях, но не является независимо воспроизведённым измерением того, как часто людей удаётся ввести в заблуждение.

Отдельный бенчмарк оценивает качество взаимодействия

В таблице лидеров NVIDIA VideoFDB Griffin-Lite получила 3,83 балла из 5 за генерацию и 3,73 за восприятие. В бенчмарке используются фрагменты реальных видеозвонков и оценка языковой моделью по установленной шкале. Оценка генерации учитывает уместность голоса, лица и поведения модели в разговоре; оценка восприятия — её ответы на аудио и видео человека. В таблице NVIDIA Griffin-Lite расположена выше перечисленных систем по обоим направлениям; результаты для человеческого эталона составляют 3,92 и 4,20 соответственно.

Эти оценки относятся к другой задаче, чем вопрос звонящим, считают ли они собеседника человеком. Различаются и наборы для сравнения с условиями: таблица генерации включает каскадные системы преобразования речи в аватар, а таблица восприятия — системы, проверенные по аудио и видео либо, в отдельных строках, только по аудио. Таблица лидеров подтверждает результат по опубликованной шкале NVIDIA. Она не подтверждает показатель 48% из исследования видеозвонков Tavus и не показывает, как Griffin работала бы в продуктах для клиентской поддержки, обучения или здравоохранения.

Как, по словам Tavus, работает система

Tavus описывает Griffin как систему из двух частей. Непрерывно работающая разговорная модель принимает аудио и видео собеседника и задаёт параметры того, что сказать, когда говорить и как это выразить. Потоковые генераторы речи и видео превращают эти параметры в голос и движущееся изображение. Компания утверждает, что система может слушать во время собственной речи, уступать слово при перебивании и реагировать на визуальный контекст, не дожидаясь завершения каждого хода. Это техническое описание и демонстрации Tavus; BIG CHANGE не получало доступ к предварительной версии и не измеряло её поведение.

Это различие важно, потому что сгенерированное лицо само по себе не определяет взаимодействие целиком. Система, реагирующая на паузы, взгляд и перебивания, может повлиять на то, почувствует ли собеседник, что его поняли, или осознает, что разговаривает с программой. Результат VideoFDB даёт численное сравнение разговорного поведения по протоколу бенчмарка. Исследование звонков Tavus даёт более узкое наблюдение о том, как участники определяли личность собеседника. Ни то ни другое не заменяет публичных данных о длительной надёжности, раскрытии информации при реальном внедрении или осознанном согласии пользователей.

Доступ и предстоящий выбор

Tavus сообщает, что Griffin-Lite открыта только для отдельных доверенных тестировщиков в рамках исследовательской предварительной версии и недоступна клиентам Tavus. Компания предлагает заполнить форму для запроса тестового доступа. Griffin пока нет на общей платформе или в публичном API Tavus; в объявлении также не указана отдельная цена модели. Существующие модели Phoenix, Raven и Sparrow остаются отдельной линейкой доступных продуктов.

Компания говорит, что до более широкого запуска разрабатывает средства раскрытия информации и дополнительные процедуры безопасности. Дата, подробное описание способов такого раскрытия и доказательства их эффективности не опубликованы. Поэтому для тех, кто оценивает видеоагента реального времени, ближайший вопрос вполне конкретен: как собеседник узнает, кто или что находится на другом конце разговора, и как это проверят до того, как Griffin станет продуктом для клиентов?

Источники и дополнительное чтение