Tavus는 새 모델 Griffin-Lite와 1분 화상 통화를 한 54명 중 26명이 실제 사람과 대화했다고 믿었다고 밝혔다. 이는 Tavus가 직접 수행한 연구에서 나온 눈에 띄는 결과지만, 특정 통화와 질문에 대한 반응을 측정한 것이다. Griffin-Lite는 여전히 일부 테스터를 위한 연구 미리보기이며, Tavus는 고객이 사용하기 전에 AI임을 알리는 보호 장치를 개발 중이라고 말한다.

큰 변화

  • 달라진 점: Tavus는 같은 대화 중에 듣고, 보고, 얼굴과 음성을 생성하는 시스템으로 영상 비서 연구를 발전시켰다. 회사가 짧게 진행한 통화에서 54명 중 26명은 모델을 사람이라고 믿었다.
  • 왜 중요한가: 영상 에이전트를 설계하는 팀에게 대화의 타이밍과 표현력 있는 영상은 인터페이스를 더 쉽게 이용하도록 도울 수 있다. 동시에 이 연구는 통화 상대가 AI라는 사실을 알리는 일을 뒤로 미뤄서는 안 되는 이유도 보여준다.
  • 앞으로 볼 점: Griffin-Lite는 선별된 연구 테스터에게만 제공된다. Tavus는 AI 고지 기능과 추가 안전 절차를 개발 중이라고 밝혔지만, 그 형태와 효과, 고객 이용 가능 시점, Griffin 전용 가격은 아직 발표하지 않았다.

26명 중 54명이라는 결과가 측정한 것

Tavus의 10월 1일 연구 설명에서 참가자들은 올해 기대하는 일을 주제로 다른 참가자와 1분간 화상 통화를 하게 된다고 안내받았다. 실제 상대는 Griffin-Lite로 구동되는 Tavus AI 페르소나였다. 통화가 끝난 뒤 참가자들은 대화에 점수를 매기고 상대가 실제 인물이 아닌지 의심했는지 질문을 받았다. 그다음 Tavus는 상대가 AI였다고 밝혔다.

Griffin-Lite 참가자 54명 가운데 26명, 약 48%는 상대가 실제 사람이라고 답했다. Tavus는 이전 시스템인 Phoenix-4.5, Sparrow-2, Raven-1에도 같은 절차를 사용했으며, 그 집단 41명 가운데 한 명이 상대를 사람이라고 답했다고 밝혔다. 이는 서로 다른 통화 참가자 집단의 결과이지, 같은 사람들을 대상으로 한 전후 비교가 아니다. 발표는 더 긴 통화나 다른 주제, 또는 AI 에이전트가 등장할 수 있음을 사람들이 아는 일상적 사용에서 이런 응답이 어떻게 달라질지는 밝히지 않는다.

Tavus는 이 결과를 실시간 영상 튜링 테스트의 통과라고 표현한다. 이는 1분 연구에 대한 회사의 설명이지, 인간처럼 대화한다는 보편적 인증은 아니다. RuntimeWire의 독립적인 출시 보도 마찬가지로 48%라는 수치를 소규모 회사 주도 연구의 결과로 다루며, 미리보기가 여전히 고객에게 제공되지 않는다고 전한다. 이 연구는 명시된 조건 아래 참가자가 내린 판단에 관한 증거다. 독립적으로 반복 검증한 기만률은 아니다.

별도 벤치마크는 상호작용 품질을 시험한다

NVIDIA와 David AI의 VideoFDB 순위표는 Griffin-Lite에 생성 점수 5점 만점에 3.83점, 인지 점수 3.73점을 준다. 이 벤치마크는 실제 화상 통화의 영상 클립과 루브릭에 따른 언어 모델 평가자를 사용한다. 생성 평가는 모델의 음성, 얼굴, 대화 행동이 적절한지를 측정하고, 인지 평가는 사람의 음성과 영상에 대한 모델의 반응을 측정한다. NVIDIA 표에서 Griffin-Lite는 두 부문 모두 기재된 시스템보다 높은 점수를 받았으며, 사람 기준 점수는 각각 3.92점과 4.20점이다.

이 점수는 통화 상대를 사람이라고 생각했는지 묻는 것과 다른 과제를 측정한다. 비교 대상과 조건도 다르다. 생성 부문 표에는 음성에서 아바타를 만드는 단계형 시스템이 포함되고, 인지 부문 표에는 음성과 영상을 함께 평가한 시스템과 별도 행의 음성만 평가한 시스템이 포함된다. 순위표는 NVIDIA가 공개한 평가 기준에서 나온 결과를 뒷받침한다. Tavus의 통화 연구에서 나온 48% 수치를 검증하거나 Griffin이 고객 서비스, 과외 또는 의료 제품으로서 어떤 성능을 보일지 입증하지 않는다.

Tavus가 설명하는 시스템의 작동 방식

Tavus는 Griffin을 두 부분으로 이루어진 설계라고 설명한다. 연속 대화 모델은 통화 상대의 음성과 영상을 입력받아 무엇을 말하고 언제 말할지, 어떻게 표현할지 제어 신호를 낸다. 스트리밍 음성 및 영상 생성기는 이 제어 신호를 음성과 움직이는 장면으로 바꾼다. 회사는 시스템이 말하는 중에도 들을 수 있고, 끼어들면 발화를 양보하며, 매번 대화 차례가 끝날 때까지 기다리지 않고 시각적 맥락에 반응한다고 말한다. 이는 Tavus가 설명하고 시연한 기술이다. BIG CHANGE는 미리보기에 접근하거나 작동 방식을 측정하지 않았다.

이 구분이 중요한 이유는 생성된 얼굴만으로 전체 상호작용이 결정되지 않기 때문이다. 멈춤, 시선, 끼어들기에 반응하는 시스템이라면 통화 상대가 이해받는다고 느끼는지, 아니면 소프트웨어와 대화하고 있음을 알아차리는지가 달라질 수 있다. VideoFDB 결과는 벤치마크 절차 아래 대화 행동을 점수화해 비교한다. Tavus의 사람 대상 통화 연구는 정체성 판단을 좁게 관찰한다. 어느 쪽도 지속적인 신뢰성, 실제 배포 중의 고지, 사용자의 충분한 동의에 관한 공개 증거를 대신하지 않는다.

이용 조건과 다음 결정

Tavus에 따르면 일부 신뢰할 수 있는 테스터만 접근 가능한 Griffin-Lite 연구 미리보기이며 Tavus 고객은 이용할 수 없다. 회사는 테스트 신청 양식을 제공한다. Griffin은 아직 일반 플랫폼이나 공개 API에 포함되지 않았고, 발표에는 Griffin 전용 가격이 없다. 기존 Phoenix, Raven, Sparrow 모델은 별도의 현재 제품 경로로 남아 있다.

회사는 더 넓게 공개하기 전에 AI 고지 기능과 추가 안전 절차를 마련 중이라고 밝혔다. 하지만 날짜나 구체적인 고지 설계, 조치가 효과적이라는 증거는 공개하지 않았다. 실시간 영상 에이전트를 평가하는 사람이라면 당장 물어야 할 질문은 구체적이다. Griffin이 고객용 제품이 되기 전에 통화 상대가 상대방이 누구 또는 무엇인지 어떻게 알게 되며, 이를 어떻게 확인할 것인가?

출처 및 추가 읽을거리