A Tavus afirma que 26 das 54 pessoas que participaram em videochamadas de um minuto com o novo modelo Griffin-Lite acreditaram ter falado com uma pessoa real. É um resultado marcante de um estudo realizado pela própria Tavus, mas mede as respostas a uma chamada e a uma pergunta específicas. Griffin-Lite continua numa pré-visualização de investigação para testadores selecionados, e a Tavus afirma estar a desenvolver salvaguardas de transparência antes de disponibilizar o modelo aos clientes.

A grande mudança

  • O que mudou: A Tavus orientou a investigação sobre assistentes de vídeo para um sistema que ouve, observa e gera um rosto e uma voz durante a mesma conversa. Nas chamadas curtas realizadas pela empresa, 26 das 54 pessoas acharam que o modelo era uma pessoa.
  • Por que isso importa: Para as equipas que concebem agentes de vídeo, o ritmo da conversa e a expressividade do vídeo podem tornar a interação com a interface mais natural. O mesmo estudo mostra porque é que informar quem telefona de que está a falar com uma IA não pode ser uma consideração de última hora.
  • O que observar: Griffin-Lite está limitado a testadores de investigação selecionados. A Tavus afirma que está a desenvolver funcionalidades de transparência e procedimentos de segurança adicionais; ainda não anunciou o seu formato ou eficácia, o acesso dos clientes nem um preço específico para Griffin.

O que mediu o resultado de 26 em 54

No relato de pesquisa da Tavus de 1º de outubro, os participantes foram informados de que seriam ligados a outra pessoa para uma videochamada de um minuto sobre aquilo por que aguardavam com expectativa nesse ano. Na realidade, o interlocutor era uma persona de IA da Tavus, alimentada por Griffin-Lite. Depois da chamada, os participantes avaliaram a conversa e responderam se tinham pensado que o interlocutor poderia não ser real. A Tavus revelou então que se tratava de uma IA.

Dos 54 participantes que falaram com Griffin-Lite, 26 disseram que o interlocutor era uma pessoa real, cerca de 48%. A Tavus afirma que utilizou o mesmo protocolo com o seu sistema anterior, composto por Phoenix-4.5, Sparrow-2 e Raven-1; nesse grupo, uma pessoa em 41 disse que o interlocutor era humano. São grupos diferentes, não uma comparação antes e depois com as mesmas pessoas. O anúncio não permite concluir como mudaria esta resposta em chamadas mais longas, sobre outros temas ou na utilização quotidiana, quando as pessoas sabem que poderá surgir um agente de IA.

A Tavus descreve o resultado como uma aprovação num teste de Turing de vídeo em tempo real. Esta é a caracterização da empresa para o seu estudo de um minuto, não uma certificação universal de conversa semelhante à humana. A reportagem independente da RuntimeWire sobre o lançamento também descreve a percentagem de 48% como um resultado limitado, obtido pela própria empresa, e refere que a pré-visualização ainda não está disponível aos clientes. O estudo constitui evidência sobre as avaliações dos participantes nas condições declaradas; não representa uma taxa de engano replicada de forma independente.

Um benchmark separado avalia a qualidade da interação

O classificação do NVIDIA VideoFDB atribui a Griffin-Lite uma pontuação de 3,83 em 5 na geração e de 3,73 na perceção. O benchmark utiliza excertos de videochamadas reais e um modelo de linguagem como avaliador, segundo uma grelha de critérios. A geração avalia a adequação da voz, do rosto e do comportamento conversacional do modelo; a perceção avalia as respostas ao áudio e vídeo de uma pessoa. A tabela da NVIDIA coloca Griffin-Lite acima dos sistemas aí listados em ambas as categorias; as pontuações de referência humana são 3,92 e 4,20, respetivamente.

Estas pontuações medem uma tarefa diferente da pergunta aos participantes sobre se consideravam humano o interlocutor. Os conjuntos de comparação e as condições também são diferentes: a tabela de geração inclui sistemas de fala para avatar em cascata, enquanto a tabela de perceção inclui sistemas avaliados com áudio e vídeo ou, em linhas separadas, apenas com áudio. A classificação documenta um resultado segundo a grelha publicada pela NVIDIA. Não valida os 48% do estudo de chamadas da Tavus nem demonstra como Griffin se comportaria num produto de apoio ao cliente, tutoria ou cuidados de saúde.

O que a Tavus afirma sobre o funcionamento do sistema

A Tavus descreve Griffin como uma arquitetura com duas partes. Um modelo conversacional contínuo recebe o áudio e o vídeo de quem telefona e emite instruções sobre o que dizer, quando falar e como se expressar. Os geradores de voz e vídeo em streaming convertem essas instruções numa voz e numa cena em movimento. A empresa afirma que o sistema consegue ouvir enquanto fala, ceder a vez quando alguém o interrompe e reagir ao contexto visual sem esperar que cada turno termine. Estas são descrições técnicas e demonstrações da Tavus; a BIG CHANGE não acedeu à pré-visualização nem mediu o comportamento do sistema.

Esta distinção importa porque um rosto gerado não é toda a interação. Um sistema que reage a pausas, olhares e interrupções poderá alterar se quem telefona sente que foi compreendido ou percebe que está a falar com software. O resultado VideoFDB apresenta uma comparação pontuada do comportamento conversacional segundo um protocolo de benchmark. O estudo da Tavus com participantes observa, de forma mais restrita, as avaliações sobre a identidade do interlocutor. Nenhum substitui evidência pública sobre fiabilidade prolongada, transparência numa implementação real ou consentimento informado dos utilizadores.

Acesso e a decisão que se aproxima

A Tavus afirma que Griffin-Lite está disponível apenas para testadores de pesquisa confiáveis selecionados como pré-visualização de investigação, e não está disponível aos clientes da Tavus. A empresa disponibiliza um formulário para pedir acesso aos testes. Griffin ainda não faz parte da plataforma geral nem da API pública da Tavus, e o anúncio não indica um preço específico para o modelo. Phoenix, Raven e Sparrow continuam a ser opções de produto atuais e distintas.

A empresa afirma que está a trabalhar em funcionalidades de transparência e procedimentos de segurança adicionais antes de uma disponibilização mais ampla. Ainda não publicou uma data, uma descrição detalhada da transparência nem evidências de que estas medidas sejam eficazes. Para quem avalia um agente de vídeo em tempo real, a questão imediata é concreta: como saberá quem ou o que está do outro lado e como será essa informação verificada antes de Griffin se tornar um produto para clientes?

Fontes e leituras adicionais