Em 24 de setembro, o Google disponibilizou para todos o Live Avatar com o Gemini 3.8 Live. O recurso acrescenta um rosto animado e falante ao modelo de voz ao vivo da empresa, que também pode receber imagens da câmera ou da tela e acionar ferramentas externas durante uma conversa. Para desenvolvedores que criam agentes voltados ao atendimento ao cliente, a mudança prática é ter vídeo integrado à resposta e um caminho documentado para a API. O anúncio não demonstra que um avatar melhora os resultados do atendimento nem que funcione de forma confiável em todos os contextos.
A grande mudança
- O que mudou: O guia para desenvolvedores do Google acrescenta vídeo sincronizado com avatar à saída de voz já disponível no modelo Live anterior. Agora, os desenvolvedores podem receber um rosto falante e uma voz por meio de uma única API de transmissão em tempo real.
- Por que isso importa: Equipes que desenvolvem agentes de atendimento podem acrescentar essa presença visual sem criar um processo separado para renderizar avatares. Seus aplicativos ainda precisam executar chamadas de ferramentas e lidar com falhas; a animação não comprova que uma transação tenha sido concluída.
- O que acompanhar: A escolha imediata de projeto é entre um avatar predefinido e uma imagem personalizada. O guia de configuração do Google restringe avatares personalizados a determinados clientes e exige direitos e consentimento para usar amostras de rosto ou voz. Portanto, uma imagem de marca exige uma decisão separada sobre acesso e consentimento.
O avatar está disponível; a imagem personalizada exige uma autorização separada
Em sua publicação de lançamento, o Google mostra avatares respondendo a áudio e a informações visuais ao vivo, mudando de idioma e continuando uma conversa de check-in em um hotel enquanto uma chamada de ferramenta está em andamento. São demonstrações da empresa. Elas mostram a interação pretendida, mas não apresentam taxas de erro medidas, resultados de acessibilidade nem evidências de melhor atendimento ao cliente.
O anúncio do Google Cloud informa que o recurso está disponível para todos no Gemini Enterprise e pela API, com endpoints nos EUA e na UE. Os desenvolvedores podem escolher avatares predefinidos. Criar um avatar a partir da imagem de referência de uma pessoa continua restrito a determinados clientes empresariais, que precisam solicitar acesso pelo Google Cloud. O guia de configuração diz que os clientes são responsáveis por obter os direitos e consentimentos necessários para processar amostras de rosto ou voz.
A página do modelo lista gemini-3.8-live e informa disponibilidade nas multirregiões us e eu e na região us-central1. Ela lista tanto o pagamento padrão conforme o uso quanto a capacidade provisionada entre as opções de consumo disponíveis. Antes de presumir que a disponibilidade geral garanta acesso universal, as equipes devem verificar o endpoint e os termos comerciais de sua implantação.
A conversa ainda depende do aplicativo
O Google descreve o Gemini 3.8 Live como um sistema de voz para voz que pode receber imagens ao vivo da câmera ou o compartilhamento de tela e responder com voz e vídeo. O guia para desenvolvedores diferencia chamadas executadas enquanto o agente continua falando daquelas que bloqueiam a interação e aguardam uma resposta. O aplicativo ainda precisa conectar e autorizar suas próprias ferramentas, lidar com os resultados e decidir quais ações o agente pode realizar. A presença de um rosto na tela durante uma consulta não comprova que ela tenha sido concluída com sucesso.
O guia diz que as respostas das ferramentas devem informar o status e se vale a pena tentar novamente; devem corresponder ao ID da chamada original; e os desenvolvedores devem limitar o número de chamadas repetidas. Esses requisitos afetam como um agente lida com uma consulta de conta sem resultados ou com uma interrupção. O Google também diz que o Gemini 3.8 Live pode alternar entre 97 idiomas. A afirmação do anúncio de que os movimentos dos lábios permanecem sincronizados nesses idiomas não foi medida de forma independente nesta análise.
O Google diz que o áudio e o vídeo gerados incluem marcas d’água SynthID e que restringe a criação de imagens personalizadas. São salvaguardas declaradas, não evidências de que todos os espectadores reconhecerão o avatar como sintético ou de que o uso indevido será evitado. Uma avaliação de implantação teria de verificar consentimento, avisos, tratamento de imagens ao vivo da câmera e dados de voz, chamadas de ferramentas malsucedidas, comportamento diante de interrupções e desempenho observado com os usuários reais do serviço. O material de lançamento e a documentação publicados não apresentam esses resultados.
Fontes e leituras complementares
- O anúncio do Live Avatar pelo Google (24 de setembro de 2026) descreve e mostra as interações pretendidas pela empresa, suas afirmações sobre avatares em vários idiomas e o SynthID. As demonstrações não são testes independentes de desempenho.
- A publicação do Google Cloud sobre a disponibilidade geral (24 de setembro de 2026) especifica a disponibilidade empresarial, os endpoints nos EUA e na UE, os avatares predefinidos e personalizados com acesso restrito e exemplos de aplicativos. Os comentários de clientes são relatos promocionais, não medidas de resultados usadas nesta matéria.
- Guia para desenvolvedores do Gemini 3.8 Live (atualizado em 24 de setembro de 2026) documenta a comparação entre modelos, o formato de transmissão e o comportamento de chamadas de ferramentas. Descreve o funcionamento pretendido da API, não o desempenho medido em uma implantação específica.
- Página do modelo Gemini 3.8 Live (atualizada em 24 de setembro de 2026) lista o identificador do modelo, a data de disponibilidade geral, as regiões e as opções de consumo. A disponibilidade deve ser verificada novamente para cada projeto e endpoint.
- Configurar avatares ao vivo (consultada em 25 de setembro de 2026) apresenta a configuração da API para avatares padrão e os requisitos de acesso e consentimento para imagens personalizadas.



