A Google disponibilizou o Live Avatar de forma geral com o Gemini 3.8 Live a 24 de setembro. A funcionalidade acrescenta um rosto animado e falante ao modelo de voz em tempo real da empresa, que também pode receber imagens de uma câmara ou de um ecrã e chamar ferramentas externas durante uma conversa. Para os programadores de agentes de atendimento ao cliente, a mudança prática é a integração de saída de vídeo e uma via documentada de acesso à API. O anúncio não demonstra que um avatar melhore os resultados do serviço ou funcione de forma fiável em todos os contextos.
A grande mudança
- O que mudou: O guia para programadores da Google acrescenta vídeo sincronizado do avatar à saída de voz já disponibilizada pelo modelo Live anterior. Os programadores podem agora obter um rosto falante e voz através de uma única API de transmissão em tempo real.
- Porque é importante: As equipas que desenvolvem agentes de atendimento ao cliente podem acrescentar essa presença visual sem criar um sistema de geração de avatares em separado. As aplicações continuam a executar as chamadas a ferramentas e a gerir falhas; a animação não demonstra que uma transação tenha sido concluída.
- O que importa acompanhar: A decisão imediata de conceção é escolher entre um avatar predefinido e uma imagem personalizada. O guia de configuração da Google restringe os avatares personalizados a determinados clientes e exige direitos e consentimento para utilizar amostras de rosto ou voz. Por isso, adotar uma imagem de marca exige uma decisão separada sobre acesso e consentimento.
O avatar está disponível; a criação de uma imagem personalizada tem um processo de acesso separado
Na sua publicação de lançamento, a Google mostra avatares a responder a áudio e imagens em tempo real, a mudar de idioma e a continuar uma conversa de registo num hotel enquanto é executada uma chamada a uma ferramenta. São demonstrações da empresa. Ilustram a interação pretendida, mas não apresentam taxas de erro medidas, resultados de acessibilidade nem provas de melhor atendimento ao cliente.
O anúncio da Google Cloud indica que a funcionalidade está disponível de forma geral no Gemini Enterprise e através da API, com pontos de acesso nos EUA e na UE. Os programadores podem escolher entre avatares predefinidos. A criação de um avatar a partir da imagem de referência de uma pessoa continua limitada a determinados clientes empresariais, que têm de solicitar acesso através da Google Cloud. O guia de configuração indica que os clientes são responsáveis por obter os direitos e consentimentos necessários para tratar amostras de rosto ou voz.
A página do modelo apresenta o identificador gemini-3.8-live e disponibilidade na multirregião us e na multirregião eu e na região us-central1. Indica também que são suportadas as opções de consumo de pagamento conforme a utilização e de capacidade aprovisionada. Antes de presumirem que a disponibilidade geral significa acesso universal, as equipas devem verificar o ponto de acesso e as condições comerciais aplicáveis à sua implementação.
A conversa continua a depender da aplicação
A Google descreve o Gemini 3.8 Live como um sistema de conversão de fala em fala que pode receber imagens em tempo real da câmara ou a partilha do ecrã e devolver voz e vídeo. O guia para programadores distingue as chamadas executadas enquanto o agente continua a falar das chamadas bloqueantes, que aguardam uma resposta. A aplicação continua a ter de ligar e autorizar as suas próprias ferramentas, tratar os resultados e decidir que ações o agente pode executar. O facto de um rosto continuar visível durante uma consulta não demonstra que esta tenha sido concluída com êxito.
O guia indica que as respostas das ferramentas devem comunicar um estado e dizer se faz sentido tentar de novo; têm de corresponder ao ID da chamada original e os programadores devem limitar chamadas repetidas. Estes requisitos influenciam, por exemplo, a forma como um agente responde quando uma consulta a uma conta não devolve resultados ou é interrompida. A Google afirma também que o Gemini 3.8 Live pode alternar entre 97 idiomas. Neste artigo, não foi verificada de forma independente a afirmação do anúncio de que os movimentos dos lábios permanecem sincronizados em todos esses idiomas.
A Google afirma que o áudio e o vídeo gerados têm marcas de água SynthID e restringe a criação de imagens personalizadas. São salvaguardas declaradas, não provas de que todos os espectadores reconhecerão o avatar como sintético ou de que se evitará a utilização indevida. Uma avaliação da implementação teria de verificar o consentimento, a divulgação, o tratamento dos dados de voz e da câmara em tempo real, as falhas nas chamadas a ferramentas, o comportamento perante interrupções e o desempenho observado com os utilizadores reais. Os materiais de lançamento e a documentação publicados não apresentam esses resultados.
Fontes e leituras complementares
- Publicação da Google sobre o Live Avatar (24 de setembro de 2026), que descreve e mostra as interações pretendidas pela empresa e as afirmações sobre avatares multilingues e SynthID. As demonstrações não são testes independentes de desempenho.
- Publicação da Google Cloud sobre a disponibilidade geral (24 de setembro de 2026), especifica a disponibilidade empresarial, os pontos de acesso nos EUA e na UE, os avatares predefinidos e personalizados sujeitos a autorização e exemplos de aplicações. Os comentários dos clientes são testemunhos promocionais, não medições de resultados utilizadas neste artigo.
- Guia para programadores do Gemini 3.8 Live (atualizado a 24 de setembro de 2026), documenta a comparação entre modelos, o formato de transmissão e o comportamento das chamadas a ferramentas. Descreve o funcionamento previsto da API, não o desempenho medido numa implementação específica.
- Página do modelo Gemini 3.8 Live (atualizada a 24 de setembro de 2026), apresenta o ID do modelo, a data de disponibilidade geral, as regiões e as opções de consumo. A disponibilidade para cada projeto e implementação deve ser verificada separadamente.
- Configurar avatares em tempo real (consultado a 25 de setembro de 2026), explica a configuração da API para avatares predefinidos e os requisitos de acesso e consentimento para imagens personalizadas.



