Le 24 septembre, Google a rendu Live Avatar généralement disponible avec Gemini 3.8 Live. Cette fonctionnalité ajoute un visage animé qui parle au modèle vocal en temps réel de l’entreprise, lequel peut aussi recevoir des images de caméra ou le contenu d’un écran et appeler des outils externes pendant une conversation. Pour les développeurs qui conçoivent des agents destinés aux clients, le changement pratique est l’intégration d’une sortie vidéo et l’existence d’une voie d’accès documentée à l’API. L’annonce ne démontre ni qu’un avatar améliore les résultats du service ni qu’il fonctionne de manière fiable dans tous les contextes.

Le grand changement

  • Ce qui change : Le guide destiné aux développeurs ajoute une vidéo d’avatar synchronisée à la sortie vocale déjà proposée dans le modèle Live précédent. Les développeurs peuvent désormais obtenir un visage parlant et une voix au moyen d’une seule API de diffusion en continu.
  • Pourquoi c’est important : Les équipes qui développent des agents de service client peuvent ajouter cette présence visuelle sans créer une chaîne distincte de rendu d’avatar. Leurs applications doivent toujours exécuter les appels d’outils et gérer les échecs ; l’animation ne prouve pas qu’une transaction a abouti.
  • À surveiller : Le premier choix de conception consiste à utiliser un avatar prédéfini ou une ressemblance personnalisée. Le guide de configuration de Google réserve les avatars personnalisés à certains clients et exige qu’ils disposent des droits et du consentement nécessaires pour utiliser des échantillons de visage ou de voix. L’utilisation d’une image de marque personnalisée nécessite donc une décision distincte concernant l’accès et le consentement.

L’avatar est disponible ; l’accès à une ressemblance personnalisée reste soumis à des conditions

Dans son article de lancement, Google montre des avatars qui répondent à des entrées audio et visuelles en direct, changent de langue et poursuivent une conversation d’enregistrement à l’hôtel pendant l’exécution d’un appel d’outil. Il s’agit de démonstrations de l’entreprise. Elles illustrent l’interaction visée, mais ne fournissent ni taux d’erreur mesuré, ni résultat en matière d’accessibilité, ni preuve d’une amélioration du service client.

L’annonce de Google Cloud indique que la fonctionnalité est généralement disponible dans Gemini Enterprise et par l’API, avec des points de terminaison aux États-Unis et dans l’UE. Les développeurs peuvent choisir parmi les avatars prédéfinis. La création d’un avatar à partir de l’image de référence d’une personne reste réservée à certains clients entreprise, qui doivent en demander l’accès par l’intermédiaire de Google Cloud. Le guide de configuration précise que les clients doivent obtenir les droits et consentements nécessaires au traitement d’échantillons de visage ou de voix.

La page du modèle répertorie gemini-3.8-live et sa disponibilité dans les régions multirégionales us et eu, ainsi que dans la région us-central1. Elle indique que le paiement à l’usage standard et le débit provisionné sont tous deux pris en charge. Avant de considérer la disponibilité générale comme un accès universel, les équipes doivent vérifier les conditions commerciales et le point de terminaison associés à leur propre déploiement.

La conversation dépend toujours de l’application

Google décrit Gemini 3.8 Live comme un système de conversion de la parole en parole capable de recevoir des images de caméra en direct ou un partage d’écran et de renvoyer de la parole et de la vidéo. Son guide destiné aux développeurs distingue les appels exécutés pendant que l’agent continue de parler des appels bloquants qui attendent une réponse. L’application doit toujours connecter et autoriser ses propres outils, gérer leurs résultats et décider quelles actions l’agent peut entreprendre. Le fait qu’un visage reste à l’écran pendant une recherche ne prouve pas que celle-ci a abouti.

Le guide indique que les réponses des outils doivent préciser leur statut et s’il est pertinent de réessayer ; elles doivent correspondre à l’identifiant de l’appel d’origine, et les développeurs doivent limiter le nombre d’appels d’outils répétés. Ces exigences influent sur la manière dont l’agent gère une recherche de compte sans résultat ou une interruption. Google indique également que Gemini 3.8 Live peut passer d’une langue à l’autre parmi 97. L’affirmation de l’annonce selon laquelle les mouvements des lèvres restent synchronisés dans ces langues n’a pas été mesurée de manière indépendante ici.

Selon Google, l’audio et la vidéo générés comportent des filigranes SynthID, et la création d’avatars ressemblant à des personnes est soumise à des restrictions. Ce sont des garanties annoncées, et non la preuve que tous les spectateurs reconnaîtront l’avatar comme synthétique ou que les usages abusifs seront empêchés. Pour évaluer un déploiement, il faudrait examiner le consentement, l’information des utilisateurs, le traitement des données de caméra et de voix en direct, les échecs d’appels d’outils, la gestion des interruptions et les performances observées auprès des utilisateurs concernés. Les documents et l’annonce de lancement publiés ne fournissent pas ces résultats.

Sources et lectures complémentaires

  • Annonce de Live Avatar de Google (24 septembre 2026) : décrit et illustre les interactions visées par l’entreprise, ses affirmations sur les avatars multilingues et SynthID. Ses démonstrations ne constituent pas des tests de performance indépendants.
  • Google Cloud : Gemini 3.8 Live avec Live Avatar est désormais disponible de manière générale (24 septembre 2026) : précise la disponibilité pour les entreprises, les points de terminaison aux États-Unis et dans l’UE, les avatars prédéfinis et personnalisés soumis à des conditions, ainsi que des exemples d’applications. Les commentaires de clients sont promotionnels et ne constituent pas des mesures de résultats utilisées dans cet article.
  • Guide destiné aux développeurs pour Gemini 3.8 Live (mis à jour le 24 septembre 2026) : documente la comparaison des modèles, le format de diffusion en continu et le comportement des appels d’outils. Il décrit le comportement prévu de l’API, et non des performances mesurées dans un déploiement particulier.
  • Page du modèle Gemini 3.8 Live (mise à jour le 24 septembre 2026) : répertorie l’identifiant du modèle, la date de disponibilité générale, les régions et les options de consommation. Il convient de vérifier à nouveau la disponibilité pour un projet et un point de terminaison précis.
  • Configurer les avatars en direct (consulté le 25 septembre 2026) : présente la configuration de l’API pour les avatars prédéfinis, ainsi que les conditions d’accès, de consentement et d’image applicables aux ressemblances personnalisées. Le guide décrit la configuration, et non des résultats observés.