Google hat Live Avatar mit Gemini 3.8 Live am 24. September allgemein verfügbar gemacht. Die Funktion ergänzt das Live-Sprachmodell des Unternehmens um ein sprechendes, animiertes Gesicht. Das Modell kann außerdem Kamera- oder Bildschirminhalte empfangen und während eines Gesprächs externe Werkzeuge aufrufen. Für Entwickler kundenorientierter Agenten besteht die praktische Neuerung in einer integrierten Videoausgabe und einem dokumentierten API-Zugang. Die Ankündigung belegt weder, dass ein Avatar die Servicequalität verbessert, noch dass er in jeder Umgebung zuverlässig funktioniert.
Die große Veränderung
- Was sich geändert hat:Googles Entwicklerleitfaden ergänzt die Sprachausgabe des früheren Live-Modells um synchronisiertes Avatar-Video. Entwickler können nun über eine einzige Streaming-API ein sprechendes Gesicht und eine Stimme ausgeben lassen.
- Warum das wichtig ist:Teams, die Kundenservice-Agenten entwickeln, können eine sichtbare Präsenz hinzufügen, ohne eine separate Pipeline zur Avatar-Darstellung aufzubauen. Ihre Anwendungen führen weiterhin Werkzeugaufrufe aus und müssen Fehler behandeln; die Animation belegt nicht, dass eine Transaktion erfolgreich war.
- Worauf es zu achten gilt:Bei der Gestaltung ist zunächst zwischen einem vorgegebenen Avatar und einem individuellen Abbild zu wählen. Googles Konfigurationsleitfaden beschränkt individuelle Avatare auf ausgewählte Kunden und verlangt Rechte und Einwilligungen für Gesichts- oder Sprachproben. Für ein markengebundenes Abbild müssen Zugang und Einwilligung daher gesondert geklärt werden.
Der Avatar ist verfügbar; eigene Abbilder unterliegen gesonderten Zugangsbeschränkungen
In seinem Einführungsbeitrag zeigt Google Avatare, die auf Live-Audio und visuelle Eingaben reagieren, die Sprache wechseln und ein Gespräch zum Hotel-Check-in fortsetzen, während ein Werkzeugaufruf läuft. Das sind Produktdemonstrationen des Unternehmens. Sie zeigen das vorgesehene Nutzungserlebnis, enthalten aber weder gemessene Fehlerraten noch Ergebnisse zur Barrierefreiheit oder Belege für einen besseren Kundenservice.
Googles Cloud-Ankündigung zufolge ist die Funktion in Gemini Enterprise und über die API allgemein verfügbar; es gibt Endpunkte für die USA und die EU. Entwickler können vorgegebene Avatare auswählen. Einen Avatar anhand eines Referenzbilds einer Person zu erstellen, bleibt ausgewählten Unternehmenskunden vorbehalten, die bei Google Cloud Zugang beantragen müssen. Der Konfigurationsleitfaden verpflichtet Kunden, vor der Verarbeitung von Gesichts- oder Sprachproben die nötigen Rechte und Einwilligungen einzuholen.
Die Modellseite nennt die Modell-ID gemini-3.8-live und die Verfügbarkeit in den Multi-Regionen us und eu sowie in us-central1. Als unterstützte Abrechnungsoptionen nennt sie sowohl die nutzungsabhängige Zahlung als auch die reservierte Durchsatzkapazität. Vor einer Bereitstellung sollten Teams den Endpunkt und die kommerziellen Bedingungen für ihr konkretes Projekt prüfen, statt die allgemeine Verfügbarkeit mit einem uneingeschränkten Zugang gleichzusetzen.
Das Gespräch hängt weiterhin von der Anwendung ab
Google beschreibt Gemini 3.8 Live als Sprache-zu-Sprache-System, das Live-Kamerabilder oder eine Bildschirmfreigabe entgegennehmen und Sprache und Video zurückgeben kann. Der Entwicklerleitfaden unterscheidet Werkzeugaufrufe, bei denen der Agent während der Ausführung weiterspricht, von blockierenden Aufrufen, bei denen er auf eine Antwort wartet. Die Anwendung muss ihre eigenen Werkzeuge weiterhin verbinden und autorisieren, deren Ergebnisse verarbeiten und entscheiden, welche Handlung der Agent ausführen darf. Ein Gesicht, das während einer Abfrage auf dem Bildschirm bleibt, belegt nicht, dass die Abfrage erfolgreich war.
Laut Leitfaden sollen Werkzeugantworten einen Status und die Information enthalten, ob ein erneuter Versuch sinnvoll ist. Sie müssen zur ursprünglichen Aufruf-ID passen; außerdem sollten Entwickler die Zahl wiederholter Werkzeugaufrufe begrenzen. Diese Anforderungen beeinflussen, wie ein Agent mit einer leeren Kontoabfrage oder einer Unterbrechung umgeht. Google zufolge kann Gemini 3.8 Live außerdem zwischen 97 Sprachen wechseln. Die Ankündigung, dass die Lippenbewegungen in all diesen Sprachen synchron bleiben, wurde hier nicht unabhängig überprüft.
Google zufolge tragen erzeugte Audio- und Videoinhalte SynthID-Wasserzeichen; außerdem schränkt das Unternehmen die Erstellung individueller Abbilder ein. Das sind erklärte Schutzmaßnahmen, kein Beleg dafür, dass jeder Zuschauer den Avatar als künstlich erkennt oder Missbrauch verhindert wird. Für eine Bereitstellungsbewertung müssten Einwilligung, Offenlegung, der Umgang mit Live-Kamera- und Sprachdaten, fehlgeschlagene Werkzeugaufrufe, das Verhalten bei Unterbrechungen und die tatsächliche Leistung mit den vorgesehenen Nutzern geprüft werden. Die veröffentlichten Einführungsunterlagen und Dokumentationen enthalten solche Ergebnisse nicht.
Quellen und weiterführende Informationen
- Googles Live-Avatar-Ankündigung (24. September 2026) beschreibt und zeigt die vorgesehenen Interaktionen, Googles Angaben zu mehrsprachigen Avataren und den SynthID-Hinweis. Die Vorführungen sind keine unabhängigen Leistungstests.
- Googles Cloud-Beitrag zur allgemeinen Verfügbarkeit (24. September 2026) nennt den Zugang für Unternehmen, Endpunkte in den USA und der EU, vorgegebene und zugangsbeschränkte individuelle Avatare und Anwendungsbeispiele. Kundenstimmen darin sind Werbeaussagen, keine Ergebniskennzahlen für diesen Artikel.
- Entwicklerleitfaden zu Gemini 3.8 Live (aktualisiert am 24. September 2026) dokumentiert den Modellvergleich, Streamingformate und das Verhalten von Werkzeugaufrufen. Er beschreibt das vorgesehene API-Verhalten, keine gemessene Leistung in einer bestimmten Bereitstellung.
- Modellseite zu Gemini 3.8 Live (aktualisiert am 24. September 2026) listet Modell-ID, Datum der allgemeinen Verfügbarkeit, Regionen und Abrechnungsoptionen. Die Verfügbarkeit sollte für ein konkretes Projekt und einen bestimmten Endpunkt erneut geprüft werden.
- Live-Avatare konfigurieren (geprüft am 25. September 2026) erläutert die API-Einrichtung für Standardavatare und Zugangsbeschränkungen, Einwilligungs- und Bildanforderungen für individuelle Abbilder.



