Technologie
Google: 2 neue Gemini-Audiomodelle für Live-Gespräche und komplexe Aufgaben

Google: 2 neue Gemini-Audiomodelle für Live-Gespräche und komplexe Aufgaben

Larissa Ceccio | 16.09.26

Mit Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking will Google Sprachinteraktionen natürlicher und vielseitiger machen. Die neuen Audiomodelle können auch Bilder einbeziehen und Tools im Hintergrund nutzen.

Per Sprache einen Business-Plan erstellen, Ideen brainstormen und passende Marketing-Materialien entwickeln: Das ist mit Googles zwei neuen fortschrittlichen Audiomodellen jetzt möglich.

Gemini 3.8 Live ist auf schnelle und flüssige Gespräche ausgelegt. Das Modell verarbeitet Sprache und visuelle Informationen nahezu in Echtzeit und kann Tools oder APIs im Hintergrund aufrufen, während das Gespräch weiterläuft. Gemini 3.8 Live Extended Thinking ist für komplexere Aufgaben gedacht, bei denen mehrere Denk- und Arbeitsschritte zusammenkommen.

In der Demo aus Googles Ankündigung auf X richtet eine Nutzerin ihre Smartphone-Kamera auf eine handwerkliche Aufgabe. Search Live kombiniert die Live-Bilder mit ihrer gesprochenen Frage und führt sie Schritt für Schritt durch die Lösung. User können so gleichzeitig zeigen und erklären, worum es geht, statt das Problem nur per Sprache ausführlich beschreiben zu müssen.

Für mehr Transparenz versieht Google alle mit den neuen Live-Modellen erzeugten Audios mit SynthID. Das für Menschen nicht hörbare Wasserzeichen wird direkt in die Audioausgabe eingebettet und soll dabei helfen, AI-generierte Inhalte später zu erkennen. Google nutzt SynthID bereits für andere generative Inhalte wie Bilder und Videos.

Gemini 3.8 Live Extended Thinking kommt außerdem in Gemini Live und in mehrere Workspace-Produkte. Google AI Pro- und Ultra-Abonnent:innen erhalten Zugriff in Docs, während die Funktionen in Gmail und Keep für alle Google AI-Abonnent:innen verfügbar sind. Die neuen Sprachfunktionen für Gmail, Docs und Keep hat Google bereits Anfang September vorgestellt. Mit Gemini 3.8 Live Extended Thinking nennt Google nun auch das Modell, das bei diesen Live-Funktionen zum Einsatz kommt.



Google hört jetzt genauer hin:
Das sind die neuen KI-Sprachfunktionen für Workspace

Google Workspace Bild. Weißer Hintergrund, Logo von Notes und GMail
© Google


Gemini 3.8 Live hilft per Kamera und Sprache in Echtzeit

Wer die Kamera auf ein Problem richtet und direkt fragt, was zu tun ist, kann dafür künftig Gemini 3.8 Live in Search Live nutzen. Das Modell verarbeitet Sprache und Kamerabilder nahezu in Echtzeit, verbindet beide Informationen miteinander und kann während eines Gesprächs automatisch zwischen 97 unterstützten Sprachen wechseln. Wie natürlich sich solche Gespräche inzwischen anfühlen sollen, beschreibt auch Robby Stein, Vice President of Product bei Google Search.

Neben Sprache und Bildern kann Gemini 3.8 Live Tools und APIs einbinden. Diese Aufrufe laufen im Hintergrund weiter, ohne das Gespräch zu unterbrechen. So muss die Unterhaltung beispielsweise nicht pausieren, wenn eine externe Funktion noch eine Aufgabe verarbeitet.

Eine weitere Demo zeigt Gemini 3.8 Live beim Schachspielen. Während sich die Stellung auf dem Brett verändert, verfolgt das Modell die Züge und reagiert per Sprache nahezu in Echtzeit darauf. So entsteht ein laufendes Gespräch über die Partie, statt dass der User nach jedem Zug eine neue Anfrage stellen muss.

Gemini 3.8 Live verfolgt in der Demo eine laufende Schachpartie und reagiert per Sprache nahezu in Echtzeit auf die Züge, © Google

Auch in unabhängigen Vergleichstests landet Gemini 3.8 Live derzeit weit vorne. In der Speech Agent Arena von Artificial Analysis belegt Gemini 3.8 Live aktuell Platz zwei. Dort vergleichen User Sprachmodelle in anonymisierten Live-Gesprächen und entscheiden anschließend, welche Antwort sie bevorzugen. Google hebt zudem die vergleichsweise niedrigen Kosten und die Skalierbarkeit für Entwickler:innen und Unternehmen hervor.

Gemini 3.8 Live Extended Thinking übernimmt komplexere Aufgaben

Gemini 3.8 Live Extended Thinking ist für Aufgaben gedacht, bei denen mehrere Schritte zusammenkommen und mehr Planung nötig ist. Während die einzelnen Schritte im Hintergrund verarbeitet werden, kann die Sprachunterhaltung weiterlaufen. Gemini kann dabei kurz bestätigen, dass eine Anfrage bearbeitet wird, Zwischenschritte erklären und parallel weitere Tools oder Funktionen aufrufen, ohne dass das Gespräch dafür unterbrochen werden muss.

In der Demo startet der User mit einer einfachen Skizze auf Papier. Er zeichnet grob, wie die Produktseite aussehen soll, und ergänzt per Sprache weitere Wünsche. Währenddessen entsteht auf dem Bildschirm nach und nach die digitale Version. Gemini 3.8 Live Extended Thinking setzt die Vorgaben um, reagiert auf neue Hinweise und passt die Oberfläche direkt im laufenden Gespräch weiter an.

Aus einer handgezeichneten Produktskizze entsteht mithilfe von Gemini 3.8 Live Extended Thinking und gesprochenem Feedback schrittweise eine digitale React-Oberfläche, © Google

Im Artificial Analysis Speech-to-Speech Index liegt Gemini 3.8 Live Extended Thinking mit 82,6 Punkten vor Gemini 3.8 Live mit 76 Punkten. Beim Big Bench Audio erreicht Extended Thinking 97,7 Prozent, Gemini 3.8 Live kommt auf 91,7 Prozent. Bei der Speech Agent Arena liegt dagegen Gemini 3.8 Live aktuell vor Extended Thinking.

Wenn beide Live-Modelle abseits von Tests und Demos auch im Alltag zuverlässig funktionieren, könnte Sprache für Search, Gemini und Workspace für einige User zur bevorzugten Bedienform werden.



Googles Gemini 3.8 kommt:
Besser als 3.7, genauso teuer und schon in der Suche aktiv

Gemini-Logo, Schriftzug zu Gemini 3.9 Flash und Cyber, blau-weißer Hintergrund
© Google via Canva


Stelle OnlineMarketing.de als bevorzugte Quelle auf Google ein

Wenn du OnlineMarketing.de auf Google als bevorzugte Quelle einstellen möchtest, um auch in den Schlagzeilen auf Google immer aktuelle News und Tipps aus der Welt des Marketing und der Tech-Entwicklungen zu finden, kannst du einfach die Google-Quelleneinstellungen aufrufen und die Seite anwählen. Über das Stern-Icon neben den Top Stories kannst du ebenfalls bevorzugte Quellen für die spätere Suche speichern.

Kommentare aus der Community

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

*
*