YouMind
Anmelden

Echtzeit-Konversations-Agenten mit Gemini 3.1 Flash Live entwickeln

@GoogleAIStudio
ENGLISCH26. MĂ€rz 2026
2.7M
2.4K
341
72
4.8K

TL;DR

Google veröffentlicht Gemini 3.1 Flash Live, ein Modell mit geringer Latenz fĂŒr Echtzeit-Interaktionen in Sprache und Bild, das eine verbesserte Befolgung von Anweisungen sowie UnterstĂŒtzung fĂŒr ĂŒber 90 Sprachen bietet.

Heute starten wir Gemini 3.1 Flash Live ĂŒber die Gemini Live API in Google AI Studio. Gemini 3.1 Flash Live hilft Entwicklern, Echtzeit-Sprach- und Bildagenten zu erstellen, die nicht nur ihre Umgebung wahrnehmen, sondern auch in GesprĂ€chsgeschwindigkeit reagieren können.

Dies ist ein bedeutender Fortschritt in puncto Latenz, ZuverlĂ€ssigkeit und natĂŒrlicher klingender Dialoge und bietet die QualitĂ€t, die fĂŒr die nĂ€chste Generation von sprachgesteuerter KI erforderlich ist.

Erleben Sie verbesserte Latenz, ZuverlÀssigkeit und QualitÀt

Bei Echtzeit-Interaktionen nimmt jede Millisekunde Latenz den natĂŒrlichen GesprĂ€chsfluss, den Nutzer erwarten. Das neue Modell versteht Tonfall, Betonung und Absicht besser und ermöglicht Agenten wichtige Verbesserungen:

  • Höhere Aufgabenerledigungsrate in lauten, realen Umgebungen: Wir haben die FĂ€higkeit des Modells, externe Tools auszulösen und wĂ€hrend Live-GesprĂ€chen Informationen zu liefern, deutlich verbessert. Durch die bessere Unterscheidung relevanter Sprache von UmgebungsgerĂ€uschen wie Verkehr oder Fernsehen filtert das Modell HintergrundgerĂ€usche effektiver heraus, um zuverlĂ€ssig und reaktionsschnell auf Anweisungen zu bleiben.
  • Bessere Befolgung von Anweisungen: Die Einhaltung komplexer Systemanweisungen wurde erheblich gesteigert. Ihr Agent bleibt innerhalb seiner operativen Leitplanken, selbst wenn GesprĂ€che unerwartete Wendungen nehmen.
  • NatĂŒrlicherer und latenzarmer Dialog: Das neueste Modell verbessert die Latenz und ist noch effektiver bei der Erkennung akustischer Nuancen wie Tonhöhe und Tempo im Vergleich zu 2.5 Flash Native Audio, was EchtzeitgesprĂ€che viel flĂŒssiger und natĂŒrlicher erscheinen lĂ€sst.
  • Mehrsprachige FĂ€higkeiten: Das Modell unterstĂŒtzt ĂŒber 90 Sprachen fĂŒr Echtzeit-Multimodal-GesprĂ€che.

Erleben Sie die Gemini Live API in Aktion

Entwickler bauen aktiv Sprachagenten, die mit natĂŒrlichem Fluss und Tempo kommunizieren und mit Gemini Flash Live-Modellen zuverlĂ€ssig handeln. Hier sind einige Beispiele fĂŒr reale Anwendungen, die das Modell fĂŒr ihre Konversationsinteraktionen nutzen:

Stitch

Mit der Gemini Live API ermöglicht Stitch seinen Nutzern nun, mit ihrer Stimme zu „vibe designen". Der Agent kann die Leinwand und ausgewĂ€hlte Bildschirme „sehen" und Designkritiken geben, Variationen erstellen und mehr.

Google AI Studio - inline image

Hey Ato

In dieser Demo nutzt das KI-BegleitgerĂ€t fĂŒr Ă€ltere Menschen, Ato, die mehrsprachigen FĂ€higkeiten von Gemini 3.1 Flash Live, um tĂ€gliche GesprĂ€che in echte Verbindungen fĂŒr seine Nutzer zu verwandeln.

Google AI Studio - inline image

Wits End

Sehen Sie, wie das Weekend-Team die starke Charakterisierung und menschenĂ€hnliche Übermittlung von Gemini 3.1 Flash Live integriert, um dem Spielleiter ihres RPGs – Wit’s End – eine einzigartige theatralische Note zu verleihen.

Google AI Studio - inline image

0:52

Bauen Sie mit einem wachsenden Ökosystem von Integrationen

Die Live API ist fĂŒr Produktionsumgebungen konzipiert, aber reale Systeme erfordern die Verarbeitung vielfĂ€ltiger Eingaben, von Live-Videostreams bis hin zu TelefongesprĂ€chen auf Abruf.

FĂŒr Systeme, die WebRTC-Skalierung oder globales Edge-Routing benötigen, empfehlen wir, unsere Partnerintegrationen zu erkunden, um die Entwicklung von Echtzeit-Sprach- und Videoagenten zu optimieren.

Google AI Studio - inline image

Erste Schritte mit der Live API

Gemini 3.1 Flash Live ist ab heute ĂŒber die Gemini API und in Google AI Studio verfĂŒgbar. Entwickler können die Gemini Live API nutzen, um das Modell in ihre Anwendung zu integrieren.

Schauen Sie sich dieses


Video-Tutorial

um Sprachagenten mit Gemini 3 zu bauen:

Erkunden Sie unsere Entwicklerdokumentation, um zu erfahren, wie Sie Echtzeit-Agenten erstellen können.

  • Gemini Live API Dokumentation: Erkunden Sie Funktionen wie mehrsprachige UnterstĂŒtzung, Tool-Nutzung und Funktionsaufrufe, Sitzungsverwaltung (fĂŒr die Verwaltung langer GesprĂ€che) und flĂŒchtige Tokens.
  • Gemini Live API Beispiele: Lassen Sie sich inspirieren, welche Art von Spracherlebnissen Sie heute mit dem Modell erstellen können.
  • Gemini Live API Skill: FĂŒr Code-Agenten, um mit der Live API zu lernen und zu bauen.

Legen Sie los mit dem Google GenAI SDK:

python
1import asyncio
2from google import genai
3
4client = genai.Client(api_key="YOUR_API_KEY")
5
6model = "gemini-3.1-flash-live-preview"
7configresponse_modalities": ["AUDIO"]}
8
9async def main():
10 async with client.aio.live.connect(model=model, config=config) as session:
11 print("Session started")
12 # Inhalt senden...
13
14if __name__ == "__main__":
15 asyncio.run(main())
Mit einem Klick speichern

Virale Artikel mit YouMind per KI tief lesen

Speichere die Quelle, stelle gezielte Fragen, fasse die Argumentation zusammen und verwandle einen viralen Artikel in wiederverwendbare Notizen in einem einzigen KI-Arbeitsbereich.

YouMind entdecken
FĂŒr Creator

Verwandle dein Markdown in einen sauberen 𝕏-Artikel

Wenn du eigene Langtexte veröffentlichst, wird die 𝕏-Formatierung von Bildern, Tabellen und Codeblöcken mĂŒhsam. YouMind macht aus einem ganzen Markdown-Entwurf einen sauberen, sofort postbaren 𝕏-Artikel.

Markdown zu 𝕏 testen

Mehr Muster zum EntschlĂŒsseln

Aktuelle virale Artikel

Mehr virale Artikel entdecken