Heute starten wir Gemini 3.1 Flash Live ĂŒber die Gemini Live API in Google AI Studio. Gemini 3.1 Flash Live hilft Entwicklern, Echtzeit-Sprach- und Bildagenten zu erstellen, die nicht nur ihre Umgebung wahrnehmen, sondern auch in GesprĂ€chsgeschwindigkeit reagieren können.
Dies ist ein bedeutender Fortschritt in puncto Latenz, ZuverlĂ€ssigkeit und natĂŒrlicher klingender Dialoge und bietet die QualitĂ€t, die fĂŒr die nĂ€chste Generation von sprachgesteuerter KI erforderlich ist.
Erleben Sie verbesserte Latenz, ZuverlÀssigkeit und QualitÀt
Bei Echtzeit-Interaktionen nimmt jede Millisekunde Latenz den natĂŒrlichen GesprĂ€chsfluss, den Nutzer erwarten. Das neue Modell versteht Tonfall, Betonung und Absicht besser und ermöglicht Agenten wichtige Verbesserungen:
- Höhere Aufgabenerledigungsrate in lauten, realen Umgebungen: Wir haben die FÀhigkeit des Modells, externe Tools auszulösen und wÀhrend Live-GesprÀchen Informationen zu liefern, deutlich verbessert. Durch die bessere Unterscheidung relevanter Sprache von UmgebungsgerÀuschen wie Verkehr oder Fernsehen filtert das Modell HintergrundgerÀusche effektiver heraus, um zuverlÀssig und reaktionsschnell auf Anweisungen zu bleiben.
- Bessere Befolgung von Anweisungen: Die Einhaltung komplexer Systemanweisungen wurde erheblich gesteigert. Ihr Agent bleibt innerhalb seiner operativen Leitplanken, selbst wenn GesprÀche unerwartete Wendungen nehmen.
- NatĂŒrlicherer und latenzarmer Dialog: Das neueste Modell verbessert die Latenz und ist noch effektiver bei der Erkennung akustischer Nuancen wie Tonhöhe und Tempo im Vergleich zu 2.5 Flash Native Audio, was EchtzeitgesprĂ€che viel flĂŒssiger und natĂŒrlicher erscheinen lĂ€sst.
- Mehrsprachige FĂ€higkeiten: Das Modell unterstĂŒtzt ĂŒber 90 Sprachen fĂŒr Echtzeit-Multimodal-GesprĂ€che.
Erleben Sie die Gemini Live API in Aktion
Entwickler bauen aktiv Sprachagenten, die mit natĂŒrlichem Fluss und Tempo kommunizieren und mit Gemini Flash Live-Modellen zuverlĂ€ssig handeln. Hier sind einige Beispiele fĂŒr reale Anwendungen, die das Modell fĂŒr ihre Konversationsinteraktionen nutzen:
Stitch
Mit der Gemini Live API ermöglicht Stitch seinen Nutzern nun, mit ihrer Stimme zu âvibe designen". Der Agent kann die Leinwand und ausgewĂ€hlte Bildschirme âsehen" und Designkritiken geben, Variationen erstellen und mehr.
Hey Ato
In dieser Demo nutzt das KI-BegleitgerĂ€t fĂŒr Ă€ltere Menschen, Ato, die mehrsprachigen FĂ€higkeiten von Gemini 3.1 Flash Live, um tĂ€gliche GesprĂ€che in echte Verbindungen fĂŒr seine Nutzer zu verwandeln.
Wits End
Sehen Sie, wie das Weekend-Team die starke Charakterisierung und menschenĂ€hnliche Ăbermittlung von Gemini 3.1 Flash Live integriert, um dem Spielleiter ihres RPGs â Witâs End â eine einzigartige theatralische Note zu verleihen.
0:52
Bauen Sie mit einem wachsenden Ăkosystem von Integrationen
Die Live API ist fĂŒr Produktionsumgebungen konzipiert, aber reale Systeme erfordern die Verarbeitung vielfĂ€ltiger Eingaben, von Live-Videostreams bis hin zu TelefongesprĂ€chen auf Abruf.
FĂŒr Systeme, die WebRTC-Skalierung oder globales Edge-Routing benötigen, empfehlen wir, unsere Partnerintegrationen zu erkunden, um die Entwicklung von Echtzeit-Sprach- und Videoagenten zu optimieren.

Erste Schritte mit der Live API
Gemini 3.1 Flash Live ist ab heute ĂŒber die Gemini API und in Google AI Studio verfĂŒgbar. Entwickler können die Gemini Live API nutzen, um das Modell in ihre Anwendung zu integrieren.
Schauen Sie sich dieses
um Sprachagenten mit Gemini 3 zu bauen:
Erkunden Sie unsere Entwicklerdokumentation, um zu erfahren, wie Sie Echtzeit-Agenten erstellen können.
- Gemini Live API Dokumentation: Erkunden Sie Funktionen wie mehrsprachige UnterstĂŒtzung, Tool-Nutzung und Funktionsaufrufe, Sitzungsverwaltung (fĂŒr die Verwaltung langer GesprĂ€che) und flĂŒchtige Tokens.
- Gemini Live API Beispiele: Lassen Sie sich inspirieren, welche Art von Spracherlebnissen Sie heute mit dem Modell erstellen können.
- Gemini Live API Skill: FĂŒr Code-Agenten, um mit der Live API zu lernen und zu bauen.
Legen Sie los mit dem Google GenAI SDK:
1import asyncio2from google import genai34client = genai.Client(api_key="YOUR_API_KEY")56model = "gemini-3.1-flash-live-preview"7configresponse_modalities": ["AUDIO"]}89async def main():10 async with client.aio.live.connect(model=model, config=config) as session:11 print("Session started")12 # Inhalt senden...1314if __name__ == "__main__":15 asyncio.run(main())








