Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 是我们迄今为止最先进的实时对话模型。在智能水平和并行推理方面的重大升级,使得通过语音协作和执行复杂任务变得更加直观。
今天,我们推出两款新模型,它们在近乎实时的推理方面取得了突破,从而更有效地赋能语音 Agent,让与 AI 的对话感觉更加直观、智能。
- Gemini 3.8 Live:专为规模化应用和成本效益打造,融合了对话智能、流畅交互以及视觉理解能力。
- Gemini 3.8 Live Extended Thinking:专为高复杂度任务设计,具备更强的智能水平和多步推理能力。
对于开发者和企业而言,这些模型提供了构建可靠、可投入生产环境的语音 Agent 的基础组件。它们还让在 Gemini App、Google Workspace 和 Search 中与 Gemini 的语音交互更加流畅、更具协作性——帮助你仅凭语音就能处理复杂任务。
体验更流畅、更智能的对话
Gemini 3.8 Live Extended Thinking 提供企业级的任务完成能力和智能水平,在 Artificial Analysis 的语音到语音质量指数(Speech to Speech Quality Index)中位居综合榜首(82.6 分),并在 Agentic 任务完成率上领先,τ-Voice 得分 68.6%,Sierra 的 τ-Voice-banking 基准测试得分 35.1%。它还提供强大的推理能力,在 Big Bench Audio 上获得 97.7% 的高分,同时与其他前沿模型相比保持极具竞争力的价格点。
Gemini 3.8 Live 深受用户青睐,在 Speech Agent Arena 中排名第二。除了出色的性能表现外,它还保持了极高的性价比——为开发者和企业提供了一个功能强大且高效、专为规模化打造的模型。




在 ServiceNow 的 EVA-Bench(一个用于评估语音 Agent 的基准测试)上,我们的模型通过在准确性与对话质量之间取得完美平衡,推动了复杂工作流的帕累托前沿(Pareto Frontier)。

Gemini 3.8 Live 能够近乎实时地处理视觉输入,通过上下文丰富对话内容,从而提供更有帮助的回答。它支持在对话中途自动检测并切换 97 种语言。它在后台执行工具和 API 调用,同时继续对话,因此模型可以在确认请求的同时保持聊天状态,直到后台任务完成。

Gemini 3.8 Live 利用视觉上下文实时回答现场问题,指导员工入职培训。

观看 Gemini 3.8 Live 如何利用视觉上下文、推理能力和自然的对话流程,在近乎实时的情况下下棋。
对于需要更深层次推理的任务,3.8 Live Extended Thinking 能够同时进行推理和发声。它为复杂工作流提供了更高的智能水平,同时保持不间断的对话流畅度——使用诸如 “让我检查一下……” 这样的早期口头提示来自然地回应指令,并通过实时进度叙述引导用户了解多步骤后台任务的进展。

观看 Gemini 3.8 Live Extended Thinking 如何将原始草图和实时语音反馈转化为功能性的 React 组件。

查看 Gemini 3.8 Live Extended Thinking 如何协调多步骤预订和异步函数调用——全程不打断自然的实时对话。

观看 Gemini 3.8 Live 如何通过自然语音即时构建完整的商业计划和定制营销工具包。
在 Google Workspace 和 Search 中,我们的 Live 模型提供了更直观、更具协作性的体验——尤其是在处理你最复杂的任务时。

在 Google Workspace 中尝试 Gemini 3.8 Live Extended Thinking,包括 Docs Live、Gmail Live 和 Keep Live。

在 Search Live 中获取由 Gemini 3.8 Live 驱动的逐步、实时故障排除帮助。
赋能开发者与企业语音生态系统
通过使用 Gemini Live API,Agora、Fishjam、LiveKit、Pipecat、Vercel 和 Vision Agents 等开发者平台,使开发者能够轻松构建和部署高性能的语音驱动界面。这些平台在幕后管理复杂的实时媒体流基础设施,让开发者可以完全专注于打造用户体验。
我们还与 Salesforce、Genspark 和 Lumeris 等公司合作,他们对 3.8 Live 和 3.8 Live Extended Thinking 感到兴奋,特别强调了其令人印象深刻的低延迟、流畅性以及工具调用能力。











通过 SynthID 水印确保透明度
我们所有 AI 产品生成的音频均带有 SynthID 水印。这种不可见的水印直接嵌入音频输出中,确保 AI 生成的内容可被检测,从而有助于防止错误信息传播。有关我们在安全与责任方面的方法详情,请查阅模型卡片。
开始使用我们最新的 Gemini 音频模型:
3.8 Live 即日起开始推出:
- 面向开发者:通过 Google AI Studio 中的 Gemini API 使用
- 面向企业:在 Gemini Enterprise 中进行私有预览,并即将登陆 Gemini Enterprise for Customer Experience
- 面向所有人:在 Search Live 中使用
3.8 Live Extended Thinking 即日起开始推出:
- 面向开发者:通过 Google AI Studio 中的 Gemini API 使用
- 面向企业:在 Gemini Enterprise 中进行私有预览,并即将登陆 Gemini Enterprise for Customer Experience 及 Google Workspace 企业客户
- 面向所有人:在 Gemini Live 中使用;Google AI Pro 和 Ultra 订阅者可在 Workspace 的 Docs 中使用;所有 Google AI 订阅者可在 Gmail 和 Keep 中使用





