Gemini 3.8 Live and 3.8 Live Extended Thinking

发布时间 2026-09-16 15 天前
来源 Hacker首页帖子
字数 2,634 字
查看原文

补充自 2026年09月16日

AI智能总结

Google 推出两款实时语音对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,2026 年 9 月 15 日上线,可通过 Gemini API、Google Workspace 及 Gemini 应用使用。

2026 年 9 月 15 日

Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 是我们迄今为止最先进的实时对话模型。在智能与并行推理方面的重大升级,使它们在协作时更加直观,并能够通过语音执行复杂任务。


Tom Ouyang
首席工程师

Malini Jaganathan
技术团队成员,代表 Gemini 音频团队撰写


标题为"Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking"的文字配以 Gemini Spark 图标,背景为浅蓝色

我们正式发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,让语音交互更自然、更流畅、更智能。这些模型能够处理复杂推理、实时视觉上下文以及后台任务执行,同时不会打断你的对话。你现在就可以通过 Gemini API、Google Workspace 以及 Gemini 应用开始体验这些功能。


今天,我们推出两款新模型,它们在近实时推理方面取得了显著进展,能够更高效地支持语音智能体,并让与 AI 的对话变得更直观、更智能。

  • Gemini 3.8 Live:面向规模化与高性价比打造,将对话智能与流畅对话及视觉感知能力相结合。
  • Gemini 3.8 Live Extended Thinking:面向高复杂度任务打造,具备更强的智能与多步推理能力。

对开发者与企业而言,这些模型提供了构建可靠、可投入生产的语音智能体所需的模块化能力。同时也让用户能够在 Gemini 应用、Google Workspace 以及 Search 中与 Gemini 语音交互时获得更流畅、更具协作性的体验——帮助你仅凭语音即可应对复杂任务。

体验更流畅、更智能的对话

Gemini 3.8 Live Extended Thinking 提供企业级的任务完成能力与智能水平,在 Artificial Analysis 语音到语音质量指数(Speech to Speech Quality Index)中以 82.6 分名列第一,并在 τ-Voice 上以 68.6%、在 Sierra 的 τ-Voice-banking 基准上以 35.1% 的成绩领先于智能体任务完成率。它同时具备强大的推理能力,在 Big Bench Audio 上取得 97.7% 的成绩,且相对其他前沿模型仍保持极具竞争力的价格。

Gemini 3.8 Live 在用户中获得了较高的偏好度,在 Speech Agent Arena 中位列第二。除了这一表现之外,它仍然极具性价比——为开发者与企业提供了一个面向规模化设计的高效且能力出众的模型。

在 ServiceNow 的 EVA-Bench(用于评估语音智能体的基准)上,我们的模型在复杂工作流中推进了帕累托前沿(Pareto Frontier),在准确性与对话质量之间取得了良好的平衡。

注:此次评估在 Gemini Enterprise Agent Platform 的 Live API 上运行。

EVA Bench 体验与任务完成对比图表

Gemini 3.8 Live 能够近实时地处理视觉输入,借助上下文丰富对话内容,从而给出更有帮助的回复。它可以在对话过程中自动检测并切换 97 种支持的语言。它会在后台执行工具调用与 API 请求,同时保持对话继续进行,因此模型能够在后台任务执行期间确认请求并持续交流。

Gemini 3.8 Live 利用视觉上下文,实时引导员工入职流程并回答即时提问。

观看 Gemini 3.8 Live 结合视觉上下文、推理能力与自然对话流,近实时地与你下棋。

对于需要更深层推理的任务,3.8 Live Extended Thinking 可以同时进行思考与表达。它在保持不间断对话流的同时,为复杂工作流提供更强的智能——例如使用"让我查一下……"这样的早期语音提示自然地确认用户输入,并通过实时进度播报带领用户了解多步后台任务的推进过程。

观看 Gemini 3.8 Live Extended Thinking 将原始草图与近实时语音反馈转化为可运行的 React 组件。

了解 Gemini 3.8 Live Extended Thinking 如何协调多步骤预订与异步函数调用——整个过程不打断自然的实时对话。

观看 Gemini 3.8 Live 通过自然语音即时构建完整的商业计划与定制化营销工具包。

在 Google Workspace 与 Search 中,我们的 Live 模型带来了更直观、更具协作性的体验——尤其是在应对最复杂的任务时。

在 Google Workspace 中通过 Docs Live、Gmail Live 与 Keep Live 体验 Gemini 3.8 Live Extended Thinking。

在 Search Live 内,由 Gemini 3.8 Live 驱动,获取分步式实时故障排查帮助

赋能开发者与企业的语音生态

通过使用 Gemini Live API,Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 以及 Vision Agents 等开发者平台使开发者能够轻松构建并部署高性能语音驱动的界面。这些平台在后台处理复杂的实时媒体流基础设施,让开发者能够专注于打磨用户体验。

我们同时与 Salesforce、Genspark 和 Lumeris 等公司展开合作,他们对 3.8 Live 与 3.8 Live Extended Thinking 充满期待,并对其在延迟、流畅度与工具调用能力方面的表现给予了高度评价。

通过 SynthID 水印确保透明度

我们所有 AI 产品生成的音频均带有 SynthID 水印。这种人耳难以感知的水印被直接嵌入音频输出之中,确保 AI 生成的内容始终可被识别,从而帮助防止错误信息传播。有关我们在安全与责任方面的方法,请参阅 模型卡。

开始使用我们最新的 Gemini 音频模型

3.8 Live 即日起开始陆续推出:

3.8 Live Extended Thinking 即日起开始陆续推出: