谷歌上线 Gemini 3.8 Live:语音对语音模型,强调低延迟与可打断交互

谷歌发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,两款语音对语音模型均面向实时对话场景,并支持浏览器内可打断交互。

2026 年 9 月 15 日,谷歌发布了 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking。两款新模型均为语音对语音模型,产品形态与 OpenAI 的 GPT-Live 系列相近,意味着头部大模型厂商正在把竞争重点从文本生成进一步推向实时语音交互

从“语音转文本”走向完整语音对话

与传统的“语音识别 + 大模型生成 + 语音合成”拼接方案不同,Gemini Live 的目标是让模型直接处理语音输入并生成语音输出。这类路线通常可以减少中间环节带来的延迟,也更容易保留语气、停顿和对话节奏。谷歌此次同时推出 Extended Thinking 版本,显示其语音模型不仅要支持快速应答,也在尝试覆盖更复杂的推理型语音交互场景。

从产品定位看,Gemini Live 与 OpenAI 的 GPT-Live 家族形成了直接对位。后者此前已经把实时语音作为模型能力的重要展示方向,强调自然对话、即时插话和连续反馈。谷歌此次发布同类模型,说明语音 Agent 正成为大模型平台的新标准能力。

开发者可通过 WebSocket 与 Web Audio API 接入

在开发者侧,谷歌为 Gemini Live 提供了基于 WebSocket 的实时接口。开发者可以连接 wss://generativelanguage.googleapis.com/ws/google.ai.generativelanguage.v1alpha.GenerativeService.BidiGenerateContent?key=… 这一双向生成内容端点,实现浏览器内的语音对话。实际调用时,可结合 Web Audio API 的 AudioContext 完成声音采集与播放。

据开发者 Simon Willison 分享,他已经使用 GPT-6 Astra Extra High 阅读相关文档,并构建了一个用于测试新模型的网页界面。该界面支持选择模型与语音预设,可输入可选系统提示词,并允许用户在浏览器中直接开始语音对话。值得注意的是,该演示还支持在模型说话过程中打断它,这通常是实时语音助手体验是否自然的重要指标。

  • Gemini Live 支持选择模型版本与语音预设
  • 可设置系统提示词,引导助手角色或回答风格
  • 浏览器内即可发起实时语音会话
  • 用户可在模型回复过程中插话或打断

对行业意味着什么

谷歌此次发布进一步确认了语音交互正在成为大模型能力竞争的新前线。与文字聊天相比,语音对话对延迟、连续性和多轮上下文保持提出更高要求。模型不仅要理解用户说了什么,还要在用户插话、改口或补充信息时迅速调整响应。

如果 Gemini Live 能在实际应用中保持低延迟和稳定打断能力,它将有助于谷歌在语音助手、客服机器人、车载交互和可穿戴设备场景中扩展生态。与 OpenAI 的语音路线相比,谷歌的优势可能来自其现有 Android、搜索和云服务入口;而 OpenAI 的优势则在于此前语音模型已形成的开发者认知和用户习惯。

对开发者而言,Gemini Live 提供的 WebSocket 接口降低了构建实时语音应用的门槛。无需复杂中间件即可接入双向语音流,意味着更多团队可以尝试制作可打断、可连续对话的 AI 语音产品。接下来值得观察的是,谷歌是否会进一步开放更多语音风格、语言支持以及工具调用能力。

原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/gu-ge-shang-xian-gemini-3-8-live-yu-yin-dui-yu-yin-mo-xing

Like (0)
点点的头像点点
Previous 12小时前
Next 2024年8月28日

相关推荐