跳到正文

Gemini 3.1 Flash Live 亮相,未来可能更难分辨你是否在和机器人对话

Google 推出面向实时对话的音频模型 Gemini 3.1 Flash Live,并开始在 Search、Gemini 和开发者工具中上线。该模型主打更快响应和更自然语音,也让人机语音交流更接近真人。

功思 AI 编辑部

约 3 分钟读完

Gemini 3.1 Flash Live 亮相,未来可能更难分辨你是否在和机器人对话

Google 新的对话式音频 AI 今日开始在 Search、Gemini 和开发者工具中推出。

人工智能生成的文本往往带有一种特殊的“味道”,让人能看出它是机器生成的,但随着技术进步,这些特征已经越来越难辨认。生成式 AI 音频或许也在经历类似的演变。Google 宣布推出一款新的 AI 音频模型 Gemini 3.1 Flash Live,顾名思义,它是为实时对话设计的。它从今天开始进入部分 Google 产品,开发者也将能够用这款模型打造自己的健谈机器人。

Google 表示,这款 AI 速度更快,生成语音时的节奏也更自然,目标是解决 AI 语音长期存在的一个问题。和聊天机器人一样,生成式音频系统在输入和输出之间总会存在延迟。延迟更长、语调不自然,都会让对话显得迟缓,也更难跟上。研究人员通常认为,300 毫秒的延迟大致是实现最佳语音感知的上限,但 Google 并未说明 Gemini 3.1 Flash Live 的具体延迟表现,只是笼统地表示它具备所需的速度。

视频封面
正在准备视频内容
00:00 / 00:00

那基准测试数据呢?Google 给出了不少数据,并称这些数据表明,3.1 Flash Live 会成为进行音频到音频 AI 对话时更可靠的方式。例如,它在 ComplexFuncBench Audio 上的大幅提升显示,这款新模型更擅长处理复杂的多步骤任务。Gemini 3.1 Flash Live 还在 Big Bench Audio 测试中位居榜首,这项测试通过 1,000 道音频问题评估推理能力。

与此同时,它在 Scale AI 的 Audio MultiChallenge 中表现强劲,这意味着新的 Gemini 模型更能应对音频输入中的犹豫和打断。尽管它领先于其他实时音频模型,Gemini 3.1 Flash Live 在这项测试中的成绩也只有 36.1%。而那些并非为对话式运行而设计的音频模型,在 MultiChallenge 中可以拿到超过 50% 的分数。

这意味着,Gemini 3.1 Flash Live 听起来应该会更像真人,以至于 Google 认为现在已经到了整合 AI 标记的时候。该模型的输出将带有 SynthID 水印,人类听众无法感知到这些水印。不过,如果有人试图把 Gemini 生成的 AI 语音冒充成真实人声,这些水印仍然可以被检测出来。

Google 已与 Home Depot、Verizon 等公司合作测试这款模型。在博客文章中,这些公司都对 3.1 Flash Live 模拟人类语音的能力给出了高度评价。因此,你下一次在电话中遇到的 AI 助手,听起来可能会真实得多。你甚至可能会以为自己在和真人交谈,而 SynthID 并不能帮你当场分辨这一点。

开发者现在已经可以在 AI Studio、Gemini API 和 Gemini Enterprise for Customer Experience 中接入这款模型。后者本质上是一套面向代理式购物的工具包。Gemini 3.1 Flash Live 最显著的落地场景将是 Gemini Live 和 Search Live(AI Mode 的一项功能)。这套新的对话式 AI 已从今天开始在这些产品中推出。

25 年多来,Ars Technica 一直在从噪音中辨别真正有价值的信息。凭借独特的技术洞察力,以及对技术、艺术和科学领域的广泛兴趣,Ars 在信息洪流中成为值得信赖的来源。毕竟,你不需要知道一切,只需要知道什么最重要。

参与讨论

正在确认登录状态…