跳到正文

Google 推出更具表现力的 Gemini 3.1 Flash TTS,支持 70 多种语言

Google 推出基于 Gemini 3.1 Flash 的新一代文本转语音模型,主打更自然的语音表现、音频标签控制和 70 多种语言支持,原文同时附带演示视频。

功思 AI 编辑部

约 1 分钟读完

Google 推出更具表现力的 Gemini 3.1 Flash TTS,支持 70 多种语言

Google 押注更自然的语音输出

Google 正在推出基于 Gemini 3.1 Flash 的新文本转语音模型,并称这是目前自家最自然、表现力最强的一代语音输出。它的一个核心更新是音频标签,也就是开发者可以用简单文本命令去控制语音的风格、节奏、语气和口音。

视频封面
正在准备视频内容
00:00 / 00:00

The Decoder 还提到,这个模型支持 70 多种语言,并且可以生成多说话人对话。

强调质量与价格的平衡

按照 Artificial Analysis 的排名,这个模型的 Elo 评分达到 1211,并被报道为在质量与价格之间表现突出。文章称,它在整体质量上超过 ElevenLabs v3,仅次于 Inworld 1.5 Max。

定价方面,Gemini 3.1 Flash TTS 提供免费层,但 Google 会利用相关数据改进产品;付费层的文本输入价格为每百万 tokens 1.00 美元,音频输出为每百万 tokens 20.00 美元,batch 模式则降至 0.50 美元和 10.00 美元。

预览版已接入多条 Google 产品线

Google 表示,Gemini 3.1 Flash TTS 已以预览版形式登陆 Gemini API,也会提供给 Vertex AI 企业用户和 Google Vids 的 Workspace 用户。任何人都可以在 Google AI Studio 中免费试用。

所有生成音频都会打上 Google 的 SynthID 水印,以标记这是一段 AI 生成内容。

参与讨论

正在确认登录状态…