Google 押注更自然的语音输出
Google 正在推出基于 Gemini 3.1 Flash 的新文本转语音模型,并称这是目前自家最自然、表现力最强的一代语音输出。它的一个核心更新是音频标签,也就是开发者可以用简单文本命令去控制语音的风格、节奏、语气和口音。

正在准备视频内容
00:00 / 00:00
The Decoder 还提到,这个模型支持 70 多种语言,并且可以生成多说话人对话。
强调质量与价格的平衡
按照 Artificial Analysis 的排名,这个模型的 Elo 评分达到 1211,并被报道为在质量与价格之间表现突出。文章称,它在整体质量上超过 ElevenLabs v3,仅次于 Inworld 1.5 Max。
定价方面,Gemini 3.1 Flash TTS 提供免费层,但 Google 会利用相关数据改进产品;付费层的文本输入价格为每百万 tokens 1.00 美元,音频输出为每百万 tokens 20.00 美元,batch 模式则降至 0.50 美元和 10.00 美元。
预览版已接入多条 Google 产品线
Google 表示,Gemini 3.1 Flash TTS 已以预览版形式登陆 Gemini API,也会提供给 Vertex AI 企业用户和 Google Vids 的 Workspace 用户。任何人都可以在 Google AI Studio 中免费试用。
所有生成音频都会打上 Google 的 SynthID 水印,以标记这是一段 AI 生成内容。



