法国人工智能公司 Mistral 周四发布了一款新的开源文本转语音模型,可用于语音 AI 助手或客户支持等企业应用场景。该模型允许企业构建用于销售和客户互动的语音代理,使 Mistral 直接与 ElevenLabs、Deepgram 和 OpenAI 等公司展开竞争。
这款名为 Voxtral TTS 的新模型支持九种语言,包括英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语。
“我们的客户一直要求提供语音模型。因此,我们构建了一个小型的语音模型,可以适配智能手表、智能手机、笔记本电脑或其他边缘设备。它的成本仅为市场上其他产品的一小部分,但性能却处于领先水平,”Mistral AI 科学运营副总裁 Pierre Stock 在接受 TechCrunch 电话采访时表示。
Mistral 表示,该新模型可以通过少于五秒的样本适配自定义语音,并能捕捉诸如细微口音、语调、声调以及语音流中的不规则性等特征。该模型基于 Ministral 3B 构建,可以轻松在不同语言间切换,同时保持声音的特征,这对于配音或实时翻译等用例非常有用。Stock 表示,公司希望该模型听起来像真人,而不是机器人的声音。
据该公司称,该模型专为实时性能而构建。其首个音频时间 (TTFA) ——即模型在接收输入后开始“说话”的测量指标——为 90 毫秒(针对 500 个字符的 10 秒样本)。该模型的实时因子 (RTF) 为 6 倍,这意味着它可以在大约 1.6 秒内渲染出 10 秒的音频片段。
今年早些时候,Mistral 发布了一对转录模型,一个用于大规模批处理,另一个用于具有低延迟的实时用例。随着新语音模型的推出,该公司很可能是为了向企业提供全套的语音产品。
“我们计划拥有一个端到端的平台,能够处理包括音频、文本和图像在内的多模态输入流,并进行输出。其主要好处在于,通过支持音频作为输入或输出的端到端代理系统,您可以获得更多信息,”Stock 说。
参加 TechCrunch 创始人峰会,最高可节省 300 美元或享受 30% 折扣
Mistral 的定位是,其开源和定制化特性将帮助企业采用其语音模型而非竞争对手的产品,因为企业可以按照自己的需求对其进行调整。
Ivan 在 TechCrunch 负责报道全球消费类科技动态。他常驻印度,此前曾任职于《赫芬顿邮报》(Huffington Post) 和 The Next Web 等出版物。



