跳到正文

Amazon Polly 推出双向流式接口,面向实时对话式 AI 语音合成

AWS 为 Amazon Polly 发布 Bidirectional Streaming API,可在文本仍在生成时同步回传语音,目标是缩短对话式 AI 的等待时间。

功思 AI 编辑部

约 1 分钟读完

Amazon Polly 推出双向流式接口,面向实时对话式 AI 语音合成

让语音合成跟上实时对话

AWS 宣布为 Amazon Polly 推出新的 Bidirectional Streaming API,允许开发者在发送文本的同时开始接收合成语音,不必等完整文本全部准备好后再发起请求。

这项能力瞄准的是对话式 AI 场景,尤其是大语言模型逐 token 生成文本时的语音播报需求。

传统请求-响应模式的瓶颈

AWS 指出,传统文字转语音接口通常采用请求-响应模式。虽然 Polly 以往已经支持把音频流式回传给用户,但前提仍然是文本输入先全部准备完成。

在由 LLM 驱动的虚拟助手中,这意味着用户需要先等待模型生成文本,再等待 TTS 开始工作,整体对话节奏容易被拉长。

通过 HTTP/2 实现双向流式通信

新接口 StartSpeechSynthesisStream 基于 HTTP/2 做双向通信,允许应用边送文本、边收音频,从而把生成与播报这两个阶段重叠起来。

AWS 认为,这能为实时语音助手、客服系统和其他对延迟敏感的会话式应用带来更自然的交互体验。

参与讨论

正在确认登录状态…