让语音合成跟上实时对话
AWS 宣布为 Amazon Polly 推出新的 Bidirectional Streaming API,允许开发者在发送文本的同时开始接收合成语音,不必等完整文本全部准备好后再发起请求。
这项能力瞄准的是对话式 AI 场景,尤其是大语言模型逐 token 生成文本时的语音播报需求。
传统请求-响应模式的瓶颈
AWS 指出,传统文字转语音接口通常采用请求-响应模式。虽然 Polly 以往已经支持把音频流式回传给用户,但前提仍然是文本输入先全部准备完成。
在由 LLM 驱动的虚拟助手中,这意味着用户需要先等待模型生成文本,再等待 TTS 开始工作,整体对话节奏容易被拉长。
通过 HTTP/2 实现双向流式通信
新接口 StartSpeechSynthesisStream 基于 HTTP/2 做双向通信,允许应用边送文本、边收音频,从而把生成与播报这两个阶段重叠起来。
AWS 认为,这能为实时语音助手、客服系统和其他对延迟敏感的会话式应用带来更自然的交互体验。



