OpenAI 宣布扩展 Responses API,以便开发者更容易构建代理式工作流,并新增对 shell 工具、内置代理执行循环、托管容器工作区、上下文压缩以及可复用代理技能的支持。
OpenAI 表示,有了这些新能力,使用 Responses API 的开发者将不再需要自行搭建执行环境,来安全且可靠地执行现实世界任务。相反,他们可以依赖一套内置基础设施来处理所有代理开发者都会遇到的实际挑战,例如管理中间文件、优化提示词使用、确保安全的网络访问,以及处理超时和重试。
这一新设计的核心是代理执行循环。模型不会立即给出最终答案,而是可以“提议”一个动作,例如运行命令、查询某些数据,或从互联网获取内容。该动作会在受控环境中执行,结果再反馈给模型。这个循环会以迭代方式持续,直到任务完成。
执行循环可以利用新的 Shell 工具,通过命令行与计算机交互,让模型能够使用开箱即用的 grep、curl 和 awk 等常见 Unix 工具以及其他程序来完成任务。
与现有只能执行 Python 的代码解释器相比,Shell 工具支持更广泛的用例,例如运行 Go 或 Java 程序,或启动 NodeJS 服务器。这种灵活性让模型能够完成复杂的代理式任务。
需要明确的是,模型只能提议使用某个工具,而不能自行运行它。
除 Shell 工具外,OpenAI 还提供了一个容器化执行环境,文件和数据库可以存放其中,网络访问则通过策略控制进行安全管理。这些工具旨在减少必须把所有输入都直接放入提示上下文的需求。相反,模型可以通过 shell 命令访问特定文件,对现有信息进行解析或转换;运行数据库查询,只提取相关行;或直接从网络获取数据。
为确保网络访问安全,所有出站流量都会经过一个集中式策略层,由其执行允许列表和访问控制,同时保持流量可观测。凭证不会存储在容器内部,对模型也不可见;模型只能看到占位符,这些占位符会在外部层被替换。
新版 Responses API 引入的另一个关键概念是“skills(技能)”,它让定义复杂、可重复的任务变得更容易,在这类任务中,shell 命令会按照预定义模式执行。
代理技能把这些模式打包成可复用、可组合的构建模块。具体来说,一个 skill 是一个文件夹包,其中包含 SKILL.md(含元数据和说明)以及任何配套资源,例如 API 规范和 UI 资产。



