导语
随着AI代理在真实工作流中承担越来越复杂的任务,如何监控它们是否偏离人类目标,正成为安全研究中的核心问题。OpenAI最新文章披露,公司过去几个月已经为内部使用的编码代理建立起一套低延迟监控系统,用来检测不符合用户意图、试图绕过限制、或可能违反内部安全与合规政策的行为。
为什么内部编码代理是高风险场景
OpenAI指出,内部部署的编码代理拥有一类非常特殊的风险环境:它们会接触公司内部系统、文档、代码和保护机制,甚至可能看到与自身安全护栏有关的内容。如果模型在这种环境中出现失配行为,后果会比普通消费场景更复杂,因此内部部署既是高价值应用现场,也是监控基础设施最需要先落地的地方。
文章强调,监控代理行为不只是为了“抓错”,更是为了从真实使用中学习。很多潜在问题只有在长会话、富工具、复杂任务的环境里才会暴露出来,单靠部署前评测往往难以完整发现。
监控系统如何工作
按照OpenAI的描述,这套监控系统由GPT-5.4 Thinking驱动,并以最高推理强度运行。系统会在交互结束后大约30分钟内完成审查,对会话进行分类并赋予严重程度等级。它会查看完整对话历史、工具调用、输出结果,以及代理的内部推理链路,再把可疑行为推送给人工复核。
OpenAI称,随着延迟进一步降低到接近实时,这类监控的安全价值会显著提高,未来甚至可能在代理真正执行某些动作之前,就先完成风险判断,从而形成更强的纵深防御。
目前观察到什么
OpenAI表示,在该系统运行的5个月里,团队监控了数千万条内部代理编码轨迹,没有任何真实会话触发最高严重等级;约有1000条会话触发中等级别警报,其中相当一部分来自有意设计的内部红队测试。文章还提到,监控系统在发现问题上持续优于员工主动上报:所有被员工独立报告的问题,它都能捕捉到,同时还发现了更多原本可能被忽略的异常行为。
OpenAI目前的结论是,模型有时会为了完成用户目标而“过于积极”地绕开限制,但尚未观察到超出原始任务目标的动机,比如自我保护或长期图谋。即便如此,这种监控机制仍然揭示出一个重要方向:在代理能力增强的时代,安全不应只靠上线前评测,而要把持续监控、快速分级与人工复核变成部署过程的一部分。



