跳到正文

Microsoft 推出 CORPGEN,面向真实办公场景评估多任务 AI 智能体

Microsoft Research 发布 CORPGEN,试图把 AI 智能体从单任务测试推进到真实办公环境中的并行多任务协作,并给出了当前系统在高负载下的表现数据。

功思 AI 编辑部

约 1 分钟读完

Microsoft 推出 CORPGEN,面向真实办公场景评估多任务 AI 智能体

配图

把办公场景的并行任务搬进评测

Microsoft Research 指出,真实知识工作往往同时涉及报告、预算表、演示文稿和邮件等多项相互依赖的任务,但现有主流 AI 智能体通常仍按“单任务一次完成”的方式被评测。

为缩小这一差距,团队在论文《CORPGEN: Simulating Corporate Environments with Autonomous Digital Employees in Multi-Horizon Task Environments》中提出了 CORPGEN,希望让智能体具备更适合真实工作的记忆、规划和学习能力。

核心评测环境是 Multi-Horizon Task Environments

Microsoft 为此构建了 Multi-Horizon Task Environments,也就是 MHTEs。在这种环境中,智能体需要在同一场长达五小时的会话里,同时处理多个复杂任务。

每个任务都包含 10 到 30 个相互依赖的步骤,目的是逼近现实办公中不断切换、彼此牵连的任务形态。

当前系统在并发负载下明显掉速

团队在大规模实验中总结出四类问题:记忆容量不够、不同任务间的信息会互相干扰、任务依赖关系并非简单串行,以及系统难以在长时段里稳定推进多件事。

在对三套独立智能体系统的测试中,随着并发任务数从 12 个增加到 46 个,整体完成率从 16.7% 下降到 8.7%,说明多任务办公仍是智能体落地的一大难点。

参与讨论

正在确认登录状态…