
把办公场景的并行任务搬进评测
Microsoft Research 指出,真实知识工作往往同时涉及报告、预算表、演示文稿和邮件等多项相互依赖的任务,但现有主流 AI 智能体通常仍按“单任务一次完成”的方式被评测。
为缩小这一差距,团队在论文《CORPGEN: Simulating Corporate Environments with Autonomous Digital Employees in Multi-Horizon Task Environments》中提出了 CORPGEN,希望让智能体具备更适合真实工作的记忆、规划和学习能力。
核心评测环境是 Multi-Horizon Task Environments
Microsoft 为此构建了 Multi-Horizon Task Environments,也就是 MHTEs。在这种环境中,智能体需要在同一场长达五小时的会话里,同时处理多个复杂任务。
每个任务都包含 10 到 30 个相互依赖的步骤,目的是逼近现实办公中不断切换、彼此牵连的任务形态。
当前系统在并发负载下明显掉速
团队在大规模实验中总结出四类问题:记忆容量不够、不同任务间的信息会互相干扰、任务依赖关系并非简单串行,以及系统难以在长时段里稳定推进多件事。
在对三套独立智能体系统的测试中,随着并发任务数从 12 个增加到 46 个,整体完成率从 16.7% 下降到 8.7%,说明多任务办公仍是智能体落地的一大难点。



