来自美国四所大学的研究人员构建了一个可在运行过程中改进 AI 代理的框架。它会查看用户的 Google Calendar,以判断何时进行训练。
大多数基于大语言模型构建的 AI 代理只在发布前训练一次,之后便按原样交付使用。但用户需求始终在变化,模型本身却不会随之适应。
北卡罗来纳大学教堂山分校、卡内基梅隆大学、加州大学圣克鲁兹分校和加州大学伯克利分校的研究人员正通过 MetaClaw 解决这个问题。这个框架可以让 AI 代理通过从自身错误中学习而持续改进,而且大多数情况下用户不会察觉,服务也不会中断。
失败任务会转化为新的行为规则
第一种机制会在代理任务失败时启动。另一个语言模型会分析失败的交互,并从中提炼出一条紧凑的行为规则。这条规则会被直接注入代理的系统提示词中,并立刻应用到之后的所有任务。模型本身不做改动,服务也会继续运行。
论文称,这一过程中主要会产生三类规则:正确规范化时间格式、在执行破坏性文件操作前创建备份,以及遵循命名约定。由于这些规则并不绑定于单一任务,一次错误也可能推动之后完全不同任务的改进。
训练会在你不注意时进行
第二种机制则通过基于云端的 LoRA 微调,以强化学习方式更新模型权重。由于这种更新会短暂打断代理运行,因此不能在用户正积极工作时执行。
为了解决这个问题,研究人员构建了一个名为 OMLS(Opportunistic Meta-Learning Scheduler,机会式元学习调度器)的后台进程,用来监测三类信号:可配置的休眠时间、操作系统层面的键盘和鼠标不活动状态,以及 Google Calendar 事件。如果日历显示用户正在开会,就会开启一个训练窗口。训练器可以暂停和恢复,因此即便是短暂的空闲时段也能被利用起来。
系统严格区分规则变更前收集的数据和变更后收集的数据。只有规则变更后的数据会进入训练。否则,模型会因为那些已被新行为规则修正的错误而继续受到惩罚。
研究人员表示,这两种机制会相互促进:更好的模型会产生信息量更高的错误,从而导出更好的规则;而更好的规则又会为下一次权重更新生成质量更高的训练数据。
较弱模型几乎缩小差距
研究人员在一个自定义基准上测试了 MetaClaw,该基准包含 44 个模拟工作日中的 934 个问题,使用的模型为 GPT-5.2 和 Kimi-K2.5。仅行为规则一项,就能让 Kimi-K2.5 的准确率相对提升最高 32 percent。完整框架则将 Kimi-K2.5 从 21.4 percent 提升到 40.6 percent,几乎追平 GPT-5.2 的 41.1 percent 基线。完全解决任务的比率提升了 8.25 倍。



