跳到正文

MetaClaw 框架会在你开会时通过检查 Google Calendar 训练 AI 代理

美国四所大学的研究人员提出 MetaClaw 框架,让 AI 代理在运行中持续改进。系统会结合 Google Calendar、键鼠空闲等信号,选择用户不在工作的时段进行训练。

功思 AI 编辑部

约 2 分钟读完

MetaClaw 框架会在你开会时通过检查 Google Calendar 训练 AI 代理

来自美国四所大学的研究人员构建了一个可在运行过程中改进 AI 代理的框架。它会查看用户的 Google Calendar,以判断何时进行训练。

大多数基于大语言模型构建的 AI 代理只在发布前训练一次,之后便按原样交付使用。但用户需求始终在变化,模型本身却不会随之适应。

北卡罗来纳大学教堂山分校、卡内基梅隆大学、加州大学圣克鲁兹分校和加州大学伯克利分校的研究人员正通过 MetaClaw 解决这个问题。这个框架可以让 AI 代理通过从自身错误中学习而持续改进,而且大多数情况下用户不会察觉,服务也不会中断。

失败任务会转化为新的行为规则

第一种机制会在代理任务失败时启动。另一个语言模型会分析失败的交互,并从中提炼出一条紧凑的行为规则。这条规则会被直接注入代理的系统提示词中,并立刻应用到之后的所有任务。模型本身不做改动,服务也会继续运行。

论文称,这一过程中主要会产生三类规则:正确规范化时间格式、在执行破坏性文件操作前创建备份,以及遵循命名约定。由于这些规则并不绑定于单一任务,一次错误也可能推动之后完全不同任务的改进。

训练会在你不注意时进行

第二种机制则通过基于云端的 LoRA 微调,以强化学习方式更新模型权重。由于这种更新会短暂打断代理运行,因此不能在用户正积极工作时执行。

为了解决这个问题,研究人员构建了一个名为 OMLS(Opportunistic Meta-Learning Scheduler,机会式元学习调度器)的后台进程,用来监测三类信号:可配置的休眠时间、操作系统层面的键盘和鼠标不活动状态,以及 Google Calendar 事件。如果日历显示用户正在开会,就会开启一个训练窗口。训练器可以暂停和恢复,因此即便是短暂的空闲时段也能被利用起来。

系统严格区分规则变更前收集的数据和变更后收集的数据。只有规则变更后的数据会进入训练。否则,模型会因为那些已被新行为规则修正的错误而继续受到惩罚。

研究人员表示,这两种机制会相互促进:更好的模型会产生信息量更高的错误,从而导出更好的规则;而更好的规则又会为下一次权重更新生成质量更高的训练数据。

较弱模型几乎缩小差距

研究人员在一个自定义基准上测试了 MetaClaw,该基准包含 44 个模拟工作日中的 934 个问题,使用的模型为 GPT-5.2 和 Kimi-K2.5。仅行为规则一项,就能让 Kimi-K2.5 的准确率相对提升最高 32 percent。完整框架则将 Kimi-K2.5 从 21.4 percent 提升到 40.6 percent,几乎追平 GPT-5.2 的 41.1 percent 基线。完全解决任务的比率提升了 8.25 倍。

参与讨论

正在确认登录状态…