跳到正文

Google DeepMind发布衡量AGI进展的认知框架,并启动20万美元评测挑战

Google DeepMind发布论文《Measuring Progress Toward AGI: A Cognitive Taxonomy》,试图以心理学、神经科学和认知科学为基础,为AGI进展建立更系统的能力分类与评测方法。

功思 AI 编辑部

约 2 分钟读完

Google DeepMind发布衡量AGI进展的认知框架,并启动20万美元评测挑战

导语

Google DeepMind正试图把“我们距离AGI还有多远”这个模糊问题,转化为一个可测量、可比较、可复现的研究问题。该团队发布的新论文《Measuring Progress Toward AGI: A Cognitive Taxonomy》提出,评估通用人工智能进展,不能只看单项基准成绩,而应借助心理学、神经科学和认知科学中的长期研究成果,从更完整的认知能力视角理解模型。

框架想解决什么问题

DeepMind在文章中指出,AGI之所以难以讨论,一个核心原因是缺少经验性的评价工具。行业里经常会围绕“模型是不是更聪明了”展开争论,但如果没有一套相对稳定的能力分类与对照标准,就很难判断模型究竟是在某些任务上刷分,还是在更广泛的通用智能上取得进展。为此,团队提出了一个认知分类体系,列出10项他们认为对通用智能至关重要的关键能力。

这些能力并非只为了做学术概念展示,而是要进一步进入评测协议。DeepMind提出一个三阶段评估方法,主张把AI系统表现和人类能力放在同一坐标里进行比较,用更系统的方法观察不同模型在学习、注意、执行功能、元认知、社会认知等维度上的进展差异。

AGI认知能力框架示意图

AGI认知能力框架示意图

社区参与与奖金设置

为了让这套框架从论文走向可执行实践,DeepMind还与Kaggle合作发起了名为“Measuring progress toward AGI: Cognitive abilities”的挑战赛。此次活动把重点放在五类“评测缺口最大”的能力上,分别是学习、元认知、注意、执行功能和社会认知,并鼓励研究社区为这些能力设计新的评测方式。

参赛者可以使用Kaggle新推出的Community Benchmarks平台,直接对前沿模型构建和测试评测。奖金池总额为20万美元:五个赛道各自前两名将获得1万美元奖励,另外还会从所有作品中评出4个总冠军,每个奖励2.5万美元。官方给出的时间表是3月17日开放提交,4月16日截止,6月1日公布结果。

对行业的意义

这件事的意义,在于它把AGI讨论从营销叙事重新拉回到评测方法。随着大模型和智能体能力持续增强,行业越来越需要能跨模型、跨任务、跨时间复用的测量框架。DeepMind这次没有直接宣称“AGI接近了”,而是先补方法论地基:先定义要测什么,再定义如何测。

对研究者和开发者来说,这类框架有助于发现模型能力的真实短板,而不只是追逐单一排行榜。对产业界来说,更精细的认知评测也可能影响未来模型训练目标、风险评估和产品路线。即便这套框架仍需大量社区验证,它至少为“AGI进展如何量化”提供了一个更严肃的起点。

参与讨论

正在确认登录状态…