我们其实并不了解 AI 的内部运作机制,因此在很大程度上等于是在盲飞。
人工智能能否用于战争,正处于 Anthropic 与五角大楼法律争议的核心。这场争论已经变得紧迫,因为在当前与伊朗的冲突中,AI 所起的作用比以往任何时候都更大。AI 已不再只是帮助人类分析情报。它如今已经成为主动参与者,能够实时生成目标、控制并协调导弹拦截,以及引导具有杀伤力的自主无人机群。
围绕 AI 驱动的自主致命武器,公众讨论大多集中在人类应在多大程度上继续“留在回路中”。按照五角大楼当前的指导方针,人类监督据称能够提供问责、语境和细致判断,同时降低遭受黑客攻击的风险。
AI 系统是不透明的“黑箱”
但关于“人在回路中”的争论,其实是一种令人安心的干扰。眼前真正的危险,不是机器会在没有人类监督的情况下行动,而是人类监督者根本不知道机器实际上在“想”什么。五角大楼的指导方针从根本上就有缺陷,因为它建立在一个危险的假设之上:人类理解 AI 系统如何运作。
我研究人脑中的意图已有数十年,近年也开始研究 AI 系统中的意图。基于这些经验,我可以确认,最先进的 AI 系统本质上就是“黑箱”。我们知道输入和输出,但处理中间过程的人工“脑”仍然是不透明的。即便是它们的创造者,也无法完整解释或真正理解它们如何工作。而且,当 AI 给出理由时,这些理由也并不总是可信。
自主系统中“人类监督”的幻觉
在人类监督的争论中,有一个根本问题一直没有被提出:我们能否在 AI 系统行动之前,理解它打算做什么?
设想一架自主无人机的任务是摧毁一座敌方军火工厂。自动化指挥与控制系统认定,最佳目标是一栋弹药储存建筑。它报告称任务成功概率为 92%,因为该建筑内弹药引发的二次爆炸将彻底摧毁整座设施。一名人类操作员审查了这一合法军事目标,看到了很高的成功率,于是批准了打击。
但操作员不知道的是,AI 系统的计算中包含了一个隐藏因素:除了重创军火工厂外,二次爆炸还会严重破坏附近的一家儿童医院。随后,应急响应将把重点放在医院上,从而确保工厂被烧毁。对 AI 来说,以这种方式最大化破坏符合它被赋予的目标。但对人类来说,这可能是在违反有关平民生命规则的情况下犯下战争罪。
让人类留在回路中,未必能提供人们所想象的保障,因为人在 AI 行动之前并不知道它的意图。先进的 AI 系统并不只是执行指令;它们还会解释指令。如果操作员未能足够精确地定义目标,而这在高压情境下很可能发生,那么这个“黑箱”系统可能确实在按指示做事,却仍然没有按照人类本来的意图行动。
AI 系统与人类操作员之间这种“意图鸿沟”,正是为什么我们在民用医疗或空中交通管制中对部署前沿黑箱 AI 犹豫不决,也正是为什么它进入职场时仍充满风险。然而,我们却在急于把它部署到战场上。
更糟的是,如果冲突一方部署了完全自主、以机器速度和规模运作的武器,为了维持竞争力,另一方也会被迫依赖这类武器。这意味着,战争中越来越自主且越来越不透明的 AI 决策,只会继续增长。
解决之道:推进 AI 意图科学
AI 科学既必须包括构建高度强大的 AI 技术,也必须包括理解这项技术如何运作。在开发和构建更强大模型方面,我们已经取得了巨大进展,而这背后是创纪录的投资。Gartner 预测,仅在 2026 年,这一数字就将增长到约 2.5 万亿美元。相比之下,用于理解这项技术如何运作的投资却微乎其微。
我们需要一次巨大的范式转变。工程师们正在构建能力越来越强的系统。但理解这些系统如何工作,并不只是一个工程问题,它需要跨学科的努力。我们必须建立工具,在 AI 智能体行动之前,对其意图进行刻画、测量和干预。我们需要描绘驱动这些智能体的神经网络内部通路,从而对其决策形成真正的因果理解,而不只是停留在观察输入与输出。
一条有前景的前进路径,是将机制可解释性的方法,与意图神经科学中的洞见、工具和模型结合起来。机制可解释性旨在把神经网络拆解为人类可以理解的组成部分。另一个思路,则是开发透明、可解释的“审计员”AI,用于实时监测能力更强的黑箱系统的行为及其涌现目标。
如果我们能更好地理解 AI 如何运作,就能在任务关键型应用中更有把握地依赖 AI 系统。这也会让我们更容易构建更高效、更强大且更安全的系统。
我和同事们正在探索,神经科学、认知科学和哲学中的一些观点能否帮助我们理解人工系统的意图。这些领域研究的是人类决策中意图如何产生。我们必须优先推动这类跨学科努力,包括学术界、政府和产业界之间的合作。
不过,我们需要的不只是学术探索。科技行业,以及为 AI 对齐提供资金支持的慈善家,都必须把大量投资投向跨学科的可解释性研究。AI 对齐试图把人类价值观和目标编码进这些模型。此外,随着五角大楼推进越来越自主的系统,国会必须强制要求对 AI 系统的意图进行严格测试,而不只是测试其性能。
在做到这一点之前,人类对 AI 的监督可能更像是一种幻觉,而不是一种保障。
Uri Maoz 是一位认知与计算神经科学家,专门研究大脑如何将意图转化为行动。他是 Chapman University 的教授,同时在加州大学洛杉矶分校(UCLA)和加州理工学院(Caltech)任职,并领导一项跨学科计划,专注于理解和测量人工智能系统中的意图(ai-intentions.org)。



