跳到正文

为什么在 AI 战争中保留“人在回路中”是一种幻觉

随着 AI 在战争中从情报辅助转向实时生成目标、协调导弹拦截和引导自主无人机群,作者认为“人在回路中”并非真正保障。问题在于,人类并不了解黑箱 AI 的内部机制与意图,因此需要大幅加强 AI 可解释性与意图研究。

功思 AI 编辑部

约 5 分钟读完

为什么在 AI 战争中保留“人在回路中”是一种幻觉

我们其实并不了解 AI 的内部运作机制,因此在很大程度上等于是在盲飞。

人工智能能否用于战争,正处于 Anthropic 与五角大楼法律争议的核心。这场争论已经变得紧迫,因为在当前与伊朗的冲突中,AI 所起的作用比以往任何时候都更大。AI 已不再只是帮助人类分析情报。它如今已经成为主动参与者,能够实时生成目标、控制并协调导弹拦截,以及引导具有杀伤力的自主无人机群。

围绕 AI 驱动的自主致命武器,公众讨论大多集中在人类应在多大程度上继续“留在回路中”。按照五角大楼当前的指导方针,人类监督据称能够提供问责、语境和细致判断,同时降低遭受黑客攻击的风险。

AI 系统是不透明的“黑箱”

但关于“人在回路中”的争论,其实是一种令人安心的干扰。眼前真正的危险,不是机器会在没有人类监督的情况下行动,而是人类监督者根本不知道机器实际上在“想”什么。五角大楼的指导方针从根本上就有缺陷,因为它建立在一个危险的假设之上:人类理解 AI 系统如何运作。

我研究人脑中的意图已有数十年,近年也开始研究 AI 系统中的意图。基于这些经验,我可以确认,最先进的 AI 系统本质上就是“黑箱”。我们知道输入和输出,但处理中间过程的人工“脑”仍然是不透明的。即便是它们的创造者,也无法完整解释或真正理解它们如何工作。而且,当 AI 给出理由时,这些理由也并不总是可信。

自主系统中“人类监督”的幻觉

在人类监督的争论中,有一个根本问题一直没有被提出:我们能否在 AI 系统行动之前,理解它打算做什么?

设想一架自主无人机的任务是摧毁一座敌方军火工厂。自动化指挥与控制系统认定,最佳目标是一栋弹药储存建筑。它报告称任务成功概率为 92%,因为该建筑内弹药引发的二次爆炸将彻底摧毁整座设施。一名人类操作员审查了这一合法军事目标,看到了很高的成功率,于是批准了打击。

但操作员不知道的是,AI 系统的计算中包含了一个隐藏因素:除了重创军火工厂外,二次爆炸还会严重破坏附近的一家儿童医院。随后,应急响应将把重点放在医院上,从而确保工厂被烧毁。对 AI 来说,以这种方式最大化破坏符合它被赋予的目标。但对人类来说,这可能是在违反有关平民生命规则的情况下犯下战争罪。

让人类留在回路中,未必能提供人们所想象的保障,因为人在 AI 行动之前并不知道它的意图。先进的 AI 系统并不只是执行指令;它们还会解释指令。如果操作员未能足够精确地定义目标,而这在高压情境下很可能发生,那么这个“黑箱”系统可能确实在按指示做事,却仍然没有按照人类本来的意图行动。

AI 系统与人类操作员之间这种“意图鸿沟”,正是为什么我们在民用医疗或空中交通管制中对部署前沿黑箱 AI 犹豫不决,也正是为什么它进入职场时仍充满风险。然而,我们却在急于把它部署到战场上。

更糟的是,如果冲突一方部署了完全自主、以机器速度和规模运作的武器,为了维持竞争力,另一方也会被迫依赖这类武器。这意味着,战争中越来越自主且越来越不透明的 AI 决策,只会继续增长。

解决之道:推进 AI 意图科学

AI 科学既必须包括构建高度强大的 AI 技术,也必须包括理解这项技术如何运作。在开发和构建更强大模型方面,我们已经取得了巨大进展,而这背后是创纪录的投资。Gartner 预测,仅在 2026 年,这一数字就将增长到约 2.5 万亿美元。相比之下,用于理解这项技术如何运作的投资却微乎其微。

我们需要一次巨大的范式转变。工程师们正在构建能力越来越强的系统。但理解这些系统如何工作,并不只是一个工程问题,它需要跨学科的努力。我们必须建立工具,在 AI 智能体行动之前,对其意图进行刻画、测量和干预。我们需要描绘驱动这些智能体的神经网络内部通路,从而对其决策形成真正的因果理解,而不只是停留在观察输入与输出。

一条有前景的前进路径,是将机制可解释性的方法,与意图神经科学中的洞见、工具和模型结合起来。机制可解释性旨在把神经网络拆解为人类可以理解的组成部分。另一个思路,则是开发透明、可解释的“审计员”AI,用于实时监测能力更强的黑箱系统的行为及其涌现目标。

如果我们能更好地理解 AI 如何运作,就能在任务关键型应用中更有把握地依赖 AI 系统。这也会让我们更容易构建更高效、更强大且更安全的系统。

我和同事们正在探索,神经科学、认知科学和哲学中的一些观点能否帮助我们理解人工系统的意图。这些领域研究的是人类决策中意图如何产生。我们必须优先推动这类跨学科努力,包括学术界、政府和产业界之间的合作。

不过,我们需要的不只是学术探索。科技行业,以及为 AI 对齐提供资金支持的慈善家,都必须把大量投资投向跨学科的可解释性研究。AI 对齐试图把人类价值观和目标编码进这些模型。此外,随着五角大楼推进越来越自主的系统,国会必须强制要求对 AI 系统的意图进行严格测试,而不只是测试其性能。

在做到这一点之前,人类对 AI 的监督可能更像是一种幻觉,而不是一种保障。

Uri Maoz 是一位认知与计算神经科学家,专门研究大脑如何将意图转化为行动。他是 Chapman University 的教授,同时在加州大学洛杉矶分校(UCLA)和加州理工学院(Caltech)任职,并领导一项跨学科计划,专注于理解和测量人工智能系统中的意图(ai-intentions.org)。

参与讨论

正在确认登录状态…