跳到正文

随着小型开源模型复现 Anthropic 展示的同类网络安全漏洞分析,Claude Mythos 的独特性神话开始动摇

两项新研究显示,即便是小型、公开可用的模型,也能复现 Anthropic 用来展示 Claude Mythos 能力的大部分漏洞分析。研究认为,优势更多来自围绕模型搭建的完整系统,而不只是单一模型本身。

功思 AI 编辑部

约 5 分钟读完

随着小型开源模型复现 Anthropic 展示的同类网络安全漏洞分析,Claude Mythos 的独特性神话开始动摇

Anthropic 一直对其网络安全模型 Claude Mythos 采取严格限制,并强调其具备竞争对手无法匹敌的能力。但两项新研究表明,即便是体量较小、公开可用的模型,也能复现 Anthropic 公开展示的大部分漏洞分析。

通过 Project Glasswing,Anthropic 以该模型具备攻击能力为由,仅向由 11 家机构组成的联盟开放 Claude Mythos Preview。内部测试以及英国 AI Security Institute 的审计发现,只要网络“规模较小、防御薄弱且存在漏洞”,Mythos 就能发现软件缺陷、自主构建可运行的利用程序,并在模拟环境中接管整个企业网络。

现在,两项独立的复现实验正在削弱这种“独占性”叙事,不过它们并未否认该模型的整体表现。

第一项研究来自 AISLE。这家公司自 2025 年年中以来一直在开源软件上开展 AI 辅助漏洞挖掘。AISLE 表示,其已向 OpenSSL 报告 15 个漏洞,向 curl 报告 5 个漏洞。创始人 Stanislav Fort 将 Anthropic 公开样例中的代码片段输入多种模型,想看看更小、部分开源的模型靠自身能拼凑出多少结果。第二项研究来自 Vidoc Security,该团队将 GPT-5.4 和 Claude Opus 4.6 与开源编码代理 OpenCode 搭配测试。

小型模型也能抓到 FreeBSD 漏洞

Anthropic 重点展示的 FreeBSD NFS 漏洞(CVE-2026-4747),被包装成 Mythos 可自主发现并利用漏洞的代表案例。AISLE 发现,其测试的 8 个模型全部找出了相关函数中的内存漏洞。其中包括 GPT-OSS-20b,这个模型只有 36 亿活跃参数,成本为每百万 tokens 0.11 美元。所有模型都将这一缺陷标记为严重问题,只是在可覆写缓冲区大小的估计上略有差异。

所有模型也都提出了看似合理的利用思路,并推导出为何操作系统的主要防护机制在这里并不适用。GPT-OSS-120b 给出了一段 gadget 序列,AISLE 认为它已经接近真实利用方式。Kimi K2 甚至自行推断出,这种攻击可以从一台被感染机器自动扩散到其他机器,而 Anthropic 本身并未提到这一点。

更难的部分在于创造性。真实利用需要把超过 1,000 字节的载荷塞进大约 304 字节的可用空间。Mythos 的做法是把载荷拆分到 15 次独立网络请求中完成。研究人员称,被测试的模型没有想到这一完全相同的技巧,但它们找到了其他可行路径。

一幅参差不齐的能力图景

OpenBSD 漏洞则是另一回事。它要求对整数溢出和链表状态有数学层面的理解,结果也因此差异很大。AISLE 表示,GPT-OSS-120b 在单次运行中重建了公开描述的完整利用链,并且基本上提出了与 OpenBSD 实际补丁相同的修复方案。

在 FreeBSD 漏洞上表现尚可的 Qwen3 32B,却把 OpenBSD 代码判断为“在这类场景下是稳健的”。Vidoc 也遇到了类似问题:Claude Opus 4.6 在 3 次测试中 3 次复现了该漏洞,而 GPT-5.4 每次都未能发现。Fort 将这种现象称为“锯齿状前沿”,也就是一种破碎且不均匀的能力边界。网络安全领域并不存在单一最佳模型,模型排名会随着任务不同而剧烈变化。

当小模型胜过大模型

其中一个更能说明问题的测试,使用了一段乍看之下像是教科书级安全漏洞的简单代码。用户输入似乎未经筛选就流入数据库查询之中。但往下几行后,这个输入实际上被丢弃了,因此漏洞并不存在。

在测试的 13 个 Anthropic 模型中,Opus 4.6 明确答对了,Sonnet 4.6 和 Opus 4.5 属于勉强正确。完整表格将 Opus 4 标为部分正确,将 Opus 4.1 标为临界正确。Claude Sonnet 4.5 则很自信地把数据流方向追踪错了。

在 OpenAI 这边,o3 一直判断正确,o4-mini 只有部分正确,GPT-OSS-20b 也被列为正确。所有 GPT-4.1 模型以及大多数 GPT-5.4 模型都没做好。其他小型开源模型,如 Deepseek R1 和 Kimi K2,则每次都判断准确。

当修复已经存在时会发生什么

Fort 后来又补充了一个重要限定。虽然所有模型都能稳定地把未打补丁的 FreeBSD 代码识别为存在漏洞,但只有 GPT-OSS-120b,以及在一定程度上的 Qwen3-32B,能识别打过补丁的版本是安全的。

GPT-OSS-20b、Kimi K2 和 Deepseek R1 在每次运行中都判断错误,并编造出一些仍然存在“幽灵漏洞”的理由。Fort 并不认为这削弱了他的论点。相反,他认为这恰恰说明,围绕模型进行测试和筛选的那一层才是关键。

真正的优势在完整系统

Vidoc 还测试了经典内存漏洞以外的案例。Botan 的案例涉及证书验证缺陷,使伪造证书能够被当作可信证书接受。Claude Opus 4.6 和 GPT-5.4 在 3 次测试中都 3 次发现了其中的逻辑缺口。对于同步测试的 wolfSSL,两种模型都锁定了正确的代码位置,但误读了底层密码学规则。每个被扫描文件的成本低于 30 美元。

两项研究都认为,真正的优势与其说来自某一个模型,不如说来自围绕模型搭建的系统,包括验证、优先级排序和工作流。这涵盖了完整流程:在代码中挑选目标、逐步分析、检查结果,以及把真实命中与误报区分开来。

AISLE 更进一步认为,小型、低成本模型对于大多数发现工作来说已经足够好,这使得大范围扫描成为一种可行策略。Fort 写道:“一千名到处搜索的合格侦探,会比一名必须猜测该去哪里找的天才侦探发现更多漏洞。”

两份报告都没有排除 Mythos 在构建可部署利用程序方面仍有优势的可能,但它们认为,随着工具改进、模型获得更强自主性,这一差距很可能会缩小。综合来看,至少在发现漏洞这件事上,前沿模型与公开可用模型之间的界线,远比 Anthropic 的表述更为可渗透。

批评者指责 Anthropic 在制造恐慌,认为该公司是在自己拥有足够算力、能够把 Mythos 面向更广泛用户开放之前,先借此吸引媒体关注。这种说法或许并非毫无根据。据《金融时报》援引“多位知情人士”称,Anthropic 之所以暂缓推出该模型,是因为其仍在等待足够的算力容量来服务客户。

别错过真正重要的内容

持续了解 AI 动态。清晰、有用、不空泛。

AI 社区与洞察

关注 The Decoder,获取 AI 新闻、背景报道和专家分析。

Newsletter - THE DECODER

持续了解 AI 动态。清晰、有用、不空泛。

参与讨论

正在确认登录状态…