跳到正文

Anthropic 的 Claude Opus 4.7 在编程能力上大幅跃升,同时有意削弱网络安全能力

Anthropic 发布 Claude Opus 4.7,主打自主编程提升,SWE-bench Pro 得分升至 64.3%。该模型图像理解增强、幻觉率下降,同时在训练中有意压低部分网络安全能力,定价不变但实际使用成本可能上升。

功思 AI 编辑部

约 4 分钟读完

Anthropic 的 Claude Opus 4.7 在编程能力上大幅跃升,同时有意削弱网络安全能力

Anthropic 新旗舰模型 Claude Opus 4.7 在编程任务上带来重大提升。在训练过程中,该公司还刻意尝试降低某些网络安全能力。

Anthropic 已发布 Claude Opus 4.7,作为前代 Opus 4.6 的直接升级版。公司将其主要定位为自主编程能力的一次进步。在 SWE-bench Pro 编程基准上,Opus 4.7 得分 64.3%,高于前代的 53.4%,也领先于 OpenAI 的 GPT-5.4(57.7%)。不过,Anthropic 自家的顶级模型 Claude Mythos Preview 仍以 77.8% 大幅领先。

Anthropic 表示,Opus 4.7 比前代更能精确遵循指令。公司指出,为旧模型编写的提示词现在可能会产生意料之外的结果,因为 Opus 4.7 对指令的理解比 Opus 4.6 更字面化,而后者有时会较宽松地理解指令,甚至完全跳过其中部分内容。

图像分辨率提升至原来的三倍,以增强视觉理解

Opus 4.7 可处理长边最高 2,576 像素的图像。Anthropic 称,这大致相当于 375 万像素,超过此前 Claude 模型可处理水平的三倍。这不是 API 设置,而是模型层面的变化:图像会自动以更高分辨率处理,但因此也会消耗更多 token。不需要额外细节的用户,可以在发送前先将图像缩小。

Anthropic 认为,这对需要读取高密度截图的计算机使用代理,以及从复杂图表中提取数据的场景,是一项重要优势。在文档推理基准(OfficeQA Pro)上,该公司报告的准确率为 80.6%,高于 Opus 4.6 的 57.1%。这些基准还显示,该模型在生物分子推理和视觉导航(ScreenSpot-Pro)方面也有显著提升。

Anthropic 有意限制网络安全能力

此次发布较为引人注意的一点,是 Anthropic 对模型网络安全能力的处理方式。该公司表示,它在训练中曾进行实验,尝试有差别地降低某些网络安全能力。新的安全防护旨在自动检测并拦截暗示被禁止或高风险网络安全用途的请求。

其背景是 Anthropic 近期公布的 Project Glasswing,在该项目中,公司讨论了 AI 模型在网络安全方面的风险与收益。Anthropic 此前解释称,它会限制能力更强的 Mythos Preview 的发布,并先在能力较弱的模型上测试新的安全防护。Opus 4.7 是这一策略的首个测试案例。

希望将该模型用于渗透测试或红队测试的安全研究人员,可以报名参加新的 Cyber Verification Program。

幻觉减少,但并未消失

根据系统卡,Anthropic 将幻觉分为两类:事实幻觉,即对现实世界作出错误断言,例如捏造引述或错误数据;以及输入幻觉,即模型表现得像是能够访问实际上并不存在的工具或附件。

在事实幻觉方面,Opus 4.7 在四项基准上的表现优于或不逊于 Opus 4.6,但仍落后于 Mythos Preview。Anthropic 表示,这一差距主要来自 Mythos Preview 在冷门事实上的命中率更高,而不是 Opus 4.7 的错误率更高。

在输入幻觉方面,当用户请求一个并不存在的工具时,Opus 4.7 在所有测试模型中取得了最低的幻觉率。当上下文信息缺失时,它的表现接近 Mythos Preview,并明显领先于较旧模型。不过,Anthropic 也承认,工具集相关的测试案例是针对 Opus 4.6 的弱点定制的,这会使该模型的结果产生偏差。

在处理基于虚构事实的问题时,Opus 4.7 与 Opus 4.6 表现相当,低于 Mythos Preview。在受压情境下,例如用户或系统提示推动模型否定其自身判断时,Opus 4.7 比 Opus 4.6 更诚实,但不如 Mythos Preview 坚定。

对齐结果喜忧参半

总体来看,Anthropic 将 Opus 4.7 的安全特征描述为与 Opus 4.6 相近,在欺骗、迎合以及配合滥用方面的发生率都较低。该模型对提示词注入攻击的抵抗力更强。

早期 Claude 模型中的一个已知问题仍部分存在:拒绝协助合法的 AI 安全研究。根据系统卡,Opus 4.7 在模拟安全研究任务中仍有 33% 的情况下拒绝提供帮助。相比 Opus 4.6 的 88%,这已明显下降,但占比仍然不低。

单个 token 定价不变,但实际成本可能高得多

定价保持不变,输入 token 每百万 5 美元,输出 token 每百万 25 美元。不过,Opus 4.7 使用了新的分词器,可能会把相同文本映射为最多 1.35 倍的 token 数。在更高 effort 等级下,该模型还会生成更多输出 token。实际使用中,尽管单个 token 的价格不变,每次请求的成本仍可能显著上升。

名为“xhigh”的新 effort 等级被加入“high”和“max”之间。Claude Code 也新增了用于专门代码审查的“/ultrareview”命令,并为 Max 用户扩展了“Auto Mode”,在该模式下 Claude 会自行作出决策。Opus 4.7 已可通过 Claude API、Amazon Bedrock、Google Cloud Vertex AI 和 Microsoft Foundry 使用。

更多细节和建议可在 Opus 4.7 的迁移指南中找到。

参与讨论

正在确认登录状态…