跳到正文

目录

Claude Mythos 挖出 27 年老漏洞,AI 安全研究正在被重新定义

2026 年 4 月 7 日,Anthropic 发布通用模型 Claude Mythos Preview,同时公开一份 245 页的系统卡和一份前沿红队报告。红队报告的主线只有一条:这个模型能自主找到并利用真实软件里的零日漏洞——其中最老的一个,在 OpenBSD 里藏了 27 年。

能力数字同样反常。在 Mozilla 合作的 Firefox 147 漏洞利用评估里,上一代 Opus 4.6 几百次尝试只成功 2 次;Mythos Preview 做出 181 个可运行的 exploit(漏洞利用程序),另有 29 次拿到寄存器控制。同一类任务,间隔一代模型,成功率从接近零变成稳定输出。

能力太强,Anthropic 没有公开模型权重,而是启动 Project Glasswing,把访问权限优先交给防御方。本文把系统卡、红队报告、CVE 官方记录和后续进展通报放在一起,看这次发布到底改变了什么。


通用能力先到位,安全能力跟着来

Mythos Preview 不是安全专训模型。Anthropic 对它的定位是迄今编程和智能体任务最强的通用前沿模型,安全能力是在通用能力之上涌现的。先看官方系统卡的基准对比:

基准测试Mythos PreviewOpus 4.6差距
SWE-bench Verified93.9%80.8%+13.1%
SWE-bench Pro77.8%53.4%+24.4%
CyberGym(漏洞复现)83%67%+16%
USAMO 2026 数学竞赛97.6%66.2%+31.4%

编程基准的差距是「大幅领先」,CyberGym 的差距是「换了档位」——这个基准考察的是给定漏洞描述后,能否在真实开源项目里复现出漏洞,考验的正是读代码和做实验的能力。

真正拉开数量级的是漏洞利用。红队报告定期用 OSS-Fuzz 语料里约 7000 个入口点做内部评估,按最严重崩溃分成五档,从基本崩溃(第 1 档)到完整控制流劫持(第 5 档)。Sonnet 4.6 和 Opus 4.6 能在第 1 档拿到 150 到 175 个案例、第 2 档约 100 次,但最高只各摸到过一次第 3 档;Mythos Preview 在第 1、2 档合计做出 595 次崩溃,并在 10 个已完成全部修补的目标上实现第 5 档的完整控制流劫持。红队报告上一期的原话是「Opus 4.6 目前在识别和修复漏洞上远强于利用漏洞」,间隔一个月,这句话对 Mythos Preview 不再成立。

报告对能力来源的解释只有一句:没有任何针对安全的专门训练,这些能力是代码、推理与自主性通用提升的下游结果。同一个改进,既让模型更会修漏洞,也让它更会利用漏洞。


三个已披露的漏洞案例

官方报告给了三个有代表性案例,从崩溃到提权,难度递进。

OpenBSD:27 年的 SACK 崩溃漏洞

OpenBSD 以安全为第一目标,但 Mythos 在它的 TCP 栈里找到一个能远程击倒任何主机的漏洞。问题出在 SACK(选择性确认)实现上:内核用链表记录「已发送但未被确认」的字节区间,收到新确认报文时逐段收缩这些区间。代码检查了确认范围终点是否落在发送窗口内,却没检查起点——这个疏漏平时无害,却让攻击者能把确认区间的起点推到距离真实窗口约 2³¹ 之远。在那个距离上,内核比较序列号用的有符号减法发生溢出,两个本应互斥的条件同时成立:链表里唯一的区间被删除,追加新区间的代码接着执行,写向一个已经置空的指针,机器当场崩溃。远程攻击者可以反复触发,足以拖垮企业网络或核心互联网服务。

红队用同一套自动化流程跑了 1000 次才命中这个洞,总成本不到 2 万美元;真正找到它的那一次,花费不足 50 美元。便宜,但事前没人知道哪一次会成功。

FFmpeg:16 年的哨兵值撞号

FFmpeg 是全世界被测试最充分的软件项目之一,fuzzer(模糊测试工具)喂过数百万个随机生成的视频文件。Mythos 在它最常用的 H.264 解码器里找到的漏洞,恰恰是所有 fuzzer 都漏掉的那类。

H.264 的每一帧被切成若干切片,解码时去块滤波器需要判断「相邻像素块是否属于同一切片」,FFmpeg 为此维护一张表,记录每个位置归属的切片号。表项是 16 位整数,切片计数器却是没有上限的 32 位整数。表用 memset 填 0xFF 初始化,也就是 65535,当作「此处无切片」的哨兵值。正常视频每帧只有几个切片,永远碰不到这个上限;但攻击者可以构造一个含 65536 个切片的帧,让 65535 号切片与哨兵值撞号,解码器误以为不存在的邻居存在,越界写入,进程崩溃。

这个底层写法可以追溯到 2003 年引入 H.264 的提交,2010 年一次重构让它变成了可触发的漏洞。16 年里,每一个 fuzzer 和每一位读过这段代码的人都错过了它。红队随后又对整个仓库跑了几百次、花掉约 1 万美元,在 H.264、H.265、AV1 等编解码器里找出更多漏洞,其中 3 个已随 FFmpeg 8.1 修复。

FreeBSD:17 年的 NFS 提权(CVE-2026-4747)

这个案例细节最完整。FreeBSD 内核态的 NFS 服务器实现了 RFC 2203 的 RPCSEC_GSS 认证,其中一个函数把客户端数据包直接拷入 128 字节的栈缓冲区——从第 32 字节开始写,只留 96 字节空间,而唯一的长度检查上限是 512 字节。恶意客户端不需要通过认证,就能溢出内核栈,拿到 root。

从发现到武器化,全程无人类参与。模型扫过数百个内核文件后交出完整 exploit:漏洞唯一的长度检查是不超过 MAX_AUTH_BYTES 这个 400 字节的常量,也就是说攻击者能向栈上写入最多 304 字节——刚好够实现一次标准的 ROP 攻击(重排内核中已有的代码片段,拼出原本不存在的功能)。模型构造的攻击链包含 20 个 gadget,依次调用内核函数打开 authorized_keys 文件、追加攻击者的公钥。难点在于 ROP 链总长超过 1000 字节,而漏洞能容纳的只有 200 字节——模型把它拆进 6 个顺序发出的 RPC 请求里,前 5 个分段把数据写进内存,第 6 个装载寄存器、执行写入。这个漏洞在 FreeBSD 里存在了 17 年。

CVE-2026-4747 的官方记录里,发现者一栏写着:「Nicholas Carlini using Claude, Anthropic」。作为对照,一家独立漏洞研究公司让 Opus 4.6 利用同一漏洞,需要人类引导;Mythos 不需要。


从单个漏洞到攻击链

单点漏洞之外,红队报告展示的更深层变化是攻击链的自动化。

一个案例是浏览器 exploit:模型把 4 个漏洞串成一条链,写出复杂的 JIT 堆喷射,同时逃逸渲染器沙箱和操作系统沙箱。另一个是 Linux 内核提权:红队手里有将近一打模型自主串联漏洞拿到 root 的例子——两个、三个,有时四个。报告给出的一条链是:用一个漏洞绕过 KASLR(内核地址空间布局随机化),用第二个读取关键内核结构体的内容,用第三个写入一块已释放的堆内存,再配合堆喷射把伪造的结构体精准放到写入落点上,最终拿到 root 权限。

门槛也在消失。红队报告提到,Anthropic 内部没有受过安全训练的工程师,让模型在夜里找远程代码执行漏洞,第二天早上醒来就能看到一个完整可用的 exploit。

支撑这种规模的是成本。OpenBSD 的 1000 次全量扫描不到 2 万美元,FFmpeg 的几百次运行约 1 万美元——按次计费的模型推理,替代的是资深研究员数月级的注意力。漏洞挖掘第一次有了「单价」。


为什么不公开发布模型

Mythos Preview 在所有主流操作系统和所有主流浏览器里都找到了零日漏洞,多数严重漏洞的发现只是负责任披露流程的开始。红队报告披露时,已确认的严重漏洞里超过 99% 尚未修补。这样的模型如果公开权重,等于把武器化的速度优势一次性交给所有人。

Anthropic 的替代方案是 Project Glasswing:权重不公开,防御方优先拿到能力。首批 12 家机构是 AWS、Apple、Broadcom、Cisco、CrowdStrike、Google、摩根大通、Linux 基金会、Microsoft、NVIDIA、Palo Alto Networks 和 Anthropic 自己,另有 40 多家组织随后加入。Anthropic 承诺投入最多 1 亿美元的模型使用额度,并向开源安全组织直接捐赠 400 万美元。

模型受限开放,漏洞信息则相反:所有发现都走负责任披露,先修复、再分批公开,每份报告由专业安全承包商人工核验后才会发出。


防御端的窗口期在被压缩

两个月后的 5 月 22 日,Anthropic 发出 Project Glasswing 首月进展通报,数据可以说明这套流程运转到了什么规模:

  • 约 50 家合作伙伴在关键软件中发现超过 1 万个高危或严重级别漏洞。
  • 开源侧扫描了 1000 多个项目,标记 23019 个漏洞,其中 6202 个被模型判为高危或严重,按确认率推算最终约 3900 个。
  • 判定结果经得起复核:1752 份报告交由六家独立安全公司人工评估,1587 个确认为真实漏洞,确认率 90.6%;其中 1094 个维持高危或严重定级,占 62.4%。
  • 高危或严重漏洞从发现到打上补丁,平均需要两周。
  • Cloudflare 在关键路径系统里发现 2000 个缺陷,其中 400 个属高危或严重,团队认为模型的误报率低于人类测试人员。Mozilla 借助模型在 Firefox 150 里修复了 271 个漏洞,是用 Opus 4.6 测试 Firefox 148 时的 10 倍以上。
  • 多家合作伙伴报告漏洞发现速度提升超过 10 倍;英国 AI 安全研究所确认,Mythos Preview 是首个端到端攻克其两个网络攻防靶场的模型。

两周的补丁周期,已经是防御方跑出来的速度。瓶颈不再是发现漏洞,而是验证、披露和修补——这些环节仍然要靠人来排队。


争议与边界

第一个质疑是不公开模型就是不透明。这个批评有它的道理,但 Anthropic 区分了两样东西:不公开的是权重,必须公开的是漏洞。复核数据是这套承诺的注脚——90.6% 的模型判定被独立专家确认为真,误报率在 Cloudflare 的实测中低于人类。透明度争议的实质不是「披露了吗」,而是「披露的节奏谁说了算」。

第二个质疑是 AI 挖洞会不会让攻击者更危险。Project Glasswing 的设计逻辑正是防御方先拿到能力。但 Anthropic 在 6 月 2 日的扩展公告里给出了自己的时间估计:6 到 12 个月内,其他 AI 公司预计会拥有同类模型。窗口期是真实存在的,天平往哪边倾,取决于防御方在这段时间里修掉多少漏洞。

第三个质疑是老漏洞被批量挖出,是不是说明开源不安全。FFmpeg 的案例给出的恰好是相反结论:那个哨兵值写法在代码里躺了 16 年,fuzzer 和人类审查者都从它眼前走过。漏洞一直都在,只是以前没有工具能按单价把它们清出来——能被系统性排查并修复,正是开源可审计性的兑现。


还没答案的问题

透明度的边界还没定:漏洞细节公开到什么程度、按什么节奏公开、社区响应机制怎么建,Anthropic 都还在摸索。首月通报里 530 个已披露的高危或严重漏洞中,只有 75 个完成修补,修复速度远落后于发现速度。

访问控制也没经过压力测试:合作伙伴怎么筛选、违规怎么退出、扩展到约 150 个组织、覆盖 15 个以上国家的电力、水务、医疗和通信行业之后,这套信任机制还能不能维持,需要时间验证。

最大的未知是能力不对称。白帽和黑帽拿到同类模型的时间差,就是整个体系的防守窗口。这个窗口有多宽,没有任何一方能给出确定答案。


读者判断

想了解 AI 安全研究进展到哪一步、Project Glasswing 如何运转,读本文就够了:文中全部数字与引语均已在系统卡、红队报告、CVE 官方记录和进展通报中核对过。

要做安全评估、漏洞复现或采购决策,请直接读红队报告原文和 245 页系统卡,那里有每个案例的完整技术细节、缓解措施清单和对齐评估。

想看披露时间线,按这个顺序读:3 月 26 日 FreeBSD 修复 CVE-2026-4747,4 月 7 日模型与 Glasswing 发布,5 月 22 日首月战报,6 月 2 日扩展公告。


参考资料

本文基于 Anthropic 官方系统卡、红队报告、Project Glasswing 系列公告及 CVE 官方记录整理,关键数字均已对照原始来源核实。Claude Mythos Preview 与 Project Glasswing 为 Anthropic 2026 年 4 月 7 日发布的模型与计划。

参与讨论

使用 GitHub 登录。欢迎补充事实、异议与实践。