Claude Mythos 挖出 27 年老漏洞,AI 安全研究正在被重新定义
posts posts 2026-04-09T15:05:00+08:00Anthropic 发布 Claude Mythos Preview 与 Project Glasswing:模型在 OpenBSD 里挖出藏了 27 年的漏洞,自主完成 FreeBSD NFS 提权利用,Firefox 147 评估中 181 次写出可用 exploit。权重不公开,只向 12 家防御方机构受限开放。视频精读Anthropic, Claude, 安全研究, AI 安全, Project Glasswing2026 年 4 月 7 日,Anthropic 发布通用模型 Claude Mythos Preview,同时公开一份 245 页的系统卡和一份前沿红队报告。红队报告的主线只有一条:这个模型能自主找到并利用真实软件里的零日漏洞——其中最老的一个,在 OpenBSD 里藏了 27 年。
能力数字同样反常。在 Mozilla 合作的 Firefox 147 漏洞利用评估里,上一代 Opus 4.6 几百次尝试只成功 2 次;Mythos Preview 做出 181 个可运行的 exploit(漏洞利用程序),另有 29 次拿到寄存器控制。同一类任务,间隔一代模型,成功率从接近零变成稳定输出。
能力太强,Anthropic 没有公开模型权重,而是启动 Project Glasswing,把访问权限优先交给防御方。本文把系统卡、红队报告、CVE 官方记录和后续进展通报放在一起,看这次发布到底改变了什么。
通用能力先到位,安全能力跟着来
Mythos Preview 不是安全专训模型。Anthropic 对它的定位是迄今编程和智能体任务最强的通用前沿模型,安全能力是在通用能力之上涌现的。先看官方系统卡的基准对比:
| 基准测试 | Mythos Preview | Opus 4.6 | 差距 |
|---|---|---|---|
| SWE-bench Verified | 93.9% | 80.8% | +13.1% |
| SWE-bench Pro | 77.8% | 53.4% | +24.4% |
| CyberGym(漏洞复现) | 83% | 67% | +16% |
| USAMO 2026 数学竞赛 | 97.6% | 66.2% | +31.4% |
编程基准的差距是「大幅领先」,CyberGym 的差距是「换了档位」——这个基准考察的是给定漏洞描述后,能否在真实开源项目里复现出漏洞,考验的正是读代码和做实验的能力。
真正拉开数量级的是漏洞利用。红队报告定期用 OSS-Fuzz 语料里约 7000 个入口点做内部评估,按最严重崩溃分成五档,从基本崩溃(第 1 档)到完整控制流劫持(第 5 档)。Sonnet 4.6 和 Opus 4.6 能在第 1 档拿到 150 到 175 个案例、第 2 档约 100 次,但最高只各摸到过一次第 3 档;Mythos Preview 在第 1、2 档合计做出 595 次崩溃,并在 10 个已完成全部修补的目标上实现第 5 档的完整控制流劫持。红队报告上一期的原话是「Opus 4.6 目前在识别和修复漏洞上远强于利用漏洞」,间隔一个月,这句话对 Mythos Preview 不再成立。
报告对能力来源的解释只有一句:没有任何针对安全的专门训练,这些能力是代码、推理与自主性通用提升的下游结果。同一个改进,既让模型更会修漏洞,也让它更会利用漏洞。
三个已披露的漏洞案例
官方报告给了三个有代表性案例,从崩溃到提权,难度递进。
OpenBSD:27 年的 SACK 崩溃漏洞
OpenBSD 以安全为第一目标,但 Mythos 在它的 TCP 栈里找到一个能远程击倒任何主机的漏洞。问题出在 SACK(选择性确认)实现上:内核用链表记录「已发送但未被确认」的字节区间,收到新确认报文时逐段收缩这些区间。代码检查了确认范围终点是否落在发送窗口内,却没检查起点——这个疏漏平时无害,却让攻击者能把确认区间的起点推到距离真实窗口约 2³¹ 之远。在那个距离上,内核比较序列号用的有符号减法发生溢出,两个本应互斥的条件同时成立:链表里唯一的区间被删除,追加新区间的代码接着执行,写向一个已经置空的指针,机器当场崩溃。远程攻击者可以反复触发,足以拖垮企业网络或核心互联网服务。
红队用同一套自动化流程跑了 1000 次才命中这个洞,总成本不到 2 万美元;真正找到它的那一次,花费不足 50 美元。便宜,但事前没人知道哪一次会成功。
FFmpeg:16 年的哨兵值撞号
FFmpeg 是全世界被测试最充分的软件项目之一,fuzzer(模糊测试工具)喂过数百万个随机生成的视频文件。Mythos 在它最常用的 H.264 解码器里找到的漏洞,恰恰是所有 fuzzer 都漏掉的那类。
H.264 的每一帧被切成若干切片,解码时去块滤波器需要判断「相邻像素块是否属于同一切片」,FFmpeg 为此维护一张表,记录每个位置归属的切片号。表项是 16 位整数,切片计数器却是没有上限的 32 位整数。表用 memset 填 0xFF 初始化,也就是 65535,当作「此处无切片」的哨兵值。正常视频每帧只有几个切片,永远碰不到这个上限;但攻击者可以构造一个含 65536 个切片的帧,让 65535 号切片与哨兵值撞号,解码器误以为不存在的邻居存在,越界写入,进程崩溃。
这个底层写法可以追溯到 2003 年引入 H.264 的提交,2010 年一次重构让它变成了可触发的漏洞。16 年里,每一个 fuzzer 和每一位读过这段代码的人都错过了它。红队随后又对整个仓库跑了几百次、花掉约 1 万美元,在 H.264、H.265、AV1 等编解码器里找出更多漏洞,其中 3 个已随 FFmpeg 8.1 修复。
FreeBSD:17 年的 NFS 提权(CVE-2026-4747)
这个案例细节最完整。FreeBSD 内核态的 NFS 服务器实现了 RFC 2203 的 RPCSEC_GSS 认证,其中一个函数把客户端数据包直接拷入 128 字节的栈缓冲区——从第 32 字节开始写,只留 96 字节空间,而唯一的长度检查上限是 512 字节。恶意客户端不需要通过认证,就能溢出内核栈,拿到 root。
从发现到武器化,全程无人类参与。模型扫过数百个内核文件后交出完整 exploit:漏洞唯一的长度检查是不超过 MAX_AUTH_BYTES 这个 400 字节的常量,也就是说攻击者能向栈上写入最多 304 字节——刚好够实现一次标准的 ROP 攻击(重排内核中已有的代码片段,拼出原本不存在的功能)。模型构造的攻击链包含 20 个 gadget,依次调用内核函数打开 authorized_keys 文件、追加攻击者的公钥。难点在于 ROP 链总长超过 1000 字节,而漏洞能容纳的只有 200 字节——模型把它拆进 6 个顺序发出的 RPC 请求里,前 5 个分段把数据写进内存,第 6 个装载寄存器、执行写入。这个漏洞在 FreeBSD 里存在了 17 年。
CVE-2026-4747 的官方记录里,发现者一栏写着:「Nicholas Carlini using Claude, Anthropic」。作为对照,一家独立漏洞研究公司让 Opus 4.6 利用同一漏洞,需要人类引导;Mythos 不需要。
从单个漏洞到攻击链
单点漏洞之外,红队报告展示的更深层变化是攻击链的自动化。
一个案例是浏览器 exploit:模型把 4 个漏洞串成一条链,写出复杂的 JIT 堆喷射,同时逃逸渲染器沙箱和操作系统沙箱。另一个是 Linux 内核提权:红队手里有将近一打模型自主串联漏洞拿到 root 的例子——两个、三个,有时四个。报告给出的一条链是:用一个漏洞绕过 KASLR(内核地址空间布局随机化),用第二个读取关键内核结构体的内容,用第三个写入一块已释放的堆内存,再配合堆喷射把伪造的结构体精准放到写入落点上,最终拿到 root 权限。
门槛也在消失。红队报告提到,Anthropic 内部没有受过安全训练的工程师,让模型在夜里找远程代码执行漏洞,第二天早上醒来就能看到一个完整可用的 exploit。
支撑这种规模的是成本。OpenBSD 的 1000 次全量扫描不到 2 万美元,FFmpeg 的几百次运行约 1 万美元——按次计费的模型推理,替代的是资深研究员数月级的注意力。漏洞挖掘第一次有了「单价」。
为什么不公开发布模型
Mythos Preview 在所有主流操作系统和所有主流浏览器里都找到了零日漏洞,多数严重漏洞的发现只是负责任披露流程的开始。红队报告披露时,已确认的严重漏洞里超过 99% 尚未修补。这样的模型如果公开权重,等于把武器化的速度优势一次性交给所有人。
Anthropic 的替代方案是 Project Glasswing:权重不公开,防御方优先拿到能力。首批 12 家机构是 AWS、Apple、Broadcom、Cisco、CrowdStrike、Google、摩根大通、Linux 基金会、Microsoft、NVIDIA、Palo Alto Networks 和 Anthropic 自己,另有 40 多家组织随后加入。Anthropic 承诺投入最多 1 亿美元的模型使用额度,并向开源安全组织直接捐赠 400 万美元。
模型受限开放,漏洞信息则相反:所有发现都走负责任披露,先修复、再分批公开,每份报告由专业安全承包商人工核验后才会发出。
防御端的窗口期在被压缩
两个月后的 5 月 22 日,Anthropic 发出 Project Glasswing 首月进展通报,数据可以说明这套流程运转到了什么规模:
- 约 50 家合作伙伴在关键软件中发现超过 1 万个高危或严重级别漏洞。
- 开源侧扫描了 1000 多个项目,标记 23019 个漏洞,其中 6202 个被模型判为高危或严重,按确认率推算最终约 3900 个。
- 判定结果经得起复核:1752 份报告交由六家独立安全公司人工评估,1587 个确认为真实漏洞,确认率 90.6%;其中 1094 个维持高危或严重定级,占 62.4%。
- 高危或严重漏洞从发现到打上补丁,平均需要两周。
- Cloudflare 在关键路径系统里发现 2000 个缺陷,其中 400 个属高危或严重,团队认为模型的误报率低于人类测试人员。Mozilla 借助模型在 Firefox 150 里修复了 271 个漏洞,是用 Opus 4.6 测试 Firefox 148 时的 10 倍以上。
- 多家合作伙伴报告漏洞发现速度提升超过 10 倍;英国 AI 安全研究所确认,Mythos Preview 是首个端到端攻克其两个网络攻防靶场的模型。
两周的补丁周期,已经是防御方跑出来的速度。瓶颈不再是发现漏洞,而是验证、披露和修补——这些环节仍然要靠人来排队。
争议与边界
第一个质疑是不公开模型就是不透明。这个批评有它的道理,但 Anthropic 区分了两样东西:不公开的是权重,必须公开的是漏洞。复核数据是这套承诺的注脚——90.6% 的模型判定被独立专家确认为真,误报率在 Cloudflare 的实测中低于人类。透明度争议的实质不是「披露了吗」,而是「披露的节奏谁说了算」。
第二个质疑是 AI 挖洞会不会让攻击者更危险。Project Glasswing 的设计逻辑正是防御方先拿到能力。但 Anthropic 在 6 月 2 日的扩展公告里给出了自己的时间估计:6 到 12 个月内,其他 AI 公司预计会拥有同类模型。窗口期是真实存在的,天平往哪边倾,取决于防御方在这段时间里修掉多少漏洞。
第三个质疑是老漏洞被批量挖出,是不是说明开源不安全。FFmpeg 的案例给出的恰好是相反结论:那个哨兵值写法在代码里躺了 16 年,fuzzer 和人类审查者都从它眼前走过。漏洞一直都在,只是以前没有工具能按单价把它们清出来——能被系统性排查并修复,正是开源可审计性的兑现。
还没答案的问题
透明度的边界还没定:漏洞细节公开到什么程度、按什么节奏公开、社区响应机制怎么建,Anthropic 都还在摸索。首月通报里 530 个已披露的高危或严重漏洞中,只有 75 个完成修补,修复速度远落后于发现速度。
访问控制也没经过压力测试:合作伙伴怎么筛选、违规怎么退出、扩展到约 150 个组织、覆盖 15 个以上国家的电力、水务、医疗和通信行业之后,这套信任机制还能不能维持,需要时间验证。
最大的未知是能力不对称。白帽和黑帽拿到同类模型的时间差,就是整个体系的防守窗口。这个窗口有多宽,没有任何一方能给出确定答案。
读者判断
想了解 AI 安全研究进展到哪一步、Project Glasswing 如何运转,读本文就够了:文中全部数字与引语均已在系统卡、红队报告、CVE 官方记录和进展通报中核对过。
要做安全评估、漏洞复现或采购决策,请直接读红队报告原文和 245 页系统卡,那里有每个案例的完整技术细节、缓解措施清单和对齐评估。
想看披露时间线,按这个顺序读:3 月 26 日 FreeBSD 修复 CVE-2026-4747,4 月 7 日模型与 Glasswing 发布,5 月 22 日首月战报,6 月 2 日扩展公告。
参考资料
- Anthropic — Project Glasswing
- Anthropic 红队 — Claude Mythos Preview’s cybersecurity capabilities
- Anthropic — Claude Mythos Preview System Card(PDF,245 页)
- Anthropic — Project Glasswing 首月进展通报
- Anthropic — Expanding Project Glasswing
- FreeBSD 安全公告 FreeBSD-SA-26:08.rpcsec_gss(CVE-2026-4747)
- The Hacker News — Anthropic’s Claude Mythos Finds Thousands of Zero-Day Flaws
- IT之家 — Anthropic 披露 AI 抓虫首月战报,揪出超 1 万个高危漏洞
本文基于 Anthropic 官方系统卡、红队报告、Project Glasswing 系列公告及 CVE 官方记录整理,关键数字均已对照原始来源核实。Claude Mythos Preview 与 Project Glasswing 为 Anthropic 2026 年 4 月 7 日发布的模型与计划。
参与讨论
使用 GitHub 登录。欢迎补充事实、异议与实践。
讨论暂时无法加载。