Claude Mythos:Anthropic 发布了一个模型,然后把它藏起来
Anthropic 发布 Claude Mythos。
然后把它藏起来了。
不是没发布。是发布了,但不公开卖。
官方说这个模型能做什么
根据 Anthropic 官方公告 和 Red Team 博文,Claude Mythos Preview 在受控测试中发现了数千个零日漏洞,覆盖主流操作系统和浏览器,包括 Linux 内核。
被单独提出来的例子:
- 每个主流浏览器里都找到了漏洞
- Linux 内核里找到漏洞,并能把多个洞串成完整攻击路径
- OpenBSD 里一个活了 27 年、可远程把机器打崩的洞
- FFmpeg 里一个活了 16 年、自动化测试打中五百万次仍未抓住的洞
官方把 Mythos Preview 写成未发布的通用前沿模型,并给了一个硬判断:在发现和利用软件漏洞上,它已经超过除最顶尖人类以外的所有人。
这个能力被写成需求驱动。Anthropic 提到,已经有人用公开的 Claude 挖漏洞、写恶意软件、抽敏感数据、发定向勒索。所以做了一个选择:模型发布,但不公开。通过 Project Glasswing,只向经过筛选的伙伴提供访问。
为什么值得注意
漏洞发现自动化是 AI 安全的转折点。
以前靠人类安全研究员:经验、时间、运气。现在模型能在受控环境里系统性地挖零日,规模是人力达不到的。攻防两边都会用。防御者可以主动找洞,攻击者也可以。
Anthropic 的选择是:只让「防御者」用。
这个决定的逻辑
把找洞能力开放给防御者、限制给攻击者,听起来合理。下面三件事公告没有回答。
1. 谁来审核「防御者」
CrowdStrike、Palo Alto Networks 是安全公司,也是卖安全产品的公司。同一批人先知道洞、再卖修复方案,利益冲突写在名单上。
2. 为什么是这些公司
启动伙伴包括 AWS、Apple、Broadcom、Cisco、CrowdStrike、Google、JPMorganChase、Linux Foundation、Microsoft、NVIDIA、Palo Alto Networks。中心是商业公司。独立安全研究机构、学术安全团队不在首发中心。Linux Foundation 是开源侧的入口,不是个人申请通道。
3. 漏洞修复的优先级由谁决定
一个洞影响数十亿设备,但修它不影响任何 Glasswing 伙伴的商业利益,会不会被优先处理?公告没有说。
关于 Claude Mythos 本身
来自官方、目前能核到的部分:
- 通过 Project Glasswing 访问,没有公开零售 API,也没有「很快上架」的承诺
- 伙伴名单见上一节;另外承诺最多 1 亿美元用量额度,外加 400 万美元给开源安全组织
- 额度写给伙伴,不是写给个人账号
- CyberGym 上官方写 Mythos Preview 83.1%、Opus 4.6 66.6%。这是他们自己的对照,用来解释为什么锁,不是可以复跑的购买理由
- 已修复的洞在 Red Team 博文 里写技术细节,其余先公布哈希。「数千」不是公开成绩单
具体完整 benchmark 和面向个人的定价,官方没有全部公开。