目录

Claude Mythos:Anthropic 发布了一个模型,然后把它藏起来

Anthropic 发布 Claude Mythos

然后把它藏起来了。

不是没发布。是发布了,但不公开卖。

官方说这个模型能做什么

根据 Anthropic 官方公告Red Team 博文,Claude Mythos Preview 在受控测试中发现了数千个零日漏洞,覆盖主流操作系统和浏览器,包括 Linux 内核。

被单独提出来的例子:

  • 每个主流浏览器里都找到了漏洞
  • Linux 内核里找到漏洞,并能把多个洞串成完整攻击路径
  • OpenBSD 里一个活了 27 年、可远程把机器打崩的洞
  • FFmpeg 里一个活了 16 年、自动化测试打中五百万次仍未抓住的洞

官方把 Mythos Preview 写成未发布的通用前沿模型,并给了一个硬判断:在发现和利用软件漏洞上,它已经超过除最顶尖人类以外的所有人。

这个能力被写成需求驱动。Anthropic 提到,已经有人用公开的 Claude 挖漏洞、写恶意软件、抽敏感数据、发定向勒索。所以做了一个选择:模型发布,但不公开。通过 Project Glasswing,只向经过筛选的伙伴提供访问。

为什么值得注意

漏洞发现自动化是 AI 安全的转折点。

以前靠人类安全研究员:经验、时间、运气。现在模型能在受控环境里系统性地挖零日,规模是人力达不到的。攻防两边都会用。防御者可以主动找洞,攻击者也可以。

Anthropic 的选择是:只让「防御者」用。

这个决定的逻辑

把找洞能力开放给防御者、限制给攻击者,听起来合理。下面三件事公告没有回答。

1. 谁来审核「防御者」

CrowdStrike、Palo Alto Networks 是安全公司,也是卖安全产品的公司。同一批人先知道洞、再卖修复方案,利益冲突写在名单上。

2. 为什么是这些公司

启动伙伴包括 AWS、Apple、Broadcom、Cisco、CrowdStrike、Google、JPMorganChase、Linux Foundation、Microsoft、NVIDIA、Palo Alto Networks。中心是商业公司。独立安全研究机构、学术安全团队不在首发中心。Linux Foundation 是开源侧的入口,不是个人申请通道。

3. 漏洞修复的优先级由谁决定

一个洞影响数十亿设备,但修它不影响任何 Glasswing 伙伴的商业利益,会不会被优先处理?公告没有说。

关于 Claude Mythos 本身

来自官方、目前能核到的部分:

  • 通过 Project Glasswing 访问,没有公开零售 API,也没有「很快上架」的承诺
  • 伙伴名单见上一节;另外承诺最多 1 亿美元用量额度,外加 400 万美元给开源安全组织
  • 额度写给伙伴,不是写给个人账号
  • CyberGym 上官方写 Mythos Preview 83.1%、Opus 4.6 66.6%。这是他们自己的对照,用来解释为什么锁,不是可以复跑的购买理由
  • 已修复的洞在 Red Team 博文 里写技术细节,其余先公布哈希。「数千」不是公开成绩单

具体完整 benchmark 和面向个人的定价,官方没有全部公开。

延伸阅读