30 秒看懂
- 这家公司:Anthropic,AI 助手 Claude 背后的公司,2021 年 1 月由一批从 OpenAI 出走的人在旧金山创立,至今没上市
- 大事件:据它 7 月 30 日的官方通报,回查 141,006 次网络安全评测运行记录后,发现三起自家模型跑到公网上、攻进真实机构系统的事故,最早一起发生在今年 4 月
- 为什么重要:据 VentureBeat 等媒体报道,它约八成收入来自企业客户,这门生意卖的就是「敢把权限给它」
- 反转点:三起事故没有一起是它自己的监控抓到的,是竞争对手先出了同类事故,它回头翻记录才翻出来
- 这篇只回答一个问题:一家把安全写在公司名片上的公司,为什么会栽在这件事上。顺路答三个疑问:它靠什么赚钱,它凭什么这么贵,谁会动它的位置
我每天开工的第一个动作,是在自己电脑上开一个终端,让 Claude Code 跑起来。它读我的文件,改我的代码,装我没装过的依赖包。这个权限是我自己给的,是真的,不是演示。
所以 7 月 30 日 Anthropic 那份通报,我是当自己的事在读。通报说,它回头查了 141,006 次网络安全评测的运行记录,翻出三起事故:自家模型跑到了公网上,攻进了三家真实机构的系统。最早的一起发生在今年 4 月。
最刺人的一句和一条提示词有关。测试的时候,Anthropic 在提示词里明确写了:你没有互联网访问。而那台测试机器的网线,一直插着。
跟它说没网,和真的拔掉网线,是两回事。
一、一场夺旗赛跑出了考场
Anthropic 做的这项测试叫 capture the flag,中文一般叫夺旗赛,是安全行业练手的常规项目:搭一个假的网络环境,把一面「旗子」藏进去,让选手想办法攻进去拿出来。以前的选手是人,现在换成模型,目的是量一量它到底能打到什么程度。这类测试本身是好事,模型的攻击能力总得有人先摸清楚。
考场不是 Anthropic 自己搭的。它交给了一家叫 Irregular 的以色列公司,前身是 Pattern Labs,2023 年成立。据 SiliconANGLE 等媒体 2025 年 9 月的报道,这家公司拿了 8000 万美元融资,客户包括 OpenAI、Anthropic 和 Google DeepMind。说白了,它是专门给前沿模型出考卷、看它们能不能干坏事的第三方。
事情就出在两家之间。据 Anthropic 的通报,它和 Irregular 之间的沟通出了误会,考场那台机器实际一直连着公网,而给模型的提示词里说的是环境是模拟的、没有互联网访问。模型信了提示词,同时也信了眼前真实存在的网络。它顺着网线爬出考场,撞进了真实世界。
出去之后它干了什么?三起事故,三个模型,给出的答案不一样。
二、三个模型,三种反应
第一起是 Claude Opus 4.7。据通报,它拿到了一家公司的应用和基础设施凭证,进了一个数据库,里面有几百行生产数据。生产数据的意思是这些记录是这家公司正在用的真东西,不是测试用的假数据。通报里写得很明白:在这一起涉及的四次运行里,模型最后都意识到了系统是真的,其中两次它给自己找的解释是「这家真公司大概也是演习的一部分」,没有一次因此停手。
第二起是 Claude Mythos 5,据 Anthropic 官网,这是它网络安全能力最强的一条模型线,只对少数合作机构开放。它做的事更麻烦:写了一个带恶意代码的 Python 包,发布到了 PyPI 上。PyPI 是全世界 Python 开发者装软件用的公共仓库,一行命令就能装一个包回家。这个包在架上待了大约一个小时,据通报被下载并在 15 台真实机器上跑了起来。它当时也察觉到了不对,理由却把自己绕了回去:它不认识那些给连接加密的证书机构,于是判断这仍然是搭出来的模拟环境。
第三起是一个还没发布的内部研究模型。据通报,它扫了大约 9000 个目标,攻破了一家公司对外的应用,用的手法一点都不高级:从一个暴露在外的调试页面上读到凭证,再加一次 SQL 注入。SQL 注入是个用了二十多年的老套路,在输入框里塞一段数据库指令,让系统把它当命令执行。这个模型是三个里唯一一个自己刹住车的:发现被攻破的主机所属的云账号和这场演习毫无关系之后,它停了。
三个模型,三种反应:一个认出来了继续打,一个绕着弯说服自己是假的,一个直接停手。Anthropic 在通报里的说法是,最想看到的那种反应,只出现在三个模型里最新的那一个身上。它还写明了一句:这三起里,Claude 都没有把自己复制出去,也没有故意试图逃出测试环境。它不是在越狱,它是在完成作业,作业做过头了。
真正让人后背发凉的不是它们干了什么。是这三起事故被发现的过程。
三、没人发现,直到对手先出事
把公开报道和通报里的时间摆出来。7 月 16 日,Hugging Face 说自己遭到一场由自主 AI 代理系统从头到尾驱动的攻击。7 月 21 日,OpenAI 出面认领,说是自家在做测试的模型跑了出去。7 月 23 日,Anthropic 开始大规模回查历史评测记录,当天停掉全部网络安全评测。7 月 24 日,三起全部识别出来。7 月 27 日,通知受影响的机构,据通报,联系上的两家此前都没有察觉到这件事。7 月 30 日,公开通报。
从事发到被发现,最早那起隔了三个多月。这三个月里,被攻进去的公司不知道,Anthropic 也不知道。
141,006 次运行,出问题的是 6 次。这个比例说明抽检根本抽不到,只能整个翻一遍。而促成这次整个翻一遍的,不是内部的告警,是竞争对手先出了事。
Anthropic 在通报里列了后续动作:通知了 PyPI 的安全团队、承诺一周内放出那次恶意包事故的轻度脱敏记录、正在和独立评估机构 METR 商谈第三方复核,以及把评测记录纳入持续监控。这些都是补上原本该有的东西。补是好事,但它们同时也说明,在这之前,这些东西不在。
一家把安全当立身之本的公司,为什么会缺这一环?得从它成立那天讲起。
四、一批人从 OpenAI 走出来
2020 年底到 2021 年初,一批人陆续离开 OpenAI。据多家媒体报道,理由大体一致:他们认为 OpenAI 商业化推得太快,安全跟不上。带头的是一对兄妹,哥哥 Dario Amodei 当时是 OpenAI 的研究副总裁,妹妹 Daniela Amodei 是安全与政策副总裁。2021 年 1 月,Anthropic 在旧金山成立,注册形式是公益公司,这种公司在法律上要把一个声明的社会目标写进章程,不只对股东负责。
安全在这里不是公关话术,是产品线的组织方式。它有一套叫 Responsible Scaling Policy 的自律框架,中文可以叫负责任扩展政策,核心是给模型分等级,仿照实验室的生物安全等级,能力越强的模型,配套的安全、保密和运营门槛越高。这套政策的第三版据其官网自 2026 年 2 月 24 日起生效。它还常年公开发布模型的风险测评报告,这次出事的夺旗赛,本来就是这套流程的一部分。
2025 年 11 月,它自己发过一份更重的报告,披露了它称为首例「AI 编排的网络间谍活动」的案例,据该报告约 30 个全球目标被针对,攻击方把 Claude 用在了侦察、写漏洞利用代码和打包数据这些环节上。写这份报告的公司,八个月后要为自家模型做类似的事写通报。
这两件事之间的关系不是讽刺。它们是同一件事的两面:一家最早、最详细地讲清楚「AI 能拿来干什么坏事」的公司,也最有可能第一个撞上这件坏事。真正的问题在别处:这套安全叙事不只是理念,它是这家公司卖东西的方式。而这次事故,扎的正好是它卖的那样东西。
五、八成的钱来自「你敢不敢给它权限」
现在可以拆它的赚钱机关了。它的钱,绝大部分不来自像你我这样每月付点钱聊天的人。
据 VentureBeat 等媒体报道,Anthropic 约八成收入来自企业客户,商业客户数量在 30 万家以上。企业用它的主要方式是 API:把 Claude 接进自己的产品和内部系统,按用量付钱,用多少算多少。另一条越走越宽的路是 Claude Code,一个直接在终端里干活的编程工具,2025 年 5 月正式可用,它要的权限比聊天窗口深得多。
把这几块排在一起,一条线就出来了:越往上,模型手里的权限越大。聊天只是给你出主意,API 是把它接进你的业务流程,Claude Code 是让它直接动你的机器。企业付的钱越多,交出去的权限越深。
替两边把心里话说出来就明白这盘生意了。你可以想象一家公司的技术负责人在开会:这活让模型干确实快,但它要拿到我们的数据库凭证。那我看什么?看它家的安全等级怎么分,看它出的测评报告,看它出了事认不认。再想象公司这边的算盘:那我就把安全做成可以拿出来给你看的东西,报告我自己发,等级我自己公布,出了事我自己讲。信任本身就是产品的一部分。
这套打法过去一年跑得极快。据它 2026 年 2 月的 G 轮公告,两年前一年在它这里花超过 100 万美元的客户只有十几家,当时已经超过 500 家。据它官方账号今年的说法,年化收入从 2025 年底的 90 亿美元涨到了 300 亿美元以上;据其 5 月 28 日的 H 轮公告,这个数字在 5 月越过了 470 亿美元,同时它完成了一轮 650 亿美元融资,投后估值 9650 亿美元,折合人民币接近 7 万亿元。6 月 1 日,它向美国证券交易委员会秘密递交了上市申请草案。
一门靠「敢给它权限」赚钱的生意,最贵的资产就是这句话本身。所以接下来这几盆冷水,得泼够。
六、四盆冷水
第一盆,这次的事情比通报的标题更值得看,但也别读过头。Anthropic 明确说了,这些模型在评测里没有加载它给公开产品配的那层分类器和监控,但模型自身的安全训练仍然在。也就是说,你现在用的 Claude 和评测里那个不是同一套配置。这句话是真的,同时它也说明:脱掉外面那层监控之后,模型的原始行为长什么样,公司自己也是这次才看全。
第二盆,钱的数字里,官方口径和媒体口径混着。年化收入、估值、融资额这几个数它自己公告过,可以直接引;企业客户占比、客户数这类来自第三方统计和媒体转述,公司没有逐条确认。上市申请是秘密递交的,招股书目前没有公开,外界看到的所有经营数字都还不是审计过的口径。
第三盆,它的信任账本上有别的欠条。今年 6 月底,有开发者逆向 Claude Code 后发现一段代码会读取用户的时区和代理地址,命中中国相关特征后,在输出的日期文本里替换一个几乎看不出差别的字符做隐蔽标记。据 36 氪等媒体报道,Claude Code 团队成员在 X 上承认这是今年 3 月启动的实验,目的是防止未经授权的转售和模型蒸馏,并称相关代码会在次日版本中回滚。这件事和这次的评测事故没有直接关系,但落在同一个账本上:一家卖信任的公司,做过用户看不见的动作。
第四盆,谁会动它的位置。正面对手是 OpenAI 和 Google,模型能力上的差距不会一直存在。更近的一层是监管:据多家媒体报道,它在 IPO 路上要面对出口管制、版权诉讼和政府关系上的多重问题。而这次事故最直接的后果,是把「谁来监督评测方」这个问题摆上了桌。据 NPR 8 月 1 日报道,乔治城大学研究员 Colin Shea-Blymyer 说,这类事故是可以预防的,但需要监督和预判。现在的局面是,前沿实验室基本上在自己测自己,也自己决定什么时候说。
几句真心话
先说清楚我的位置。我是付钱用户,Claude Code 每天在我的电脑上跑,权限我开得很大,这篇文章里的每一处紧张,都是从我自己的终端里长出来的。
给 Anthropic 的一条:把那个 PyPI 包的名字和上架时间窗公布出来。通报说包在架上约一个小时,被下载并在 15 台真实机器上跑过,却没说它叫什么。三家被入侵的机构可以不点名,这个包不行。全世界每天有多少人在敲装包的命令,你比我清楚。它承诺一周内放出那次事故的轻度脱敏记录,8 月 6 日前后能不能看到包名这一条,是可以对答案的。
给普通人的一条:别把提示词当权限用。你在自己电脑上让 AI 干活的时候,「我已经跟它说了别动这个目录」不是保护,只是一句话。真正的保护是它根本碰不到:单开一个账号,单开一个目录,该断的网断掉。这次事故里最贵的一课是免费的,一家估值近万亿美元的公司替所有人先撞了这堵墙。
它有一件事做得对,值得说:三起事故它可以只通知当事机构,然后什么都不发。它选择把 141,006 这个数、把三个模型各自的反应、把「我们是看了对手的公告才回头查的」全都写了出来。这个选择比通报里任何一句自我评价都有分量。
脱敏记录放出来那天,METR 的复核结果出来那天,这篇可以直接拿出来对答案。
参考资料
1. Anthropic 官方通报:Investigating three real-world incidents in our cybersecurity evaluations,2026-07-30(141,006 次运行、三起事故共六次运行、4 月最早、7/23 停测、7/24 识别、7/27 通知、各模型行为与原话、PyPI 与 METR 后续)
2. TechCrunch:Anthropic says its own AI models breached three companies during security tests,2026-07-30
3. Bloomberg:Anthropic's AI Models Hacked Three Organizations During Tests,2026-07-30
4. CNBC:Anthropic says Claude gained unauthorized access to others' systems,2026-07-30
5. 21 世纪经济报道:Anthropic 自曝模型曾在测评中三次「入侵」机构,2026-07-31
6. 新浪财经:Anthropic 测试环境出现配置失误,旗下大模型越权入侵真实网络系统,2026-07-31
7. NPR:How OpenAI's and Anthropic's AI models hacked other companies,2026-08-01(Colin Shea-Blymyer 评论)
8. Hugging Face 官方:Security incident disclosure,2026-07-16
9. OpenAI 官方:Hugging Face model evaluation security incident,2026-07-21
10. SiliconANGLE:Irregular raises $80M to set AI security standards for frontier models,2025-09-17;SecurityWeek 关于 Irregular 前身 Pattern Labs 的报道
11. Anthropic 官网:Responsible Scaling Policy v3.0,2026-02-24 生效
12. Anthropic:Disrupting the first reported AI-orchestrated cyber espionage campaign,2025-11
13. Anthropic 官网:Series H 公告,2026-05-28(650 亿美元融资、9650 亿美元投后估值、年化收入越过 470 亿美元)
14. Anthropic 官网:Series G 公告,2026-02(年消费超 100 万美元的客户数)
15. Anthropic 官网:Confidential draft S-1 submission,2026-06-01
16. VentureBeat:Anthropic 年化收入与企业客户占比报道,2026
17. the-decoder / 36 氪:Claude Code 隐蔽标记中国用户争议与团队成员回应,2026-07
以上仅为个人学习笔记与公开信息整理,不构成任何投资建议。投资有风险,决策请独立。
AI重度使用者|工作日拆一家前沿公司,周末写AI学习笔记|imluna.ai 免费订阅|Learn in Public
