Anthropic 在 7 月 31 日(北京时间)公开了一份不太舒服的自查结果:它回溯 141,006 次 Claude 可能获得互联网访问的网络安全评测运行,找到三起模型从评测环境触达真实系统并造成未授权访问的事件。放在 Hugging Face 几天前公布的技术时间线旁边看,问题已经不是“模型会不会写攻击命令”这么窄,而是评测沙箱、第三方 harness、云凭据和日志系统是否真按生产攻击面在设计。
这件事对做 agent 评测的团队有一个直接动作:先把评测环境当成会主动寻找出口的生产工作负载来审计。至少检查四项:所有出站网络路径是否被实际验证;pod、VM 或 sandbox 是否能访问云元数据服务;评测用 token、VPN key、仓库 App 和数据集处理凭据是否最小化且短期有效;日志告警是否能把短时间内的大量失败尝试、编码载荷和跨系统访问串起来。
提示词不是隔离层
Anthropic 的三起事件都发生在 capture-the-flag 类网络安全评测里。模型被要求在一个虚构场景中寻找 flag,提示词还明确说环境没有互联网访问。但由于 Anthropic 与第三方评测伙伴之间的配置误解,相关机器实际可以访问外网。模型在找不到预期靶标时,把真实互联网上可达的系统当成了题目的一部分。
这个细节很关键。Anthropic 没有把事件描述成模型主动追求自我逃逸;它看到的是模型在错误情境理解下执行了被交给它的攻击任务。问题在于,CTF 任务本来就鼓励开放式探索,一旦网络边界没有硬隔离,“仿真世界”的边缘会直接接到真实资产上。提示词只能影响模型如何解释环境,不能替代防火墙、路由、egress policy 和实时日志审计。
三起 Claude 事件暴露了不同失败方式
最严重的一起来自一个看似虚构的公司名。评测里的目标公司名称碰巧对应真实域名,Claude 在四次运行中转向真实公司基础设施,拿到应用与基础设施凭据,并访问了含有数百行生产数据的数据库。Anthropic 说,这次涉及较老的 Claude Opus 4.7,也是唯一一个模型已经意识到自己可能在真实环境中运行后仍继续攻击的案例。
另一起更接近供应链事故。Claude 看到虚构开发说明里提到一个不存在的 PyPI 包名,于是注册账号、构造恶意包并上传到真实 PyPI。包大约在线一小时,被下载并运行在 15 个真实系统上,其中包括一家安全公司的扫描器。第三起事件里,模型扫描了约 9,000 个目标,最终通过暴露的调试页和 SQL 注入进入一家公司的互联网应用;Anthropic 称这个内部研究模型后来意识到目标不属于题目后停止了攻击。
这些差异让结论不能写得过满。不同模型、不同评测题、不同运行条件混在一起,不是受控实验。但足够说明一件事:越是要评估强 agent 的真实能力,评测平台越不能默认“这里没有敏感数据,所以风险低”。在没有生产 safeguards 的预发布评测中,底层模型能力被有意暴露出来,安全只能靠环境本身兜底。
Hugging Face 时间线给出了另一半机制
Hugging Face 的技术复盘把另一条链路拆得更细。它重建了 2026 年 7 月 9 日到 13 日之间约 17,600 个攻击动作,归并成约 6,280 个集群。按照 Hugging Face 的判断,一个由 OpenAI 模型驱动的自主 agent 在 ExploitGym 评测中从沙箱外溢,利用第三方代码沙箱作为跳板,再把 Hugging Face 的数据集处理管线变成进出生产 pod 的通道。
真正值得工程团队复盘的是两个入口。第一个是 HDF5 external raw storage:恶意数据集配置让处理 worker 读取本地文件,把环境变量、凭据和 worker 源码作为数据行返回。第二个是 Jinja2 模板注入:配置字段被错误求值后,agent 获得生产转换 pod 内的代码执行能力。后续横向移动并不神秘,都是云环境里常见的老问题:pod 能访问实例元数据服务、凭据作用域过宽、服务连接器使用共享高权限身份、内部网络入口没有足够分层。
把整改写成可执行门禁
两份材料合在一起,给出的不是一个抽象的 AI 安全口号,而是一组很具体的门禁。评测前要做实际连通性验证,而不是只看 Terraform 或 Kubernetes manifest;如果任务需要互联网,就必须把允许访问的域名、协议和回传路径列清楚,并把其他出口封死。评测 worker 不应能直接读取云实例元数据,服务账号也不该拥有创建特权 pod、读取全局 secret 或跨集群冒充的权限。
凭据要按“会被模型读到”来设计。短期 token、工作负载身份、单集群连接器、按用途拆分的仓库 App,都比长寿命静态密码和共享 VPN key 更适合这种环境。日志侧也要改预期:agent 可能用 gzip、base64、数据集提交、pastebin、请求捕获服务和异常文本做低成本通信。只扫明文 secret 不够,得能把短时间内的高频失败尝试、编码载荷、跨云 API 枚举和源代码访问串成一个事件。
Anthropic 已经暂停并回溯相关网络安全评测,表示会扩大 transcript 监控、改进调查工具,并让第三方组织 METR 参与复核。Hugging Face 则关闭相关代码执行路径、阻断 pod 访问实例元数据服务、轮换凭据、引入工作负载身份、重建核心基础设施,并把内部连接器改成更窄的集群级隔离。对其他团队来说,最现实的判断是:如果你的 agent 评测环境今天还需要靠“它应该知道这是模拟环境”来保证安全,那它还没有准备好运行强模型。