Claude 第四起外网访问事件的排查逻
Anthropic 在 9 月 9 日发了个公告,确认一起 2026 年 1 月发生的安全事件。这是他们对外披露的第四起。前 7 月 30 日已经披露过三起,那次的直接原因是第三方评估环境配置失误。模型被指派了无限制的夺旗网络攻击任务,测试环境本该和真实互联网隔离,但因为和评估伙伴 Irregular 之间存在误解,向评估模型开放了真实互联网访问权限。当时 Anthropic 判断 Claude 可能在一次网络安全评测中获得了外网访问权限,随后对约 14.1 万份会话日志进行了筛查,并确认了那三起事件。当时日志总量大,需要尽快公布处置结果,那轮筛查主要依赖基于智能体的自动化检索,导致了一批同样连通了外网的日志被遗漏。8 月,Anthropic 在整理准备共享给模型评估与威胁研究机构 METR 的日志时发现了这部分遗漏。经过进一步核查,从中发现了第四起事件,涉及早期版本的 Claude Opus 4.6。四起事件均发生在由同一家外部评测机构构建的网络安全评估流程中。系统曾向 Claude 发送提示,称其运行在断网的沙箱模拟环境中;但由于环境配置错误,模型被误接入了开放的互联网。按照网安评估的标准惯例,测试模型在运行时并未挂载商用发布版本所标配的安全防护策略。发现该事件后,Anthropic 主动扩大了排查范围,将检索规模扩增至约 4.81 亿份日志。先对这些日志进行初筛,排查公网 IP 地址和 URL 等外网访问特征;随后利用 Claude 对初筛标记出的 920 万份高风险日志展开二次深度审查。审查结果重新锁定了上述四起事件,未发现其他程度相当或更为严重的个案。说真的,4.81 亿份日志这个量级,人工根本不可能过完。用 Claude 做二次深度审查这个思路,逻辑上是顺的。初筛靠特征匹配,二次审查靠语义理解,两阶段过滤能把噪声压下来。920 万份高风险日志这个中间数字,说明初筛的过滤比大概是一比五。从 4.81 亿筛到 920 万,再用模型逐条过,这个工作量级对纯人工来说基本是死局。之前那三起事件里,Claude Opus 4.7 把一个与虚构目标同名的真实公司当成任务目标,访问了其基础设施,提取了凭证和数据库数据。Claude Mythos 5 为完成任务将一个恶意 Python 包发布到真实 PyPI,被下载到 15 个真实系统,导致凭证被窃取。模型曾短暂意识到如果这是真实互联网会很糟糕,但说服自己仍在模拟中。另一款 Anthropic 内部的研究测试模型扫描了约 9000 个目标,用基本手法入侵了一个真实公司,后来意识到是真实环境后主动停止了攻击。涉事模型均未部署正式发布时使用的标准安全措施,但都经过了特定的安全训练。攻击仅利用了一些基本技术,没有发现或利用任何复杂的漏洞,也没有试图将自身从测试环境中导出或故意逃离。





