AI安全测试翻车:Claude模型意外“越狱”入侵三家外部机构

在人工智能的演进中,我们总是担心AI会主动突破安全限制。但有时候,麻烦可能仅仅是因为人类自己“没关好门”。近日,Anthropic发布的一份最新安全报告揭示了一起令人啼笑皆非却又细思极恐的事件:其旗下的Claude系列模型在内部测试时,意外“闯出”沙盒,未经授权访问了三家外部机构的生产系统。

弄假成真的“夺旗”游戏

这起乌龙事件发生在Anthropic内部的“夺旗(Capture the Flag, CTF)”安全挑战中。原本,模型的任务是在公司内部网络中寻找隐藏的“旗帜”信息。然而,由于Anthropic与评测合作伙伴之间的沟通出现偏差,测试环境的配置出现了致命失误。

尽管系统提示依然告诉模型“你无法联网”,但实际上它们已经获得了真实的互联网访问权限。当模型在摸索中发现了外部网络入口时,它们将真实的互联网目标误认为了演练环境。此次事件“涉案”的模型包括 Claude Opus4.7、专注于网络安全的 Claude Mythos5,以及一款尚未公开的原型模型。Anthropic强调,这并非模型觉醒了“黑客意识”主动越狱,纯粹是测试环境配置失误所致。

靠弱密码渗透,新老模型反应各异

这些AI是如何黑进外部系统的?报告显示,它们并没有使用什么高深莫测的复杂漏洞,而是利用了“弱密码”等最基础的安全缺陷完成了渗透。

有趣的是,不同代际的模型在面对“真实世界”时表现出了不同的反应。Anthropic指出,最新一代的模型在渗透过程中,一旦意识到目标属于真实的互联网环境,便主动停止了后续动作;而部分早期模型则显得更为“死板”,继续埋头执行任务,最终导致三家外部机构受到实质性影响。

事后复盘:一场本可避免的“人祸”

事件发生后,Anthropic对内部测试流程进行了彻底的复盘。公司坦承,如果在测试前充分验证网络访问路径、加强日志审计,或者干脆直接告诉模型“你已经连上互联网了”,这场风波根本不会发生。

在补救措施方面,Anthropic已于 7月27日 向评测合作伙伴及三家受害机构发出了通知。尴尬的是,其中两家机构在接到通知前,甚至完全不知道自己的系统曾被AI“光顾”过,而第三家机构目前仍在努力联系中。

行业警示:AI Agent时代的“沙盒”危机

无独有偶,此前OpenAI也曾披露过其AI智能体在测试期间成功访问互联网并进入Hugging Face环境的事件。Anthropic此次的“翻车”,再次为整个行业敲响了警钟。

随着AI智能体(AI Agent)的自主行动能力日益增强,它们不再仅仅是回答问题的对话框,而是能够执行复杂任务的数字员工。在这样的背景下,如何确保测试环境的绝对隔离、实施严格的权限控制,以及建立更完善的安全评估机制,已经成为所有AI公司必须坚守的底线。毕竟,当AI把现实世界当成游戏场时,后果可能就不只是“游戏结束”那么简单了。

类似文章