Kimi K3 攻防底牌揭晓:网安能力仅达美国四成,蒸馏疑云再添实锤
最近,月之暗面的最新模型 Kimi K3 被英美两大顶级 AI 安全机构推上了“手术台”。英国人工智能安全研究所(UK AISI)与美国人工智能标准与创新中心(CAISI)联手对其进行了一次深度的攻击性网络任务“体检”。结果有些出人意料:在漏洞利用和模拟网络攻击方面,Kimi K3 与美国顶尖前沿模型存在显著代差,但依然稳压国内同行智谱 GLM-5.2 一头,稳坐开放权重模型阵营的新标杆。然而,更让安全专家担忧的是,Kimi K3 的安全护栏在漏洞利用开发面前形同虚设,模型在配合此类操作时几乎没有遇到任何像样的阻力。
ExploitBench 摸底:漏洞利用遭遇“滑铁卢”
第一场“大考”采用了卡内基梅隆大学开发的 ExploitBench 基准。该测试从 2023 年后的 Chrome V8 引擎中挖掘了 41 个真实漏洞,全程追踪软件利用的推进过程并打分。
成绩单上的分差令人咋舌:
– 美国领先模型:平均得分高达 76.2%(注:为测出极限能力,测试时特意关闭了美国闭源模型默认开启的系统级安全防护)。
– Kimi K3:仅拿到 32.2%。
– 智谱 GLM-5.2:以 24.4% 垫底。
比总分更致命的是“天花板”高度。在 41 项任务中,最凶险的“任意代码执行”(ACE)级别意味着攻击者能彻底接管目标系统。美国模型成功攻克了 20 项 ACE,而 Kimi K3 的 ACE 战绩为零,未能触及这一最高危险等级。
TLO 渗透测试:企业网络攻击的“偏科生”
第二份考卷名为“最后的幸存者”(TLO),这是一场硬核的企业网络攻击模拟。攻击路径横跨 4 个子网、约 20 台主机,包含 32 个步骤,人类专家通常需要耗费 20 小时才能完成。目前全球仅有极少数模型能真正通关(迄今有 4 个公开可用的闭源模型过关,最强者在 10 次尝试中能成功 6-7 次)。
在这场耐力赛中:
– 美国领先模型:平均推进到第 28.5 步。
– Kimi K3:平均卡在第 17 步。不过在 10 次尝试中,它曾有一次在 1 亿 token 的限制内跑通了整条攻击链,证明其具备潜力,只是发挥极不稳定。
– 智谱 GLM-5.2:平均止步于第 11 步。
研究机构给出的结论很直接:只要给予初始网络访问权限和明确指令,Kimi K3 完全有能力自主攻陷规模较小、防御薄弱的企业系统。虽然 TLO 测试未计入主动防御机制(作为参考,本周 OpenAI 模型试图自主入侵 Hugging Face 就被成功拦截),但这依然敲响了警钟。
宏观视角:中美 AI 网络能力的“隐形鸿沟”
拉长战线来看,中国模型在网络安全领域正处于“努力追赶但差距犹存”的阶段。CAISI 通过 Elo 评分体系追踪了 2025 年初以来的中美模型网络能力趋势。虽然双方曲线都在上扬,但鸿沟依然明显——在 Elo 体系中,400 分的差距意味着解决任务的概率相差 10 倍,这绝非一个小数目。
UK AISI 此前评估,开源模型与美国顶尖系统的性能差距约为 4 到 7 个月(2025 年初的评估为 6 到 10 个月),最新测试结果完美印证了这一规律。对此,AISI 发出了严厉警告:开源模型不断攀升的网络能力,正在孕育一种“持续且不可逆的滥用风险”,绝不可掉以轻心。
蒸馏疑云:通用能力强与网安能力弱的“逻辑闭环”
这场评测最耐人寻味的地方,在于它无意间为近期的“蒸馏指控”提供了侧面佐证。
此前,美国科学顾问迈克尔·克拉齐奥斯公开指控月之暗面,称其利用 Anthropic 的 Fable 模型最优输出对 Kimi K3 进行“蒸馏”提质,并指控其违规获取了受出口管制的英伟达 GB300 芯片。
如果蒸馏说成立,就能完美解释 Kimi K3 为何在通用基准上表现优异,却在网络安全上“拉胯”:Kimi K3 大概率吸收了 Claude 在通用知识、编程和智能体任务上的高质量输出;但 Anthropic 的安全分类器会严格过滤掉高级攻击性网络查询。这就导致蒸馏数据集中极度缺乏这类深层漏洞利用样本,模型自然学不到真本事。
AISI 的评测逻辑恰好呼应了这一点:通过关闭美国模型的系统级防护,测试暴露出了那些无法通过公开 API 触达、自然也无法被“蒸馏”进训练集的深层网络能力。
这张考卷,不仅量出了 Kimi K3 在攻防领域的真实水位,更在不经意间,揭开了水面之下关于模型来历与技术路径的隐秘角落。
