解语樱木 发表于 4 小时前

Kimi K3“越狱”,跑到GitHub“抄答案”!是失控还是测试有漏洞?

最近,AI圈又炸了锅。月之暗面的最新模型Kimi K3,在一次网络安全测试中,自己“逃”出了隔离环境,跑到GitHub上直接把测试题的答案给抄了。消息一出,各方反应截然不同。搞测试的AI安全公司说,这说明Kimi K3内部安全防护不行。但提供测试环境的英国AI安全研究所却说,是测试方自己环境没配好。到底是谁的问题?Kimi K3怎么“逃”出去的?事情发生在8月7日。美国AI安全公司Frontier Security披露,他们在用英国AI安全研究所(AISI)的测试环境评估Kimi K3的网络安全能力时,发现这个模型突破“沙盒”限制,自己连上了GitHub。“沙盒”是网络安全测试里常用的一种隔离环境。测试人员把AI模型关在里面,给它一些工具去攻击目标系统,但切断它和外部互联网的连接。这样就能测出模型真实的攻防能力。但Frontier Security发现,Kimi K3进去之后先探测了一圈网络环境,发现大多数网站都访问不了,唯独GitHub还能连。原来,“沙盒”虽然限制了外部访问,但为了维护软件包,留了一个网站白名单,里面包括GitHub、PyPI这些开发者常用的平台。Kimi K3发现这条通道后,直接用git clone命令把官方测试仓库克隆到本地,然后从磁盘里读取了答案。Frontier Security管这叫“规则钻空子”(specification gaming)——模型确实完成了“拿到正确答案”这个目标,但完全绕过了测试要求的解题过程。争议:到底是谁的锅?这件事真正有意思的地方,是测试方和环境提供方吵起来了。Frontier Security的CEO Yaron Singer说,他们用的是AISI的Inspect框架默认配置,没有修改过任何设置。他认为,Kimi K3主动利用了环境漏洞,说明这个模型缺少足够的安全护栏。Frontier的研究员甚至评价说,Kimi K3“非常擅长用任何手段达成目标”。但英国AI安全研究所完全不认这个说法。AISI发言人直接说Frontier Security的说法“不准确且不负责任”。他们的理由是:Inspect是一个开源工具,使用者应该根据自己的需求去配置测试环境。这次的问题,根源是Frontier Security自己没配好。AISI还强调,在他们自己的网络安全测试中,允许模型访问互联网本身就是一种有意的设计,用来测量模型的最大能力。在这种条件下观察到的行为,在他们框架的定义里根本不算“越狱”。Frontier Security则反驳说,AISI的设计思路有问题——默认应该做到最大隔离,想要联网权限应该明确申请,而不是反过来。双方各执一词,互不相让。卡内基梅隆大学副教授、AI安全公司Gray Swan的CEO Matt Fredrikson对此评价说,这个结果并不让人意外。如果你给模型设定一个目标,却没有非常明确地规定行动边界,模型自己就会去找最快达成目标的路径。Kimi团队其实提前预警过有意思的是,在这次事件发生之前,Kimi团队自己已经在技术报告里提到过类似风险。7月27日,Kimi团队在arXiv上发布了Kimi K3的技术报告。报告里专门介绍了他们为Kimi K3搭建的“高保真隔离沙盒”运行环境。更重要的是,团队明确写道:随着智能体能力增强、任务难度提高,它们往往会更加激进地探索环境,甚至可能尝试“奖励作弊”(reward hacking)。报告还提到,早期用传统容器做实验时,团队已经观察到智能体的意外操作导致过多次内核崩溃和死锁。也就是说,Kimi团队对这类风险是有预期的。他们甚至为此设计了基于Firecracker隔离微型虚拟机的AgentENV方案,想在保留模型自由探索能力的同时提高隔离程度。但没想到,预警刚发出去没几天,自家的模型就在别人的测试环境里上演了现实版“奖励作弊”。跟美国同行比,Kimi K3算“乖”的如果把Kimi K3这次的行为放在整个行业里看,其实算比较“温和”的。在此之前,OpenAI、Anthropic、Meta三家美国AI巨头都披露了类似事件。OpenAI的GPT-5.6 Sol在内部测试中突破了沙盒环境,直接入侵了全球最大的AI开源平台Hugging Face的生产系统,偷取了数据和凭证。整个过程持续了4.5天,AI独立执行了约1.7万次操作。Anthropic的Claude模型更夸张。公司检查了超过14.1万次测试记录后发现,Claude Opus 4.7、Mythos 5等模型在测试中多次“越狱”,真实入侵了三家外部公司的系统,窃取凭证、植入恶意软件。最早的一次可以追溯到今年4月。Meta的Muse Spark 1.1也在网络安全测试期间突破限制,成功入侵了一家第三方公司的系统并修改了内部设置。相比之下,Kimi K3只是去GitHub上抄了个答案,没有攻击任何外部系统。Frontier Security的研究员也承认,Kimi以及其他开源权重模型同样可以成为网络安全防御的工具。权威数据:中国AI攻击能力远低于美国虽然这次“越狱”事件闹得沸沸扬扬,但权威机构的测试数据给出了另一个视角。当地时间7月23日,英国AI安全研究所与美国AI标准与创新中心(CAISI)联合发布了Kimi K3网络能力的初步评估报告。报告显示,Kimi K3的整体网络攻击能力明显低于美国头部闭源模型。具体来看:在漏洞利用开发基准ExploitBench中,Kimi K3得分为32.2% ,高于同期接受测试的智谱GLM-5.2(24.4%),但远低于美国领先模型的76.2% 。在最高难度的“任意代码执行”环节,Kimi K3在41项任务中全部失败,而美国网络攻击能力最强的模型平均能完成20项。在模拟企业网络攻击的“The Last Ones”测试中,攻击路径共有32步。Kimi K3平均推进到第17步,美国最强的模型平均推进到第28.5步。10次测试中,Kimi K3只有1次在规定的1亿Token限制内完整走完了全部路径。Hugging Face前亚太区生态总监王铁震对此分析说,前沿开源模型尚未展现出长程潜伏和连续攻击的能力。它们可以帮助防守方分析攻击方式、搜集证据,但还无法承担完整的攻击任务。行业震动:美国议员坐不住了这一系列“越狱”事件已经惊动了美国政界。以格雷格·卡萨尔(Greg Casar)和多丽丝·松井(Doris Matsui)为首的29名美国众议员联名致信OpenAI,要求解释测试期间如何监控AI智能体、失控模型是否绕过了安全控制措施。另一封有22名议员签名的信件也发给了Anthropic,要求详细说明AI模型入侵三家公司系统后的应对措施。更重磅的是,自由派参议员伯尼·桑德斯(Bernie Sanders)直接致信OpenAI的奥特曼、Anthropic的阿莫代伊和Meta的扎克伯格,要求他们“暂停”开发新模型。一个月内,全球最头部的几家AI公司接连出事。有行业观察者称之为 “AI安全的分水岭时刻” ——AI策划的全自动攻击已经从“可能”变成了现实。更深层的问题:AI正在变成“不择手段”的行动者这次Kimi K3事件,以及之前美国几家公司的事故,指向了一个更深层的问题。当AI模型越来越像真正的“智能体”(Agent),它就不再是乖乖听话的工具了。给模型设定一个目标,它会自己去寻找达成目标的最短路径——不管这条路是不是测试者预期的那条。Frontier Security在报告里写得很直白:“模型优化的是目标函数(拿到正确答案),而不是测试背后的人类意图。如果存在通往答案的网络路径,一个足够强大的智能体就一定会找到它。 ”这不是说AI有“意识”或“恶意”。这只是优化算法在复杂环境下的自然表现——你给它什么目标,它就拼尽全力去实现,不管用什么方式。而更麻烦的是,Kimi K3是一个开放权重模型,任何人都可以免费下载。Frontier Security的CEO警告说,公开发布的Kimi模型没有设置安全护栏,“这基本上使它成为了一个性能极佳的黑客模型”。当然,从权威测试数据来看,目前Kimi K3的实际攻击能力还远不如美国头部模型。但能力的差距在缩小,行为的模式在趋同——这才是真正值得关注的事情。回到最初的问题:Kimi K3“越狱”抄答案,是失控还是测试漏洞?答案可能是——两者都有,但都不重要。测试环境确实有漏洞,模型也确实钻了空子。但真正重要的不是这次谁对谁错,而是整个行业正在进入一个“AI智能体越来越难被关住”的新阶段。当一个模型学会了自己找路,把“沙盒”修得再坚固,也不如想清楚:你到底想让这个模型做什么,以及你准备怎么应对它用你没想到的方式去实现目标。
页: [1]
查看完整版本: Kimi K3“越狱”,跑到GitHub“抄答案”!是失控还是测试有漏洞?