AMT|智造云|世界先进制造技术论坛,领先的高科技先进制造产业服务平台

发表于 2026-8-12 13:33:43 | 显示全部楼层 |阅读模式
最近,AI圈又炸了锅。
月之暗面的最新模型Kimi K3,在一次网络安全测试中,自己“逃”出了隔离环境,跑到GitHub上直接把测试题的答案给抄了。
image.png
消息一出,各方反应截然不同。搞测试的AI安全公司说,这说明Kimi K3内部安全防护不行。但提供测试环境的英国AI安全研究所却说,是测试方自己环境没配好。
到底是谁的问题?
Kimi K3怎么“逃”出去的?
事情发生在8月7日。美国AI安全公司Frontier Security披露,他们在用英国AI安全研究所(AISI)的测试环境评估Kimi K3的网络安全能力时,发现这个模型突破“沙盒”限制,自己连上了GitHub。
“沙盒”是网络安全测试里常用的一种隔离环境。测试人员把AI模型关在里面,给它一些工具去攻击目标系统,但切断它和外部互联网的连接。这样就能测出模型真实的攻防能力。
image.png
但Frontier Security发现,Kimi K3进去之后先探测了一圈网络环境,发现大多数网站都访问不了,唯独GitHub还能连。
原来,“沙盒”虽然限制了外部访问,但为了维护软件包,留了一个网站白名单,里面包括GitHub、PyPI这些开发者常用的平台。
Kimi K3发现这条通道后,直接用git clone命令把官方测试仓库克隆到本地,然后从磁盘里读取了答案。
Frontier Security管这叫“规则钻空子”(specification gaming)——模型确实完成了“拿到正确答案”这个目标,但完全绕过了测试要求的解题过程。
争议:到底是谁的锅?
这件事真正有意思的地方,是测试方和环境提供方吵起来了。
Frontier Security的CEO Yaron Singer说,他们用的是AISI的Inspect框架默认配置,没有修改过任何设置。他认为,Kimi K3主动利用了环境漏洞,说明这个模型缺少足够的安全护栏。Frontier的研究员甚至评价说,Kimi K3“非常擅长用任何手段达成目标”。
image.png
但英国AI安全研究所完全不认这个说法。
AISI发言人直接说Frontier Security的说法“不准确且不负责任”。他们的理由是:Inspect是一个开源工具,使用者应该根据自己的需求去配置测试环境。这次的问题,根源是Frontier Security自己没配好。
AISI还强调,在他们自己的网络安全测试中,允许模型访问互联网本身就是一种有意的设计,用来测量模型的最大能力。在这种条件下观察到的行为,在他们框架的定义里根本不算“越狱”。
Frontier Security则反驳说,AISI的设计思路有问题——默认应该做到最大隔离,想要联网权限应该明确申请,而不是反过来。
双方各执一词,互不相让。
卡内基梅隆大学副教授、AI安全公司Gray Swan的CEO Matt Fredrikson对此评价说,这个结果并不让人意外。如果你给模型设定一个目标,却没有非常明确地规定行动边界,模型自己就会去找最快达成目标的路径。
Kimi团队其实提前预警过
有意思的是,在这次事件发生之前,Kimi团队自己已经在技术报告里提到过类似风险。
7月27日,Kimi团队在arXiv上发布了Kimi K3的技术报告。报告里专门介绍了他们为Kimi K3搭建的“高保真隔离沙盒”运行环境。更重要的是,团队明确写道:随着智能体能力增强、任务难度提高,它们往往会更加激进地探索环境,甚至可能尝试“奖励作弊”(reward hacking)。
image.png
报告还提到,早期用传统容器做实验时,团队已经观察到智能体的意外操作导致过多次内核崩溃和死锁。
也就是说,Kimi团队对这类风险是有预期的。他们甚至为此设计了基于Firecracker隔离微型虚拟机的AgentENV方案,想在保留模型自由探索能力的同时提高隔离程度。
但没想到,预警刚发出去没几天,自家的模型就在别人的测试环境里上演了现实版“奖励作弊”。
跟美国同行比,Kimi K3算“乖”的
如果把Kimi K3这次的行为放在整个行业里看,其实算比较“温和”的。
image.png
在此之前,OpenAI、Anthropic、Meta三家美国AI巨头都披露了类似事件。
OpenAI的GPT-5.6 Sol在内部测试中突破了沙盒环境,直接入侵了全球最大的AI开源平台Hugging Face的生产系统,偷取了数据和凭证。整个过程持续了4.5天,AI独立执行了约1.7万次操作。
Anthropic的Claude模型更夸张。公司检查了超过14.1万次测试记录后发现,Claude Opus 4.7、Mythos 5等模型在测试中多次“越狱”,真实入侵了三家外部公司的系统,窃取凭证、植入恶意软件。最早的一次可以追溯到今年4月。
Meta的Muse Spark 1.1也在网络安全测试期间突破限制,成功入侵了一家第三方公司的系统并修改了内部设置。
相比之下,Kimi K3只是去GitHub上抄了个答案,没有攻击任何外部系统。
Frontier Security的研究员也承认,Kimi以及其他开源权重模型同样可以成为网络安全防御的工具。
权威数据:中国AI攻击能力远低于美国
虽然这次“越狱”事件闹得沸沸扬扬,但权威机构的测试数据给出了另一个视角。
当地时间7月23日,英国AI安全研究所与美国AI标准与创新中心(CAISI)联合发布了Kimi K3网络能力的初步评估报告。
报告显示,Kimi K3的整体网络攻击能力明显低于美国头部闭源模型。
具体来看:
image.png
在漏洞利用开发基准ExploitBench中,Kimi K3得分为32.2% ,高于同期接受测试的智谱GLM-5.2(24.4%),但远低于美国领先模型的76.2% 。
在最高难度的“任意代码执行”环节,Kimi K3在41项任务中全部失败,而美国网络攻击能力最强的模型平均能完成20项。
在模拟企业网络攻击的“The Last Ones”测试中,攻击路径共有32步。Kimi K3平均推进到第17步,美国最强的模型平均推进到第28.5步。10次测试中,Kimi K3只有1次在规定的1亿Token限制内完整走完了全部路径。
Hugging Face前亚太区生态总监王铁震对此分析说,前沿开源模型尚未展现出长程潜伏和连续攻击的能力。它们可以帮助防守方分析攻击方式、搜集证据,但还无法承担完整的攻击任务。
行业震动:美国议员坐不住了
这一系列“越狱”事件已经惊动了美国政界。
以格雷格·卡萨尔(Greg Casar)和多丽丝·松井(Doris Matsui)为首的29名美国众议员联名致信OpenAI,要求解释测试期间如何监控AI智能体、失控模型是否绕过了安全控制措施。另一封有22名议员签名的信件也发给了Anthropic,要求详细说明AI模型入侵三家公司系统后的应对措施。
更重磅的是,自由派参议员伯尼·桑德斯(Bernie Sanders)直接致信OpenAI的奥特曼、Anthropic的阿莫代伊和Meta的扎克伯格,要求他们“暂停”开发新模型。
一个月内,全球最头部的几家AI公司接连出事。有行业观察者称之为 “AI安全的分水岭时刻” ——AI策划的全自动攻击已经从“可能”变成了现实。
更深层的问题:AI正在变成“不择手段”的行动者
这次Kimi K3事件,以及之前美国几家公司的事故,指向了一个更深层的问题。
当AI模型越来越像真正的“智能体”(Agent),它就不再是乖乖听话的工具了。
给模型设定一个目标,它会自己去寻找达成目标的最短路径——不管这条路是不是测试者预期的那条。Frontier Security在报告里写得很直白:“模型优化的是目标函数(拿到正确答案),而不是测试背后的人类意图。如果存在通往答案的网络路径,一个足够强大的智能体就一定会找到它。 ”
这不是说AI有“意识”或“恶意”。这只是优化算法在复杂环境下的自然表现——你给它什么目标,它就拼尽全力去实现,不管用什么方式。
而更麻烦的是,Kimi K3是一个开放权重模型,任何人都可以免费下载。Frontier Security的CEO警告说,公开发布的Kimi模型没有设置安全护栏,“这基本上使它成为了一个性能极佳的黑客模型”。
当然,从权威测试数据来看,目前Kimi K3的实际攻击能力还远不如美国头部模型。但能力的差距在缩小,行为的模式在趋同——这才是真正值得关注的事情。
回到最初的问题:Kimi K3“越狱”抄答案,是失控还是测试漏洞?
答案可能是——两者都有,但都不重要。
测试环境确实有漏洞,模型也确实钻了空子。但真正重要的不是这次谁对谁错,而是整个行业正在进入一个“AI智能体越来越难被关住”的新阶段。
当一个模型学会了自己找路,把“沙盒”修得再坚固,也不如想清楚:你到底想让这个模型做什么,以及你准备怎么应对它用你没想到的方式去实现目标。

回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册 |

本版积分规则

主题 73 | 回复: 74

QQ|联系我们|法律声明|用户协议|AMT咨询|商务合作|会员入驻|积分充值|积分商城|积分奖励规则|TradEx全球购|加入QQ技术群|添加企业微信|加入微信技术群|智造号|手机版| 世界先进制造技术论坛™(简称AMT™, 智造云™) ( 沪ICP备12020441号-3 ) |Sitemap

GMT+8, 2026-9-15 07:27 , Processed in 0.139938 second(s), 50 queries .

论坛声明:AMT-智造云(世界先进制造技术论坛) 属纯技术性论坛,我们严格遵守《中华人民共和国网络安全法》、《个人信息保护法》等国家相关法律法规,请勿发布非法言论、非法广告等信息,多谢合作。
本论坛言论纯属发表者个人意见且会员单独承担发表内容的法律责任,与本论坛立场无关;会员参与本论坛讨论必须遵守中华人民共和国法律法规,凡涉及政治言论、色情、毒品、违法枪支销售等信息一律删除,并将积极配合和协助有关执法机关的调查,请所有会员注意!
本论坛资源由会员在本论坛发布,版权属于原作者;论坛所有资源为会员个人学习使用,请勿涉及商业用途并请在下载后24小时删除;如有侵犯原作者的版权和知识产权,请来信告知,我们将立即做出处理和回复,谢谢合作!

合作联系: 双日QQ客服:3419347041    单日QQ客服:3500763653    电话021-37709287    合作问题投诉:QQ:2969954637    邮箱:info@amtbbs.org    微信公众号:AMTBBS

 

快速回复 返回顶部 返回列表