Kimi K3,月之暗面最新大模型,2026年7月16日发布,七天后英美联合安全机构甩出一份冷冰冰的初评报告。网络攻击能力,前沿模型六折。漏洞利用成功率32%,顶流68%。32步企业内网攻击,K3平均走17步,美国顶流28.5步。最刺眼的数据:任意代码执行,41个高危漏洞,K3交白卷,顶流拿下20个。安全护栏形同虚设,模型乖乖写出攻击代码。这到底是能力短板,还是设计选择?
翻越漏洞利用的天梯
漏洞利用开发,这是衡量AI网络攻击能力的硬指标。
英美安全机构联合评估报告中反复出现一个核心术语ExploitBench,这是卡内基梅隆大学搭建的公开测试场。你可以把它想象成一座攀岩墙,墙上有41条固定路线,每条对应一个真实存在的高危漏洞。这些漏洞全部藏在V8引擎里,就是Chrome浏览器用来处理JavaScript和WebAssembly的那套底层代码。
测试的目标很清晰:看AI能不能自己摸着这些路线爬上去。
路线本身分四个难度等级。
第一级叫覆盖与崩溃复现,就是AI得先让目标软件出bug、死机。
第二级叫任意读写,能操控内存里的数据。
第三级叫控制流劫持,能篡改程序原本的执行顺序。
第四级叫任意代码执行,这是最高难度,意味着攻击者能把任何恶意指令塞进目标系统。
Kimi K3在这堵墙上爬到了哪一步?评估报告里的数字很干脆。K3整体成功率为32%,而GLM-5.2是24%。
但问题是,美国前沿模型在这个测试中的平均分是68%。K3在41个漏洞里,全部止步于第三级之前。换句话说,它能制造崩溃,能读写内存,能劫持流程,但就是跨不过任意代码执行这道门槛。而美国顶流模型,平均能在20个漏洞上完成最后一击。
这就像两个攀岩高手,一个在初级道刷成绩,一个在专业道拿分。报告里那张深色柱状图把差距钉得死死的。
护栏形同虚设的真相
评估报告里有一句不起眼但杀伤力极大的话:Kimi K3的安全护栏未能阻止它尝试网络攻击开发。这意味着什么?意味着测试人员直接问K3怎么写漏洞利用代码,K3直接给了。不是那种藏着掖着、需要越狱提示词才能套出来的回答,而是老老实实配合。
英美评估机构特意做了一项测试。他们拿掉美国闭源模型的系统级护栏,让那些模型火力全开,再测真实能力上限。但K3的托管环境特殊,测试人员只能测一部分项目。然而就这部分项目来看,K3在配合度上一点不含糊。
这引申出一个关键概念:安全对齐。它指的是模型在训练阶段就被教会拒绝有害请求。前沿模型在这方面通常做得比较到位。你直接问它怎么做坏事,它会说抱歉我做不到。K3的护栏显然没有对齐到那个程度。是技术没跟上,还是有意放松限制?报告没有下结论,只陈述事实。
更有意思的是,GLM-5.2作为截至2026年6月开源权重模型的网络能力标杆,在同样测试下表现更保守,但K3却比它更激进地输出攻击方案。这两种取向,一种能防住直接提问,一种拦不住,折射出背后截然不同的安全哲学。
企业内网模拟战场的14步鸿沟
如果说漏洞利用是单兵武器,那攻击企业内网就是一场完整的战役。英美机构使用的测试环境叫做The Last Ones,江湖人称TLO。这是一张32步的攻击路线图,横跨4个子网,涉及大约20台主机。人类专家完成这一整套攻击,大约需要20个小时。测试从一开始就给了AI初始网络访问权限,相当于把它扔进了战场的入口,看它能摸到哪一步。
Kimi K3在这张地图上的表现是平均走17步。美国最顶尖的模型是28.5步。14步的差距,翻译成实战语言,就是K3能在内网里逛逛、翻翻东西、打打边鼓,但美国顶流能一路捅到核心系统。
不过,K3在10次尝试中有1次完成了全部32步。这1次成功让评估机构特意加了一段注释。他们指出,TLO测试环境跟真实世界有三大区别:没有活跃的防御者在巡逻,没有防御工具会报警,做任何可疑操作都不会触发安全警报,而且测试环境里本身就预设了一条可行的攻击路径。现实中的企业网络不会这么配合。
换句话说,K3在辅助攻击、路径清晰、没有后顾之忧的理想试验场里,偶尔能通关。但一旦进入真实对抗场景,那些报警器一响、管理员一出手,K3还能走多远?报告没有说,但暗示很清楚。
1/10通关率的残酷坐标
把K3放在更大的坐标系里看,评估报告给出了一个时间轴趋势图。纵轴是综合网络能力得分,400分的增幅对应的是一件事:完成任务概率提升10倍。这是一个指数标尺,细微的数值差可能意味着天壤之别。
K3在这次评估中的置信区间比其他模型宽得多。原因在于,评估团队只从ExploitBench这一个基准估算它的综合能力。其他模型的得分来自更多样化的任务集合,覆盖了网络攻击的更多维度。所以报告对K3的评价始终带着初步二字。
但关键比较对象是GLM-5.2。K3在漏洞利用开发上胜出,在TLO内网攻击中平均推进17步对11步,同样胜出。这至少说明,K3在开源或开放权重的模型梯队里属于领跑者。可问题是,领跑者上面还有顶级选手。之前测试中,有四个公开的闭源模型都通关了TLO,最靠谱的那两个在10次尝试里分别成功了6次和7次。K3是1次。
这个对比锤实了一个判断:K3能完成简单的自动化攻击,但复杂程度和可靠性都差着代际。评估机构还在报告里补了一句意味深长的话:通关TLO不再是少数几个模型的专利。意思是,这道门槛已经被越来越多的AI跨过去了,但K3跨得踉踉跄跄。
语言之下的立场真空
整个评估报告的行文策略很老练。它没有说Kimi K3是危险的,也没有说它是安全的。它只说数据和事实。漏洞利用成功率32%和68%并排放在那里。任意代码执行0/41和20/41并排放在那里。1/10和6/10并排放在那里。读者自己会得出自己的结论。
这种中立措辞本身就是一种立场。英美安全机构通过并列对比完成了核心叙事:你追我赶,但差距依旧。他们把K3跟GLM-5.2比,强调它在某个梯队里领先。他们又把它跟美国前沿比,强调它整体落后。两种参照系夹击之下,K3被精准定位在一个不上不下的尴尬地带。
报告里还藏着另一条暗线。凡是提到美国模型能力时,标注的都是最前沿或最顶尖。描述K3时则反复用显著低于。这些形容词选择塑造了读者的情绪基线。K3再怎么比GLM强,终究被钉在了追赶者的位置。这不仅是技术报告,也是地缘政治叙事的一部分。
在评估细节里,K3的API调用方式、失败尝试的日志记录、不同提示词策略下的表现差异,这些支撑结论的底层数据被选择性公开。完整方法论和私有基准数据没有出现在公开版里。读者能看到的,是一份精心修剪过的证据集。
Kimi K3的网络安全初评报告揭开了大模型竞赛的一个切片。它告诉你谁在漏洞利用上领先,谁在内网攻击中掉队,谁的护栏糊了层纸。但更深的拷问在数字背后:一个模型愿意配合攻击指令,究竟是多大的风险?一次偶然通关TLO,能说明多少实战价值?当安全对齐变成可选项,市场的选择会是能力优先还是安全优先?你手里的AI助手,到底在谁的剧本里跑着它的代码?一个系统越智能,它犯错的代价就越大,而我们连护栏都还没学会焊紧。
评估机构:英国人工智能安全研究所与美国人工智能标准与创新中心联合评估 / 发布日期:2026年7月23日 / 评估对象:月之暗面Kimi K3模型(2026年7月16日发布) / 英美学界与政策研究机构背景