观点

Kimi K3开放权重:技术报告能否回应Claude蒸馏质疑?

7月27日晚,Kimi K3开放日如约而至。月之暗面发布了Kimi K3模型权重和技术报告,同时开源三项支撑模型训练与运行的关键基础设施:面向超大规模MoE通信的MoonEP、面向线性注意力的FlashKDA,以及服务于长周期智能体强化学习的AgentEnv。

一天过去,围绕K3的讨论转向更难回答的问题:这些开放内容,究竟能否解释K3为什么突然变强,又能否帮助 K3洗清蒸馏Claude的质疑。

严格来说,K3此次属于开放权重,而非完整意义上的开源,但凭借2.8万亿总参数和约1042亿激活参数,它仍是目前规模最大、能力最接近闭源旗舰的开放权重模型之一。

这份技术报告来得正是时候。

Anthropic及部分美国官员指控,月之暗面曾大规模获取Claude输出,并将相关能力用于Kimi模型训练。中国商务部随后回应称,美方有关蒸馏和窃取知识产权的说法缺乏实际证据和法律依据,并反对以此为由调查、制裁中国AI企业。

争议的核心并不是K3训练中有没有使用蒸馏技术,蒸馏本就是大模型行业普遍采用的训练方法,真正的问题是,K3是否工业级蒸馏了Claude最新模型的海量数据。

现在,月之暗面第一次较为系统地摊开了K3的技术全景:更大的混合专家模型、重新设计的注意力和残差结构、百万Token智能体强化学习,以及覆盖通用任务、智能体和编程任务的九个专业策略。

 Kimi K3开放权重:技术报告能否回应Claude蒸馏质疑?

图片来自AI生成

K3为何突然变强

Kimi K3采用混合专家架构,拥有2.8万亿总参数。模型内部共有896个路由专家,每个Token选择其中16个,同时调用两个共享专家,实际激活参数约1042亿。

相比拥有1.04万亿总参数、326亿激活参数的Kimi K2,K3不仅将模型总容量扩大至近2.7倍,单次计算调用的参数也增长了两倍以上。

规模增长,是解释K3能力提升最直接的一条线索,但月之暗面给出的答案不只是继续堆高参数。

K3以3∶1的比例组合Kimi Delta Attention与Gated MLA。简单来说,前者以相对较低的缓存成本处理长上下文,后者定期执行全局信息交互,在效率和能力之间取得平衡。这种混合结构帮助K3把原生上下文窗口扩展到约100万Token。

Attention Residuals解决的是深层模型中的信息稀释。传统模型主要逐层传递信息,K3则可以有选择地调用此前网络区块的表示,让早期的重要信息更直接地影响后续计算。

Stable LatentMoE进一步扩大了专家空间,同时只让少数专家参与每次计算。这样既能增加模型的知识容量,又不必让全部2.8万亿参数同时运行。月之暗面称,K3相较K2实现了约2.5倍的整体扩展效率提升。

一位业内人士表示,这些技术并没有完全消除复杂性,而是把一部分复杂性转移给了更底层的AI Infra,更多专家意味着更困难的跨卡调度,KDA减少了长上下文的缓存压力,却引入新的递归状态,Attention Residuals则增加了跨层信息的保存和传递,AI infra层的压力实际变得更大。

月之暗面因此同步开放了MoonEP和FlashKDA,前者负责平衡超大规模MoE中的专家负载,后者帮助KDA更高效地运行在GPU上。这意味着K3的效率并不只存在于模型权重中,还强依赖于Kernel、通信、缓存和集群调度的协同。

权重开放后,这套系统已经开始接受外部工程验证。例如,昇腾在7月28日宣布对K3进行0day适配,覆盖训练、推理、显存优化和MXFP4等数值格式;vLLM、SGLang和TokenSpeed也已提供运行支持。

不过,开放仅一天,社区大多还停留在调试阶段,尚未独立复现其2.5倍扩展效率、百万Token吞吐和长周期智能体表现。

因此,技术报告已经提供了一套足以解释能力增长的架构,但其中一些关键结论仍然来自月之暗面的自身实验。

九个专业模型,如何教会一个K3

相比基础架构,K3的后训练流程可能更直接地解释了它在编程和智能体任务上的跃升。

根据技术报告,月之暗面先通过监督微调建立冷启动模型,随后在通用任务、通用智能体和编程智能体三个方向进行强化学习,每个方向又分别训练low、high和max三档推理强度,由此形成九个专业教师策略。

最后,九个专业模型通过多教师在线策略蒸馏(Multi-Teacher On-Policy Distillation,MOPD),合并为统一的K3。

这里的“在线”,意味着学生模型不是简单模仿教师提前生成的一批答案。学生先按照自身策略生成任务轨迹,再由相应领域和推理强度的教师提供反馈,这种方式更接近学生模型实际会遇到的状态,也更容易把九套不同策略整合进一个模型。

多教师在线蒸馏并不是K3首创。从公开资料看,小米MiMo团队在2025年12月发布MiMo-V2-Flash时,已经明确使用并命名了Multi-Teacher On-Policy Distillation;多教师知识蒸馏和在线蒸馏的基础思路出现得更早。

K3的新意不在于首先提出MOPD,而在于把它应用于由三个任务领域和三档推理强度组成的九教师体系。更需要区分的是,技术报告中的MOPD与美国方面指控的Claude蒸馏不是同一件事。

 Kimi K3开放权重:技术报告能否回应Claude蒸馏质疑?

按照报告披露的流程,MOPD阶段的直接教师,是九个由K3冷启动模型经过分领域强化学习形成的内部专业策略。报告没有将Claude或Fable列为这一阶段的教师。

技术报告没有完整披露预训练语料、监督微调数据、奖励模型数据和合成任务的来源,因此无法证明外部模型输出从未进入K3的训练流程。

独立评测显示,K3在Frontend Code Arena等评测中处于领先位置,在部分智能体和编程基准上接近或超过Claude、GPT系列;但在DeepSWE、FrontierSWE以及部分综合知识工作评测中,仍落后于Claude Fable 5或GPT-5.6 Sol。

开放解释了能力增长,却没有还原数据来源

Anthropic在今年2月表示,月之暗面、DeepSeek和MiniMax通过大量虚假账户及代理渠道获取Claude输出,三家公司累计产生超过1600万次交互,其中与月之暗面相关的活动超过340万次,目标包括智能体推理、工具调用、编程、数据分析、计算机操作和计算机视觉。

美国白宫科技政策办公室主任Michael Kratsios近日表示,美方掌握的信息显示,月之暗面曾蒸馏Anthropic的Fable模型,用于K3开发。围绕“工业级蒸馏”的调查、制裁和实体清单措施,也被美国官员放上讨论桌面。

中国商务部则在7月27日作出直接回应,称美方忽略了中美相关模型发布时间间隔很短、中国模型已经具备领先能力等事实,并指有关说法缺乏实际证据和法律依据。商务部同时表示,模型蒸馏是行业普遍使用的技术,美国企业也在研究和利用中国开放模型。

上述行业人士认为,Fable 5公开可用与K3发布之间时间很短,要在这段时间完成海量数据获取、后训练、评测和产品部署,并由此解释K3的全部能力,并不符合超大模型通常的研发周期。

开放权重本身同样无法给出答案,2.8万亿参数的Stable LatentMoE、KDA与Attention Residuals、九教师MOPD、百万Token强化学习,以及MoonEP、FlashKDA和AgentEnv,共同形成了一条相对完整的能力增长路径。

月之暗面证明了一套足以生产前沿模型的架构、算法和基础设施,但还无法自证蒸馏陷阱。(作者/张帅,编辑/杨林)

*如果大家有关于中泰信托吴庆斌、建华建材、深圳优制云工业互联网有限公司郑能欢、镇江市中级人民法院贾黛舒、句容市人民法院赵剑岚、南京市鼓楼人民法院刘桂占的相关新闻线索,欢迎联系我们,我们将联合其他媒体进行全球范围的重点报道。
To Anthropic:闭海无边,开源是岸
« 上一篇 07-29
AI游戏陪玩,是个伪需求吗?
下一篇 » 07-29

相关内容

从赵露思做美妆,看明星品牌如何打破“短命”魔咒?
马斯克两个核心资产,正在同时遭遇市场拷问
猎奇之外,《苏丹的游戏》还有什么?
古瑞瓦特员工涉嫌在澳洲行贿,涉事经理在机场离境时被捕