北京月之暗面开放K3权重:技术报告解释了能力从哪来,没解释数据从哪来 来源: 钛媒体 · 2026-07-29 · 事件观察 核心问题: Anthropic指控北京月之暗面通过超340万次欺诈交互"工业级蒸馏"Claude用于训练K3。7月27日,月之暗面发布K3权重及47页技术报告,首次系统披露训练流程——九教师在线蒸馏体系解释了K3的"能力增长",但没有完整披露预训练语料和外部数据来源。技术报告能否洗清指控,取决于一个难以自证的问题:数据来源。 一、争议时间线:从一次旧指控到白宫点名 2026年2月 Anthropic发表博客,指控月之暗面、DeepSeek和MiniMax通过大量虚假账户及代理渠道获取Claude输出,三家公司累计超1600万次交互。其中月之暗面相关活动超过340万次,涉及智能体推理、工具调用、编程和计算机视觉等领域。发布时反响有限。 2026年7月16–17日 月之暗面在世界人工智能大会(WAIC)发布Kimi K3,2.8万亿参数混合专家模型,支持100万Token上下文。24小时内登顶Arena前端编程匿名测试,超越Claude Fable 5和GPT-5.6 Sol。纳指当日收跌1.4%,彭博称之为"Kimi Moment"。 2026年7月22日 美国白宫科技政策办公室主任Michael Kratsios在X平台公开点名月之暗面,称开发K3时"蒸馏了Anthropic的Fable模型"。财长贝森特跟进,放风讨论实体清单和贸易黑名单。 2026年7月27日 月之暗面如约在Hugging Face开放K3完整权重(Modified MIT衍生许可),同步发布47页技术报告,并开源三大训练基础设施:MoonEP、FlashKDA、AgentEnv。 2026年7月27日 中国商务部回应,称美方说法缺乏实际证据和法律依据,强调模型蒸馏是行业普遍使用的技术,美国企业也在研究和利用中国开放模型。 2026年7月28日 Anthropic CEO Dario Amodei发文回应开放权重讨论,声明"从未主张禁止开放权重模型",但强调要打击"工业规模的蒸馏活动"并继续限制对华芯片出口。 二、K3技术全景:47页报告里最关键的三件事 K3采用混合专家(MoE)架构,总参数2.8万亿,每个Token激活约1040亿参数。相比K2(1.04万亿总参/326亿激活),模型容量翻了约2.7倍,单次调用参数也增长两倍以上。 2.8T 总参数 104B 每Token激活参数 896 路由专家数(激活16个) 1M 上下文窗口(Token) 2.5× 扩展效率提升(vs K2) 技术报告的三个核心创新: ① 混合注意力(KDA + Gated MLA 按3:1比例组合)。 KDA(Kimi Delta Attention)是一种线性注意力变体,通过带遗忘门的增量规则更新固定大小的隐状态,将长上下文的显存压力大幅降低——这解释了K3如何实现百万Token上下文而不撑爆显存。 ② Attention Residuals(注意力残差)。 允许每层注意力直接访问所有先前层的表示,缓解深层网络中的信息稀释问题。月之暗面采用分块变体,每12层为一个block,将开销从O(Ld)降至O(Nd)。 ③ Stable LatentMoE。 896个路由专家+2个共享专家,每个Token仅激活16个。为解决极端稀疏性下的训练不稳定问题,引入了SiTU-GLU激活函数和Quantile Balancing(分位数负载均衡)——后者无需辅助损失函数,通过动态调整偏差使专家间负载近乎完美均衡。 三、最关键的章节:九教师MOPD——它回答了也遗留下了什么 技术报告的后训练章节披露了K3的训练流程: 月之暗面先通过监督微调(SFT)建立冷启动模型,随后在 通用任务、通用智能体、编程智能体 三个方向分别进行强化学习,每个方向再按 低、高、最大 三档推理强度分别训练,由此形成 九个专业教师策略 。最后通过多教师在线策略蒸馏(Multi-Teacher On-Policy Distillation, MOPD),将九套策略合并为统一的K3。 这里的"在线"意味着:学生模型不是模仿教师提前生成的固定答案,而是先按自身策略生成轨迹,再由对应领域的教师提供反馈——更接近学生模型实际运行中遇到的状态。 关键区分:两种"蒸馏"不是同一件事 MOPD阶段的教师 :九个由K3冷启动模型经分领域强化学习形成的 内部专业策略 。技术报告没有将Claude或Fable列为这一阶段的任何教师。 美方指控的"蒸馏" :指月之暗面通过340万次API调用,获取 外部模型(Claude) 的输出来改进自身模型。 技术报告解释了K3能力的"增长路径"——但未能证明这条路径的"起点"(预训练语料、SFT数据、奖励模型数据、合成任务的来源)中不包含外部模型输出。 行业人士指出,MOPD并非K3首创。小米MiMo团队在2025年12月发布MiMo-V2-Flash时已明确使用相同命名;多教师知识蒸馏和在线蒸馏的基础思路出现得更早。 四、证据缺口:预训练语料与数据来源未完整披露 技术报告没有完整披露以下信息: 预训练语料的具体构成和来源 监督微调(SFT)数据的收集方式和来源 奖励模型数据的标注流程和来源 合成数据任务的工程细节 报告没有以可验证的方式说明,上述任意阶段中是否混入了通过API从外部模型获取的输出。这使得"K3是否使用了Claude输出"这一核心指控,至今仍处于双方各执一词的状态。 独立评测显示的分层表现,也为这个讨论提供了侧面参照: 评测领域 K3表现 对比对象 Frontend Code Arena 1679分,全球第一 超越Claude Fable 5(1631)和GPT-5.6 Sol(1618) Artificial Analysis智能指数 全球第三(5分) 落后于Claude Fable 5(59.9)和GPT-5.6 Sol(58.9) SWE Marathon 42.0分,第一 长程软件工程能力领先 DeepSWE / FrontierSWE 仍存差距 落后于Claude Fable 5或GPT-5.6 Sol HLE-Full(研究级推理) 明显差距 落后于Fable 5和GPT-5.6 Sol ⏱ 关键时间矛盾: 行业人士认为,Fable 5公开可用与K3发布之间时间窗口极短,要在这段时间内完成海量数据获取、后训练、评测和产品部署,并由此解释K3的全部能力,"并不符合超大模型通常的研发周期"。月之暗面企业业务负责人黄震昕此前也曾表示,K3的性能跨越是自身工程效率和架构创新的结果。 五、北京月之暗面是谁:"烧钱"最快的中国AI公司 从2023年4月成立到2026年7月,月之暗面在三年内累计融资超370亿元人民币——据天眼查工商信息,是国内大模型创业公司中公开融资最多的企业。创始人杨植麟(持股78.97%)在2025年底全员信中披露,当时账上现金已超100亿元人民币。 关键融资节点: 时间 轮次 金额 投后估值 主要投资方 2024-02 A轮 超10亿美元 — 红杉、小红书、美团、阿里 2024-08 B轮 超3亿美元 33亿美元 腾讯、高榕、阿里 2025-12 C轮 5亿美元 43亿美元 IDG资本、阿里、腾讯 2026-02 C+轮 7亿美元 — — 2026-05 D轮 20亿美元 破200亿美元 美团龙珠、中国移动、CPE 2026年1-2月密集完成3轮合计19亿美元融资;上半年累计融资超39亿美元,估值从43亿美元跃升至200亿美元以上。据彭博社7月22日报道,月之暗面计划于8月启动Pre-IPO轮融资,目标投前估值500亿美元,最快6个月内赴港上市。商业化方面:截至2026年6月,公司年化经常性收入(ARR)已达3亿美元,三个月内从1亿美元翻三倍。API调用收入占总收入七成以上。 六、硅谷用脚投票:Kimi已进入美国企业供应链 围绕蒸馏指控的另一层叙事矛盾来自美国企业的实际行为: Cursor用Kimi做基座。 2026年3月,美国估值293亿美元的编程工具公司Cursor发布Composer 2,被开发者发现底层模型ID为"kimi-k2p5",随后公开承认选择Kimi K2.5作为基座模型,并于5月的Composer 2.5继续沿用。 美国医疗AI用Kimi做出产品。 2026年7月20日,美国医疗AI初创actAVA在arXiv发表论文《Cura 1T》,明确标注基座模型为月之暗面Kimi K2.6(2026年4月发布的1T参数开放权重模型),通过LoRA微调后以闭源API向美国医疗企业销售,定价为每百万Token 0.5/2.5美元,6个医疗评测中5个压过GPT-5.5和Claude Opus 4.8。 叙事变化观察: 2026年3月,用Kimi当底座还是需要道歉的事;到7月,它已经能被写进论文第一句、挂上产品官网首页。四个月内从"被抓包"到"写进论文",反映了美国开发者对中国开源模型接受度的快速转变。 七、下一步:什么才是真正的验证节点 技术报告发布后,以下信号值得持续关注: 1. 工程复现进展。 开放仅两天,社区大多还处在权重加载调试阶段,尚未独立复现2.5倍扩展效率、百万Token吞吐和长周期智能体表现。昇腾7月28日宣布0day适配,vLLM和SGLang提供运行支持——外部验证正在启动。 2. 开源许可证的博弈。 K3采用自定义Kimi K3 License(衍生自MIT),对MaaS业务设有连续12个月营收2000万美元的阈值门槛。Anthropic CEO Amodei 7月28日声明未主张禁止开放权重,但主张打击"工业规模蒸馏"——这一定义本身的边界尚未明确。 3. 政策与上市窗口。 白宫科技主任Kratsios已将"工业级蒸馏调查、制裁和实体清单措施"放上讨论桌面。若月之暗面按计划于8月启动Pre-IPO(目标500亿美元估值),这一政策不确定性将直接成为资本市场的定价变量。 4. 第三方取证。 独立评测(如Arena和Artificial Analysis)显示K3在部分领域已超越Claude Fable 5,在另一些领域仍落后——这种"分层竞争"的格局与纯蒸馏假说存在张力,因为如果K3全面依赖Fable 5的能力,很难解释为什么在一些任务上能超越而另一些任务上落后。但这一推理属于间接证据,不能替代对训练数据来源的直接检查。 参考来源: [1] 钛媒体 — Kimi K3开放权重:技术报告能否回应Claude蒸馏质疑? [2] 月之暗面开源Kimi K3,Anthropic回应模型开、闭源之争 [3] 天眼查 — 月之暗面B轮融资:腾讯重仓 [4] 天眼查 — 北京月之暗面科技有限公司工商信息 [5] RunPod — Kimi K3 Technical FAQ [6] 彭博社 — 月之暗面K3:百亿现金与500亿美元估值 [7] 指控蒸馏的这一周,美国公司在Kimi上炼丹 [8] Kimi K3让美国羡慕又不甘:8倍投入为何中国先做出来? 公司数据来源:北京月之暗面科技有限公司天眼查档案(主体ID: 6062817535),数据截止2026年7月。