北京月之暗面押注K3的“眼睛”:2.8万亿参数,赌一个与DeepSeek的时间差 7月16日发布Kimi K3、27日开源1.56TB权重;一周之内,DeepSeek V4-Flash用纯后训练拿下9项Agent测试全胜。视觉早晚要做,分歧在何时做、付多大代价——这是2026年夏天国产大模型最值钱的一个问题。 北京月之暗面(Moonshot AI)在7月16日发布Kimi K3——2.8万亿参数MoE、原生多模态、100万token上下文——并在7月27日把完整权重挂上Hugging Face,被 虎嗅 报道为“30分钟拿下4000多个赞”的平台最快增长发布。几乎同一周,DeepSeek V4-Flash以2840亿参数、纯文本架构、不动预训练只重做后训练的方式,把9项Agent基准全部拉到自家V4-Pro预览版之上。两家头部公司的路线分叉,被 36氪 概括为“时间差”:多模态最终要做,分歧在何时做、付多大代价。本文以北京月之暗面为观察主体,核验它押注“眼睛”的筹码、代价,以及对手给出的反证。 三条路线同场竞技:参数、激活、模态与发布节奏 7月中旬到8月初,国产头部模型密集出牌。K3押“原生多模态+超大参数”,DeepSeek押“纯后训练+极致成本”,阿里Qwen3.8-Max则与K3同走“大而全”。三家的技术账,一张表可以看全: 维度 Kimi K3(北京月之暗面) DeepSeek V4-Flash Qwen3.8-Max(阿里) 发布节奏 7月16日发布;7月27日开源权重 8月1日开启API公测(版本0731),权重开源 7月19日预览版;8月3日正式版,下周开源 总参数 / 激活 2.8万亿 / 约1040亿 2840亿 / 约130亿 2.4万亿 / 约950亿 上下文 100万token 100万token(最大输出384K) 100万token 模态路线 原生多模态,early fusion,约15万亿混合图文token预训练 纯文本 原生全模态(图像/视频/文档/文本) 核心卖点 视觉进环路:Coding+Agent+视觉“水桶模型” 不动架构,纯后训练提分,低成本Agent Coding+Cowork+全模态,千问首个开源Max级权重 关键外部成绩 Frontend Code Arena 1679分登顶,7大领域6项第一 9项Agent测试超V4-Pro预览;Terminal Bench 2.1得82.7 第三方盲测:文本/视觉第二、编程第三(官方口径“仅次于Claude Fable 5”) 数据来源: 网易科技(Arena榜单) 、 搜狐·ZPedia(V4-Flash实测) 、 SegmentFault(Qwen3.8-Max) 、 月之暗面K3开放日官方文章 、 36氪 。第三方榜单口径未经审计,Qwen3.8-Max官方标准化Benchmark成绩截至发布日尚未公布。 为什么是“现在”押眼睛:视觉正在变成Agent的反馈回路 K3的技术叙事核心不是“能看图”,而是“用视觉给自己反馈”。 36氪 报道,K3在浏览器开发平台Puter的测试中被制造5处视觉偏差,对照目标页与运行页截图后全部找出且无误报;Kimi方面把“写完代码→查看页面→根据视觉结果继续调整”称为“vision in the loop”。其依据是长链任务的经验:如果只靠代码层面反馈,误差会不断累积,“视觉是更准确的反馈,也更贴近用户意图”。 这一判断有工程细节支撑:K3从零训练约4亿参数的视觉编码器MoonViT-V2,直接以next-token prediction训练、不依赖SigLIP初始化权重,视觉表示直接进入下一token预测目标;自研KDA混合线性注意力机制据称能在100万token上下文下把解码速度提升最高6.3倍。而路线时机的选择,月之暗面自己的消融实验给出了答案——K2.5技术报告显示,训练中后期才加入视觉数据,文本能力会先下降再恢复,图文token总量固定时,越早、以越低比例引入视觉通常越优。换句话说,K3押的是“拖得越久,合版成本越高”。 赌注的资本面:7个月,估值从43亿到500亿美元 路线选择背后是弹药。按 天眼查融资历史 与媒体报道的融资序列,北京月之暗面的资本曲线与模型节奏高度同步: 2025年12月30日 ——C轮5亿美元,投后估值43亿美元,IDG、阿里、腾讯、Lollapalooza Capital参投,出让约11.63%股权;创始人杨植麟称“账上有超百亿元人民币”。 2026年1-2月 ——三个月内连融三轮,金额分别为5亿、7亿、7亿美元( 钛媒体 口径)。 2026年5月6日 ——D轮20亿美元,投后估值破200亿美元,美团龙珠领投(单笔超2亿美元),中国移动、中信产业基金参投;报道称累计融资超376亿元人民币,为大模型创业公司中最多。 2026年7月27日 ——K3权重开源,与F轮消息仅隔两天。 2026年7月29日 ——据 新浪科技 ,完成超35亿美元F轮(报道口径投后估值350亿美元),因超募提前关闭,原定8月启动的G轮(Pre-IPO轮)提前开始,投前估值报500亿美元;公司未公开回应。 按各轮披露金额累加,2026年以来北京月之暗面新增融资约74亿美元(19亿+20亿+35亿)。与此对应,公司主体成立于2023年4月,注册资本152.36万元,参保人数162人,法定代表人杨植麟,实控人杨植麟持股78.968%,持有高新技术企业证书(GR202411000464)与增值电信业务经营许可(京B2-20240852)——股权高度集中,决策链条短,这是“路线由老板说了算”的组织基础( 天眼查·工商信息 )。 DeepSeek的反证:不开眼,后训练也能提分 北京月之暗面押视觉的同时,DeepSeek给出了另一组数据。 ZPedia实测 显示,V4-Flash延续284B总参数、单token激活13B的纯文本MoE架构,1M上下文配384K输出,在32万亿token上完成预训练后只重做后训练:Terminal Bench 2.1得分82.7、CyberGym 76.7、Toolathlon-Verified 70.3,9项Agent测试全部超过V4-Pro预览版; 36氪 称其在Arena WebDev榜单公开得分一度升至1577分,接近GLM-5.2,前面只剩K3、Claude Fable 5和GPT-5.6 Sol等少数模型。 这条路线证明:在不加视觉、不大幅扩张参数的情况下,Agent能力仍有显著提分空间。DeepSeek创始人梁文锋的两句话放在一起,正好概括这场分歧——“把AI训练做好,并不需要世界模型,甚至不用多模态”,但他同时说“多模态最终还是要做的”。分歧不在终点,在优先级。 代价:1.56TB权重与“200万入场券” K3的开源是“开源的,但你能跑吗”的问题。 虎嗅 测算,K3完整权重约1.56TB,最低公开验证配置是8张AMD MI355X加速卡(一台8卡服务器成本约25万-35万美元,折合人民币170万-240万),官方技术文档则建议64张以上加速卡——硬件投入约1360万-1900万元,全年电费就可能接近百万元。“200万只是入场券,千万级才接近商业化服务的起点。”这与月之暗面官方“每个人都可以下载并部署”的宣传形成落差:开源的实际受益者首先是云厂商与推理服务商。K3开源当天,华为昇腾宣布Day 0原生支持,阿里云真武M890完成适配(首token时延降低约35%),vLLM、Fireworks、Together AI、Nebius、Baseten、DigitalOcean六家海外平台同步适配( 官方开放日文章 )。 成本劣势的另一面是推理端的价格优势: 虎嗅 报道,K3在BrowseComp拿到91.2分,单任务成本2.03美元,约为GPT-5.6 Sol的一半、Claude Fable 5的四成不到。模型层的稀缺性在下降,价值正在向“跑模型的基础设施”转移——这是K3开源最直接的产业后果。 下一步验证什么 这场赌局的下注已经完成,接下来的几个时点决定输赢: Qwen3.8-Max权重下周(预计8月10日前后)开源 ——千问历史上首个开源Max级权重,2.4T参数将直接与K3争夺开源生态与部署算力;国内API定价每百万token输入12元、输出36元( SegmentFault )。 智谱、腾讯混元是否转向原生多模态 ——智谱首席科学家唐杰6月底在X向用户征集“下一版GLM必须加入哪些新功能”,评论区反复出现“视觉”;下一代基座是否跟进,是判断“时间差”能否成立的第一个样本( 36氪 )。 DeepSeek V4-Pro正式版(9月上线) ——后训练提分曲线能否延续;若V4-Flash的WebDev得分继续逼近K3,将直接检验“现在不开眼”的代价。 K3的视觉反馈在真实Agent长链任务中的商业化验证 ——视觉带来的正确率提升,能否覆盖1.56TB权重、64卡起步的部署成本。 风险观察:北京月之暗面 开源即B端开放,C端叙事承压 ——“每人可用”的宣传与“200万入场券”的部署现实之间存在落差;若API降价战延续,模型层利润会进一步向算力与云厂商转移( 虎嗅 )。 烧钱节奏与退出时钟提前 ——2026年以来约74亿美元新融资,估值7个月间从43亿美元冲到350亿-500亿美元(报道口径),Pre-IPO轮提前启动,意味着资本对兑现节奏的要求同步提前;公司在商业化收入端目前没有公开披露口径( 新浪科技 、 天眼查 )。 “水桶模型”的合版风险 ——K2.5消融实验已证明视觉与文本/代码会争夺模型容量、后期接入会让文本能力先降后恢复;2.8万亿参数的训练、推理与运维成本是硬约束( 36氪 )。 人才争夺信号 ——K3发布后,公司附近咖啡馆与餐厅出现扎堆的猎头,“多模态”成为拜访关键词;核心能力外流风险与行业热度并存( 36氪 )。 证据边界说明 ——本次已核验的公司档案(天眼查口径)显示经营状态存续、无经营异常记录;风险模块目录中存在开庭公告与多名股东/高管股权出质登记条目,但本次未读取到可引用的具体案由与结果,相关风险状态本次不作判断( 天眼查 )。 来源 36氪:《Kimi K3与DeepSeek V4之间,隔着原生多模态的时间差》 腾讯云开发者社区·月之暗面:《Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放》 网易科技:《Kimi-K3超越Claude Fable 5,登顶全球前端编程榜》 虎嗅·未来图灵:《月之暗面宣称Kimi K3是“每人可用”的大模型,实则最低入场券200万》 新浪科技:《曝月之暗面完成超35亿美元F轮融资,估值升至500亿美元》 钛媒体:《月之暗面将完成20亿美元新融资,估值破200亿美元》 SegmentFault:《Qwen3.8-Max 正式发布并即将开源:2.4T参数、自主编程16天》 搜狐·ZPedia:《DeepSeek-V4-Flash实测:13B激活干284B的活》 今日头条:《月之暗面发布Kimi K3:首个开源2.8万亿参数巨无霸模型》 天眼查:《北京月之暗面科技有限公司》工商信息、股东、融资历史