事时观察 · 大模型技术路线 北京深度求索人工智能基础技术研究:V4-Flash反超自家万亿旗舰,原生多模态的巨额投入被高估了吗? 7月31日,北京深度求索人工智能基础技术研究有限公司(DeepSeek)上线 V4-Flash 正式版 API 公测:模型骨架没动,总参数 2840 亿、单步激活 130 亿,与三个月前的预览版完全一致,唯一改动是「重做了一遍后训练」。就是这套没换的骨架,在 9 项智能体与代码基准测试中全部反超自家总参数 1.6 万亿、激活 490 亿的 V4-Pro 预览版,DeepSWE 得分从 7.3 飙到 54.4。紧随其后的行业争论是:如果纯文本+后训练也能把 Coding 冲进头部梯队,Kimi K3 那条「2.8 万亿参数+原生多模态」路线的代价,是不是付高了? 六个数字读懂这次发布 2840亿 / 130亿 V4-Flash 正式版总参数/激活参数,约为 K3(2.8 万亿/1040 亿激活)的十分之一和八分之一 82.7分 Terminal Bench 2.1 得分:超过 V4-Pro 预览版 72.1 与 GLM-5.2 的 81.0,逼近 Claude Opus 4.8 的 85.0 54.4分 DeepSWE 得分,预览版仅 7.3,同一副骨架经后训练提升超过 6 倍 1元 / 2元 每百万 token 输入/输出价格,缓存命中后输入低至 0.02 元;高峰时段价格翻倍 1577~1586分 Arena 网页开发类榜单公开得分:36氪记录一度升至 1577 分,另一报道口径为 1586 分、全球第 7、开源第 3 1/89 输出价格约为 Claude Opus 4.8 的 89 分之一(输入约 1/36);同日 OpenAI 宣布 GPT-5.6 Luna 降价 80% 时间线:一个半月里,两条路线正面撞上 2026-04-18 证券时报转引 The Information:DeepSeek 启动成立以来首轮外部股权融资,报道口径估值超 100 亿美元(约 681.8 亿元人民币)、计划募集不少于 3 亿美元,公司当时尚未正式回应。 2026-04-24 V4 预览版发布并开源:V4-Pro(总参数 1.6 万亿、激活 490 亿)与 V4-Flash(总参数 2840 亿、激活 130 亿),全系标配 100 万 token 上下文。 2026-06-16 多家媒体称首轮融资完成、募资超 500 亿元人民币、估值突破 500 亿美元;到 8 月 1 日,太平洋电脑网称「距完成超 500 亿元首轮融资不足两月,公司估值约 710 亿美元」。 2026-07-17 月之暗面发布 Kimi K3:2.8 万亿总参数、原生多模态,发布后以 1679 分登顶 Arena Frontend Code 榜单。 2026-07-31 DeepSeek 上线 V4-Flash 正式版(V4-Flash-0731)API 公测:结构与预览版完全一致、仅重做后训练;同日 OpenAI 宣布 GPT-5.6 Luna 降价 80%。 2026-08-03 第一财经「壹评级」发布首份大模型技术路线专项评级,将 V4-Flash 的进展定义为「小参数基座+定向后训练」路线的验证。 同一副骨架:官方 9 项基准,全数反超自家 Pro 预览版 DeepSeek 官方明确:V4-Flash-0731 的模型结构与尺寸与此前预览版一致,仅重新进行后训练。9 项 Agent 基准测试全部超过 V4-Pro 预览版,其中多个指标与头部闭源模型的差距已收窄到个位数。 基准测试 V4-Flash 正式版 对照数据(来源口径不同,并列) Terminal Bench 2.1 82.7 预览版 61.8;V4-Pro 预览版 72.1;GLM-5.2 为 81.0;Claude Opus 4.8 为 85.0 DeepSWE 54.4 预览版 7.3,提升超 6 倍 Cybergym 76.7 官方 9 项之一 NL2Repo 54.2 官方 9 项之一 Toolathlon(verified) 70.3 官方 9 项之一 Agent Last Exam 25.2 V4-Pro 预览版 15.8;Claude Opus 4.8 为 25.7 第三方口径:Artificial Analysis 智能指数(AII)给 V4-Flash-0731(最高推理档)50 分,比 4 月预览版高 10 分、比 GPT-5.6 Luna 低 1 分,同类可比模型的中位数仅 17 分。Arena 榜单得分则有两套报道口径:36氪称 Arena WebDev 公开得分一度升至 1577 分、身前只剩 K3、Claude 与 GPT 系列少数模型;另一篇报道称 Arena.ai Frontend Code Arena 为 1586 分、全球第 7、开源第 3,较预览版提升 154 分。 两条路线的「时间差」:K3 领先的恰恰是视觉 把两件事放在一起看,结论比表面更微妙。K3 以 1679 分登顶 Arena Frontend Code 榜单,仍明显高于 V4-Flash 的 1577~1586 分——而 K3 的标签正是原生多模态:图像与文字从预训练阶段就共同塑造主干,视觉编码器 MoonViT-V2(约 4 亿参数)从零训练,模型写完代码后能对照页面截图自我纠错,月之暗面称之为「vision in the loop」。 DeepSeek 给出的答案则是另一种:不加视觉、不调架构,把全部更新押在后训练。两者间隔仅两周(K3 于 7 月 17 日发布,V4-Flash 正式版 7 月 31 日上线),恰好构成一次路线对照实验。 原生多模态路线 月之暗面 K3:总参数 2.8 万亿、激活约 1040 亿,约 15 万亿混合图文 token 联合预训练(early fusion) 阿里 Qwen3.8-Max:总参数 2.4 万亿、激活 950 亿,原生视觉+Coding+Cowork 智谱与腾讯混元被业内多次报道可能跟进;唐杰公开征集「下一版 GLM 必须加入的功能」,评论区高频词是「视觉」 纯文本+后训练路线 DeepSeek V4-Flash:总参数 2840 亿、激活 130 亿,结构与预览版一致,仅重做后训练 智谱、腾讯混元最新通用基座仍以文本输入为主(36氪报道口径) DeepSeek 创始人梁文锋原话:「把 AI 训练做好,并不需要世界模型,甚至不用多模态」——但「多模态最终还是要做的」 36氪引述的多模态研究员认为,视觉在长链任务里是「更准确的反馈」:外接视觉工具等于一个「瞎的 LLM + 能看清的小弟」,感知结果要在两个模型间传递;原生多模态的内部通道更宽,还能在视觉强化学习中把运行结果纳入同一条训练轨迹。这意味着,K3 在「看页面改代码」这类任务上的结构性优势,短期内不太可能被纯文本模型靠后训练抹平。 价格是另一条战线:成本阈值被击穿 项目 V4-Flash 正式版 对比口径 API 定价 输入 1 元/百万 token(缓存命中 0.02 元),输出 2 元/百万 token;高峰时段(北京时间 9–12 点、14–18 点)翻倍 V4-Pro 预览版输出约 6 元/百万 token vs Claude Opus 4.8 输出价约为其 1/89、输入价约 1/36(不同报道写作 1/90) 缓存命中折扣约 98%,远超行业普遍的约 90% vs GPT-5.6 Luna 同日 Luna 降价 80%,V4-Flash 单任务成本仍比降价后低约 60% 有开发者实测:一次本地文件读取+全网检索任务耗 51 万 token、费用 0.53 元 工程侧同步给出一条效率证据:V4 系列在 100 万 token 场景下单 token 推理计算量仅为 V3.2 的 27%、KV Cache 占用降至约 10%。模型原生支持 OpenAI Responses API 并适配 Codex,自研 Agent 测试框架 DeepSeek Harness 也首次正式亮相。第一财经「壹评级」据此判断:极低推理成本击穿了企业级智能体规模化部署的成本阈值;天风证券计算机团队以「大超预期」定调,称其综合能力接近 Claude Opus 4.8、智能体代码能力接近 GPT-5.6 Luna。 公司档案:法人独资、67 人参保、首轮融资 北京深度求索人工智能基础技术研究有限公司成立于 2023 年 5 月 16 日,注册资本与实缴资本均为 1000 万元人民币,有限责任公司(法人独资),法定代表人裴湉、监事王苗军,注册地址北京市海淀区科学院南路 2 号 C 座 5 层 N501,为增值税一般纳税人。 股权:唯一股东为杭州深度求索人工智能基础技术研究有限公司(持股 100%,实缴 2023-07-28);天眼查登记梁文锋为疑似实际控制人,综合持股比例 89.46%(路径含梁文锋→宁波程恩 50.1%→杭州深度求索 66%→北京深度求索 100%,以及直接持股 34% 等)。 团队:社保参保人数由 2024 年报的 37 人增至 2025 年报(2026-06-12 发布)的 67 人,一年内接近翻倍;年报营收、利润、资产等财务科目均「企业选择不公示」。 融资:4 月报道称公司从「拒绝资本」转向首轮募资,主要压力是研发成本激增与核心研究员流失(报道点名罗福莉、郭达雅被小米、字节跳动挖角);6 月报道称首轮融资完成、募资超 500 亿元、估值破 500 亿美元;8 月 1 日太平洋电脑网称估值约 710 亿美元。融资规模与估值在不同时间点、不同媒体口径下差异较大,均未获公司官方公告确认。 风险观察:这次跃迁的成色与边界 后训练红利是否可复制。 Terminal Bench 2.1 从 61.8 一步跃到 82.7,说明基座能力临界点已到、后训练空间被低估;但 85.0 的 Claude Opus 4.8 近在眼前,下一次再靠「同一副骨架」还能挤出多少提升,是悬而未决的问题。V4-Pro 正式版尚未发布,官方称「将尽快」。 产品完成度打折。 仅限 API 公测,网页端与 App 未更新;开发者反馈「太喜欢框框干」——任务边界清晰时好用、说不清楚就出岔子;Agent 模式推理语言被锁定为英文,系统提示词无效。 融资压力与人才流失并存。 从「自给自足」转向首轮募资本身即压力信号;4 月报道时公司尚未正式回应,官方对融资规模至今未置评。工商层面注册资本仅 1000 万、年报核心财务科目不公示,烧钱与商业化之间的平衡要靠模型收入与融资共同支撑。 榜单口径与排名波动。 Arena 得分存在 1577 与 1586 两个报道口径,且 Coding 榜单排名以周为单位变化——本次「头部梯队」位置需要后续榜单验证,而非一次定性。 路线竞争未终结。 K3 完整权重已于 7 月底公开(报道口径),阿里 Qwen3.8-Max 走「大而全」路线;若视觉在更长链的 Agent 任务中形成「看得见才改得对」的结构性优势,纯文本路线存在天花板。梁文锋自己也没否认这一点——「多模态最终还是要做的」。 下一步验证什么 V4-Pro 正式版的发布时间、定价与能力——官方称「将尽快」,Responses API 预计 8 月初接入 Pro。 V4 后续版本是否加入原生多模态,以及以什么时机、什么代价加入(梁文锋「最终要做」的具体时间表)。 后训练效率能否复利:下一轮迭代若仍不改架构,Terminal Bench 等指标还有多少上行空间。 Arena 榜单的稳定性:1577~1586 分能否守住,与 K3 的 1679 分差距是否收窄。 首轮融资的官方披露与商业化收入信号——这是判断「低价换规模」能否成立的关键。 分析建议 结论(基于已核验材料): V4-Flash 正式版证明「视觉并非冲刺 Coding 排名的前提」,但这只部分证伪「原生多模态被高估」的命题,尚不足以得出「多模态整体被高估」的结论——K3 在 Arena Frontend Code 榜单仍以 1679 分领先,视觉在「看页面、查结果、给反馈」的长链任务中有结构性作用。更准确的解读是:各家公司对多模态的长期价值分歧不大,真正的分歧在时机与代价——当 Coding 排名几个月一变、商业化压力集中在 Coding 与 Agent 时,把资源押在后训练是当前性价比最高的选择。 谁受影响: 开发者(推理成本骤降,Agent 应用可大规模落地);月之暗面与阿里(需为「大而全+原生多模态」的溢价辩护);算力与推理基础设施(效率路线压低单位 token 成本);应用厂商(成本阈值击穿,垂直场景商业化窗口打开)。 依赖说明: 以上判断依赖 DeepSeek 官方 9 项基准、Artificial Analysis 与 Arena 等第三方评测、以及多家媒体报道;其中融资估值、榜单得分存在多来源口径差异,已在正文并列,不作单一确定值。 来源 36氪|Kimi K3与DeepSeek V4之间,隔着原生多模态的时间差 证券时报|DeepSeek,大消息!启动首轮外部融资! 太平洋电脑网|DeepSeek-V4-Flash正式版上线,130亿激活参数撬动Agent战场 今日头条|DeepSeek V4-Flash正式版:130亿激活参数,重做后训练反超自家万亿旗舰 掘金|DeepSeek V4-Flash正式版实测:纯后训练Agent能力碾压V4-Pro,附API调用代码 TechWeb(UC 转载)|DeepSeek-V4-Flash正式API上线!Agent能力暴涨6倍,价格仅为Claude的1/90 天眼查|北京深度求索人工智能基础技术研究有限公司·工商基础信息 天眼查|北京深度求索人工智能基础技术研究有限公司·企业年报 天眼查|北京深度求索人工智能基础技术研究有限公司·股东 天眼查|北京深度求索人工智能基础技术研究有限公司·疑似实际控制人