北京字跳网络技术押注超5万亿参数:拒绝蒸馏、接受落后,一场“原生预训练”豪赌 8月6日晚,《晚点 LatePost》独家披露:字节跳动正在讨论训练一个参数规模 超5万亿 的模型,超过阿里 Qwen 3.8-Max(2.4万亿)与月之暗面 Kimi K3(2.8万亿),是目前国内已知最大的参数目标,但计划仍处早期、不保证最终发布。同一周内,创始人张一鸣与 CEO 梁汝波先后定调——不蒸馏、接受短期落后、坚持长期自研。字节跳动在境内的主要运营主体 北京字跳网络技术 (抖音集团(香港)100%持股)由此站上一条新路线:用超大规模原生预训练,赌一次换道超车。 一、消息核心:一个还没立项的“国内最大模型” 据 晚点 LatePost 报道,新模型将由 Seed Foundation 负责人 项亮 主导,与大语言模型预训练数据负责人 沈科 合作;为此 Seed 正在重新梳理组织、划分职责、分配资源。多名字节人士称,与其在现有尺寸上继续追赶,不如把参数规模一次推到同行的数倍、争取领先位置——“像一场赌博”,一位接近 Seed 的人士说。计划仍处早期,不代表模型最终一定会发布。 模型 参数规模 状态 字节跳动新模型(讨论中) 超5万亿 早期讨论,不保证发布 Kimi K3(月之暗面) 2.8万亿 2026-07-16 发布 Qwen 3.8-Max(阿里) 2.4万亿 已发布 按超5万亿的最低值估算,新计划参数约为 K3 的 1.8倍 、Qwen 3.8-Max 的 2.1倍 。对标的含义很直接:字节不想再在同一尺寸上与开源阵营缠斗,而是想直接换一个量级。 新浪科技 援引同一报道确认了上述数字与“不保证发布”的口径。 二、为什么是现在:三次蒸馏争论,一次公开点名 2023年4月 字节引入 GPT API 调用规范检查,明令禁止将 GPT 生成数据加入训练集,并抽样核查模型输出与 GPT 的相似度——这条“红线”已延续三年多。 2025年1月 DeepSeek-R1 发布,蒸馏引发行业效仿;字节内部首度有人提议引入美国头部闭源模型输出训练,提议被否。 2025年底—2026年初 英伟达 Blackwell 系列 GPU 大规模商用,受出口管制影响,Seed 训练所用 H20 算力仅为 B200 的五十分之一;内部“实在不行就蒸馏”的动议获得较多支持,仍未获张一鸣批准。 2026年2月 Anthropic 公开指控 DeepSeek、MiniMax、月之暗面用超2.4万个虚假账号、累计超1600万次对话蒸馏 Claude;字节 Seed 不在名单。 2026年2月中旬 吴永辉执掌 Seed 后推出语言模型 Seed 2.0,市场反响有限;同期 Seedance 2.0(视频)与 Seedream 5.0 Lite(图像)上线,声量一度超过同类,Seedance 成为火山引擎 MaaS 营收基本盘。 2026年7月16日 月之暗面发布 Kimi K3(2.8万亿参数、原生视觉、100万 token 上下文);Seed 未推出同级语言模型,蒸馏提议第三次高涨。 约2026年7月下旬 张一鸣与 Seed 负责人吴永辉召开 Seed 全员会(报道称两周前):明确“闭源模型不能蒸馏,开放权重模型也不能蒸馏”,“Seed 可以接受暂时的落后,但不接受依靠蒸馏竞争对手来消除这种落后”;同时认可 Coding 是当前关键方向,要求整合火山引擎、飞书、豆包资源。 2026年8月6日上午 字节举办2026年度年中全员会,CEO 梁汝波表态:大语言模型坚持自研、做好基本功、接受短期落后、坚持优化长期。 2026年8月6日晚 晚点 LatePost 报道超5万亿参数模型计划,张一鸣“暂停蒸馏”与梁汝波“接受落后”形成双重定调。 编辑分析:三次争论的触发点都是外部压力——DeepSeek-R1 的示范、Blackwell 管制下的算力差距、Kimi K3 的发布。张一鸣三次否决,等于把“用别人输出换榜单排名”这条路彻底封死;而 Anthropic 的点名虽未涉及 Seed,也让字节失去了“快速追榜”的退路。以上判断基于上表所列媒体报道,不构成公司官方口径。 三、谁在拍板:从张一鸣到项亮 人物 身份 与本事件相关的动作 / 表态 张一鸣 字节跳动创始人 明确闭源与开放权重模型均不得蒸馏;“愿意为更长期的目标,牺牲一些短期收益”;鼓励 Seed 追求智能上限、做有自己特色的模型 梁汝波 字节跳动 CEO 8月6日年中全员会:大模型坚持自研、接受短期落后、坚持优化长期;确认豆包 C 端保持竞争力、Seedance 保持 SOTA 吴永辉 Seed 负责人 2026年2月执掌 Seed 并推出 Seed 2.0;与张一鸣共同召开 Seed 全员会 项亮 Seed Foundation 负责人 主导超5万亿参数新模型;2016年加入字节,曾任机器学习中台 AML 团队负责人、豆包大模型 Foundation 团队负责人 沈科 LLM 预训练数据负责人 与项亮合作推进新模型 郭达雅 原 DeepSeek 核心研究员 张一鸣亲自邀请加入,负责模型 Coding 能力专项训练;字节将 Coding 相关研发资源统一划归其名下 这份名单说明两件事:其一,新模型的执行权在“搜广推”体系出身的技术骨干手里;其二,Coding 补课与超大模型是两条线并行——先补最痛的短板,再赌最远的领先。 澎湃新闻 报道确认,梁汝波在全员会上承认“大语言模型被海外领先模型拉大了差距”,但方向仍是自研。 四、赌注的另一面:收入、算力与时间窗口 约150亿→超400亿 火山引擎2025年收入 → 2026年内部目标(元) 120万亿→180万亿 豆包 token 消耗:3月 → 6月(目标250万亿–300万亿) 超一半 token 消耗来自 Seedance + Seedream,语言模型占比不高 2亿日活 豆包用户体量,被普遍认为归功于 Seed 10亿 / 3亿美元 智谱 / 月之暗面 ARR,靠 Coding 能力打开市场 1/50 Seed 训练用 H20 算力与 B200 的差距(网易财经口径) 商业化的压力是真实的:火山引擎虽是国内最大的模型 API 卖家(市场份额约一半),但 token 增速已低于内部目标,短剧见顶叠加宏观变化拖累了 Seedance 的收入增速;语言模型收入占比不高,意味着字节在通用大模型榜单上的落后正在转化为收入结构上的短板。字节人士的逻辑是“用户会自然流向能力最强的产品”——Seedance 已证明一次领先能迅速变现,5万亿模型要复制的正是这条路径。 算力是这条路径最大的物理变量。除 H20 与 B200 的差距外,市场测算字节2026年资本开支约2000亿元人民币(较前次规划上调约25%),其中约850亿元用于 AI 芯片采购;外媒测算2027年算力预算最高冲击700亿美元(约5000亿元人民币)。 (以上为 市场测算 转引口径,非公司披露;另有测算称豆包日均 token 调用两年增长超1500倍,未获官方确认。) 五、公司档案:北京字跳网络技术是谁 北京字跳网络技术有限公司成立于2018年10月15日,注册资本10000万美元(已实缴),法定代表人兼经理水恒熠,监事夏绪宏,财务负责人徐乐乐,统一社会信用代码 91110108MA01F2L25J,登记状态存续、高新技术企业,注册地为北京市海淀区紫金数码园。股东为抖音集团(香港)有限公司,持股100%(台港澳法人独资)——它是字节跳动在境内的核心运营与持股平台。 天眼查|工商基础信息 显示其参保人数16875人( 2024年报 ,2025年6月4日发布;年报中营收、利润等财务数据均“企业选择不公示”)。 控股链方面,本次已核验范围内记录65条控制链,多为100%持股的科技与不动产运营主体,其中注册资本数十亿级者包括:北京拓扑之源科技(44.39亿元,持股95.56%)、无为濡须北岸科技(25亿元)、火山云(大同)科技(23.6亿元)、呼和浩特市塞北红城科技(20亿元)、芜湖江东名邑科技(15亿元)等。 (登记信息未标注用途,推断多指向数据中心与基建投入。) 这些重资本主体与“5万亿参数需要海量算力”的叙事互为背景。 人才面同样值得注意:2026年4月,剪映产品负责人张琪智完成职务交接后离职,在深圳注册“深圳想象着陆科技有限公司”进军 AI 影像创业—— 今日头条 报道称其带走了10亿用户验证的产品化能力。在字节“All in AI”的两年后,产品侧核心人物选择单飞,与 Seed 侧高薪引入郭达雅形成一进一出的对照。 六、风险观察:这条路上卡着什么 计划本身不确定。 超5万亿模型仍处早期讨论,“不代表最终一定会发布”(晚点/新浪科技)。豪赌失败的直接代价是时间与算力,而不是账面亏损——对一家上市公司而言这更容易被容忍,对非上市的字节而言则没有外部对赌压力。 算力物理约束。 H20 仅为 B200 五十分之一(网易财经口径),蒸馏又被禁令堵死,追赶只能靠自研效率与资本投入,二者都烧钱且不保证结果。 商业化窗口收窄。 token 增速低于内部目标;语言模型收入占比低;Coding 窗口已被 Anthropic、智谱、月之暗面抢占。若超大模型跑通前竞品继续迭代,榜单与收入压力会逐季累积。 组织与人才变动。 Seed 重新划分职责、分配资源本身即意味着内部重组;剪映负责人已先行离职,核心团队稳定性需观察。 司法面(本次核验范围内)。 可见诉讼以合同与著作权纠纷为主,多为小额;已审结一例中字节为原告并胜诉——(2025)京0108民初79257号著作权许可使用合同纠纷,法院判令被告享乐国际创新活动有限公司支付授权费69,213.93元、按日万分之一计的违约金及律师费3万元( 天眼查|司法风险汇总 )。未发现与本次模型计划直接相关的纠纷;被执行、行政处罚等类别本次可见范围内未提供可核验材料,无法评估。 七、下一步验证什么 超5万亿参数模型何时正式立项、进入训练,最终是否发布——这是判断“豪赌”真实性的第一信号。 “原生预训练”能否跑通:这是字节首次把参数规模推到国内第一梯队数倍,工程上没有先例可抄(张一鸣也不允许抄)。 火山引擎2026年超400亿元收入目标与 token 增速能否兑现——直接检验“模型能力→商业化”闭环是否成立。 蒸馏红线是否会松动:若算力或榜单压力再次升级,张一鸣与梁汝波的口径是否变化。 郭达雅主导的 Coding 专项先出结果,还是项亮的超大模型先出结果——两条线的时间差决定字节以什么姿态回到通用榜单。 来源 网易财经|张一鸣按下“蒸馏”暂停键:字节宁可落后,也不抄别人答案 晚点 LatePost(搜狐转载)|字节讨论训超5万亿参数模型,张一鸣:不蒸馏、别被短期热点影响 新浪科技(搜狐转载)|曝字节拟训练超5万亿参数大模型 参数规模超Kimi K3 澎湃新闻(百家号转载)|张一鸣发声后,梁汝波再谈“字节做大模型” 天眼查|北京字跳网络技术有限公司|工商基础信息 天眼查|北京字跳网络技术有限公司|企业年报(2024) 天眼查|北京字跳网络技术有限公司|实际控制人/控股链 天眼查|北京字跳网络技术有限公司|司法风险汇总 今日头条|剪映产品负责人张琪智离职,进军AI影像创业 雪球用户测算|国内资本大厂开支预测