英伟达半导体科技(上海)母公司英伟达发布Nemotron 3.5 Lightning:输出号称快4倍,智能体任务为何只提速30%? 8月11日(美东时间),英伟达同时端出两件东西:约300亿参数、单次推理只激活约30亿的“执行型”混合专家模型 Nemotron 3.5 Lightning,和开源模型路由库 NeMo Switchyard。前者补“跑得快”,后者补“谁来调度”。本文拆解两个官方数字之间的落差,并把英伟达半导体科技(上海)所处的中国市场处境放进同一个坐标系。 300亿 / 30亿 总参数 / 单次激活参数(MoE) ≈4倍 输出速度提升(英伟达自述,对比同类模型) ≈30% 智能体任务完成速度提升(英伟达自述) 85美元 / 2小时 CodeRabbit 二次训练示例成本 ≈670 tokens/秒 预发布输出速度(第三方测试) 24分 Intelligence Index(Artificial Analysis) 一、先厘清落差:4倍和30%不是同一个指标 Nemotron 3.5 Lightning 的总参数约300亿,是混合专家架构,每次推理只激活约30亿参数, 钛媒体 报道称,英伟达的官方口径是“相比同类模型输出速度最高提升约4倍、智能体任务完成速度提升约30%”。它不取代最强前沿模型,而是定位为多智能体系统里的“执行型”模型——承担代码审查、安全监控、数据处理、告警分析这类专业化工作。 官方数字之间的落差,恰恰是理解这次发布的关键: 输出快4倍,不等于整个任务快4倍。 模型推理只是智能体工作流的一环,工具调用、API响应、多智能体之间的任务编排都会形成新瓶颈,端到端收益被压缩到约30%。这解释了为什么英伟达在同一天端出 Switchyard——只解决“单个模型跑得快”远远不够,还要解决“每一步该用哪个模型”。 口径提示 4倍与30%均为英伟达自述,截至发稿未公开被比较基线模型与测试方法; 新浪财经美股 报道将其称为“同类模型中针对长时间运行的智能体AI工作负载效率最高的模型”。独立复测是下一步最值得盯的数字。 二、模型本身的第三方数据 评测数据来源:Artificial Analysis,经钛媒体报道转引 指标 Nemotron 3.5 Lightning 参照对象 Intelligence Index 24 Nemotron 3 Nano 为15;Nemotron 3 Super 为26(规模约为Lightning的4倍);与 OpenAI gpt-oss-120b 相当 GDPval-AA v2(代理任务) Elo 824 超越 Nemotron 3 Super 与 gpt-oss-120b Terminal-Bench v2.1 24% Nemotron 3 Nano 仅7% 预发布输出速度 接近每秒670个token — 换句话说,Lightning 用“激活30亿参数”的体量,在代理任务评测上追平甚至超过了规模远大于它的对手,执行能力是这次发布最硬的一块数据。 三、商业逻辑:把微调变成“洗碗机”,把竞争挪到调度层 Lightning 的另一重差异化是开放与低成本定制:英伟达同时放出数据集、后训练数据集以及训练所用的配方和框架,企业可用自有数据做混合训练。据 钛媒体 ,代码审查公司 CodeRabbit 用标准配方训练一个 epoch,约两小时、花85美元就产出路由智能体;有伙伴用单张 H100 完成训练,有公司“晚上跑训练、早上取结果”。英伟达生成式AI副总裁 Kari Briski 的说法是:“把后训练和微调变成把碗放进洗碗机、然后按下启动键。” NeMo Switchyard 是这套逻辑的另一半:开源模型路由库在智能体工作流的每一步,按质量、延迟、成本优先级把请求路由到最合适的模型,合作方包括 Boomi、Cadence、Cognition、Kong、LangChain、Nous Research、Siemens 等。模型通过 Hugging Face、OpenRouter、build.nvidia.com 及阿里系 ModelScope 上线,可在 RTX 个人电脑、DGX Spark 本地运行,并已与 vLLM、Ollama 合作( 观点网 )。 把两件产品放在一起看,英伟达的叙事已从“卖芯片”转向“卖整个AI工作流”:只要模型跑在它的路由、推理和部署体系里,无论企业最终选谁的模型,它都能从工作流中获利。 华尔街见闻 报道,戴尔已宣布将这两项技术纳入 Deskside Agentic AI,推动智能体向企业本地部署延伸。 四、战略赌注:万亿参数Nemotron 4,与OpenAI的微妙关系 这次发布只是英伟达开源模型战略的局部。Nemotron 3 家族2025年12月推出(Nano/Super/Ultra 三档),最大型号 Nemotron 3 Ultra 于2026年6月发布。据 The Information 与 Bloomberg 报道( 观点网 、 DoNews ),英伟达正在开发 Nemotron 4,旗舰版目标参数量至少1万亿,约为 Nemotron 3 Ultra 的两倍,员工口径最快2026年秋末准备就绪,发布时间未定;上一代旗舰论文已有570名作者,研发继续扩编。英伟达还组建了包含 Reflection、Cursor、Thinking Machines、Mistral 等的“Nemotron 联盟”。 这背后是英伟达微妙的处境:芯片需求高度集中于 OpenAI、微软、SpaceX 等少数前沿客户,英伟达已向 OpenAI 投资300亿美元;另一边,Nemotron 4 又定位为企业提供成本更低的替代方案,与这些前沿实验室形成竞争。但 AI 评测机构 Arena CEO Anastasios Angelopoulos 点破另一层:“无论哪家公司做出优秀的开源模型,英伟达都是赢家”——开源生态越繁荣,GPU 整体需求越旺盛。英伟达还澄清了5000亿美元AI基础设施融资计划中自身支持“不超过单个项目的25%”,并通过回租服务器将云服务算力承诺增至280亿美元( 华尔街见闻 )。 五、中国视角:硬件被政策锁死,软件绕行? 叙事主体英伟达半导体科技(上海)有限公司2004年7月13日成立,注册资本与实缴均为900万美元,为外国法人独资,唯一股东是 NVIDIA SEMICONDUCTOR HOLDING COMPANY(毛里求斯),持股100%;法定代表人 MARK STEVEN HOOSE(2023年12月由 KAREN BURNS 变更而来),2025年3月注册地址迁入上海自贸区纳贤路600号、祥科路55号,经营范围含集成电路设计、制造与检验检测服务。2025年年报显示参保约2479–2514人,税务评级连续多年为A(2017–2021、2023–2025)。本轮已核验的天眼查风险条目中,未见行政处罚、被执行或经营异常记录,可见记录为住所、法定代表人、主要人员变更等预警类事项( 天眼查·工商信息 、 天眼查·年报 、 天眼查·风险 )。 2025-10 黄仁勋称出口管制致英伟达中国数据中心AI芯片份额从95%降至0%,公司股东预测已假设中国业务为零( 财经报道 ) 2025-12 美国修订AI芯片出口管制,H200对华出口出现政策窗口,附25%销售额分成条件( 报道 ) 2026-01 H200正式获批对华出口,附加出口量不超对美销量50%、第三方性能测试等条件( 集微网 ) 2026-05 特朗普确认中国拒绝采购H200,报道称中国海关通知代理商H20/H200不得进入中国( 头条号报道 ) 2026-08-06 白宫会晤两天后H20获对华出口许可,需上缴15%销售额分成;国会推进SCALE法案拟设“AI斩杀线”(对华出口芯片性能不超中国本土量产性能的110%)( 同上 ) 2026-08-11 发布 Nemotron 3.5 Lightning 与 NeMo Switchyard,美股盘前涨近2% 数字背后是现实:英伟达2025财年中国大陆(含香港)收入171亿美元、占总收入13.1%,同比增66%,但占比已连续三年下滑( 财经报道 )。据自媒体头条号转引伯恩斯坦估算,华为已占中国AI加速器市场约50%(年销售额约121亿美元),英伟达合规出货份额约8%(年约20亿美元)——该组数据为转引口径,待官方数据核实。硬件受限之下,Lightning 通过 ModelScope 等中国平台分发模型与路由软件,是一条不受芯片出口管制约束的路径;财经报道亦显示英伟达中国工程师团队仍在为通义、DeepSeek 等国产模型做适配。但“上线”不等于“落地”,中国企业实际采用与部署案例仍是空白点。 风险观察 ① 与客户竞争边界模糊 :一边向 OpenAI 供芯片、投300亿美元,一边用开源模型给企业提供低成本替代,边界正在变得模糊。② 算力叙事的两面性 :若轻模型+路由真把token成本大幅压低,市场可能重估“算力需求曲线”;英伟达的解释是省成本让更多企业用得起智能体、从而扩大整体GPU需求——两种叙事谁成立,看后续数据中心订单。③ 中国市场政策反复 :H20“获许可但卖不动”已是现实,SCALE法案一旦落地将进一步锁死高端出口;分成本身也在削弱竞争力。④ 单一来源提示 :B30特供版、华为50%份额等说法目前仅见于媒体报道转引,需以英伟达财报与官方口径为准。 六、下一步验证什么 独立复测“输出快4倍”与“任务快30%”:基线模型、工作流构成、测试方法是否公开。 Nemotron 4 的发布时间(员工口径2026年秋末)与最终参数量是否达到1万亿。 Switchyard 路由在真实企业工作流中的质量/延迟/成本权衡数据。 ModelScope 渠道上中国企业下载与部署案例,以及英伟达中国团队的本地适配动作。 H20 8月许可后的实际出货量、分成执行情况,以及 SCALE 法案立法进展。 英伟达后续财报中软件与服务收入的占比变化,验证“卖工作流”是否真的变成收入结构。 编辑部观察 这次发布真正的信号不在“又一个模型”,而在英伟达把竞争阵地从芯片挪到了模型调度层:当模型多到数不过来,“用哪个模型、每步怎么切”就变成新软件层,而这层软件恰好长在英伟达自己的推理与部署体系里。对英伟达半导体科技(上海)而言,芯片生意被出口政策反复摆布,软件与模型分发则是它在中国市场少数不受硬件管制约束的抓手——但能否从“上线”变成“收入”,取决于中国企业是否愿意把智能体工作流建在英伟达的软件栈上,这一步目前还没有公开证据。 来源 报道与评测: 钛媒体|从卖芯片到卖整个AI工作流:英伟达发布Nemotron 3.5与模型路由器(原发) 新浪财经转载|同上(钛媒体) 新浪财经美股|英伟达推出Nemotron 3.5 Lightning 瞄准智能体AI提速 观点网|英伟达被曝开发Nemotron 4开源模型 旗舰版目标至少1万亿参数 DoNews|英伟达开发开源AI模型Nemotron 4 参数或超1万亿 华尔街见闻|早餐FM-Radio 2026年8月12日(Nemotron 4、280亿美元算力承诺、戴尔合作) 财经(17173转载)|黄仁勋称英伟达中国份额从95%降至0% 头条号|黄仁勋押对宝了?特朗普终于松口给中国芯片放行,但AI斩杀线更狠 集微网|英伟达黄仁勋拟1月下旬访问中国,力图重振AI芯片市场 报道|英伟达重启H200对华供应链,黄仁勋:需求“非常高” 工商档案(英伟达半导体科技(上海)有限公司): 天眼查|工商基础信息 天眼查|企业年报(2025) 天眼查|工商变更 天眼查|疑似实际控制人 天眼查|企业天眼风险