英伟达半导体科技(上海):AI没被电饿死,先被电“气”死——万卡集群断电一次15万到28万,GB300已把电容塞进机柜自救 电压暂降不构成停电、不进任何统计,却是比“电荒”更先到来的算力瓶颈|2026-08-08 缺电是“量”的问题,全世界都在排队解决;电压暂降是“质”的问题——电压凹下去10毫秒到2秒再弹回来,灯都没闪,训练已经断了。英伟达半导体科技(上海)背后的母公司英伟达,已在GB300机柜侧塞进超级电容自救;而多数算力账单上,至今没有“电压暂降”这一栏。这篇扩展把“电脏”的账摊开:谁在损失、谁在填坑、谁在赚钱。 一、为什么算力账单里没有这一栏 电压暂降的定义并不复杂:电压突然凹下去一截,持续10毫秒到2秒,再自己弹回来。停电是分钟级以上、有RS-1和SAIDI指标盯着、新闻天天播;电压暂降不构成停电、不进任何统计,UPS兜底一响就翻篇——没人向你道歉,也没人给你记账。 亚洲电能质量联盟2015年对200个典型用户的监测给出了量化口径:电压不稳占全部电能质量事件的89.2%,工业用户年均遭遇20.5次。一年20多次,每次都静悄悄。 10毫秒–2秒 电压暂降持续时间(不进停电统计) 89.2% 电压不稳占全部电能质量事件(200个用户监测,2015) 年均20.5次 工业用户遭遇电能质量事件频次 8–10毫秒 晶圆厂SEMI F47标准抗晃电底线,数据中心无对等标准 最讽刺的对照在隔壁行业:半导体晶圆厂怕晃电,有SEMI F47标准——设备必须扛住0.5个周期(约8到10毫秒)的电压暂降不跳机;数据中心没有任何对等标准。晶圆怕晃电有标准,算力怕晃电没标准——这正是问题“看不见”的制度性根源。 二、账本:单次不致命,级联才致命 损失公式只有两个变量:checkpoint间隔 × 集群每小时成本。按GMI Cloud 2026年租价(每卡每小时2到3.9美元、汇率约7.2折算),万卡H100集群每小时成本约15万到28万元;上限场景——整小时白算、恢复又慢——断电一次也就这个数。 场景 损失 口径 万卡H100集群断电一次(上限场景) 15万–28万元 GMI Cloud 2026租价,每卡每小时2–3.9美元,汇率约7.2 1.6万卡集群停1小时 下限约23万、上限约45万元 同租价同汇率折算 32节点集群单次事件(2025年6月案例) 超200万元 26小时算力损失约18万+2块GPU损坏约15万+延期违约金超150万 致命的是级联:checkpoint写到一半断电、文件损坏、回退好几个周期;浪涌还能带走硬件;再撞上合同违约金条款。单次断电的账,是级联帮忙放大算出来的。 头部玩家早把这当常态:Meta训练LLaMA-3的实录是1.6万张H100、54天里中断466次,其中419次非预期,平均每3小时一次,单次恢复目标控制在10分钟以内——人家不是不断电,是默认断电会发生,把恢复练成了肌肉记忆。 需要澄清的误读:“断电0.01秒烧掉几十万”是把最坏情形当典型。在线式双转换UPS切换0毫秒,服务器电源还有“保持时间”兜底(Intel ATX12V标准要求≥16毫秒、企业级CRPS电源≥20毫秒),10毫秒抖动电源通常撑得过去。 三、UPS不是答案,是问题的一部分 GPU集群负载能在毫秒级从20%跃迁到90%,DC母线掉压发生在UPS输出之后——UPS物理上够不着。更反直觉的是UPS本身会“添乱”:2024年7月10日,北弗吉尼亚一条230kV线路避雷器故障,砸出6次电压凹陷,全部落在ANSI C84.1 ±10%正常带内——按书本,电网没违规。但约60个数据中心的UPS按各自固件规则集体切到电池和柴发,82秒内约1.5GW负载从PJM电网消失(另一口径为3.1GW),频率飙升,电网紧急切除约15亿瓦发电。每一台UPS都在尽忠职守,60台尽忠职守凑在一起,反而把电网逼到了悬崖边。 2016年|AWS悉尼 一次超长电压暂降直接打穿动态旋转式UPS(DRUPS),可用区宕机 2024年7月10日|北弗吉尼亚 约60个数据中心UPS在82秒内集体切电池/柴发,约1.5GW负载从PJM消失,电网紧急切除发电 2025年2月|PJM 约40家数据中心同步脱网,频率冲到60.047Hz;NERC成立大型负荷工作组,FERC启动专项调查 2025年3月|Google Cloud us-east5-c 市电失电后电压骤升持续近1分钟,UPS级联失效,宕机约6小时 国内同样有量化线索:行业统计显示2025年约32%的数据中心非计划宕机与晃电相关;GPU开关电源谐波畸变率THD>5%,大容量PFC电容与UPS电容级在特定频率谐振,会引发变压器过热、继电保护误动作。受害者与施害者是一体的:算力越大,脉冲越猛,电能质量问题越严重。这不是临时故障,是结构性矛盾。 四、英伟达自救:把电容塞进机柜,绕开UPS后段保护 最先用脚投票的是英伟达自己:GB200已内置超级电容;GB300 NVL72电源架集成能量存储,每GPU 65焦耳、峰值电网需求降低约30%(NVIDIA官方博客,2025年7月28日,官方口径为削峰降并网压力,未必直指暂降)。2026年6月起,产业链对“超级电容从可选升级为GB300机柜标配”的讨论密集。无论出发点是削峰还是扛暂降,结果都指向一处——能量补在UPS输出之后的机柜侧,UPS的后段保护被绕开了。 这决定了“为什么是这家公司”:上海主体是英伟达在华独资法人,成立于2004年7月13日,注册资本900万美元(已实缴),注册地上海自贸区,参保约2500人(工商口径2514人,2025年报社保口径2479人),股东为NVIDIA SEMICONDUCTOR HOLDING COMPANY;董事长兼法定代表人MARK STEVEN HOOSE于2023年12月由KAREN BURNS接棒,2025年3月住所迁至纳贤路600号、祥科路55号,税务评级连续多年A级(2017–2025年,2022年未在可见范围内出现)。 “为什么是现在”:天眼查收录的新闻舆情显示,2026年5月黄仁勋访华前后,“对华高端芯片出口受限”“中国拒购H200、转向自研”“中芯国际AI订单排满”等讨论密集(关联方与市场环境线索,非公司自身确认事实)。在这种夹缝里,中国算力客户对“电网不干净也能扛”的机柜设计更敏感——机柜侧储能既是英伟达的技术自救,也是受限产品在新市场的差异化卖点。 五、中国电网更稳,但同样保不住毫秒级 先泼冷水:中国电网确实比美国稳。2024年全国供电可靠率99.924%、户均停电6.71小时(国家能源局2025年3月发布),2025年上半年提升到99.948%、户均2.25小时;美国2025年户均停电约11小时、创十年新高(EIA,2025年12月),中国不到其六成。但可靠率只统计“彻底断电”,不统计电压暂降——数字再漂亮,也保不住毫秒级的“气”。 政策已经出手:2026年4月16日,国家发展改革委、国家能源局印发《全面提升供电质量服务新质生产力发展专项行动方案(2026–2028)》,14项任务、33项举措,点名“算力设施”;能源局市场监管司司长郝瑞锋直言,2025年上海、海南等地出现的电压暂降已影响企业生产经营;南方电网梳理出芯片制造、生物医药等21个敏感行业清单——不是电网不行,是有些客户的命门,电网保不住。按时间表,2026年要建立全国电能质量敏感用户台账,在京津冀、长三角、粤港澳启动高供电质量标杆园区。 六、产业链分化:谁在兑现,谁还是故事 兑现侧|盛弘股份 电能质量业务2025年上半年收入2.8亿元、毛利率58.66%(原文口径);公司整体2025年上半年营收13.62亿元、归母净利润1.58亿元(半年报口径)。调研机构(格物致胜)将其列为智算中心低压电能质量第一梯队品牌,多次中标或配套数据中心、智算中心重大项目。 故事侧|爱科赛博、新风光 按原文口径,两家公司以亏损证明“概念不兑现就只是故事”。同样的电压暂降主题,订单落不落进财报,画出了产业链的生死线。 对照结论:电压暂降从“没人算的账”变成“有人赚钱的生意”,分水岭在于智算中心订单是否兑现。盛弘的业务兑现与英伟达的机柜侧储能是同一件事的两面——能量补在负荷侧,谁的产品先上机柜,谁先吃到订单。 风险观察|下一步验证什么 缓解信号:算力成本表或云服务合同里出现“电压暂降SLA”、专项保险条款——说明“这一栏”开始被定价;机柜侧储能/超级电容订单增速与GB300出货配套率;中国专项行动敏感用户台账的覆盖范围与标杆园区名单。 扩大信号:NERC大型负荷工作组与FERC调查的结论是否把“数据中心脱网”纳入电网调度约束;暂降宕机案例是否进入行业级公开统计(目前多为工程访谈与个案);“2025年约32%数据中心非计划宕机与晃电相关”这一口径,何时有官方背书。 公司层面:在当前可见核验范围内,英伟达半导体科技(上海)的风险档案以登记类变更为主(法代、住所、主要人员),未见行政处罚、被执行或经营异常记录;真正的经营变量在出口管制与中国AI自研节奏——属于市场环境风险,不由该公司自身财务报表直接体现。 来源 钛媒体《AI没被电饿死,先被电“气”死了》(2026-08-08) 新浪财经转载(来源:钛媒体APP) 天眼查|英伟达半导体科技(上海)有限公司|工商基础信息 天眼查|英伟达半导体科技(上海)有限公司|企业年报(2025) 天眼查|英伟达半导体科技(上海)有限公司|企业天眼风险 天眼查|英伟达半导体科技(上海)有限公司|税务评级 天眼查|英伟达半导体科技(上海)有限公司|新闻舆情