北京深度求索人工智能基础技术研究:V4 Flash API 被“前所未有的访问量”挤爆,官方确认上午失灵、现已恢复 公测上线约 4 天即出现首次公开性能事故。前一天,它的单日 token 处理量刚在 OpenCode 上冲到 8 万亿——能力追上了,容量还没跟上。 2026-08-04 | 主公司:北京深度求索人工智能基础技术研究(DeepSeek)| 事件:V4 Flash API 性能下降并恢复 8 月 4 日, DeepSeek V4 Flash API 出现性能下降 。海外开源 AI Coding Agent 平台 OpenCode 当天发文称,V4 Flash 正因“前所未有的访问量”出现容量不足、可能报错,正在紧急修复;有网友反映,官方 API 上午几乎不可用,并类比 Kimi K3 刚发布时的情况。DeepSeek 官方随后披露:今日上午 V4 Flash API 出现性能下降, 问题已解决、服务已恢复 ( 36氪/第一财经 )。 把这条消息放回时间轴看,这是一次“用量的甜蜜爆仓”:7 月 31 日 V4-Flash 正式版 API 低调上线,8 月 1 日 OpenCode 单日处理 8 万亿 token,8 月 3 日模型权重开源、登上 HuggingFace 趋势榜第二——四天后,官方 API 在工作日高峰时段被流量击穿。 关键数字:先看这场流量有多大 8 万亿 8 月 1 日 OpenCode 单日处理 token 数,其中约 5 万亿来自免费额度、3 万亿来自付费套餐 OpenCode Go(据 OpenCode 官推, 17173 ) 1/90 V4 Flash 输出价约 0.28 美元/百万 token,约为 Claude Opus 4.8(25 美元)的 1/90( TechWeb ) 2 元 官方 API 输出价/百万 token;缓存命中输入仅 0.02 元,命中折扣约 98%,业内普遍约 90%( TechWeb 、 ZAKER ) 99% 开发者晒单的缓存命中率:4 小时约消耗 1 亿 token,成本趋近于零(TechWeb 援引开发者实测) 约 4 天 从 7 月 31 日上线公测到 8 月 4 日首次公开性能事故 50 分 Artificial Analysis 智能指数,仅比 GPT-5.6 Luna(51 分)低 1 分( ZAKER ) 时间线:从低调上线到被挤爆的 5 天 7 月 16 日(对照) 月之暗面 Kimi K3 上线,总参数 2.8 万亿,接入全线产品与 API( 网易智能 ) 对照组 7 月 20 日(对照) Kimi 官方宣布:需求 48 小时内逼近现有算力容量上限,暂停新增订阅、算力优先分配给现有会员,会员体系拆分为 Kimi Membership / Kimi Code Membership( 网易智能 ) 对照组 7 月 31 日 DeepSeek-V4-Flash 正式版 API 上线公测——没有发布会,仅在 API 文档发布日志更新;模型结构、尺寸与预览版完全一致,仅重新后训练;MoE 总参数约 2840 亿、激活 130 亿(部分报道口径 304B),FP4/FP8 混合精度约 167GB;自研 Agent 测试框架 DeepSeek Harness 首次亮相( TechWeb 、 腾讯新闻 ) 8 月 1 日 OpenCode 单日处理 8 万亿 token(5 万亿免费额度 + 3 万亿 OpenCode Go 付费套餐);同日 OpenAI 宣布 GPT-5.6 Luna 降价 80%( 17173 、 TechWeb ) 8 月 2 日 Artificial Analysis 与 Arena.ai 同步更新基准:AA 智能指数 50 分,比 4 月 Flash 预览版高 10 分,仅比 GPT-5.6 Luna 低 1 分( ZAKER ) 8 月 3 日 模型权重以 MIT 许可开源,HuggingFace 趋势榜第二,仅次于 Kimi K3( 腾讯新闻 、 头条号 ) 8 月 4 日 OpenCode 称 V4 Flash 因“前所未有的访问量”出现容量不足、可能报错、紧急修复中;网友反映官方 API 上午几乎不可用;DeepSeek 官方确认上午 API 性能下降,现已恢复( 36氪/第一财经 ) 流量从哪里来:低价 × 免费额度 × Agent 场景 指标 V4-Flash 正式版 对照 / 口径 官方 API 定价 输出 2 元/百万 token;缓存命中输入 0.02 元、未命中 1 元 输出约合 0.28 美元,约为 Claude Opus 4.8(25 美元)的 1/90( TechWeb ) 缓存命中折扣 约 98% 业内普遍约 90%( ZAKER ) DeepSWE(真实编程 Agent) 54.4 预览版 7.3,提升约 6 倍( TechWeb ) Terminal Bench 2.1 82.7 V4-Pro-Preview 72.1、GLM-5.2 81.0、Claude Opus-4.8 85.0( TechWeb ) Artificial Analysis 智能指数 50 分 同类可比模型中位数 17;GPT-5.6 Luna 51 分( TechWeb 、 ZAKER ) 长上下文工程成本 100 万 token 场景单 token 推理计算量降至 V3.2 的 27%,KV Cache 占用约 10% 官方工程口径,长链路算力与显存成本被压缩( TechWeb ) 第三方渠道价 OpenCode Go 内约为官方 API 的 1/6 叠加免费额度,Agent 迁移成本接近零( 17173 ) 分析 三件事叠加导致爆仓: 价格低到接近免费 (缓存命中输入 0.02 元 + 98% 命中折扣,开发者实测 4 小时 1 亿 token); 免费额度 + 渠道补贴 (8 月 1 日 8 万亿 token 中 5 万亿来自免费额度); 场景是 Agent/Coding ——token 消耗大户,且对稳定性极度敏感。结果:8 月第一周 OpenRouter 单周调用量 7.22 万亿 token 登顶全球,调用量前五全是中国模型( 头条号 )。值得注意的是,8 月 4 日恰逢周二工作日,上午 9:00–12:00 正落在 V4 系列峰谷定价的双倍价高峰窗口内——价格杠杆也没拦住这波流量。 公司为容量做了什么:价格杠杆、工程储备、资本弹药 价格杠杆:峰谷定价。 6 月 29 日,DeepSeek 官宣 V4 正式版引入峰谷计费,7 月中旬正式版上线后生效:工作日 9:00–12:00、14:00–18:00 调用价翻倍,夜间与周末维持 5 月永久降价后的原价;V4 Pro 高峰输出 12 元/百万 token(平时 6 元),Flash 高峰输出 4 元(平时 2 元)。设计意图是把日间并发“错峰”到谷时( aiproducthub 、 百家号 、 头条号 )。但 Agent 生产任务是实时刚需、难以错峰,8 月 4 日上午高峰窗口被击穿,说明短期价格弹性有限。 工程侧:推理容量治理在持续建设。 公司登记了两项与推理容量直接相关的软件著作权:“大语言模型推理任务监控系统”(首次发表 2024-12-31,登记 2025-04-07)与“分布式集群指标采集汇聚系统”(登记 2026-05-08,与股东杭州深度求索共同登记)——推理监控、集群指标采集的储备一直在推进( 天眼查·知识产权 )。 资本侧:算力弹药在路上。 2026 年 4 月,证券时报援引 The Information 报道,DeepSeek 启动成立以来首次外部股权融资:估值超 100 亿美元(约合 681.8 亿元人民币),计划募集不少于 3 亿美元(约合 20.5 亿元),资金用途明确包括“加大算力投入、推进 V4 研发、稳定核心团队、加速商业化”;压力来自研发成本激增与核心人才流失(罗福莉、郭达雅被小米、字节跳动挖角)( 证券时报 )。 融资口径存疑: 7 月中旬网络文章称首轮融资已落地、估值约 4800 亿元、腾讯以 100 亿元成为第一大外部股东、并筹备 2027 年科创板 IPO——该口径与 4 月报道“消息仍在洽谈、公司尚未回应”冲突,且未经公司官方证实,本文不据此下结论( 头条号 )。 主体盘子: 北京深度求索成立于 2023-05-16,注册资本与实缴资本均为 1000 万元,由杭州深度求索人工智能基础技术研究有限公司 100% 持股(法人独资),法定代表人裴湉,注册于海淀区科学院南路 2 号 C 座 5 层;2025 年年报(2026-06-12 发布)显示社保人数 67 人,营收、利润等财务数据“企业选择不公示”;梁文锋为疑似实际控制人(直接 + 间接合计约 89.46%),公司由幻方量化孵化( 天眼查·工商 、 天眼查·股东 、 天眼查·疑似实控人 、 天眼查·2025 年报 、 证券时报 )。 风险观察与下一步验证 可用性风险(已发生): V4 Flash 公测约 4 天即发生首次公开性能事故。对照月之暗面 Kimi K3——7 月 16 日上线、48 小时内需求逼近算力上限、7 月 20 日暂停新增订阅——“能力领先、容量承压”已是国产头部模型的共性,而对 Agent 生产流量而言,一次高峰抖动的影响远大于对话场景( 36氪 、 网易智能 )。 定价与竞争风险: 低价已打到官方价约 1/90,OpenAI 同日降价 80% 跟进;价格继续下探的边际空间收窄后,容量与稳定性将成为新的差异化维度,免费额度退坡后的付费留存率待观察( TechWeb 、 ZAKER )。 迁移与信任风险: 开发者因“便宜到不用思考”迁入,也意味着回流成本同样低——缓存命中率 99%、成本趋近于零的流量结构忠诚度绑定很弱,高峰不可用会直接动摇“生产流量迁移”的决策( TechWeb )。 档案核验边界: 在本次已核验的当前可见范围内(risk 模块 10 条候选记录),未发现北京深度求索自身的诉讼、行政处罚、被执行或经营异常记录;记录集中于股东杭州深度求索与公司自身的常规工商变更(主要人员、投资人、注册资本、注册地址)及历史股东记录,属于关联方线索;公司为增值税一般纳税人(2023-06-01 起)。该结论仅覆盖已核验范围,不构成对范围外风险的证明( 天眼查·纳税资质 )。 分析 下一步验证四点: ① V4 Pro 正式版与 Responses API 接入进度(官方口径 8 月初,有报道称 Pro 总参数约 1.6 万亿,是更大的流量变量);② 扩容节奏——融资与算力采购是否有公开信号、下一个工作日高峰是否再现故障;③ 免费额度退坡后的调用量留存;④ OpenRouter/OpenCode 周调用量能否从 7.22 万亿继续爬升( 17173 、 TechWeb )。 来源 36氪(转第一财经):DeepSeek API 出现性能下降情况,现已恢复 TechWeb:DeepSeek-V4-Flash 正式 API 上线,Agent 能力暴涨 6 倍 ZAKER:DeepSeek-V4-Flash 正式版来了,Artificial Analysis 等更新基准 腾讯新闻:DeepSeek-V4-Flash 正式版发布并开源 头条号:DeepSeek-V4-Flash 正式版发布并开源(VulcanBench 实测) 17173:OpenCode 单日 8 万亿 Token 与 OpenCode Go 渠道价 头条号:OpenRouter 8 月第一周 7.22 万亿 Token 登顶 网易智能:Kimi K3 需求逼近算力上限,暂停新增订阅 证券时报:DeepSeek 启动首轮外部融资 头条号:V4 正式版上线与峰谷定价(含未证实融资口径) 百家号:V4 峰谷定价细则与 5 月永久降价 aiproducthub:6 月 29 日官宣峰谷定价、4 月 24 日 V4 预览版发布 天眼查:工商基础信息 天眼查:股东 天眼查:疑似实际控制人 天眼查:2025 年企业年报 天眼查:知识产权汇总(推理监控、集群指标采集系统著作权) 天眼查:纳税资质