北京深度求索人工智能基础技术研究:别人拆书抢“干净语料”,DeepSeek 33万亿Token的账怎么算? 2026年7月底,调查媒体404 Media曝光了一条隐秘产业链:多家AI公司通过图书数据库中间商ISBNdb批量收购旧书——切书脊、高速扫描、再物理销毁,只为拿到2022年之前“未被机器碰过”的文本。主角是Anthropic的“巴拿马计划”,它把整个行业的难题摆上了台面:人类高质量文本正在枯竭。对中国大模型公司北京深度求索人工智能基础技术研究(DeepSeek)来说,这道题更具体——V3训练吃掉约14.8万亿Token,V4-Pro的预训练数据已涨到33万亿,而全球网站内容里,中文只占约1.3%。 关键数字 51.72% 2025年初以来新发布网页中AI生成内容占比(斯坦福2026 AI指数报告) 2026–2032年 Epoch AI测算人类公开高质量文本耗尽窗口 9次迭代 Nature封面研究:模型塌缩,从教堂塔楼到编造不存在的兔子 +11.2% 训练数据中仅0.01%虚假文本导致的有害输出增幅 15亿美元 Anthropic版权案和解金,创美国版权案件纪录 数千万美元/数百万本 “巴拿马计划”一年内的买书投入与采购规模 14.8万亿→33万亿 DeepSeek V3→V4-Pro 预训练Token量级 1.3%/4.8% 中文内容占全球网站内容/Common Crawl语料的比例 一、巴拿马计划:一场被曝光的“阅后即焚” 据 钛媒体(新浪转载) 与 投资界 报道,Anthropic的内部文件写明:“巴拿马计划是我们对全世界所有图书进行破坏性扫描的努力。我们不想让人知道我们在做这件事。”项目从2024年初启动,一年内花费数千万美元购买数百万本纸质书;具体操作是液压切割机切掉书脊、高速扫描仪转成PDF、纸页直接送回收销毁。据法庭文件,供应商提案中的扫描量在50万到200万本之间,完成周期约六个月。 链条上游是图书数据库公司ISBNdb——它拥有超过1.11亿本图书的目录,如今把业务重心转向AI行业,提供1000本到100万本的批量采购,每笔合作签NDA、买家姓名永不披露。据404 Media调查,采购订单“没有主题、类型或作者偏好,买家不在意价格”,二手书商销量数月内飙升约五倍。被大量买走的多是地方史、小语种文献、印量极小的学术论文集——这批书一旦销毁,很可能永久退出流通。 数据荒时间线 2021年 Anthropic联合创始人本·曼恩从盗版网站LibGen下载电子书(至少500万本,具体数量在诉讼中存在争议) 2024年初 “巴拿马计划”启动,一年内买下数百万本纸质书并销毁 2024年7月 牛津、剑桥等机构关于“模型塌缩”的研究登上Nature封面 2025年6月 美国联邦法官阿尔苏普裁定破坏性扫描合法购书属“合理使用” 2025年9月底 国家数据局披露我国日均词元消耗突破40万亿(2024年初约1000亿) 2026年4月24日 DeepSeek V4发布并开源,预训练语料达33万亿/32万亿Token 2026年7月 404 Media曝光“巴拿马计划”与旧书采购链 2026年8月2日 马斯克表态要求旗下SpaceXAI无损扫描、数据保存于图书馆 二、为什么旧书成了“干净燃料”:模型塌缩 逻辑起点是“模型塌缩”。斯坦福2026 AI指数报告显示,2025年初以来新发布互联网内容中AI生成占比已超过一半(51.72%);Cloudflare数据显示其托管网站的请求中约57.4%来自AI与自动化程序(该口径统计的是HTTP请求而非实际阅读量)。2024年7月,牛津、剑桥等机构的联合研究登上Nature封面:用Meta的OPT-125m模型从一段14世纪教堂塔楼的维基百科文本出发,第五代跑偏到语言翻译,第九代开始“热情洋溢地介绍不存在的兔子物种”。论文称,只要统计近似误差、函数表达误差、函数近似误差中存在任何一类,塌缩就不可避免——这是数学必然。 时间窗更紧: 百度百家号转述Epoch AI测算 ,语言模型将在2026年到2032年间耗尽人类公开的高质量文本; 浙江日报 则援引Epoch预测称高质量语言数据“可能在2026年耗尽”——两个口径并存,但方向一致:倒计时已经开始。合成数据不是现成解药:研究显示训练数据中仅0.01%虚假文本即可让模型有害输出增加11.2%。而互联网爬取数据也谈不上干净——芝加哥大学的Nightshade工具能在图像中嵌入“投毒”像素;Anthropic与英国AI安全研究所的研究显示,250份精心构造的恶意文档就可在数千亿Token量级的语料库中植入后门。 所以旧书成了“上品”。ISBNdb在官方博客中解释:“2022年之前印刷的纸质书,在结构上保证没有受到过这种污染。仅此一点,就是巨大的优势。” 三、买书合法,偷书不行:15亿美元划出的红线 这起事件的戏剧性在于:Anthropic花15亿美元和解的,不是“毁书”,而是盗版。据 报道 ,Anthropic因从盗版网站LibGen下载约700万本电子书用于训练被作者起诉,多数报道称其以15亿美元和解,创美国版权案件纪录;也有报道表述为“法院判决赔偿”( 今日头条转载央视网文 ),诉讼最终形态以法庭文件为准。而针对“拆书”,2025年6月联邦法官阿尔苏普的裁定是:破坏性扫描合法购买的书籍属“合理使用”,因为训练是“变革性”使用。 这被从业者视为一个法律空子:合法买书—拆书—扫描—销毁,可能不构成侵权;从网上偷,则每部侵权作品最高可罚15万美元。Anthropic律师以“首次销售原则+合理使用”双重辩护,甚至把“销毁原件”用作规避“非法复制”指控的理由。ISBNdb自己的营销文案都承认:“AI公司销毁两百万本书确实不是一个能博取同情的标题。”图书馆数字化是为了让公众能看,AI公司的数字化是训练后封进私有数据库——知识从公共遗产变成私人资产。 8月2日 ,马斯克在舆论压力下表态,要求SpaceXAI以不损坏书籍的方式扫描、数据保存在图书馆,成为目前唯一公开承诺无损扫描的头部玩家。 四、DeepSeek的账:14.8万亿到33万亿 同样的数据荒,DeepSeek以另一种方式被卷进来:它的数据胃口在翻倍。据 清华大学新闻网(孙茂松、孔存良文) ,DeepSeek-V3训练语料约14.8万亿词; 浙江日报 口径为“约15万亿词元,来自互联网、书籍和学术期刊等”。到了2026年4月24日发布的V4,官方口径( 东方财富转三言科技 )显示:V4-Pro预训练数据33万亿Token、V4-Flash为32万亿Token,上下文长度由128K扩展至1M——两代之间,语料规模增幅超过一倍。 模型/口径 预训练语料 参数与上下文 来源 DeepSeek-V3 约14.8万亿Token(浙报口径约15万亿) — 清华大学新闻网;浙江日报 DeepSeek-V4-Pro 33万亿Token 总参1.6T,激活49B,上下文1M 东方财富(转三言科技) DeepSeek-V4-Flash 32万亿Token 总参284B,激活13B,上下文1M 东方财富(转三言科技) 中文供给却严重不足。同一篇清华大学文章援引阿里研究院《大模型训练数据白皮书》:全球网站内容中英文占约59.8%,中文仅约1.3%;大模型训练常用的Common Crawl语料中,中文占比约4.8%。文中直言:中文百科全书、科技图书、学术期刊、辞典等高知识密度语料在现有中文语料库中“几乎难觅踪迹”。也因此,业内出现“DeepSeek-V3所需的14.8万亿高质量文本片段目前并无对应供给”的判断——需要说明,这是 行业报道 引述的业内估计,并非DeepSeek官方口径。 中文语料供给口径 数值 全球网站内容中英文占比 约59.8%(阿里研究院白皮书) 全球网站内容中文占比 约1.3%(阿里研究院白皮书) Common Crawl语料中文占比 约4.8% 我国日均词元消耗:2024年初→2025年9月底 约1000亿→突破40万亿(国家数据局) DeepSeek应对这条线的技术储备,在其知识产权里可见一斑。 天眼查知识产权汇总 显示,公司2024年3月28日申请发明专利“一种人工智能模型训练数据集的构建方法”(申请号CN202410365843.5,2024年7月进入实质审查),摘要描述的是:将数据集切分为大小相同的数据序列、以序列为单位建立索引、按比例混合并随机打乱、均匀切分供训练批量读取——全程不增加冗余数据存储,减少存储与通信资源消耗。方向不是“囤数据”,而是“让每一份数据更高效地被用掉”。 公司本身的体量则与数据胃口形成反差: 天眼查工商信息 显示,北京深度求索2023年5月16日成立,注册资本与实缴资本均为1000万元,由杭州深度求索100%持股,法定代表人裴湉; 疑似实际控制人 为梁文锋(穿透比例约89.46%),孵化自量化私募幻方量化。2025年年报( 2026年6月12日发布 )显示,北京主体参保人数为67人——一个“67人”口径的研发主体,要供出30万亿级Token语料的模型迭代。 五、三重压力下的下一步 资本。 证券时报网 2026年4月18日报道(援引The Information):DeepSeek启动成立以来首轮外部股权融资,以超100亿美元(约681.8亿元人民币)估值计划募集不少于3亿美元(约20.5亿元),主要压力来自研发成本激增与核心研究员流失(罗福莉、郭达雅被小米、字节跳动等挖角),资金拟投向算力、新一代模型研发、稳定团队与商业化。报道同时提示“公司尚未正式回应,消息仍在洽谈中”。同一报道还给出行业背景:2026年一季度国内通用大模型融资额同比下滑72%,资金向头部集中——数据战争烧钱,而钱正在变贵。 语料供给。 中文语料正从“企业自建自用”走向公共供给:据 浙江日报 ,2025年我国启动新型国家语料库建设,年底杭州公布语料库建设图景,首批50个高质量数据集“揭榜挂帅”,并定下“年底建成100个高质量数据集、服务10个以上模型训练”的小目标;2026年2月,国家层面又发布重点行业语料库揭榜挂帅项目申报通知。 清华大学文章 确认,“推进新型国家语料库建设和应用”已写入《教育强国建设规划纲要(2024—2035年)》与《教育发展“十五五”规划》。这批供给能否形成可交易的、够“纯”的中文语料,是DeepSeek们要等的变量。 污染循环。 还有一个被讨论较少的点:DeepSeek开源权重(V4已开源),意味着其输出会被其他厂商抓取进语料池。2026年初中文社区曾热议“Anthropic模型在中文语境自称‘我是DeepSeek’”,被视为其训练语料混入DeepSeek生成内容的旁证(该讨论暂无权威来源可链接,此处仅作观察)。也就是说,DeepSeek既是数据荒的承受者,也是中文语料被“机器文本”稀释的贡献者之一——开源越成功,这个循环转得越快。 风险观察 已核验范围内的合规面: 本轮核验的company-index风险模块材料,均为程序性工商变更记录(股东杭州深度求索的主要人员、投资人、注册资本变更,以及北京主体的投资人、注册地址变更),未发现已核验的行政处罚、重大诉讼或经营异常记录。需说明:这只能证明“在当前可见范围内未见相关证据”,不构成对风险状态的排除性结论。 结构性风险(非公司已发生事件,属行业传导): ① 数据版权诉讼——Anthropic 15亿美元和解已立下“天价”先例,Meta、谷歌、OpenAI等均面临类似诉讼,国内尚无对应判例,但讨论与制度竞争正在推进;② 语料污染→模型塌缩——V4数据量翻倍而纯净供给收紧,若中文语料库建设不及预期,塌缩风险直接落在下一轮迭代上;③ 人才与资本双线承压——首轮融资尚未官宣落地,而训练成本还在随数据规模抬升。 下一步验证什么 DeepSeek是否公开V4的训练数据构成、来源与清洗方法(V3技术报告曾公开部分口径); 首轮外部融资的最终规模、估值与投资方是否落地官宣; 国家及杭州等地语料库项目能否形成规模化、可交易、合规的中文高质量供给; 国内针对“用版权内容训练大模型”的首个判例或监管规则走向。 分析建议 基于上文已核验证据,DeepSeek最可能的路径不是效仿“买旧书”式的囤积,而是三条线并行:一是把数据工程做成技术壁垒——专利显示其在数据序列索引、混合与切分上降存储开销,配合合成数据与强化学习对冲供给缺口;二是继续开源换生态——权重开源让全行业替它“测试”数据质量,同时其输出也在定义下一代中文语料的面貌;三是等公共语料库——中文供给的解法大概率在制度侧(国家语料库、行业揭榜挂帅)而非市场侧,谁能抢先拿到合规高密度中文语料,谁就拿到下一轮模型的底线优势。需要提醒的是,上述判断依赖的硬证据是V4数据量、专利方向与融资报道,最终走向仍以官方披露为准。 来源 投资界:AI公司,批量抢购旧书(原发) 钛媒体(新浪转载):AI公司,批量抢购旧书 百度百家号:15亿美元!AI公司疯狂买书拆书毁书 今日头条(转载央视网文):美国AI公司毁书数百万本,马斯克紧急发声 今日头条:DeepSeek分析:多家AI公司大量收购旧书训练模型后销毁 证券时报网:DeepSeek,大消息!启动首轮外部融资! 东方财富(转三言科技):DeepSeek-V4正式发布 极客网:DeepSeek V4正式发布,昇腾超节点系列产品全面支持 浙江日报:杭州语料库:给AI大模型“喂好料” 清华大学新闻网:孙茂松、孔存良:中文语料库建设呼唤新格局 天眼查:北京深度求索工商基础信息 天眼查:疑似实际控制人 天眼查:企业年报(2025) 天眼查:知识产权汇总(专利CN202410365843.5)