阿里巴巴达摩院(杭州)新旗舰Qwen3.8发布:2.4万亿参数、Arena全球第二,距Claude一步之遥还是口径之遥? 8月3日 发布日快评 · 大模型竞争观察 · 已核验可验证信息优先 8月3日,阿里巴巴达摩院(杭州)科技有限公司(天眼查注册别名"阿里巴巴",下称"达摩院(杭州)")所处的阿里千问体系正式发布新一代基座大模型Qwen3.8:总参数量2.4万亿(激活95B),当日放榜的第三方榜单Arena将其整体性能列为全球第二、仅次于Anthropic的Claude系列。 经济观察网 与 新浪转载全文 显示,Qwen3.8-Max的API同日上线千问AI平台并接入Agent产品"千问办公",权重下周开源;港股阿里巴巴(9988.HK)早盘应声拉升近6%。消息面上最扎眼的是榜单位次——但7月下旬的LMArena与Artificial Analysis数据里,Qwen还不在前十。 一、先把硬数字摆出来:Qwen3.8-Max 核心指标 总参数 / 激活参数 2.4万亿 / 95B 稀疏MoE+混合注意力,首次突破2.4T 上下文长度 1M Tokens 支持视觉理解 OSWorld-Verified 86.1分 主流模型第一(电脑操作智能体) GPQA Diamond 92.6分 科学推理 IF Bench 82.8分 指令遵循 BabyVision 82.0分 无工具视觉推理,称超部分主流模型近2倍 榜单位次: Vision Arena 全球第二 、 CodeArena 全球第四 ;据阿里云口径,自主编程已从"补全代码"推进到"从空文件夹自主交付十数天真实项目"。 IT之家 确认模型权重下周开源,同时开源Qwen3.8-27B。 二、定价是这场发布最硬的商业信号 口径 价格 对标 国内 API(每百万Tokens) 输入 12元 / 输出 36元 / 隐式缓存命中 1.5元 低于国内主流旗舰档位 国际 API(输入) 约为 Claude Opus 5 的 40% 直接对标 Anthropic 旗舰 国际 API(输出) 约为 Claude Opus 5 的 24% 官方表述"相近智能、更高性价比" 这组价格说明Qwen3.8的竞争姿态不是"跟Claude拼参数",而是"在接近的性能带打价格差"。上一代旗舰Qwen3.5(今年2月发布)已被 2026年7月主流排行综述 列入第二梯队,这一代能否靠性价比把企业客户从闭源模型拉过来,是下一步要验证的。 三、时间线:半年内从"第二梯队"冲到"全球第二"? 2026-02 上一代旗舰Qwen3.5系列发布(全参3970亿、激活170亿的原生多模态路线),后续进入快节奏预览期,Qwen3.6、Qwen3.7预览版先后出现在第三方榜单中。 2026-03 据 人民日报"仲音" ,Qwen系列全球累计下载量接近10亿次,占全球开源模型总下载量50%以上。 06-11 阿里宣布钉钉换帅,90后陈宇森接任CEO,为Agent产品整合埋线。 07-19 Qwen3.8-Max预览版首发上线阿里Token Plan、Qoder、QoderWork;官方称"可能是除了Fable 5外最强大的模型"。 07-20 工信部发布会:中国AI开源大模型全球累计下载量突破100亿次。 07-21 LMArena数据更新,前十中无Qwen,国产最高为月之暗面Kimi K3(1486 Elo,第10)。 07-26 Artificial Analysis智能指数更新,前十同样无Qwen(Claude Opus 5 max以61分居首)。 07-27 千问办公低调上线Mac/Windows桌面版,默认搭载Qwen3.8-Max-Preview;同日联合国相关报告肯定千问开源贡献。 08-03 Qwen3.8正式发布;Arena放榜,Qwen整体性能列全球第二、仅次于Claude;港股9988.HK早盘涨近6%。 四、"全球第二"之争:发布口径 vs 7月下旬榜单 8月3日 放榜口径(阿里发布口径) Arena榜单中, 阿里Qwen模型整体性能仅次于Anthropic的Claude系列 ,位列全球大模型第一梯队。 经济观察网 据此报道,并成为当日港股拉升的催化之一。 7月下旬 第三方数据(对照) DataLearner 汇总榜单 显示:LMArena(7/21)前十无Qwen,Kimi K3(1486 Elo)是国产最高;AA智能指数(7/26)前十无Qwen;而Terminal Bench 2.0中, Qwen3.7-Max-Preview以69.70分列总榜第二 (高于Opus 4.7的69.40,低于GPT-5.5的82.70)。 两组数据并不矛盾,但口径差异巨大:前者是"Qwen模型整体",后者是单一版本在单一基准的表现。真正的验证点在 下周开源后 ——权重公开,第三方即可复测,届时"全球第二"是否成立、与Claude Fable 5(LMArena 1507 Elo居首)的实际差距有多大,才有可核验的答案。 分析建议 在放榜细则和复测数据出来前,"反超Claude"应视为目标而非事实。 五、竞争矩阵:Qwen3.8 卡在哪个位置 模型 厂商 参数量 开放策略 2026年7-8月可核验亮点 Claude Fable 5 Anthropic 未披露 闭源 LMArena 1507 Elo 全球第一;双榜单综合第一 Claude Opus 5 Anthropic 未披露 闭源 AA智能指数61分居首;是Qwen国际定价的对标对象 Qwen3.8-Max 阿里(达摩院(杭州)体系) 2.4T / 激活95B 下周开源 8/3 Arena整体第二;OSWorld-Verified 86.1主流第一;CodeArena全球第四 Kimi K3 月之暗面 2.8T 开放权重 LMArena第10(国产最高);Frontend Code Arena 1679分登顶;API约为Fable 5的1/3 GPT-5.6 Sol OpenAI 未披露 闭源 AA智能指数59分(第4档) DeepSeek V4 深度求索 未披露 免费商用 V4 Pro完成同等评测成本约为Kimi K3的4%,主打价格战 值得注意:Kimi K3目前以2.8T参数持有"全球最大开放权重模型"头衔,Qwen3.8-Max的2.4T参数下周开源后,这一头衔归属将直接易手或展开拉锯。 人民日报"仲音" 口径显示,国产开源与顶尖闭源模型的性能差距已收窄至约3.3%、推理成本为后者的1/10—1/3,这正是Qwen打价格差的市场基础。 六、生态与商业化:下载量10亿+,但办公流量落后 开源底座:已经是大盘的一部分 截至7月,Qwen系列衍生模型超20万个、全球累计下载量超10亿次,获联合国报告点名肯定;中国开源模型在Hugging Face的月下载占比达41%,首超美国的36.5%。 相关报道 还提到英伟达、Perplexity已将Qwen纳入技术栈,爱彼迎基于Qwen搭建客服系统,将问题平均解决时长从近3小时压到6秒。 千问办公:8月3日的"第二主角" Qwen3.8正式版API上线当日即接入的Agent产品"千问办公",于7月27日低调上线桌面版:整合QoderWork、悟空、MuleRun三款智能体产品,由钉钉新任CEO陈宇森牵头,独立于钉钉运营、后续内置钉钉,个人标准版98元/月、高级版198元/月(连续包月另有优惠)。 腾讯新闻实测 显示其默认搭载Qwen3.8-Max-Preview。 东方财富转引南都报道 披露,其背后是钉钉沉淀的2600万企业组织、8亿职场用户。 但短板同样可核验:6月桌面AI办公市场月访问量中,腾讯WorkBuddy以2097万居首、字节TRAE IDE以1279万居次,阿里系QoderWork与悟空合计仅919万。 搜狐报道 将千问办公定义为"集中全部资源奋起直追"的一步。模型强≠产品流量强,这是Qwen3.8商业化要过的第二道关。 七、公司档案:阿里巴巴达摩院(杭州)科技有限公司 成立 :2017-11-07 | 类型 :有限责任公司(外商投资企业法人独资)| 注册资本(认缴) :30,007.41万元,实缴1,000万元 | 法定代表人 :张建锋(2023年7月起任执行董事兼总经理)| 监事 :尤海燕 | 财务负责人 :王磊 | 参保人数 :87 | 标签 :高新技术企业、投资机构 | 注册地 :杭州市余杭区五常街道文一西路969号 控制链 :ALIBABA GROUP SERVICES LIMITED(疑似实际控制人)→ 阿里巴巴(中国)有限公司(100%)→ 阿里巴巴达摩院(杭州)科技有限公司(100%)。股东阿里巴巴(中国)有限公司认缴全部3.0亿元,出资期限至2067-12-31。 天眼查|股东 | 天眼查|实控 关联主体 :投资设立达摩院(上海)科技有限公司,2024-09-13该关联公司住所变更至上海自贸区纳贤路799号。 天眼查|企业风险 八、风险观察 榜单口径风险(当前最大不确定性) :"仅次于Claude"是发布当日放榜口径,与7月下旬LMArena/AA数据存在一个代际的跳升。榜单统计的是哪些版本、什么时点、何种聚合方式,目前公开报道未给出细则;在权重开源、第三方复测之前,该排名不可当作已核验事实。 关联方诉讼线索(company-index已核验) :在本轮已核验的当前可见范围内,达摩院(杭州)自身未见行政处罚、经营异常或被执行记录;自身风险条目为2023年7月主要人员/法定代表人变更预警。风险条目集中于股东阿里巴巴(中国)有限公司的周边诉讼(买卖合同、网络购物合同、不正当竞争、著作权等案由,均系关联方线索,非公司自身风险)。 天眼查|企业天眼风险 竞争挤压 :Kimi K3以更大参数+更低定价在开放权重赛道抢位,DeepSeek V4走极致成本路线,Meta已转向闭源旗舰Muse Spark(LMArena 1495 Elo)——Qwen3.8既要防闭源旗舰的性能反扑,也要防开源同侪的价格内卷。 商业化流量缺口 :千问办公前身产品6月合计访问量919万,仅为腾讯WorkBuddy的约44%;新模型接入能否转化为产品流量与付费订阅,尚无数据支撑。 算力与价格战成本 :2.4T参数规模叠加输入12元/百万Tokens的定价,推理成本压力是长期财务变量,需以阿里云后续资本开支与毛利率数据验证。 九、下一步验证清单 下周 :Qwen3.8-Max权重与Qwen3.8-27B是否按期开源,第三方复测(LMArena、AA智能指数、CodeArena)的位次变化。 榜单细则 :Arena放榜的统计版本、时点与"整体性能"口径,以及下一期Qwen3.8单版本位次。 千问办公 :网页版与钉钉内置版上线时间,月访问量与WorkBuddy/TRAE的差距是否收窄。 商业化 :Qwen3.8 API调用量、千问办公付费订阅数,以及阿里云季度收入中AI相关增量。 资本市场 :港股9988.HK在发布次日及后续交易日能否守住涨势(8月3日早盘涨近6%为发布当日数据)。 编辑说明:文中"仅次于Claude""全球第二"等表述均标注为发布当日放榜口径;涉及未来事项(开源时间、产品上线)均为官方或媒体公开口径的预期,非既成事实。公司档案与风险条目来自company-index已完整核验文档,风险条目中股东诉讼属关联方线索。 引用来源 经济观察网|阿里Qwen3.8正式发布 总参数量2.4万亿 新浪新闻转载|阿里Qwen3.8正式发布(含评测与定价全文) IT之家(新浪财经转载)|千问Qwen3.8-Max正式上线 DataLearner|大模型排行榜(LMArena / AA智能指数 / Terminal Bench 2.0) DataLearner|LiveCodeBench榜单(Qwen 3.6预览版数据) 百家号|2026年7月大模型权威排行更新(梯队划分) 人民日报"仲音"(头条转载)|国产开源大模型全球下载量突破100亿次 头条|联合国报告肯定千问开源贡献:衍生模型超20万、下载量破10亿 腾讯新闻|实测千问办公:阿里桌面Agent短板补上了 东方财富(南都报道)|阿里"拳头产品"千问办公上线桌面版 搜狐|千问办公正式上线:阿里的AI办公产品落地 天眼查|阿里巴巴达摩院(杭州)科技有限公司 工商基础信息 天眼查|股东信息 天眼查|疑似实际控制人 天眼查|企业天眼风险(关联方线索与自身预警)