Qwen3.8-Max-0902 发布:编程能力一个月暴涨,登顶 CodeArena 全球第一

一句话结论: 阿里 9 月 2 日发布 Qwen3.8-Max-0902 快照版,底模不换、只堆后训练,一个月时间 TerminalBench 3.0 从 11.3 干到 29.0,Code Arena 前端编程总榜 1691 分登顶全球第一,价格还一分没涨——用千问系工具的开发者直接受益。
老张昨天刚发完 GLM-5.3 开源权重的文章,里面还说它 TerminalBench 3.0 拿到 28.3 是开源第一。结果话音未落,9 月 2 日同一天,阿里放出千问 0902 版(29.0 分),Google 发布 Gemini 3.8 Flash(DeepSWE 73.7%),编程模型圈直接打成一锅粥。这波节奏对咱们是好事:能力涨、价格不涨。
📋 速览表
| 项目 | 内容 |
|---|---|
| 模型 | Qwen3.8-Max-0902(阿里通义千问) |
| 发布时间 | 2026-09-02(快照版本,官方 alias:qwen3.8-max-2026-09-02) |
| 底模 | 与 8 月版 Qwen3.8-Max 相同(2.4T MoE,激活约 950 亿,1M 上下文) |
| 提升方向 | Coding 编程、Cowork 智能体任务、视觉(全部来自后训练) |
| 价格 | 不变:$2/百万输入、$6/百万输出(百炼 12 元/36 元) |
| 接入 | 千问 AI 平台 API、阿里云百炼、千问 App、千问办公、Qoder |
发生了什么:9 月 2 日编程模型大战日
这一天堪称 2026 年下半年编程模型最密集的一天:
- 阿里:发布 Qwen3.8-Max-0902 快照版;
- Google:发布 Gemini 3.8 Flash 和 3.8 Flash Cyber(后者是面向防守方的网络安全模型,需申请 Fairwind 计划才能用);
- 前一天 9 月 1 日,Anthropic 刚发布了 Claude Fable 5.1($10/$50 每百万 token)。
阿里的打法很清晰:底模不动,一个月后训练专攻编程和办公智能体,然后用「日期快照」的方式发版。以后看到模型名带 -0902 这种后缀,就知道是日期快照版本——这对运维和开发其实是好事,版本可追溯、行为可复现,老张建议生产环境锁定快照版本,不要直接跟 latest。
关键变化:编程能力一个月暴涨
官方公布的对比数据,老张挑重点:
- TerminalBench 3.0:11.3 → 29.0(一个月涨 2.5 倍,反超 GLM-5.3 的 28.3);
- DeepSWE 1.1:56.6 → 69.3;
- QwenSWEbench V2(阿里内部软件工程基准):55.1 → 70.0;
- JobBench(复杂任务处理):53.4 → 64.0;
- NL2Repo(自然语言生成代码仓库):55.9 → 64.9。

官方图里最亮眼的是:Code Arena 前端编程总榜,Qwen3.8-Max-0902 以 1691 分拿下全球第一,压过 Claude Opus 5(Max)的 1688 分和 Kimi K3(Max)的 1674 分,比上一代 Qwen3.8-Max 整整高出 22 分。

不过老张要说句公道话:Code Arena 是真人盲测偏好评分,看的是综合体验;在一些硬核自动化基准上,Claude Opus 5 仍然领先(TerminalBench 3.0 拿 42.7,DeepSWE 拿 73.6)。所以「登顶」指的是偏好榜第一,不是所有基准都第一——千问 0902 真正的卖点是第一梯队的体验,国产模型的价格。
价格不变,还有缓存省钱
这次升级不加价:
- 千问 AI 平台:输入 $2/百万 token,输出 $6/百万 token;
- 上下文缓存命中更便宜:显式缓存 $0.17、隐式缓存 $0.25(每百万输入 token);
- 国内百炼平台:输入 12 元、输出 36 元/百万 token,与上一代持平,新用户有 100 万 token 免费额度;
- 对照一下:同档的 Claude Fable 5.1 是 $10/$50,差了约 5-8 倍。
对跑 Agent 工作流的团队,1M 上下文 + 上下文缓存是省钱关键:长会话重复前缀命中缓存后,成本能压到零头。
怎么用:五条渠道,底座已开放权重
- 千问 AI 平台 API:模型 ID
qwen3.8-max-0902,思考档位、工具调用等全部保留; - 阿里云百炼:国内接入首选,同样价格;
- 千问 App / 千问办公:普通用户直接体验;
- Qoder(阿里编程工具):编程场景主力入口;
- 底座 Qwen3.8-Max 上个月已开放权重(2.4T-A95B),有私有化需求的团队可以评估自建——但 2.4T 总参数量,自建门槛不低。
和 GLM-5.3 怎么选
昨天刚写完 GLM-5.3,今天很多人肯定会问这个问题。老张的看法:
- 要私有化部署、数据不出域:选 GLM-5.3(权重开源,756GB FP8,需要大集群);
- 要即开即用、极致性价比的 API:千问 0902 更省心,Code Arena 第一、价格低;
- 编程 Agent 重度用户:建议两个都测,TerminalBench 3.0 上两者几乎打平(29.0 vs 28.3),DeepSWE 上 GLM-5.3 66.9 vs 千问 69.3,差距都在个位数。

🎯 老张建议
- 生产环境锁快照版本:
qwen3.8-max-0902这种日期快照可追溯,别裸奔 latest,避免模型悄悄升级导致线上行为漂移; - 长会话务必开上下文缓存:1M 上下文配缓存命中,Agent 场景成本能省一大截;
- 别迷信单一榜单:Code Arena 第一是体验第一,自动化编程基准 Opus 5 仍领先——选型前用自己的真实任务跑一遍最靠谱。
💬 互动话题
- 你现在的主力编程模型是哪家的?这次会切到千问 0902 吗?
- 日期快照式发版 vs 原地升级,你更喜欢哪种?
- 一个月 2.5 倍的迭代速度,你觉得是技术突破还是刷榜工程?
🔗 关注老张
公众号:老张聊运维 小程序:观简国学 个人博客:https://www.shanwaiyun.top/