返回首页

Qwen3.8-Max-0902 发布:编程能力一个月暴涨,登顶 CodeArena 全球第一

Qwen3.8-Max-0902 发布:编程能力一个月暴涨,登顶 CodeArena 全球第一

一句话结论: 阿里 9 月 2 日发布 Qwen3.8-Max-0902 快照版,底模不换、只堆后训练,一个月时间 TerminalBench 3.0 从 11.3 干到 29.0,Code Arena 前端编程总榜 1691 分登顶全球第一,价格还一分没涨——用千问系工具的开发者直接受益。

老张昨天刚发完 GLM-5.3 开源权重的文章,里面还说它 TerminalBench 3.0 拿到 28.3 是开源第一。结果话音未落,9 月 2 日同一天,阿里放出千问 0902 版(29.0 分),Google 发布 Gemini 3.8 Flash(DeepSWE 73.7%),编程模型圈直接打成一锅粥。这波节奏对咱们是好事:能力涨、价格不涨。

📋 速览表

项目内容
模型Qwen3.8-Max-0902(阿里通义千问)
发布时间2026-09-02(快照版本,官方 alias:qwen3.8-max-2026-09-02)
底模与 8 月版 Qwen3.8-Max 相同(2.4T MoE,激活约 950 亿,1M 上下文)
提升方向Coding 编程、Cowork 智能体任务、视觉(全部来自后训练)
价格不变:$2/百万输入、$6/百万输出(百炼 12 元/36 元)
接入千问 AI 平台 API、阿里云百炼、千问 App、千问办公、Qoder

发生了什么:9 月 2 日编程模型大战日

这一天堪称 2026 年下半年编程模型最密集的一天:

  • 阿里:发布 Qwen3.8-Max-0902 快照版;
  • Google:发布 Gemini 3.8 Flash 和 3.8 Flash Cyber(后者是面向防守方的网络安全模型,需申请 Fairwind 计划才能用);
  • 前一天 9 月 1 日,Anthropic 刚发布了 Claude Fable 5.1($10/$50 每百万 token)。

阿里的打法很清晰:底模不动,一个月后训练专攻编程和办公智能体,然后用「日期快照」的方式发版。以后看到模型名带 -0902 这种后缀,就知道是日期快照版本——这对运维和开发其实是好事,版本可追溯、行为可复现,老张建议生产环境锁定快照版本,不要直接跟 latest。

关键变化:编程能力一个月暴涨

官方公布的对比数据,老张挑重点:

  • TerminalBench 3.0:11.3 → 29.0(一个月涨 2.5 倍,反超 GLM-5.3 的 28.3);
  • DeepSWE 1.1:56.6 → 69.3
  • QwenSWEbench V2(阿里内部软件工程基准):55.1 → 70.0
  • JobBench(复杂任务处理):53.4 → 64.0
  • NL2Repo(自然语言生成代码仓库):55.9 → 64.9

官方图里最亮眼的是:Code Arena 前端编程总榜,Qwen3.8-Max-0902 以 1691 分拿下全球第一,压过 Claude Opus 5(Max)的 1688 分和 Kimi K3(Max)的 1674 分,比上一代 Qwen3.8-Max 整整高出 22 分。

不过老张要说句公道话:Code Arena 是真人盲测偏好评分,看的是综合体验;在一些硬核自动化基准上,Claude Opus 5 仍然领先(TerminalBench 3.0 拿 42.7,DeepSWE 拿 73.6)。所以「登顶」指的是偏好榜第一,不是所有基准都第一——千问 0902 真正的卖点是第一梯队的体验,国产模型的价格

价格不变,还有缓存省钱

这次升级不加价:

  • 千问 AI 平台:输入 $2/百万 token,输出 $6/百万 token
  • 上下文缓存命中更便宜:显式缓存 $0.17、隐式缓存 $0.25(每百万输入 token);
  • 国内百炼平台:输入 12 元、输出 36 元/百万 token,与上一代持平,新用户有 100 万 token 免费额度;
  • 对照一下:同档的 Claude Fable 5.1 是 $10/$50,差了约 5-8 倍。

对跑 Agent 工作流的团队,1M 上下文 + 上下文缓存是省钱关键:长会话重复前缀命中缓存后,成本能压到零头。

怎么用:五条渠道,底座已开放权重

  1. 千问 AI 平台 API:模型 ID qwen3.8-max-0902,思考档位、工具调用等全部保留;
  2. 阿里云百炼:国内接入首选,同样价格;
  3. 千问 App / 千问办公:普通用户直接体验;
  4. Qoder(阿里编程工具):编程场景主力入口;
  5. 底座 Qwen3.8-Max 上个月已开放权重(2.4T-A95B),有私有化需求的团队可以评估自建——但 2.4T 总参数量,自建门槛不低。

和 GLM-5.3 怎么选

昨天刚写完 GLM-5.3,今天很多人肯定会问这个问题。老张的看法:

  • 要私有化部署、数据不出域:选 GLM-5.3(权重开源,756GB FP8,需要大集群);
  • 要即开即用、极致性价比的 API:千问 0902 更省心,Code Arena 第一、价格低;
  • 编程 Agent 重度用户:建议两个都测,TerminalBench 3.0 上两者几乎打平(29.0 vs 28.3),DeepSWE 上 GLM-5.3 66.9 vs 千问 69.3,差距都在个位数。


🎯 老张建议

  1. 生产环境锁快照版本qwen3.8-max-0902 这种日期快照可追溯,别裸奔 latest,避免模型悄悄升级导致线上行为漂移;
  2. 长会话务必开上下文缓存:1M 上下文配缓存命中,Agent 场景成本能省一大截;
  3. 别迷信单一榜单:Code Arena 第一是体验第一,自动化编程基准 Opus 5 仍领先——选型前用自己的真实任务跑一遍最靠谱。

💬 互动话题

  1. 你现在的主力编程模型是哪家的?这次会切到千问 0902 吗?
  2. 日期快照式发版 vs 原地升级,你更喜欢哪种?
  3. 一个月 2.5 倍的迭代速度,你觉得是技术突破还是刷榜工程?

🔗 关注老张

公众号:老张聊运维 小程序:观简国学 个人博客:https://www.shanwaiyun.top/

A

Admin

用文字记录生活与思考。

评论 (0)
暂无评论,来抢沙发吧
Qwen3.8-Max-0902 发布:编程能力一个月暴涨,登顶 CodeArena 全球第一 | 山外云的Vlog