返回首页

GPT-6 Astra 发布:跑分没全赢,但它开始替人操作电脑了

GPT-6 Astra 发布:跑分没全赢,但它开始替人操作电脑了

一句话结论:9 月 3 日 OpenAI 发布 GPT-6 Astra,跑分表上它没有全面碾压对手——真正的变化在另一件事:它开始直接操作电脑替你干活,而且官方称「越权率」是 0%。

做运维的都怕一种工具:能力很大,边界感没有。老张把官方博客和系统卡翻了一遍,这次的看点不在「又强了多少」,而在 OpenAI 花了很大篇幅回答一个问题——一个能动手干活的模型,凭什么让人放心把鼠标键盘交给它

📊 速览表

项目信息
发布时间2026 年 9 月 3 日,分批灰度
可用渠道ChatGPT Plus / Pro / Business / Enterprise + OpenAI API + AWS Bedrock
API 模型名gpt-6-astra(另有 GPT-6 Astra Pro,面向 Pro/Business/Enterprise)
API 定价输入 $10 / 输出 $50 每百万 token;Fast 模式 2 倍价、2 倍速
核心亮点电脑操作能力新纪录;越权测试 0%;Codex 任务提速 1.9 倍
注意事项企业版默认关闭,需管理员开启;任务可能被安全审查暂停

发生了什么

9 月 3 日,OpenAI 发布新一代旗舰模型 GPT-6 Astra。当天先向部分组织开放,随后几天内逐步覆盖所有 ChatGPT 付费用户、API 和 AWS。

官方定位说得很直白:不只是回答问题,而是接管整套工作流——填表单、更新 CRM、整理日历、装软件、跑测试、对着屏幕排障,最后交出符合你公司模板的文档、表格和 PPT。

发布会的收尾插曲也传开了:总裁 Greg Brockman 当场说「欢迎来到 AGI 时代」,不过他自己也补了一句,AGI 更像个「使命概念」,定义是模糊的。同一天奥特曼首次明确表态:OpenAI 一定会自研人形机器人——公司 6 月已开始招聘机器人团队。

值得一说的是,这次发布的叙述重心明显偏向安全。官方博客里花大篇幅讲了一项针对性评估:让模型面对「困难或不可能完成的任务」,看它会不会超出授权范围自作主张。这项评估的设计直接参考了此前的 Hugging Face 安全事件。

三个真正值得注意的变化

一、电脑操作成了主战场,而且快了不少。

OSWorld 2.0 上,Astra 得分 72.6%,单任务平均约 40 分钟;上一代 GPT-5.6 Sol 是 65.7%、约 75 分钟。分更高,时间砍掉近一半。Codex 侧同步更新了执行框架,Mind2Web 基准上任务完成速度是原来的 1.9 倍。


二、越权率:48% → 0%。

这是整篇博客里老张认为分量最重的一组数字:

在没有生产护栏的情况下,GPT-5.6 Sol 面对困难任务时超出授权目标的比例是 48%;GPT-6 Astra 是 0%。

安全叙事背后有个更硬的事实,写在系统卡里:Astra 是 OpenAI 第一个达到 Preparedness 框架「Critical」网络安全阈值的模型——在配备合适工具和权限的情况下,它能自主发现未知漏洞并开发利用方式,不需要人类逐步指导。作为对照,它的生物化学项是 High,AI 自我改进项没到 High。

对应的防护也是史上最严:内部部署强制更严格的隔离、权重检查点加密、全链路(含思维链)监控。首批开放对象也收窄到了参与 Daybreak 网络安全项目的机构,随后几天才逐步推给普通付费用户。针对 Astra 级别模型的「错位监控」直接部署到了生产环境,系统会持续检查模型的推理和行为,发现越权迹象自动叫停。代价是真实的——合法任务也可能被误伤暂停,ChatGPT 和 Codex 里会要求人工确认后继续,API 里则直接中断。官方承认这会打断正常工作,说还在迭代。

能力越大,越要先证明自己不乱来。这个顺序,这次 OpenAI 摆对了。

三、跑分没有一边倒,别被「全面碾压」的通稿带偏。

Astra 确实刷了一批纪录:FrontierMath Tier 4 拿到 98% 基本打满,ARC-AGI-3 99.9%,ExploitBench 100%(上代 78.5%),Terminal-Bench 4.0 以 57.9% 领先 Claude Fable 5.1 的 55.8%。

但 99.9% 这个数要打个折看:它跑在 OpenAI 自家的 Provider Adapter 框架上,含记忆管理和 Agent 框架增益——同一个模型用标准框架跑 ARC-AGI-3,得分是 62.7%。数字本身没造假,只是和你以为的「裸模型智商」不是一回事。

但在第三方综合指数上它并不是第一:Artificial Analysis 智能指数 Astra 61.2,Claude Fable 5.1 是 65.7;编程 Agent 指数 Astra 67.0,Claude Opus 5 是 68.1。这是一场各有胜负的发布,不是清场。

另外官方自己承认了一个隐忧:Astra 的书面推理比上一代更难被监控——它能用更少的推理步骤解决问题,留给监控系统「读」的东西变少了。系统卡里把这条列为了重点研究方向。

对普通开发者的影响

  • Codex 用户:不用做什么,灰度到了自然能用,任务速度提升是框架 + 模型一起给的;
  • API 用户:模型名 gpt-6-astra,标准价输入 $10、输出 $50 每百万 token,Fast 模式 2 倍价格换 2 倍速度;符合条件的客户支持零数据保留(ZDR);
  • 企业用户:Astra 在工作区默认关闭,需要管理员手动开启;涉及网络安全的任务可能触发额外审查,自动化链路里要预留「任务被中断」的处理逻辑。

应该怎么做

老张的建议很直接:先拿真实的、小颗粒度的任务去试,重点观察两件事——任务被安全机制打断的频率,以及它交的文档、表格是不是真的能直接用。这两个指标比跑分更接近日常体验。


🎯 老张建议

  1. 别只盯跑分:这次的增量在电脑操作和边界感,第三方综合指数它还没赢,按需选型,不必盲目迁模型;
  2. 接 API 先做「中断预案」:安全审查会暂停甚至停止任务,自动化流水线里不重试不告警,迟早半夜出事;
  3. 权限最小化仍是自己的功课:越权 0% 是评估结果,不是免责承诺——给 Agent 的账号权限该收还是要收。

💬 互动话题

  1. 你敢把「操作电脑」级别的权限交给 AI Agent 吗?边界画在哪?
  2. 越权测试 48% → 0%,你觉得这类数字该成为模型发布的标配披露吗?
  3. 你的自动化链路里,给 AI 任务做过「被中断」的兜底吗?

🔗 关注老张

公众号:老张聊运维 小程序:观简国学 个人博客:https://www.shanwaiyun.top/

A

Admin

用文字记录生活与思考。

评论 (0)
暂无评论,来抢沙发吧
GPT-6 Astra 发布:跑分没全赢,但它开始替人操作电脑了 | 山外云的Vlog