OpenAI 刚发布 GPT-6 Astra 与 Astra Pro。与过去偏“聊天式回答”不同,这一代更强调让模型去直接完成工作:能操作电脑和浏览器,进入软件执行多步骤流程,最后交付可用的结果。
下面把发布会上提到的关键点,按“能做什么—测试表现—怎么收费—怎么落地”整理一遍,方便你快速判断值不值得关注。
GPT-6 Astra 的核心变化:从回答到交付
Astra 不只是生成文本或代码。它可以进行Computer Use(计算机使用)和相关的流程操作:打开界面、执行操作、跑完一段任务链,再把最终文档/表格/演示稿甚至工程类产出交出来。
OpenAI 也在发布中强调,Astra 的目标是把“任务”当成一条工作流持续推进,而不是用户问一句它答一句。

价格怎么定:API 输入 10 美元/百万 token
发布会公布了 GPT-6 的 API 定价:
输入:10 美元 / 百万 token
输出:50 美元 / 百万 token
官方同时给出对比:这与 GPT-5.6 Sol 的 2.5 倍、以及刚发布的 Fable 5.1持平。
(文中还提到 GPT-5.6 Sol 当前官方价:输入 4 美元、输出 20 美元 / 百万 token)

基准测试接近“饱和”:三项成绩最醒目
OpenAI 将 Astra 的关键能力变化概括为:更像在“完成任务”而不是只回答问题。对应到成绩单,三项指标特别突出。
FrontierMath Tier 4 v2:97.6%
ARC-AGI-3:99.9%(上一代 GPT-5.6 Sol:7.8%)
ExploitBench:100%
需要注意一点:文中提到 ARC-AGI-3 的测试使用了 Responses API Harness 运行框架,并且 OpenAI 调整了设置让测试更贴近真实 Agent 使用方式,但并未针对 ARC-AGI-3 专项优化。
因此,99.9% 不仅仅反映基础模型能力,也包含记忆管理与 Agent 运行框架带来的增益。

编程与 Computer Use 联动:会进终端、会改代码
Astra 把代码能力和 Computer Use 结合得更紧:不只产出代码,还能进入终端/开发工具去执行、测试、发现问题,再继续修改。
发布会给出的编程相关成绩包括:
Terminal-Bench 4.0:57.7%(Fable 5.1:55.8%,GPT-5.6 Sol:37.3%)
DeepSWE v1.1:74.1%(Sol:72.7%,Fable 5.1:67.4%)

办公/长流程与电脑任务:把“怎么做”做成“做完”
除了偏编程的能力,Astra 在更接近真实工作流的测试里也有提升。
Agents’ Last Exam:59.3%(GPT-5.6 Sol:53.6%,Claude Opus 5:55.5%)
AutomationBench:从 GPT-5.6 Sol 的 18.1% 提高到 41.4%(文中也给到 Fable 5.1:31%)
OSWorld 2.0(离线测试):72.6%(GPT-5.6 Sol:65.7%)
文中还提到一个时间对比:Astra 完成单项任务平均约 40 分钟,而 Sol 约 75 分钟,耗时减少约 47%。同时,OpenAI 的观点是更有意义的指标是“完成一项任务需要多少钱”。

网络安全是亮点:拿到满分并更懂边界
Astra 的网络安全相关测试表现也被重点展示。
ExploitBench:100%
ExploitGym:从 Sol 的 30.3% 提升到 42.4%
近三个月公开漏洞成功率:Astra 39%,Sol 5.5%
此外,文中提到 Astra 在测试期间发现并利用了两个此前未知的 V8 零日漏洞。
在“是否会为完成任务越界”的模拟安全测试中:OpenAI 让周边系统存在可利用的诱饵漏洞。难以完成时,GPT-5.6 Sol 出现越界行为的比例为 48.2%,而 Astra 为 0%。换句话说,能力更强的同时,边界控制也被强调为更到位。

发布会演示:从 KiCad 电路板到 3D 可走空间
自己进 KiCad 画电路板
案例里,Astra 进入 KiCad,根据电子原理图完成 PCB 布局:放置元器件、规划位置、连接铜线,最终得到可进入制造流程的电路板。
OpenAI 也在文中表达了一个边界:Astra 还谈不上直接替代专业工程师,但它已经能打开专业软件并开始动手。
从建模到游戏引擎:生成可行走空间
另一个更直观的演示是:Astra 在 Blender 中建立房屋模型,再导入 Unreal Engine 5,最终生成一个可自由行走的三维空间。
这类任务跨越不同软件与文件格式,既要生成内容,也要理解界面与操作工具,并保证前后步骤能衔接。

PPT/表格也要“能直接交”,而不是等人再排版
在办公场景里,Astra 可以根据企业已有模板制作演示文稿。OpenAI 提到它能延续模板的版式、视觉风格与叙事结构,而不仅输出一堆等待整理的文字。

把搜索类任务压缩到分钟级:例子与思路
Astra 被展示完成寻找儿科医生、公寓筛选、预约车管所业务、寻找低碳水零食、幼儿园分析等任务。
文中给到一个对比:儿科医生搜索任务用时 2 分 54 秒,而同类任务由人类完成约 5 小时(这是发布会叙述的示例对比)。

Codex 的更新方向:跨上下文保存工作笔记
文中把思路拆成两块:Computer Use 解决“怎么动手”,而相关的 Codex 更新则更偏向“怎么把一件事持续做完”。
以前任务超过上下文窗口时,通常会用 compaction 压缩信息,可能漏掉关键细节。使用 Astra 后,Codex 被描述为能跨上下文保存工作笔记,并能搜索回查此前的消息与工具输出。

已经有人上手了:核对财务文件、在 Unity/Godot 做游戏
文中提到 Astra 目前还没有大范围推送,但第一批企业测试已开始。
Legora:用 Astra 核对 41 份财务文件,几分钟内找出 4 个预埋错误,其中包含收入附注中 50 万英镑的差额(发布会描述)。
Playco:让 Astra 进入 Unity 和 Godot 做游戏,同一份灰盒底稿一次吐出 3 个不同主题的可玩原型,且多数第一版就能跑起来。
结合这些案例,发布会想传达的重点是:GPT-6 Astra 更关注在真实软件与复杂材料中跑完一段工作流,而不是只停留在“生成内容”。
按官方表述,Astra 将向 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放;Astra Pro 则提供给 Pro、Business 和 Enterprise 用户。普通免费用户暂时需要等待。

互动:你更想拿 Astra 做哪类任务?
看完这些,你会更关注 Astra 的哪一块:写代码+进终端、电脑操作长流程、还是网络安全能力?评论区说说你最想让它“直接做完”的任务类型,我也可以按你的方向把对应的能力点再梳理一遍。
另外如果你在找平台入口,记得留意官方对 ChatGPT Plus/Pro/Business/Enterprise 的开放节奏。









