一 它到底能干什么
OpenAI 9 月 3 日发布 GPT-6 Astra。官方定位是"自主计算机操控"——它不告诉你"怎么填这张表",而是直接跨浏览器、表格、桌面应用执行多步任务,产出完整文档或网站。
这与之前所有大模型的主要差异:过去的模型是"回答",Astra 要做的是"动手"。它操控的是 OS 层面的应用本身(Excel、浏览器、终端),而非通过 API 接入每个应用的工具函数。这意味着一个软件只要能用鼠标和键盘操作,理论上就能用它,不需要单独做集成。
OpenAI 把这称为"新的计算模式":像人用软件一样用软件,而不是为每个应用写 API 适配。对工程团队来说,这意味着 Agent 的开发边界从"API 覆盖面"扩展到了"软件能不能被人操作"。
但有一个关键限定:Astra 处理的是"完成型任务"——填完表格、搭好网站、执行完工作流——而非"理解型任务"。它需要在执行过程中做决策(选哪个功能、怎么理解当前界面状态),这正是 OSWorld 类基准衡量的内容。
二 基准表现:哪些数好看,哪些有注脚
OpenAI 公布的数字里,真正最有实用价值的是计算机操控这块。编程能力相比上一代是小幅提升,科研类得分虽高但带注脚。
| 基准 | Astra | GPT-5.6 Sol | 注脚 |
| OSWorld V2-Offline(桌面应用操控) | 72.6% | 65.7% | 单任务耗时 75 min → 40 min |
| DeepSWE v1.1(Agent 编程) | 74.1% | 70.8% | 小幅提升(非飞跃);同时也与 Muse Spark 1.3(75.4%)和 Gemini 3.8 Flash / Claude Opus 5(约 74%)重叠 |
| ARC-AGI-3 | 98.6% | — | "模型 + 智能体框架"的成绩(对话轮次间保留推理状态),非裸模型 |
| FrontierMath Tier 4 | 97.6% | — | 该基准部分 OpenAI 有独家访问权,且基准开发者由 OpenAI 资助 |
"最亮眼"的两个 98.6% / 97.6% 都依赖 OpenAI 自有框架或基准访问权限,和裸模型得分不直接可比。计算机操控的 72.6%(OSWorld)是目前最接近"真实效用"的数字,同时任务耗时从 75 分钟降到 40 分钟,说明它不是准确率更高,而是速度也快了。
OpenAI 官方在安全概述中还主动披露了一条不利信息:Astra 的书面推理过程比 Sol 更难监控——换句话说,性能提升的另一面是透明度下降。
三 定价与成本:$10 / 百万输入是什么水平
| 模型 | 输入($/百万 token) | 输出($/百万 token) | 定位 |
| GPT-6 Astra | 10 | 50 | 高端旗舰 |
| GPT-5.6 Sol(促销价) | 4 | 20 | 上代旗舰(促销期) |
| Anthropic Fable 5.1 | 10 | 50 | 高端旗舰 |
| Muse 标准(Meta) | 1.25 | 4.25 | 经济版 |
| Gemini 3.8 Flash(Google) | 0.75 | 3.75 | 经济版 |
Astra 定价是 GPT-5.6 Sol 当前促销价的 2.5 倍,与 Anthropic Fable 5.1 持平。对单次任务成本来说,OpenAI 的论点是:如果模型能以更少步骤完成、减少重试,每 token 单价高但每任务总成本可能更低。目前这个说法无法验证——发布时的配套数据不足以证明节省能覆盖溢价。
产品线方面,这一代 OpenAI 只推出了 Astra 和 Astra Pro 两个变体,没有像 GPT-5.6 那样配 Luna / Terra / Sol 的完整梯度。经济档位($0.75-4.25 区间)仍然是 Gemini Flash 和 Muse 的领地,Astra 不在这个价位上竞争。
四 上线节奏:为什么现在还用不上
Astra 采用分阶段推出。发布当天只有 OpenAI 自己的"Daybreak"网络安全计划中的企业客户能优先访问(这是基于申请的,不是公开的)。Plus / Pro / Business / Enterprise 用户和 API 开发者要"未来几天内"才能陆续开放,Astra Pro 也计划接入 OpenAI API 和 AWS。
原因不简单——这不是"技术还没准备好",而是 OpenAI 内部安全评审打出来的:Astra 是第一个触发 OpenAI"关键级"网络安全阈值判定的模型。OpenAI 自己说标准版 Astra 会直接拒绝高级网络安全任务(渗透测试、漏洞利用类),这是限流的主因。安全上的局限和能力上的突出并存,是这次发布的定义特征。
对消费者来说最实际的限制不是价格($10/$50 对普通用户不贵),而是"现在能不能用"——如果你的工作流依赖这个模型,需要等 Plus / Pro / API 正式开放,同时测试它的稳定度。目前公开可验证的运行数据还很少。
五 适用与不适用
- 适用的任务:跨应用多步操作("查这个数据→填到那张表→生成一份报告");表格构建与数据整理;从零搭建简单网站或页面;已有的工作流自动化(替代人工按键)。
- 不适用的任务:简单问答或文本生成(用便宜模型就够);高精度数学/符号计算(用专有的数学模型);需要实时人工介入或精细交互的操控任务(Astra 是自主式,不是远程桌面控制)。
- 成本敏感场景:如果你的任务量大但单价敏感(比如批量文档处理),Gemini 3.8 Flash / Muse 加上简单工具链在这个场景下成本更低。
- 需要审计链的任务:OpenAI 自己披露了 Astra 推理过程更难监控,对合规要求高的场景(金融 / 医疗)目前建议先不接入。