GPT-6 Astra 发布了:变了什么、谁能用、团队先测什么

首批仅限部分组织;真正要测的是电脑操作、长任务、成本与人工审核边界。

Buda Team
返回博客
GPT-6 Astra 发布了:变了什么、谁能用、团队先测什么

GPT-6 Astra 发布了:变了什么、谁能用、团队先测什么

OpenAI 正式发布了 GPT-6 Astra。

这次最值得关注的,不是又一张更长的跑分表,而是模型开始更直接地操作真实软件、完成长任务,并交付文档、表格、演示文稿和网站等可继续使用的成果。

但“发布”不等于所有人现在都能用。首批访问只开放给有限组织,ChatGPT 付费计划、API 和 AWS 会在接下来的几天逐步获得访问权限。对团队来说,今天最合理的动作不是立刻替换默认模型,而是先准备一组真实任务,验证它能否减少返工,同时守住权限和审核边界。

GPT-6 Astra 到底发布了什么?

OpenAI 把 Astra 定位为面向高难度端到端工作的旗舰模型。官方重点强调了五类能力:

  • 电脑和浏览器操作
  • 软件工程与代码执行
  • 文档、表格和演示文稿等专业工作
  • 科学研究
  • 网络安全

它支持文本和图片输入、文本输出,以及函数调用、Web Search、File Search、Computer Use、MCP、Skills、Shell 和 Apply Patch 等工具。模型 ID 是 gpt-6-astra

API 规格为 105 万 token 上下文窗口和 12.8 万 token 最大输出。标准上游目录价是每百万 token 输入 10 美元、输出 50 美元,缓存输入 1 美元。

这些是 OpenAI API 的上游规格和价格,不是 Buda Credits 或 Buda 用户价格。

GPT-6 Astra 的上下文、最大输出与 OpenAI 上游标准价格

真正的变化是:从回答问题到操作工作

GPT-6 Astra 的发布页面用了大量真实软件任务来说明能力,包括填写表单、更新 CRM、整理日历、生成和检查网站、分析数据,以及按既有模板制作文档和演示文稿。

OpenAI 报告称,在 OSWorld 2.0 的延迟模拟中,Astra 得分 72.6%,GPT-5.6 Sol 为 65.7%;Astra 每项任务约需 40 分钟,Sol 约需 75 分钟。这个结果说明 OpenAI 优化的方向已经不只是回答质量,而是任务完成速度和真实软件中的执行能力。

这些仍然是发布方提供的评测结果,不等于任何团队在自己系统里会获得同样提升。浏览器环境、工具权限、数据质量、任务长度和验收标准都会改变结果。

现在谁能用 GPT-6 Astra?

发布当天,Astra 先向有限组织开放。OpenAI 表示,接下来几天会逐步扩展到:

  • ChatGPT Plus
  • ChatGPT Pro
  • ChatGPT Business
  • ChatGPT Enterprise
  • OpenAI API
  • Amazon Web Services

Pro、Business 和 Enterprise 还会获得 GPT-6 Astra Pro。Enterprise 管理员需要主动为工作区启用 Astra,发布时默认关闭。

这意味着“已经发布”和“你的账号已经出现”可能相差几天。上线规划应以实际账号、区域和工作区管理设置为准。

GPT-6 Astra 从有限组织向付费计划、API 和 AWS 分阶段开放

先不要把 GPT-6 设成所有任务的默认模型

Astra 的标准输入、输出价格与 Claude Fable 5.1 的公开目录价处在同一档位。它不是批量摘要、格式转换和简单分类的经济型默认模型。

更合理的做法是把它放到需要升级判断的路径:

  • 多阶段任务在便宜模型上反复失败
  • 需要在真实软件中完成并检查工作
  • 任务要同时处理大量上下文和多种工具
  • 返工成本明显高于模型成本
  • 结果会进入客户、生产系统或管理决策

提取、分类、改格式和其他容易自动验证的步骤,仍可以交给更便宜的模型。模型越强,越需要清楚它负责哪一段,而不是把整条流水线都换掉。

团队应该先测哪五件事?

1. 用真实任务测验收通过率

不要只复现官方 demo。准备 10 到 30 个已经做过、结果可判断的真实任务,记录一次通过率、人工修改次数、完成时间和失败原因。

2. 测试权限和确认策略

给模型明确的可访问文件、网站、工具和动作范围。特别检查发送消息、修改记录、运行代码、删除数据和外部发布前是否会停下来等待确认。

3. 测试长任务中的转向能力

在任务中途增加要求、纠正方向、询问旁支问题,再观察它是否仍记得原目标和验收条件。

4. 测试暂停、失败和恢复

Astra 的额外安全检查可能让合法任务变慢、暂停或停止。团队需要知道任务中断后如何保留状态、交给人审阅并安全恢复,而不是从头重跑。

5. 计算“验收通过的任务成本”

不要只看每百万 token 单价。应把工具调用、长输入附加价格、失败执行、重试、人工审核和返工一起算进去。

单个验收通过任务的总成本 = 模型 + 工具 + 失败执行 + 重试 + 审核 + 返工

团队用真实任务评测 GPT-6 Astra 的五项检查

更强的模型,也带来更严格的控制问题

Astra 是 OpenAI 第一个达到其网络安全 Critical 能力门槛的模型。默认版本会拒绝更高级的攻击性任务,部分防御能力通过 Daybreak 等受控计划开放。

同时,OpenAI 的系统卡也披露了一个需要认真对待的限制:Astra 在整体对齐评测中表现更好,但书面推理的可监控性比 GPT-5.6 Sol 更弱。在专门要求模型躲避监控的对抗测试中,它更有能力控制自己写出的推理内容。

这两个结果可以同时成立。模型更少越界,不代表团队可以取消权限、确认和审计。对于能操作浏览器、终端和业务系统的 Agent,最终控制仍然要落到系统设计上。

GPT-6 Astra 的执行能力被权限、确认、监控和人工审核包围

这对 Buda 用户意味着什么?

GPT-6 Astra 进一步说明,模型正在从聊天能力走向真实执行能力。但一个模型本身不等于完整工作系统。

团队仍然需要持久文件、工具环境、任务历史、权限边界、执行可见性和人工审核。Buda 负责的是这一层:让 Agent 在 Browser、Terminal、Git 和 Drive 中工作,同时把 Session 和产物留给人检查。

GPT-6 Astra 暂未在 Buda 上线。后续上线后,具体可用范围和 Credits 会在 Buda 模型列表与公开价格页显示。

如果你正在设计 Agent 工作方式,可以继续阅读如何为 AI Agent 选择合适的模型什么是 AI Agent Workspace

常见问题

GPT-6 Astra 已经全面开放了吗?

还没有。发布当天先向有限组织开放,ChatGPT 付费计划、API 和 AWS 会在接下来的几天逐步获得访问。

GPT-6 Astra API 多少钱?

OpenAI 标准上游目录价是每百万 token 输入 10 美元、输出 50 美元,缓存输入 1 美元。长输入、Fast、Batch、Flex 和工具调用有额外规则。

GPT-6 Astra 的上下文窗口多大?

API 文档列出 105 万 token 上下文窗口和 12.8 万 token 最大输出。大窗口不等于永久记忆,也不保证每个位置的信息都能被同等准确地使用。

GPT-6 Astra 比 Claude Fable 5.1 更好吗?

没有一个对所有工作都成立的答案。OpenAI 发布的数据中,Astra 在部分电脑操作、终端和科学工作流上领先;其他独立综合指数仍可能更偏向 Fable 5.1。正确做法是用自己的任务、工具和验收标准比较。

GPT-6 Astra 已经在 Buda 上线了吗?

暂未上线。后续可用范围和 Credits 请查看 Buda 模型列表与公开价格页。

来源