超越 '98% AGI':转向能完成完整工作的 AI
2026 年 9 月 3 日,OpenAI 发布了 GPT-6 Astra。
发布后,人们的注意力立即集中在它的分数上:在困难的数学基准 "FrontierMath" 上约为 98%,在衡量计算机操作的 "ARC-AGI-3" 上为 99.9%,在网络安全评估 "ExploitBench" 上为 100%。
仅看这些数字,人们可能会说:"一个近乎完美的 AI 已经到来" 或 "AGI 终于完成了"。
然而,仅凭基准分数来判断 GPT-6 Astra 是危险的。
Astra 的变化不仅仅是针对问题返回更正确的文本。
它打开浏览器、阅读文档、执行代码、更新电子表格、操作网站、如果在中途失败则调查原因,并最终带回一个可审查的交付物。
传递给 ChatGPT 的工作单元已从 "单个问题" 转变为 "一系列业务操作"。
如果你像使用传统 ChatGPT 那样,仅将 Astra 用于起草电子邮件或文本摘要,它仍然只是一个昂贵的文本生成 AI。它的价值体现在当你委托它完成那些人类过去需要多次切换屏幕、被视为一个连贯流程的任务时。(OpenAI)
在本文中,我们将深入探讨官方功能特性介绍之外的内容,包括海外公司确认的案例、如何解读基准测试、与 Claude 的对比、定价、安全性,以及面向日本企业实际使用的设计。
什么是 GPT-6 Astra?
GPT-6 Astra 被 OpenAI 定位为 GPT-6 代的顶级模型,被描述为 "最智能、最对齐的模型"。
发布时,它首先向选定的组织推出,随后是 ChatGPT Plus、Pro、Business、Enterprise、API 和 Amazon Bedrock。在 Enterprise 中,默认情况下是关闭的,直到管理员启用,官方公告中没有明确提及免费计划的发布。
API 上的模型名称是 gpt-6-astra。使用更高计算资源的 Astra Pro 也正在为 Pro、Business 和 Enterprise 用户推出。(OpenAI)
主要规格总结如下:
项目 | GPT-6 Astra |
|---|---|
上下文长度 | 1,050,000 tokens |
最大输出 | 128,000 tokens |
知识截止日期 | 2026 年 4 月 30 日 |
输入 | 文本、图像(原生) |
输出 | 文本(原生) |
推理级别 | low / medium / high / xhigh / max |
API 输入价格 | 每 1M tokens $10 |
API 输出价格 | 每 1M tokens $50 |
缓存输入 | 每 1M tokens $1 |
微调 | 不支持 |
主要工具 | 网页搜索、文件搜索、代码执行、Shell、计算机使用、MCP、图像生成等 |
虽然它可以读取图像,但模型的原生输出是文本。图像生成是通过调用单独的工具执行的。它不是用于直接音频或视频输入的模型。
此外,对于超过 272,000 tokens 的长输入,整个请求将应用价格乘数。输入和缓存费用翻倍,输出费用为 1.5 倍。仅仅因为它能容纳 105 万个 tokens,并不意味着你应该每次都把所有内部文档塞进去;在准确性下降之前,成本效率会先暴跌。
Astra 改变了什么?
- 计算机操作从 "辅助" 转向主战场
Astra 的核心是 "Computer Use"。
以前的 AI 可以在浏览器上点击按钮或填写表单。但问题依然存在:如果屏幕布局稍有变化,它就会停止;无法从中途错误中恢复;或者在涉及多个站点的任务中迷失目标。
GPT-6 Astra 在衡量实际桌面环境操作的 OSWorld 2.0 上获得了 72.6%。GPT-5.6 Sol 是 65.7%。
此外,Astra 处理此评估大约需要 40 分钟,而 Sol 需要大约 75 分钟。不仅成功率提高了,处理时间也减少了约 47%。在屏幕上寻找目标的 ScreenSpot 中,Astra 得分为 92.7%,而 Sol 为 76.9%。(OpenAI)
这不仅仅是一个流畅的演示视频。它针对的任务包括:
- 搜索符合条件的医院或房产并比较候选。
- 从多个管理屏幕检索值以创建报告。
- 将客户信息输入 CRM 并更新状态。
- 登录 Web 服务检查设置。
- 在浏览器中运行创建的应用程序并修复错误。
- 在引用多个文件的同时完成电子表格或幻灯片。
在 Mind2Web 中,使用更新版 Codex harness 的 Astra 处理 Web 任务的速度比以前的模型快 1.9 倍。
这里重要的是,性能是由 "整个 harness" 决定的,包括浏览器、工具、执行环境和验证过程,而不仅仅是模型的智能。仅仅选择 Astra 这个名字并不能自动自动化所有屏幕操作。(OpenAI)
- 保持 105 万 Token 长上下文直至结束
GPT-6 Astra 的上下文长度约为 105 万个 tokens。它有能力同时处理合同、会议记录、设计文档、源代码和过去的研究。然而,"容纳" 和 "准确使用" 是不同的。
在用于查找嵌入在长文本中的信息的 MRCR 评估中,Astra 在 256k–512k 范围内为 100%,在 512k–1M 范围内为 96.3%。GPT-5.6 Sol 在后者的结果为 73.8%。
虽然 Astra 在长上下文方面很强,但当你放入 100 万个 tokens 时,它并不能完美记住每一个单词。在 1M token 范围内,它仍然有大约 3.7% 的失败率。避免将关键条件仅放在庞大文档中的一个位置;你必须明确地分别陈述目标、约束和批准条件。(OpenAI)
Astra 还具有增加长会话连续性的机制,例如异步工具调用(在等待工具时处理其他任务)、引导(允许人类在执行过程中纠正方向),以及即使在会话中途更改推理级别也能保持缓存。
它正在从 "编写完美的提示然后离开" 转向 "检查进度并纠正方向" 的工作流程。(OpenAI Developers)
- 创建完成的交付物,而不仅仅是文本
Astra 加强了创建交付物的能力,如电子表格、幻灯片、文档、应用程序和研究报告。以前的模型可以创建 "演示文稿大纲",但人类必须将其移到 PowerPoint,调整设计,重新验证数字,并添加链接。Astra 的目标是更上一层楼:阅读材料或公司模板,整理数字,创建幻灯片/电子表格,在浏览器中检查它们,并提交更正后的文件。
早期采用者 Higgsfield 表示,它可以用比现有模型少 20% 的 tokens 处理 Agent 任务。Harvey 称赞其在法律工作中的判断力,Jane Street 指出它减少了复杂技术问题的反复沟通,Lovable 则看重其在高推理设置下的迭代/测试能力。
然而,这些是早期客户的推荐信,与独立第三方复制测试的证据不同。(OpenAI)
- 在长时间任务中不太可能 "忘记目标"
传统的 Agent 有时会偏离最初制定的计划——在应该实现功能时沉迷于小的重构,或者只以信息收集结束而没有最终决定。Astra 提高了长时间工作的一致性。
另一方面,官方开发者文档指出,Astra 可能会停下来询问澄清问题、过度格式化细节、重复表达或进行不必要的过多测试。
换句话说,更高的性能并不意味着你可以给出模糊的指令。你应该比以前更清晰地设定目标、完成条件、提问的标准以及需要批准的操作。(OpenAI Developers)
基准测试令人印象深刻,但并非 "所有领域的全球最佳"
Astra 的公告展示了令人瞩目的数字:FrontierMath 上 97.6%,ARC-AGI-3 上 99.9%,ExploitBench 上 100%。这些都是重要的进步,但我们必须区分测量目标和执行条件。
计算机操作和业务自动化显著增长
在接近实际业务任务的 AutomationBench 中,Astra 得分为 41.4%。GPT-5.6 Sol 为 18.1%,Claude Fable 5.1 为 31.4%。在用于 CAD 相关任务的 BenchCAD 中,Astra 为 95.9%,Sol 为 83.3%,Fable 5.1 为 84.3%。在用于 Web 研究的 BrowseComp 中,Astra 为 91.5%,Sol 为 90.4%,Claude Opus 5 为 90.8%。Astra 在这里领先,但与 Sol 和 Opus 的差距很小。
Astra 的优势在结合了屏幕操作、文件处理、数据分析和验证的复杂复合任务中最为明显,而不仅仅是找到一个搜索结果。(OpenAI)
编码能力强,但尚未完全超越 Claude
在 Terminal-Bench 中,Astra 得分为 57.7%,超过了 Sol(37.3%)和 Fable 5.1(55.8%)。在内部数据库迁移评估中,Astra 为 63.9%,而 Sol 为 42.7%。在读取现有系统并在不破坏的情况下进行更改方面,可以看到明显的改进。
然而,在 Artificial Analysis Coding Agent Index 中,Astra 为 67.0,Claude Fable 5 为 67.2,Claude Opus 5 为 68.1。在 FrontierCode Extended 中,Astra 为 64.5,而 Fable 5 为 64.9。在 Main 评估中,Astra 为 53.3,Fable 5 为 53.5,Opus 5 为 53.4。
Astra 在编码方面处于顶级水平,但它在每个代码评估中都没有超越 Claude。(OpenAI)
学术推理方面仍存在弱点
尽管 FrontierMath 达到 97.6%,但 Astra 在衡量广泛专业知识和推理能力的 "Humanity's Last Exam" 中得分为 57.2%。Claude Fable 5.1 为 65.0%,Fable 5 为 63.8%,Opus 5 为 63.6%。在 Artificial Analysis Intelligence Index 中,Astra 为 61.2,而 Fable 5.1 为 65.7,Opus 5 为 63.1。
"因为 FrontierMath 达到 98%,所以它几乎理解所有学术领域" 的解释并不成立。根据评估的不同,Claude 在某些领域仍然产生更高的结果。(OpenAI)
99.9% 背后是专用的执行环境
ARC-AGI-3 上的 99.9% 令人震惊,但它并非通过简单地将问题输入 Astra 获得的。OpenAI 使用 Responses API 的 harness 执行了它,并修改了两个设置以使其更接近实际使用性能。虽然 OpenAI 解释这些不是特定于基准的设置,但这并非模型单独进行的零样本结果。
此外,公布的值是多个推理设置中的最高结果。无法保证在标准 ChatGPT 中每次都能复现相同的性能。(OpenAI)
在发布时的 Artificial Analysis 汇总中,Astra 的总分为 61,在 202 个模型中排名第 8。同时,其输入价格为 $10,而中位数为 $2;输出价格为 $50,而中位数为 $10。
它无疑是顶尖模型之一,但不是一个不考虑价格就什么都往上扔的模型。(Artificial Analysis)
海外案例 1:Legora 在几分钟内核对 41 份文档
提供法律 AI 的欧洲公司 Legora 展示了 Astra 的实际价值。他们使用 Astra 进行财务报表中的 "tie-out" 核对,其中相同的数字出现在文本、注释、表格和过去的文档中。Legora 在单次 Agent 运行中处理了 41 份文档,这项任务人类需要数小时或数天,而 Astra 只需几分钟。
在测试中,他们故意植入了 4 个错误。Astra 全部找到,包括收入注释中 50 万英镑的差异。它在保持先前模型准确性的同时,执行了大约 50 次更多的正确检查。(OpenAI)
然而,约 40% 的改进是针对此特定工作流程的。在 Legora 更广泛的 BAR 任务中,平均改进约为 3%。Astra 并不能统一地将所有法律工作提高 40%;它擅长在大量文档中交叉引用以发现不一致之处。
最终判断仍由人类法律专家做出。AI 负责缩小人类应阅读的范围并核对不一致的证据。(OpenAI)
海外案例 2:Playco 将手动修复减少 50%
游戏公司 Playco 使用 "Playbot"(一个用于 Unity 和 Godot 的开发 Agent)测试了 Astra。Playbot 编辑场景、运行游戏、验证行为并修复问题。Playco 让它同时创建了三个不同主题的原型。虽然不是 "完美的一次性完成",但他们报告称,与以前的模型相比,手动修复减少了 50%。
在空间意识、复现参考图像、响应式 UI、游戏感和错误检测方面都看到了改进。(OpenAI)
Astra 的优势不仅仅是 "一次写对代码",而是能够运行游戏、检查显示、操作它、发现问题、修复并重试——模仿人类开发者的迭代过程。
海外案例 3:将停滞的功能推进到 90% 完成度
产品开发者 Claire Vo 分享了使用 Astra 为她服务 ChatPRD 的结果。一个由于复杂的 CRM 操作和 UI 实现而停滞了 6 个月的产品智能功能,在单次 Astra 会话中达到了约 90% 的完成度。
她还测试了通过 CLI 控制硬件(Divoom MiniToo)、Mac 消息应用程序以及 Blender 中的 3D 资产。(Lenny's Newsletter)
虽然这些是早期合作伙伴自行报告的成功案例,但它们显示了一个一致的趋势:Astra 在操作外部服务、读取现有代码和完成交付物时能发挥重要作用。
科学突破:解决长期存在的问题
OpenAI 报告称,使用 Astra 解决或显著推进了数学和理论计算机科学中的 10 个未解决问题。该模型生成论证,人类研究人员整理草稿,然后使用同一模型通过 Lean 进行形式化。
据 OpenAI 称,这项研究的总 token 成本大约相当于 GPT-5.6 Sol 定价下的 $2,000。其中一个例子涉及更新素数间隙的界限,这是一个某些项超过 80 年未得到改进的领域。(OpenAI)
为什么 Astra 是 "最安全" 却又 "最难监控"
GPT-6 Astra 是 OpenAI 分类中第一个达到网络安全能力 "Critical" 阈值的广泛部署模型。在获得工具和访问权限的情况下,它可以发现未知漏洞,并针对受防御的系统构建攻击程序,而无需人类逐步指导。
在 ExploitBench 中,Astra 得分为 100%,而 Sol 为 78.5%。它甚至在测试期间发现了两个零日漏洞,其中一个逃逸了浏览器沙箱。然而,这些结果使用了面向防御研究人员的 "Daybreak Blue" 环境;标准版本具有拒绝高级攻击任务的控制措施。(OpenAI)
矛盾的是,虽然 Astra 减少了明显的违规行为,但其内部推理更难监控。在命令 "逃避监控" 的对抗性评估中,监控系统在某些任务中的检测率降至 11% 以下。OpenAI 没有发现 "隐写术"(在推理中隐藏信息)自然发生的证据,但模型对自身被评估的高度意识使得对齐难以被明确证明。
日本企业应从何处入手?
- 文档量大且遗漏风险高的任务:交叉核对合同、报价单、发票和会议记录。AI 可以收集材料并标记差异供人工审查。
- 需要多个管理屏幕的行政任务:EC、广告和 CRM 管理。从查看、汇总和起草开始;最初不要授予付款或删除权限。
- 端到端研究和材料创建:不要只要求总结。要求它研究竞争对手、整理功能、分析差异并总结成幻灯片。
- 原型设计和 QA:让它实现一个功能,然后打开浏览器检查布局是否损坏或链接错误。
面向 Astra 的实用提示
不要只给出 "你是专家" 这样的角色,而要设定边界和完成条件。
1## 目的2此任务要实现的状态:[填写目的]34## 最终交付物5提交内容:[文件、表格、报告、实现的功能等]6完成条件:[要满足的具体标准]78## 允许的信息和工具9要参考的材料:[文件、URL、内部数据等]10要使用的工具:[网页搜索、浏览器、代码执行、电子表格等]1112## 流程131. 确认请求和材料。142. 整理缺失信息和风险。153. 进行研究、分析和创建。164. 打开并验证交付物。175. 整理错误、未确认项和剩余任务。186. 以可审查的状态提交。1920如果一个流程停止,继续处理不依赖它的任务。21仅对显著影响结果的缺失信息提问。22对于小的差距,做出合理假设并记录。2324## 权限25你可以进行查看、分析、起草、测试和差异检查。26在以下操作之前立即停止,并附上详细信息请求批准:27- 外部发送28- 购买、付款、合同29- 发布、生产部署30- 删除数据或文件31- 权限更改32- 难以撤销的操作3334## 质量标准35- 将已验证的事实与推测分开。36- 为重要数字添加来源。37- 寻找相反的证据或例外情况。38- 打开交付物检查显示和操作。39- 最终报告必须包括采取的行动、验证结果和剩余风险。
Astra 的弱点
- 缺乏独立的长期案例:大多数数据来自 OpenAI 选择的合作伙伴。
- 105 万 Tokens 不是免费仓库:成本随输入大小增加,且遗漏风险并非为零。
- 非音频/视频原生:需要外部工具处理这些格式。
- 不支持微调:必须使用 RAG、MCP 或系统指令来反映公司规则。
- 安全机制可能阻止合法工作:监控可能会减慢防御研究或开发任务。
- 输出可能 "过于完美":它倾向于大量使用标题和列表,对于品牌文案来说可能感觉太 "AI 化"。
结论:价值在于完成率,而非答案
GPT-6 Astra 用于撰写一封电子邮件或总结会议记录是大材小用。它的意义体现在研究、判断、操作、创建和验证相互关联的工作中。
"一句话提示工程" 的时代已经结束。现在重要的是传递哪些信息、连接哪些工具、允许多少执行以及什么构成完成。Astra 不是一根能给予每个人相同结果的魔杖;如果你给它混乱的工作,它会快速地做混乱的工作。如果你组织好目的、工具和验证点,它能在几分钟内将数小时的人类劳动带到可审查的状态。





