最大化 GPT-6 Astra 的潜力:Codex 架构设计完整指南

@harisuke_ai
日语2026年9月07日
136K
294
17
0
937

TL;DR

本综合指南探讨了针对 GPT-6 Astra 的“架构工程”,将重点从提示词编写转向环境设计。文中详细介绍了构建自主、可靠的 AI Agent 所需的 8 个核心组件,并应用了 Codex 框架。

2026 年 9 月 3 日,OpenAI 发布了 GPT-6 Astra。

许多人只是将他们的 Codex 模型设置切换到 Astra,然后就停止了。

然而,OpenAI 那天并不仅仅是更新了模型。官方公告明确指出,他们与 Astra 一起更新了 Codex 的 "Harness"(来源:OpenAI "GPT-6 Astra:新一代智能" https://openai.com/index/gpt-6-astra/ )。

大脑以及大脑工作的环境。OpenAI 同时重建了两者。

但是,如果存在不明确的指令或相互矛盾的规则,Astra 可能会中途停止任务或不断要求澄清。

在本文中,我将提供以下三样东西:

  • 构成 Codex Harness 的 8 个元素的完整说明(附优先级)
  • 4 个你可以立即复制粘贴的诊断和清单提示词
  • 一个执行顺序,告诉你今天如何在 30 分钟内开始

没什么好保留的,所以我将首先分享最重要的提示词。这个提示词让 Codex 自我报告其当前的项目状态。

▼ 从这里复制

你是一位 Codex Harness 设计师。

目标是创建一个状态,让 GPT-6 Astra 能够在此项目中“安全、可重复地完成任务,并且无需每次都提供详细指令就能执行到底”。

首先,不要做任何更改。请审查当前的项目配置、设置文件和可用功能,然后诊断以下内容:

  1. AGENTS.md:目的、要遵循的规则、禁止事项、完成条件和参考资料是否清晰?
  2. docs / context:结构是否组织良好,以便你能自行找到必要的信息?是否存在陈旧、冗余或矛盾的描述?
  3. Skills:哪些重复性任务应该转化为 Skills?反之,哪些 Skills 是不必要的?
  4. MCP / Plugins:缺少哪些外部工具或数据连接?
  5. Environment:你是否能自行复现依赖项、设置和测试执行?
  6. Permissions / Sandbox:是否被授予了过多的权限?反之,是否有太多待处理的审批阻碍了工作?
  7. Hooks / Tests:能否自动化执行前检查、秘密检测、测试和完成检查?
  8. Browser / Computer Use:是否存在需要通过实际操作成品来验证的任务?
  9. Subagents:是否存在像研究、审查或测试这样,如果并行处理会更快完成的任务?
  10. Feedback Loop:是否存在一个机制,能将过去的失败或修正指令反馈到 AGENTS.md / docs / Skill / Hook / Test 中?

输出格式:A. 对每个项目进行 5 分制评估 B. 前 5 个关键缺陷 C. 今天 30 分钟内可以修复的事项 D. 需要在一周内系统化的事项 E. 需要创建/更改的文件及具体的变更建议 F. 安全/权限风险 G. 实施优先级

不要基于推测捏造设置。在判断之前,请检查当前可用的 Codex 功能和版本。明确说明功能是 Experimental / Beta / Deprecated。

在我审查完这些诊断结果之前,不要更改文件、扩展权限或连接到外部服务。

▲ 复制到这里

在你读完这篇文章之前运行它,以后会为你节省时间。

本文的目标与用途

本文的目标是截至 2026 年 9 月 7 日的 Codex。Codex 更新很快,所以阅读前请检查日期。

内容包括 8 个 Harness 组件、7 个成熟度级别和 4 个可复制的提示词模板。

目标读者是“使用 Codex 但在写完 AGENTS.md 后就停止的人”。我会在技术术语首次出现时提供注释,以便非工程师也能阅读。

为了确保即使你不通读全文也能获得价值,我为每个元素都包含了“优先级”。如果你只挑选高优先级的项目,至少能保证最低限度的功能。

究竟什么是 "Harness"?

Harness 是一个连接模型、工具和人类以完成工作的系统。

在 OpenAI 的技术博客“展开 Codex 代理循环”(2026 年 1 月,Michael Bolin)中,Codex harness 被描述为“作为所有 Codex 体验基础的核心代理循环和执行逻辑”(https://openai.com/index/unrolling-the-codex-agent-loop/ )。

代理循环指的是这个重复过程:

  • 接收用户输入
  • 查询模型进行思考
  • 执行模型选择的工具
  • 显示结果并让其再次思考

运行这个循环的是 Codex 端,而不是模型。

用一个公司来类比:

Astra = 一位极其有才华的员工的头脑。Harness = 这位员工工作的公司本身。雇佣规则、内部 Wiki、操作流程、内部系统访问权限、审批规则、检查流程和同事。

一个常见的错误是草率地总结“AGENTS.md = Harness”。AGENTS.md 只是 Harness 的一部分。就像一家公司不能仅靠一本分发的手册来运作一样。

实际上,通过结合 AGENTS.md、Skills、MCP、Hooks、权限设置、执行环境、浏览器和 Subagents 等元素来创建一个“舒适的工作环境”的全部努力,被称为 Harness Engineering。本文正是在这个意义上使用这个术语。

Astra 发布实际改变了什么?

有三点,都是 OpenAI 官方声明的。

  1. OpenAI 同时改进了大脑和环境

当 Astra 发布时,OpenAI 明确声明他们更新了 Codex harness,报告称在 Mind2Web 浏览器操作基准测试中,任务完成速度比 GPT-5.6 Sol 环境快了 1.9 倍。

在 OSWorld 2.0 中,Astra 得分为 72.6%,而 GPT-5.6 Sol 为 65.7%。此外,所需时间的模拟评估报告称,每个任务从大约 75 分钟减少到大约 40 分钟。

这里需要谨慎:这些是 OpenAI 自己公布的数据,并且是在特定条件下的基准测试结果。无法保证在你的环境中也能快 1.9 倍。

然而,要点很明确:速度提升来自于模型和执行环境的结合,而不仅仅是模型本身。

  1. Astra 读取“周围指令”的能力大大增强

这是对实际工作最有效的改变。

OpenAI 的模型指南指出,虽然 Astra 具有更强的指令遵循能力,但它也可能对包含在 Skills 和 AGENTS.md 等文件中的指令更加敏感。它强烈建议审计 Skills 和模型可访问的其他文件(https://developers.openai.com/api/docs/guides/latest-model )。

同一份文档包含了一个更具体的警告:技能文件中不明确或相互矛盾的指令可能导致模型在早期阶段停止并阻塞工作。

情况是这样的:

大脑变得更聪明了。因此,它比以往更忠实地遵循好的和坏的规则。

假设你从去年开始一直在添加的 AGENTS.md 中残留了一条无用的句子。Sol 可能会适当地忽略它。Astra 会严格遵循它。

  1. 委托和记忆处理的变化

根据官方公告,Astra 现在可以在 Codex 内跨上下文窗口维护笔记,避免每次都将累积的细节重新压缩成一个摘要。这减少了长时间任务中的信息丢失。

然而,截至 2026 年 9 月 7 日,这是一个实验性功能。它必须在 config.toml 中显式启用,并且默认是关闭的。OpenAI 已宣布它将在未来几周内成为 Astra 的默认功能,但就目前而言,除非你自己添加设置,否则它不会生效。

另一方面,模型指南也指出,对于 Astra,“委托给 Subagents 的频率可能没有你的工作流程所期望的那么高。”这意味着如果你想要并行化,你必须在 Harness 端指定何时进行委托。

指南还提到,Astra 倾向于详细、格式化的回复,因此你应该指定所需的风格和结构。

所有这些都指向:“不要因为模型聪明就放任不管”,而是“因为它聪明,它会完全按照指定的方式行动,所以请修正你的规范。”

Harness 的 8 个元素图谱

这里列出的 8 个元素和后面描述的 7 个成熟度级别并非 OpenAI 的官方定义。它们是根据目前看到的官方信息,为本文独特组织的。请将其作为一个实用的框架。

以下是包含公司类比和优先级的图谱:

  1. AGENTS.md | 雇佣规则与基本政策 | 优先级:最高
  2. docs / Context | 内部 Wiki 与手册 | 优先级:高
  3. Skills | 标准操作流程 | 优先级:高
  4. MCP / Plugins | 与内部系统的连接 | 优先级:中
  5. Environment | 电脑、办公桌、工作环境 | 优先级:高
  6. Permissions / Sandbox | 权限与审批规则 | 优先级:最高
  7. Hooks / Tests | 自动检查与审查 | 优先级:中
  8. Browser / Subagents | 眼睛、双手、下属 | 优先级:中

初学者应从 1 和 6 开始。原因很简单:仅仅通过组织好这两项,你就为其他元素奠定了基础。但这并不意味着你不应该检查其他元素。通过 MCP 连接的外部服务的权限、Skills 中的流程以及 Hooks 执行的脚本,都是安全验证的对象。特别是因为 MCP 是对外的连接,请单独检查目标是否可信以及授予的权限是否最小化。

以下是每个元素的解释。

指令与知识层 | AGENTS.md, docs, Skills

AGENTS.md

它是什么:放置在仓库根目录下的一个 Markdown 文件。Codex 在开始工作前会读取它,并将其视为项目特定的规则。

它的作用:你可以避免在每个提示词中都写上像“始终用这个命令运行测试”或“不要碰这个目录”这样的前提。

几乎每个人在这里犯的错误都是塞得太多。

OpenAI 的技术博客“Harness 工程:在代理优先的世界中利用 Codex”(2026 年 2 月 11 日,Ryan Lopopolo)描述了内部失败。尝试一个庞大的 AGENTS.md 导致了上下文压力、遗留旧规则以及对重要事项的混淆(https://openai.com/index/harness-engineering/ )。

该团队转而将 AGENTS.md 作为一个大约 100 行的“地图”来运作。细节放在 docs 下,AGENTS.md 只是指向它们。

与其让一位才华横溢的新员工记住一本 1000 页的规则手册,不如给他们一张指南地图,上面写着:“卡住了就看这个架子。”这就是区别。

上下文是一种有限的资源。庞大的指令文件会挤掉任务本身或需要读取的代码位置。

一个地图风格的 AGENTS.md 通常看起来像这样:

▼ 从这里复制

AGENTS.md

这个项目是什么?

(1-3 行。你在做什么,谁在使用它?)

首先阅读这些

  • 设计策略:docs/architecture.md
  • 目录结构:docs/structure.md
  • 术语表:docs/glossary.md
  • 过去的失败与修复:docs/postmortems.md

要遵循的规则

  • 测试:全部用(实际命令)运行,并且在存在失败的情况下不要报告完成。
  • 禁止区域:(列出路径)
  • 提交前:(linter / formatter 命令)

完成的定义

仅在满足以下所有条件时报告“完成”:

  • 测试通过
  • 变更意图可以用一段话解释
  • 自我验证了意外的副作用

如有疑问

不要做假设;至少提出两个选项并询问我。

指令优先级

  1. 我(用户)的即时指令
  2. 本 AGENTS.md
  3. Skills 中的流程 你可以忽略与更高级别指令冲突的低级别指令。如果你跳过了某条指令,请报告其名称。

▲ 复制到这里

最后的“指令优先级”对于 Astra 及以后的模型特别有效。模型指南明确指出要澄清用户指令还是技能指令优先。

docs / Context

它是什么:AGENTS.md 引用的实际知识库。设计文档、架构图、术语表、过去的决策记录等。

它的作用:Codex 只在必要时读取它们,因此它们不会持续消耗上下文。

在 Harness Engineering 文章中,引人注目的是对初始进展缓慢的解释。这并不是因为 Codex 能力不足,而是因为“环境定义不足”。

缺少的是工具、抽象、内部结构以及 Codex 可读形式的信息。

所以当某件事失败时,团队的反应不是“让它再努力一点”。而是思考,“缺少了哪种能力,我们如何让它对代理可读且可执行?”

这就是 Harness 工程的精髓。修复环境,而不是提示词。

需要澄清的是,这是一个 OpenAI 内部的案例研究。一个 3 人团队在 5 个月内,用 0 行人工编写的代码产生了大约 100 万行代码和 1500 个 PR;这并不意味着普通用户可以复现同样的结果。

Skills

它是什么:一个 SKILL.md 格式的文件。它将指令、参考资料以及(如有必要)脚本捆绑在一起,以便每次以相同的流程执行特定任务。

它的作用:你可以从复制粘贴好的提示词,转变为保存工作本身。

例如,如果你将“文章创作”做成一个 Skill,其内容可能包括:

  • 研究
  • 事实核查
  • 标题建议
  • 结构设计
  • 写作
  • 禁用表达检查
  • 最终审查

对于 Astra 及以后的模型,要注意不要添加太多。Skill 的名称和描述会被加载到上下文中,所以如果数量增加,描述会被截断,从而难以判断选择哪个。如果描述相互矛盾,或者都声称“用我”,模型可能会加载一个不适合任务的 Skill。

Skills 用于“仅特定任务需要的流程”,而不是“每次都需要执行的指令”。混淆这一点,与把所有东西都写在 AGENTS.md 里是一样的错误。

手脚层 | MCP, Plugins, Environment

MCP / Plugins

它是什么:MCP 是一个将 Codex 连接到外部工具和数据的标准,可在 CLI 和 IDE 扩展中使用。Plugins 是一种将 Skills、Connectors 和 MCP 工具打包在一起的机制。在 Codex 中,它们在 ChatGPT 桌面应用和 CLI 中可用,但在 IDE 扩展中不可用。

它的作用:允许 Codex 访问外部文档、浏览器、设计工具等。

无论 Astra 多么聪明,如果它无法获取必要的信息,那也是徒劳。就像一个没有内部系统账号的优秀员工。

但是,我将优先级设置为中。你添加的 MCP 越多,工具选择就越多,上下文消耗也越大。正确的方法是只添加你当前难以触及的内容。

Environment

它是什么:实际动手操作的脚手架,例如依赖项、设置流程、测试执行方法和工作目录结构。

它的作用:Codex 可以自我驱动到“运行和验证”的地步。如果缺少这一点,Codex 就退化为一个纯粹的代码编写者。

一个简单的检查方法是,从一个干净的状态开始,让它“设置环境、通过测试并报告结果”。它在哪一步停下来,那里就正好缺少什么。

使用 Git worktree 为每个任务分离目录,可以使多个并行任务更难发生冲突。

安全与检查层 | Permissions, Sandbox, Hooks

Permissions / Sandbox

它是什么:两个独立的设置,决定 Codex 可以自动执行多少操作。沙箱决定了文件和网络的可达范围,而审批策略决定了在何处需要人工确认。

根据官方 Codex 文档,CLI 和 IDE 扩展的初始设置限制为无网络访问,并且只能在活动工作区内写入(https://developers.openai.com/codex/sandbox )。

沙箱有 3 个级别:

  • read-only:可以读取但不能写入。用于咨询和规划。
  • workspace-write:可以在工作文件夹和临时目录内写入。这是标准设置。
  • danger-full-access:可以写入任何地方。实际上移除了沙箱。

常用的 Auto 预设是 workspace-write 和“仅在必要时请求批准”的组合。当 Codex 试图编辑工作区外或接触网络时,它会停止并检查。

如果你想在会话中切换,可以使用 /permissions 命令。一个现实的操作是:规划阶段使用 read-only,执行阶段使用 Auto。

我想让你明白的是,自主性不等于允许一切。

仅仅因为审批很烦人就逃到 danger-full-access 是最低效的解决方案。如果它只需要写入特定目录,那就只允许那个位置。

▼ 从这里复制

【Codex CLI:规划和工作的配置示例】

目标是 Codex CLI 0.134.0 或更高版本。

设置保存在三个文件中:“Common”、“Planning”和“Working”。

不要将整个解释粘贴到一个配置文件中。只将相应的设置写入每个目标位置。

目标是标准 Codex 设置。

■ 1. 通用设置

路径:~/.codex/config.toml

不要删除现有设置;添加或更改以下项目。如果存在相同的 [sandbox_workspace_write],请编辑其内部以避免重复标题。

[sandbox_workspace_write]

network_access = false

仅在需要时指定额外的批准目录。

writable_roots = ["/absolute/path/to/approved-directory"]

仅当需要额外的写入目标时,移除 writable_roots 行开头的 #,并将示例路径替换为实际的绝对路径。

■ 2. 规划设置

路径:~/.codex/plan.config.toml

将这两行保存在一个与通用设置分开的文件中。

approval_policy = "on-request"

sandbox_mode = "read-only"

■ 3. 工作设置

路径:~/.codex/work.config.toml

将这两行保存在另一个单独的文件中。

approval_policy = "on-request"

sandbox_mode = "workspace-write"

■ 如何使用

不要将启动命令写入配置文件;在项目文件夹的终端中运行它。

要启动进行规划:

codex --profile plan

要启动进行工作:

codex --profile work

所选配置文件的设置将叠加在通用设置之上。

由于项目端设置和组织限制也适用,请在启动后使用 /permissions 检查实际权限。

注意:network_access = false 是在沙箱内运行的命令的通信设置。请单独检查 MCP 等外部连接的权限。

▲ 复制到这里

扩展一个边界与完全丢弃该边界是完全不同的。网络访问也是如此;只有对于真正需要获取依赖包的项目,这才是一个有效的判断。

Hooks / Tests

它是什么:一种将你自己的脚本或 MCP 工具插入到 Codex 处理过程中的机制。它作为 Stable 功能默认启用。

它的作用:例如,这些自动化操作:

  • 在即将执行工具之前阻止危险命令
  • 检查 API 密钥等秘密信息
  • 编辑文件后立即运行 linter
  • 在工作结束时验证测试是否通过

这是将“小心不要犯错”转变为“系统在出错时会停止”。

然而,OpenAI 本身警告说,应将 Hooks 视为护栏,而不是绝对的强制边界,因为 Codex 可能通过不同的工具路径执行等效的工作。

真正想要阻止的事情应该在沙箱和权限级别阻止,而不是 Hooks。Hooks 是叠加在其上的第二层网络。

眼睛与团队层 | Browser, Subagents

Browser / Computer Use

让它构建一个网站,然后以“我写了代码,完成了”结束是一种浪费。

注意:这里描述的 Computer Use(实际屏幕操作)目前是 Codex 桌面应用版本的一个功能。本章处理的内置 Browser / Computer Use 在 ChatGPT 桌面应用中使用。内置 Browser 在 Codex CLI 或 IDE 扩展中不可用。对于 CLI/IDE 中的浏览器操作,请准备其他机制,如 MCP 或 Playwright。

你应该让它这样做:

  • 打开浏览器
  • 显示实际屏幕
  • 尝试操作
  • 发现损坏的部分
  • 修复它们
  • 再次检查

Astra 是在计算机操作基准测试中显著改进的一代,因此这个过程值得委托。在 OSWorld 2.0 中时间从 75 分钟减少到 40 分钟的报告正是关于这个的。

在 Harness Engineering 案例研究中,他们创建了一个环境,让 Codex 能够处理 Chrome DevTools Protocol、DOM、截图、日志和指标,以处理从错误复现到修复和验证的所有事情。

Subagents

它是什么:Codex 将工作分配给多个子代理的机制。每个子代理都有独立的上下文。

它的作用:并行化读取密集型、独立的任务,如研究、测试、日志分析和总结。

两个注意事项:

一是多个代理同时编写相同的代码会发生冲突。并行化写入任务时要小心。

另一个是,令牌消耗会增加。速度变快了,但成本并没有降低。

具体到 Astra,模型指南指出委托频率可能低于预期。如果你想要并行化,请在 AGENTS.md 或提示词中明确指定:“你可以拆分研究任务并并行运行它们。”

Astra 时代的逆转 | 盘点,而非添加

我已经列出了 8 个元素,但我想传达的最重要的事情恰恰相反。

为 Astra 做的第一件事是对现有指令进行盘点。OpenAI 也建议审计模型引用的指令,例如 Skills 和 AGENTS.md。保留必要的指令,填补空白,并在验证后修复或减少陈旧/矛盾的指令。

OpenAI 指南中使用的动词是“审计”,而不是“添加”。

来自预先验证了 Astra 的团队的报告也指向了同一方向。AI 编码工具提供商 Kilo 在一篇评论中写道,Astra 明显需要更少的 AGENTS.md 脚手架,并且过去一年中积累的大部分“防止模型偏离轨道的指令”现在都是不必要的。他们甚至建议,如果你有一个臃肿的代理文件,尝试删除一半然后重试(https://blog.kilo.ai/p/gpt-6-astra-what-we-learned-previewing )。

这是一家公司的印象,并非官方观点。然而,这与官方指南中“相互矛盾的指令可能导致早期停止”的说法完全吻合。

模型越聪明,就越容易被旧指令绊倒。矛盾,但却是事实。

盘点最快的方式是由 Codex 自己完成。

▼ 从这里复制

请阅读此仓库中的 AGENTS.md、docs 下的所有内容以及所有已加载的 Skill 文件。暂时不要做任何更改。

假设使用 GPT-6 Astra 工作,请分类并报告以下内容:

【保留】仍然有效且实际上能改善你判断的指令。用一句话解释原因。

【删除候选】符合以下任何一项的项目。引用原文并提供理由。这不是删除决定,而是供人工考虑的列表。

  • 为纠正前几代模型而编写、现已不必要的指令。
  • 指向已更改的规范、路径或命令的指令。
  • 命令你执行你本来就会自然去做的事情的指令。
  • 与其他指令相矛盾的指令。

然而,如果存在任何微小的可能性,该指令是为了安全、保障或基于过往事故/事件而添加的,则不要将其归类为【删除候选】。相反,应将其归入单独的【需人工判断】类别,并说明你认为存在该可能性的原因。不要仅凭自己的判断就断定其“不必要”。

【重写】 意图正确但措辞模糊、冗余或优先级不明确的指令。提供重写提案。

【疑问】 阅读时难以判断其含义的描述。

最后,请务必报告以下两点:

  1. 如果存在实际阻碍了你或让你犹豫的指令,请提供确切的行号以及你犹豫的原因。
  2. 如果要将 AGENTS.md 压缩成一个约 100 行的索引,你会采用什么结构?

▲ 复制到此为止

由此产生的“删除候选”列表不应直接被完全删除。首先,要检查该指令被添加的原因、其历史,以及删除后会影响什么。那些在过往事故后添加的验证流程,不应仅仅因为 Codex 判断其“对当前自身不必要”就被移除。特别是对于安全或安保指令,应该由了解历史的人来做最终决定。只有在确认了添加原因且判断影响有限的情况下,才进行删除。如有疑问,则保留该指令。如果将其移至 docs,请留下清晰的路径,以便在需要时能从 AGENTS.md 可靠地引用它。

成熟度 | 你处于哪个阶段?

检查你所在的阶段。

Lv.0:每次都从头编写提示词。就像每天早上向一位有才华的员工从头解释一切。

Lv.1:拥有 AGENTS.mddocs。就像公司有了规章制度和手册。

Lv.2:拥有技能。例行工作的流程已确定。

Lv.3:连接了 MCP 和插件。能够独立访问必要的系统。

Lv.4:权限、钩子和测试已生效。存在自动执行和自动检查。

Lv.5:使用浏览器和子 Agent。能够独立验证和委派工作。

Lv.6:存在反馈循环。每次发生故障时,系统本身都会更新。

许多人处于 Lv.1。他们试图通过让 AGENTS.md 变得更厚来前进。那不是 Lv.2,那只是一个臃肿的 Lv.1。

Lv.6 在性质上有所不同。它不是关于添加新功能。它只是拥有一个操作规则:“如果同样的错误犯了两次,就将该修复反馈回 AGENTS.md、技能、钩子或测试中。”

这正是 OpenAI 在《Harness Engineering》一文中转向“持续修正而非一次性验证”的方向。

执行顺序 | 30 分钟、1 天、1 周

设定优先级。按此顺序执行。

前 30 分钟

  1. 运行本文开头的诊断提示词。
  2. 使用 /permissions 检查当前权限设置。如果你一直使用 danger-full-access,请先切换回 workspace-write
  3. 打开 AGENTS.md 并通读一遍。检查是否存在冗余、矛盾或过时的描述。100 行只是 OpenAI 内部的一个例子,并非绝对标准。关注内容是否组织有序,而不是行数。

1 天

  1. 运行清单提示词。仅在确认添加原因和影响后,才删除【删除候选】。对于【需人工判断】的条目,请在咨询了解历史的人后做出决定。
  2. 将已删除内容中有价值的部分移至 docs
  3. AGENTS.md 末尾添加“指令优先级”。
  4. 从一个干净的状态开始,要求它“设置并通过测试”,并记录它在何处停止。

1 周

  1. 选择一项你每周执行超过两次的任务,并将其转化为一个技能。
  2. 如果有一个你总是难以访问的外部数据源,通过 MCP 连接它。
  3. 将秘密信息检查或编辑后 linter 执行中的一项设为钩子。
  4. 确定一个记录失败信息以用于反馈的地方。

到这一步,你将能从 Lv.1 到达 Lv.4 的入口。

反向索引 | 按目标查找

想停止重复相同的解释 → AGENTS.md

Codex 引用旧信息 → 盘点 docs / 上下文

同一任务质量波动 → 技能

无法访问必要数据 → MCP / 插件

能写代码但无法进行验证 → 环境

担心它擅自行动,或审批太多 → 权限 / 沙箱

重复犯同样的错误 → 钩子 / 测试

未注意到布局错误 → 浏览器 / 计算机使用

研究耗时太长 → 子 Agent

切换到 Astra 后任务中途停止 → 首先检查停止通知、审批请求和错误。如有必要,在 CLI 中使用 /status 检查设置和使用情况。如果怀疑存在冲突指令,盘点 AGENTS.md 和技能。

下一场竞争是环境,而非智力

选择模型的时代基本结束了。

Astra 足够智能,并且会完全按照指令行动。这就是为什么你留下的指令决定了结果。

从“写好提示词”的游戏,转变为“设计好工作环境”的游戏。Astra 是最终确定这一转变的模型。

你今天只需要做一件事。打开 AGENTS.md 并通读一遍。这就是起点。

感谢你阅读至此。

我在一个免费的公开聊天中分享使用 ChatGPT、Claude 和 Copilot 节省时间和进行 AI 副业的具体例子。如果你想成为“能用 AI”的那一方,现在就加入吧。

👉 https://x.gd/yVPeS

二次创作

使用 YouMind 创作爆款文章

收集素材、拆解爆点、生成视觉资产、撰写内容,并在一个 AI 工作空间里完成分发。

了解 YouMind
写给创作者

把你的 Markdown 变成干净的 𝕏 文章

图片上传、表格、代码块,往 𝕏 上手动重排太痛苦。YouMind 把整篇 Markdown 一键转成干净、可直接发布的 𝕏 文章草稿。

试试 Markdown 转 𝕏

更多可拆解样本

近期爆款文章

探索更多爆款文章