一项关键的 AI 工程技能是使用编码 Agent。你引导它们编写代码以及执行非代码任务(例如分析数据或管理系统操作)的能力,让你能够完成更多工作。
编码 Agent 的快速演进意味着这项技能也在迅速演变——比其他顶级 AI 工程技能更快。专有 Agent(如 Claude Code、Codex 和 Cursor)和开源 Agent(如 OpenCode 和 Pi)通过工具和模型的改进不断取得进展。因此,跟上编码 Agent 的使用方法需要一个持续的实验、构建和学习过程。
在采访了数十位顶尖 AI 工程师并反思我们团队自身使用编码 Agent 的经验后,我们发现了一个使用它们构建软件的一致的高层级工作流程。关键步骤如下:
- 规划。这包括 (i) 头脑风暴,可能涉及研究、实验以及理解现有代码库(如果有的话),以及 (ii) 编写一份包含需求、技术设计和架构的规范,然后生成执行计划。你可能还会审查计划,以质疑关键假设并检查安全性、过度工程化及其他漏洞。
- 执行,在此阶段你进行构建、测试和验证,并在 Agent 自主性和人工监督之间取得适当平衡。这包括 (i) 让 Agent 以校准过的自主性水平构建软件,以及 (ii) 通过自动化或人工检查来验证其输出。
- 部署与监控,在此阶段你 (i) 进行部署,可能通过 CI/CD 流水线或额外的人工关卡进行控制,以及 (ii) 使用 Agent 来监控日志、发现问题,并提出和执行改进措施。
这个高层级工作流程与在编码 Agent 出现之前通常用于构建软件的工作流程相似。现在,我们更少关注代码本身,而是更多地关注决定构建什么、设计架构、编写规范和验证输出。
每个步骤的持续时间在不同项目之间可能有很大差异,并且某些步骤可以被省略。例如,一个全新(即从零开始构建)原型的规范可能在一个快速编写的提示中粗略描述,而一个拥有众多用户的既有项目(即预先存在的)的规范可能需要投入更多精力来编写和验证。此外,该工作流程具有高度迭代性,熟练的开发人员知道何时来自后续步骤的反馈应引导他们回到更早的步骤。例如,如果验证失败,他们知道如何引导 Agent 重建并修复错误;或者如果监控发现问题,他们知道如何让 Agent 更新系统并重新部署。
为了在此工作流程中有效使用编码 Agent,关键技能包括:
- 引导工作流程
- 启用 Agent 自主性
- 审查工作成果
- 定制 Agent 及其环境
- 编码 Agent 基础
引导工作流程。你知道如何导航上述工作流程的每一步。这涉及决定在每个步骤上投入多少人工和 Agent 精力,以及何时返回更早的步骤进行迭代。它需要深入理解速度、成本、技术风险和人力投入之间的权衡,以便你能决定前期进行多少研究和规划、何时保留对关键工作的人工所有权、如何选择架构、在规划文档(如规范)中写入多少细节,以及如何将工作分解为可验证的步骤。
启用 Agent 自主性。在将编码 Agent 应用于工作流程的各个步骤时,你选择自主性水平:你是观察它并进行交互式来回沟通,还是将更大的工作块委托给它?以及你何时设定一个明确的目标并让它循环直到成功?此外,你必须为 Agent 仔细管理上下文。随着构建过程进入不同阶段,你将校准何时确保关键学习成果、用户反馈和假设(包括在构建过程中发生变化的假设)被捕获以供 Agent 后续使用。此外,你将决定何时设置多个 Agent 并行运行以处理分解后的任务——无论是通过人工还是更高级别的 Agent 来编排这些其他 Agent——以及如何在并发的 Agent 会话中管理人工注意力。你还知道如何安全地运行 Agent,适当地设置权限和操作关卡,以便在快速推进开发的同时,限制泄露、数据丢失或其他损害的风险。
审查工作成果。编码 Agent 的输出是不确定的。我们无法预先知道它会提出什么好主意,以及它会实现什么错误。审查和验证输出是确保你获得期望结果的关键步骤,如果不是,则重新引导 Agent。你将设计与任务相匹配的测试和验证,根据需要应用行为验证和功能验证。你还可能测试用户流程,也许让 Agent 提供截图作为成功或失败的证据。对于定性/行为评估,可以使用评估集,或许结合 LLM 作为评判者。
你还需要决定这些测试中有多少应该自动化。某些工作流程会将所有测试和验证完全自动化,以便 Agent 可以检查自己的工作并知道何时成功完成任务。你必须评估测试以确保它们符合你的目标,如果不符合,则进行改进。此外,你使用 Agent 化的代码审查,并运行 AI 驱动的安全和架构审计。当 AI 审查不足时,你明智地插入对代码行为的人工审查(并且,偶尔也对代码本身进行审查),同时探索如何进一步自动化此审查。最后,你验证部署,并能够使用 Agent 将监控和事件管理操作化。
定制 Agent 及其环境。你更新 Agent 及其工作环境的能力,使你的 Agent 能够高效地获取所需的上下文、访问工具,并正确高效地进行构建。你知道如何集成 Agent 技能、插件和 MCP 服务器。偶尔,当它们不再必要时(例如,当新模型取代了旧技能时),你会将它们移除。你可以使用钩子来自动化开发过程中可重复的部分,例如触发自动代码审查或 CI/CD 流水线。你还可以维护 Agent 工作的环境:更新常驻上下文(例如 AGENTS.md 或 CLAUDE.md),其中包含有关代码库、关键架构假设、代码样式和数据访问模式的信息。你知道如何在多个会话和并行 Agent 之间保持状态,并随着时间的推移积累 Agent 的学习成果,也许通过运行事后回顾来捕获哪些有效、哪些无效。你还知道如何建立一致的约定和结构,使你的代码库对 Agent 来说易于导航,以及如何偶尔清理 Agent 产生的技术债务。当你在团队中工作时,你会考虑如何协调不同开发者的 Agent 之间的上下文。
编码 Agent 基础。最后,为了在整个过程中做出良好的决策,你对编码 Agent 的工作原理有很好的理解:它们如何执行代码库搜索/检索,如何管理它们的上下文窗口,不同的操作(如添加工具调用、MCP 服务器等)如何影响上下文,Agent 和子 Agent 如何交互,以及 Agent 是如何通过将工具层包裹在 LLM 周围构建的。这使得 Agent 不再那么像一个黑盒,并帮助你识别失败模式,例如对简单解决方案进行过度工程化、因 Agent 缺乏明确的验证过程而失去严谨性、未能达到目标,或 Agent 操作有破坏文件或生产数据的风险。它还能帮助你推理 Agent 的状态,并通过给予它正确的指示或上下文来引导它。并且在监控运行时,这种理解使你能够更好地发现 Agent 何时偏离轨道并需要你的干预。
我发现社交媒体上关于如何使用编码 Agent 的描述往往过于简化。例如,有时让 Agent 自主运行数小时并消耗数百万或数千万个 Token 是有用的。但目前,超长周期任务的实际效用——尤其是相对于其成本而言——被夸大了。相反,大多数有效的编码 Agent 使用是一个复杂、高度迭代的过程,能够运用高技能判断进行干预会带来更好的结果。
你使用编码 Agent 的技能将使你成为一个高效的构建者。这也使你能够引导整个构建过程。我将在未来的文章中对此进行更多阐述。



![职场脱颖而出:30 个提升 Microsoft Copilot 使用效率的专业技巧 [2026 年 9 月]](/cdn-cgi/image/width=1920,quality=90,format=auto,metadata=none/https%3A%2F%2Fcms-assets.youmind.com%2Fmedia%2F1788628071941_pqwsyn_HRZ5ruNbsAA5DkG.jpg)

