Em 3 de setembro de 2026, a OpenAI lançou o GPT-6 Astra.
Muitas pessoas simplesmente alteram as configurações do modelo Codex para Astra e param por aí.
No entanto, a OpenAI não atualizou apenas o modelo naquele dia. O anúncio oficial afirma explicitamente que eles atualizaram o 'Harness' do Codex junto com o Astra (Fonte: OpenAI "GPT-6 Astra: Uma nova geração de inteligência" https://openai.com/index/gpt-6-astra/ ).
O cérebro e o ambiente no qual o cérebro funciona. A OpenAI reconstruiu ambos simultaneamente.
No entanto, se instruções pouco claras ou regras contraditórias permanecerem, o Astra pode parar no meio da tarefa ou pedir esclarecimentos constantes.
Neste artigo, fornecerei estas três coisas:
- Uma explicação completa dos 8 elementos que compõem o Codex Harness (com prioridades)
- 4 prompts de diagnóstico e inventário que você pode copiar e colar imediatamente
- Uma sequência de execução para saber por onde começar em apenas 30 minutos hoje
Não adianta segurar, então vou compartilhar o prompt mais importante primeiro. Este prompt faz o Codex relatar automaticamente o status atual do seu projeto.
▼ Copie daqui
Você é um Designer de Codex Harness.
O objetivo é criar um estado onde o GPT-6 Astra possa "concluir tarefas com segurança, de forma reproduzível e até o fim, sem precisar de instruções detalhadas a cada vez" neste projeto.
Primeiro, não faça nenhuma alteração. Revise a configuração atual do projeto, os arquivos de configuração e os recursos disponíveis, e diagnostique o seguinte:
- AGENTS.md: O propósito, as regras a seguir, as proibições, as condições de conclusão e as referências estão claros?
- docs / context: A estrutura está organizada para que você encontre as informações necessárias por conta própria? Existem descrições antigas, redundantes ou contraditórias?
- Skills: Quais tarefas repetitivas devem ser transformadas em Skills? Por outro lado, quais Skills são desnecessárias?
- MCP / Plugins: Quais ferramentas externas ou conexões de dados estão faltando?
- Ambiente: Você consegue reproduzir dependências, configuração e execução de testes por conta própria?
- Permissões / Sandbox: Você recebeu permissões excessivas? Por outro lado, há muitas aprovações pendentes que impedem o trabalho?
- Hooks / Testes: As verificações de pré-execução, detecção de segredos, testes e verificações de conclusão podem ser automatizadas?
- Navegador / Uso do Computador: Existem tarefas que devem ser verificadas operando o produto final?
- Subagentes: Existem tarefas como pesquisa, revisão ou teste que seriam mais rápidas se fossem paralelizadas?
- Ciclo de Feedback: Existe um mecanismo para realimentar falhas passadas ou instruções de correção no AGENTS.md / docs / Skill / Hook / Teste?
Formato de saída: A. Avalie cada item em uma escala de 5 pontos B. Top 5 deficiências críticas C. Coisas que podem ser corrigidas em 30 minutos hoje D. Coisas a serem sistematizadas em uma semana E. Arquivos a serem criados/alterados e propostas de alteração específicas F. Riscos de segurança/permissão G. Prioridade de implementação
Não invente configurações com base em suposições. Verifique os recursos e versões atualmente disponíveis do Codex antes de julgar. Indique claramente se os recursos são Experimental / Beta / Obsoleto.
Não altere arquivos, expanda permissões ou conecte-se a serviços externos até que eu tenha revisado estes resultados de diagnóstico.
▲ Copie até aqui
Executar isso antes de terminar a leitura economizará seu tempo mais tarde.
Público-Alvo e Uso Deste Artigo
Este artigo tem como alvo o Codex em 7 de setembro de 2026. O Codex é atualizado rapidamente, então verifique a data antes de ler.
Estão incluídos os 8 componentes do harness, 7 níveis de maturidade e 4 modelos de prompt prontos para copiar e colar.
O público-alvo são "pessoas que usam o Codex, mas pararam depois de escrever o AGENTS.md." Fornecerei anotações para termos técnicos na primeira aparição para que não-engenheiros também possam ler.
Para garantir valor mesmo que você não leia tudo, incluí a "Prioridade" para cada elemento. Se você pegar apenas os de alta prioridade, pelo menos funcionará em um nível mínimo.
O que Exatamente é um "Harness"?
Um harness é um sistema que conecta modelos, ferramentas e humanos para realizar o trabalho.
No blog técnico da OpenAI "Desvendando o loop de agente do Codex" (janeiro de 2026, Michael Bolin), o harness do Codex é descrito como "o loop de agente principal e a lógica de execução que serve como base para todas as experiências do Codex" (https://openai.com/index/unrolling-the-codex-agent-loop/ ).
O loop de agente se refere a esta repetição:
- Receber entrada do usuário
- Consultar o modelo para pensar
- Executar a ferramenta escolhida pelo modelo
- Mostrar o resultado e deixá-lo pensar novamente
É o lado do Codex, não o modelo, que executa este loop.
Usando uma analogia empresarial:
Astra = O cérebro de um funcionário extremamente talentoso. Harness = A própria empresa onde esse funcionário trabalha. Regras de emprego, Wiki interno, procedimentos operacionais, direitos de acesso a sistemas internos, regras de aprovação, processos de inspeção e colegas.
Um erro comum é resumir preguiçosamente "AGENTS.md = Harness." AGENTS.md é apenas uma parte do harness. Assim como uma empresa não funciona apenas com um livro de regras distribuído.
Na prática, todo o esforço de criar um "ambiente de trabalho confortável" combinando elementos como AGENTS.md, Skills, MCP, Hooks, configurações de permissão, ambientes de execução, navegadores e Subagentes é chamado de Harness Engineering. Este artigo usa o termo nesse sentido.
O Que Realmente Mudou com o Lançamento do Astra?
Existem três coisas, todas declaradas oficialmente pela OpenAI.
- A OpenAI melhorou o cérebro e o ambiente simultaneamente
Quando o Astra foi anunciado, a OpenAI afirmou explicitamente que atualizou o harness do Codex, relatando que a conclusão de tarefas foi 1,9x mais rápida em comparação com o ambiente GPT-5.6 Sol no benchmark de operação de navegador Mind2Web.
No OSWorld 2.0, o Astra obteve 72,6% em comparação com os 65,7% do GPT-5.6 Sol. Além disso, as avaliações de simulação para o tempo necessário relataram uma redução de aproximadamente 75 minutos para cerca de 40 minutos por tarefa.
Cautela é necessária aqui: estes são números publicados pela própria OpenAI e são resultados de benchmark sob condições específicas. Não há garantia de que será 1,9x mais rápido no seu ambiente.
No entanto, a conclusão é clara: os ganhos de velocidade vieram da combinação do modelo e do ambiente de execução, não apenas do modelo.
- O Astra lê "instruções circundantes" muito melhor
Esta é a mudança mais eficaz para o trabalho prático.
A orientação do modelo da OpenAI afirma que, embora o Astra tenha capacidades de seguir instruções mais fortes, ele também pode ser mais sensível a instruções contidas em arquivos como Skills e AGENTS.md. Recomenda-se fortemente auditar as Skills e outros arquivos acessíveis ao modelo (https://developers.openai.com/api/docs/guides/latest-model ).
O mesmo documento contém um aviso mais específico: instruções pouco claras ou contraditórias dentro de um arquivo de skill podem fazer com que o modelo pare e bloqueie o trabalho em um estágio inicial.
A situação é esta:
O cérebro ficou mais inteligente. Portanto, tornou-se mais fiel tanto às regras boas quanto às ruins do que antes.
Suponha que uma frase inútil permaneça em um AGENTS.md ao qual você vem adicionando desde o ano passado. O Sol pode tê-la ignorado apropriadamente. O Astra a seguirá estritamente.
- Mudanças na delegação e no gerenciamento de memória
De acordo com o anúncio oficial, o Astra agora pode manter anotações entre janelas de contexto dentro do Codex, evitando a necessidade de recomprimir detalhes acumulados em um único resumo a cada vez. Isso reduz a perda de informações durante tarefas longas.
No entanto, em 7 de setembro de 2026, este é um recurso experimental. Ele deve ser explicitamente ativado em config.toml e está desativado por padrão. A OpenAI anunciou que se tornará um recurso padrão do Astra nas próximas semanas, mas por enquanto, não funcionará a menos que você mesmo adicione a configuração.
Por outro lado, a orientação do modelo também observa que, para o Astra, "a delegação para Subagentes pode não ser tão frequente quanto seu fluxo de trabalho espera." Isso significa que, se você deseja paralelização, deve especificar quando delegar no lado do harness.
A orientação também menciona que o Astra tende a respostas detalhadas e formatadas, então você deve especificar o estilo e a estrutura necessários.
Tudo isso aponta para: "Não deixe apenas porque o modelo é inteligente", mas sim "Porque é inteligente, ele se moverá exatamente como especificado, então corrija suas especificações."
O Mapa de 8 Elementos do Harness
Os 8 elementos listados aqui e os 7 níveis de maturidade descritos posteriormente não são definições oficiais da OpenAI. Eles são organizados de forma única para este artigo com base nas informações oficiais vistas até agora. Use-os como uma estrutura prática.
Aqui está o mapa com analogias empresariais e prioridades:
- AGENTS.md | Regras de Emprego e Política Básica | Prioridade: Mais Alta
- docs / Contexto | Wiki Interno e Manuais | Prioridade: Alta
- Skills | Procedimentos Operacionais Padrão | Prioridade: Alta
- MCP / Plugins | Conexão com Sistemas Internos | Prioridade: Média
- Ambiente | PC, Mesa, Ambiente de Trabalho | Prioridade: Alta
- Permissões / Sandbox | Autoridade e Regras de Aprovação | Prioridade: Mais Alta
- Hooks / Testes | Verificações e Inspeções Automáticas | Prioridade: Média
- Navegador / Subagentes | Olhos, Mãos, Subordinados | Prioridade: Média
Iniciantes devem começar com 1 e 6. A razão é simples: apenas organizando esses dois, você solidifica a base para outros elementos. No entanto, isso não significa que você não deva verificar os outros. Permissões para serviços externos conectados via MCP, procedimentos em Skills e scripts executados por Hooks são todos assuntos para verificação de segurança. Especialmente porque o MCP é uma conexão com o exterior, verifique separadamente se o destino é confiável e se as permissões concedidas são mínimas.
Abaixo está uma explicação de cada um.
Camada de Instrução e Conhecimento | AGENTS.md, docs, Skills
O que é: Um arquivo markdown colocado na raiz do repositório. O Codex o lê antes de começar a trabalhar e o trata como regras específicas do projeto.
O que faz: Você pode evitar escrever premissas como "Sempre execute testes com este comando" ou "Não toque neste diretório" em cada prompt.
A falha que quase todo mundo comete aqui é o excesso de informação.
O blog técnico da OpenAI "Harness engineering: alavancando o Codex em um mundo agente-primeiro" (11 de fevereiro de 2026, Ryan Lopopolo) descreve falhas internas. Tentar um AGENTS.md massivo resultou em pressão de contexto, regras antigas deixadas para trás e confusão sobre o que era importante (https://openai.com/index/harness-engineering/ ).
A equipe mudou para operar o AGENTS.md como um "mapa" de cerca de 100 linhas. Os detalhes são colocados em docs, e o AGENTS.md simplesmente aponta para eles.
Em vez de fazer um novo contratado talentoso memorizar um livro de regras de 1.000 páginas, você dá a ele um mapa guia dizendo: "Olhe nesta prateleira se estiver preso." Essa é a diferença.
Contexto é um recurso finito. Arquivos de instrução massivos empurram a própria tarefa ou a localização do código a ser lido para fora.
Um AGENTS.md no estilo mapa geralmente se parece com isto:
▼ Copie daqui
AGENTS.md
O que é este projeto?
(1-3 linhas. O que você está fazendo, quem usa?)
Leia estes primeiro
- Política de Design: docs/architecture.md
- Estrutura de Diretórios: docs/structure.md
- Glossário: docs/glossary.md
- Falhas Passadas e Correções: docs/postmortems.md
Regras a seguir
- Testes: Execute todos com (comando real) e não relate conclusão com falhas restantes.
- Áreas proibidas: (Liste caminhos)
- Antes de commitar: (comandos linter / formatador)
Definição de Concluído
Relate "Concluído" somente quando todos os itens a seguir forem atendidos:
- Testes passam
- Intenção da alteração pode ser explicada em um parágrafo
- Auto-verificado quanto a efeitos colaterais não intencionais
Em caso de dúvida
Não faça suposições; apresente pelo menos duas opções e pergunte-me.
Prioridade de Instrução
- Minhas instruções imediatas (do usuário)
- Este AGENTS.md
- Procedimentos em Skills Você pode ignorar instruções de nível inferior que contradizem as de nível superior. Se pular uma instrução, relate seu nome.
▲ Copie até aqui
A "Prioridade de Instrução" final é especialmente eficaz para o Astra e modelos posteriores. A orientação do modelo afirma explicitamente para esclarecer se as instruções do usuário ou as instruções da skill têm precedência.
O que é: O repositório de conhecimento real referenciado pelo AGENTS.md. Documentos de design, diagramas de arquitetura, glossários, registros de decisões passadas, etc.
O que faz: O Codex só os lê quando necessário, então eles não consomem contexto constantemente.
O que é impressionante no artigo Harness Engineering é a explicação para o progresso inicial lento. Não foi porque o Codex faltava habilidade, mas porque "o ambiente estava subespecificado."
O que faltava eram ferramentas, abstrações, estruturas internas e informações em uma forma que o Codex pudesse ler.
Então, quando algo falhava, a reação da equipe não era "fazê-lo tentar mais." Era pensar: "Qual capacidade está faltando e como podemos torná-la legível e aplicável para o agente?"
Esta é a essência da engenharia de harness. Corrija o ambiente, não o prompt.
Para esclarecer, este é um estudo de caso interno da OpenAI. Uma equipe de 3 pessoas produziu cerca de 1 milhão de linhas e 1.500 PRs em 5 meses com 0 linhas de código escrito por humanos; isso não significa que usuários comuns podem reproduzir os mesmos resultados.
O que é: Um arquivo no formato SKILL.md. Ele agrupa instruções, materiais de referência e scripts, se necessário, para executar tarefas específicas com o mesmo procedimento todas as vezes.
O que faz: Você pode passar de copiar e colar bons prompts para salvar o próprio trabalho.
Por exemplo, se você transformar "Criação de Artigo" em uma Skill, o conteúdo seria:
- Pesquisa
- Verificação de fatos
- Propostas de título
- Design de estrutura
- Escrita
- Verificação de expressões proibidas
- Revisão final
A cautela para o Astra e posteriores é não adicionar muitas. Os nomes e descrições das Skills são carregados no contexto, então, se o número aumentar, as descrições são truncadas, dificultando julgar qual escolher. Se as descrições se contradisserem ou todas afirmarem "Use-me", o modelo pode carregar uma Skill que não se encaixa na tarefa.
Skills são para "procedimentos necessários apenas para tarefas específicas", não "instruções necessárias a cada vez." Confundir isso é o mesmo que escrever tudo no AGENTS.md.
Camada de Mãos e Pés | MCP, Plugins, Ambiente
O que é: MCP é um padrão para conectar o Codex a ferramentas e dados externos, utilizável tanto em extensões CLI quanto IDE. Plugins são um mecanismo para distribuir Skills, Conectores e ferramentas MCP juntos. No Codex, eles estão disponíveis no aplicativo de desktop ChatGPT e na CLI, mas não em extensões IDE.
O que faz: Permite que o Codex acesse documentos externos, navegadores, ferramentas de design, etc.
Não importa o quão inteligente o Astra seja, é inútil se ele não conseguir alcançar as informações necessárias. É como um funcionário brilhante sem uma conta no sistema interno.
No entanto, defini a prioridade como Média. Quanto mais MCPs você adicionar, mais opções de ferramentas aumentam e o contexto é consumido. A abordagem correta é adicionar apenas o que você está atualmente com dificuldade para alcançar.
O que é: O andaime para realmente mover as mãos, como dependências, procedimentos de configuração, métodos de execução de teste e estruturas de diretório de trabalho.
O que faz: O Codex pode se autoguiar até o ponto de "executar e verificar." Se isso estiver faltando, o Codex volta a ser apenas um escritor de código.
Uma maneira simples de verificar é pedir a partir de um estado limpo para "Configurar, passar nos testes e relatar resultados." Onde quer que pare é exatamente o que está faltando.
Usar Git worktree para separar diretórios para cada tarefa torna mais difícil que várias tarefas paralelas colidam.
Camada de Segurança e Inspeção | Permissões, Sandbox, Hooks
O que é: Duas configurações independentes que determinam quanto o Codex pode executar automaticamente. O sandbox determina o alcance de arquivos e redes, enquanto a política de aprovação determina onde solicitar confirmação humana.
De acordo com a documentação oficial do Codex, as configurações iniciais para extensões CLI e IDE são restritas a nenhum acesso à rede e escrita apenas dentro do espaço de trabalho ativo (https://developers.openai.com/codex/sandbox ).
O sandbox tem 3 níveis:
- somente-leitura: Pode ler, mas não escrever. Para consulta e planejamento.
- workspace-write: Pode escrever dentro da pasta de trabalho e diretórios temporários. Este é o padrão.
- danger-full-access: Pode escrever em qualquer lugar. Efetivamente remove o sandbox.
O preset Auto comumente usado é uma combinação de workspace-write e "pedir aprovação apenas quando necessário." O Codex irá parar e verificar ao tentar editar fora do workspace ou tocar na rede.
Se você quiser alternar no meio da sessão, pode usar o comando /permissions. Uma operação realista é somente-leitura para a fase de planejamento e Auto para a fase de execução.
O que quero que você entenda é que autonomia não significa permitir tudo.
Escapar para danger-full-access só porque as aprovações são irritantes é a solução menos eficaz. Se ele só precisa escrever em um diretório específico, apenas permita esse local.
▼ Copie daqui
【Codex CLI: Exemplos de configuração para Planejamento e Trabalho】
O alvo é Codex CLI 0.134.0 ou posterior.
As configurações são salvas em três arquivos: "Comum", "Planejamento" e "Trabalho".
Não cole esta explicação inteira em um único arquivo de configuração. Escreva apenas as configurações correspondentes em cada destino.
Os destinos são para configurações padrão do Codex.
■ 1. Configurações Comuns
Caminho: ~/.codex/config.toml
Não exclua as configurações existentes; adicione ou altere os seguintes itens. Se o mesmo [sandbox_workspace_write] existir, edite dentro dele para evitar cabeçalhos duplicados.
[sandbox_workspace_write]
network_access = false
Especifique diretórios aprovados adicionais apenas se necessário.
writable_roots = ["/caminho/absoluto/para/diretório-aprovado"]
Apenas se destinos de gravação adicionais forem necessários, remova o # no início da linha writable_roots e substitua o caminho de exemplo pelo caminho absoluto real.
■ 2. Configurações de Planejamento
Caminho: ~/.codex/plan.config.toml
Salve estas duas linhas em um arquivo separado das configurações comuns.
approval_policy = "on-request"
sandbox_mode = "read-only"
■ 3. Configurações de Trabalho
Caminho: ~/.codex/work.config.toml
Salve estas duas linhas em outro arquivo separado.
approval_policy = "on-request"
sandbox_mode = "workspace-write"
■ Como usar
Não escreva o comando de inicialização no arquivo de configuração; execute-o no terminal na pasta do projeto.
Para iniciar para planejamento:
codex --profile plan
Para iniciar para trabalho:
codex --profile work
As configurações do perfil selecionado serão sobrepostas às configurações comuns.
Como as configurações do lado do projeto e as restrições organizacionais também se aplicam, verifique as permissões reais com /permissions após a inicialização.
Nota: network_access = false é a configuração de comunicação para comandos executados dentro do sandbox. Verifique as permissões para conexões externas como MCP separadamente.
▲ Copie até aqui
Expandir um limite em um é completamente diferente de descartar o próprio limite. O mesmo se aplica ao acesso à rede; é um julgamento válido apenas para projetos que realmente precisam buscar pacotes de dependência.
O que é: Um mecanismo para inserir seus próprios scripts ou ferramentas MCP no meio do processamento do Codex. Está ativado por padrão como um recurso Estável.
O que faz: Por exemplo, estas automações:
- Parar comandos perigosos antes de executar uma ferramenta
- Inspecionar segredos como chaves de API
- Executar um linter imediatamente após editar um arquivo
- Verificar se os testes passam no final do trabalho
Trata-se de mudar de "tenha cuidado para não cometer erros" para "o sistema para se houver um erro."
No entanto, a própria OpenAI adverte para tratar os Hooks como guardrails, não como limites de aplicação absolutos, porque o Codex pode executar trabalho equivalente através de diferentes caminhos de ferramentas.
Coisas que você realmente deseja parar devem ser paradas no nível do sandbox e permissão, não nos Hooks. Os Hooks são a segunda rede colocada em cima.
Camada de Olhos e Equipe | Navegador, Subagentes
Fazer com que ele construa um site e terminar com "Eu escrevi o código, terminei" é um desperdício.
Nota: O Computer Use (operação real de tela) descrito aqui é atualmente um recurso para a versão do aplicativo de desktop do Codex. O Navegador / Computer Use integrado tratado neste capítulo é usado no aplicativo de desktop ChatGPT. O Navegador integrado não está disponível no Codex CLI ou extensões IDE. Para operações de navegador em CLI/IDE, prepare outros mecanismos como MCP ou Playwright.
Você deve fazê-lo fazer isso:
- Abrir o navegador
- Exibir a tela real
- Tentar operá-lo
- Encontrar partes quebradas
- Corrigi-las
- Verificar novamente
Astra é uma geração que melhorou significativamente em benchmarks de operação de computador, então este processo vale a pena ser delegado. O relatório de redução de tempo de 75 para 40 minutos no OSWorld 2.0 é exatamente sobre isso.
No estudo de caso do Harness Engineering, eles criaram um ambiente onde o Codex podia lidar com Chrome DevTools Protocol, DOM, screenshots, logs e métricas para lidar com tudo, desde a reprodução de bugs até a correção e verificação.
O que é: Um mecanismo onde o Codex divide o trabalho entre vários subagentes. Cada um tem um contexto independente.
O que faz: Paraleliza tarefas independentes e pesadas de leitura, como pesquisa, teste, análise de log e sumarização.
Duas cautelas:
Uma é que vários agentes escrevendo o mesmo código simultaneamente colidirão. Tenha cuidado ao paralelizar tarefas de escrita.
A outra é simplesmente que o consumo de tokens aumenta. Fica mais rápido, mas não mais barato.
E específico para o Astra, a orientação do modelo diz que a frequência de delegação pode ser menor do que o esperado. Se você deseja paralelização, especifique explicitamente no AGENTS.md ou prompts: "Você pode dividir tarefas de pesquisa e executá-las em paralelo."
A Inversão da Era Astra | Inventário, Não Adição
Listei 8 elementos, mas a coisa mais importante que quero transmitir é o oposto.
A primeira coisa a fazer para o Astra é um inventário das instruções existentes. A OpenAI também recomenda auditar as instruções que o modelo referencia, como Skills e AGENTS.md. Mantenha as instruções necessárias, preencha as lacunas e corrija ou reduza as instruções antigas/contraditórias após verificação.
O verbo usado na orientação da OpenAI é "auditar", não "adicionar."
Relatos de equipes que pré-verificaram o Astra apontam na mesma direção. A Kilo, uma provedora de ferramentas de codificação de IA, escreveu em uma revisão que o Astra claramente requer menos scaffolding de AGENTS.md, e a maioria das "instruções para evitar que o modelo descarrilasse" acumuladas no último ano agora são desnecessárias. Eles até sugeriram que, se você tem um arquivo de agente inchado, tente deletar metade dele e tentar novamente (https://blog.kilo.ai/p/gpt-6-astra-what-we-learned-previewing ).
Esta é a impressão de uma empresa, não uma visão oficial. No entanto, alinha-se perfeitamente com a orientação oficial que afirma que "instruções contraditórias podem causar paradas prematuras."
Quanto mais inteligente o modelo, mais ele é atrapalhado por instruções antigas. Paradoxal, mas verdadeiro.
O inventário é mais rápido quando feito pelo próprio Codex.
▼ Copie daqui
Por favor, leia o AGENTS.md, tudo em docs e todos os arquivos de Skill carregados neste repositório. Ainda não faça alterações.
Assumindo o trabalho com GPT-6 Astra, classifique e relate o seguinte:
【Manter】 Instruções que ainda são válidas e realmente melhoram seu julgamento. Explique o porquê em uma linha.
【Candidatos à Exclusão】 Itens que se enquadram em qualquer um dos seguintes. Cite o texto original e forneça um motivo. Esta não é uma decisão de excluir, mas uma lista para consideração humana.
- Instruções escritas para corrigir o curso de modelos de geração anterior que agora são desnecessárias.
- Instruções apontando para especificações, caminhos ou comandos que já mudaram.
- Instruções que mandam você fazer coisas que você naturalmente faz sem ser instruído.
- Instruções que contradizem outras instruções.
No entanto, se houver a menor possibilidade de a instrução ter sido adicionada por segurança, proteção ou devido a acidentes/incidentes passados, não a classifique como 【Candidato à Exclusão】. Em vez disso, coloque-a em uma categoria separada 【Requer Julgamento Humano】 e explique por que você acha que essa possibilidade existe. Não conclua que é "desnecessária" baseando-se apenas no seu próprio julgamento.
【Reescrever】 Instruções onde a intenção está correta, mas a redação é ambígua, redundante ou a prioridade não está clara. Forneça uma proposta de reescrita.
【Dúvidas】 Descrições que você achou difíceis de julgar o significado ao ler.
Por fim, certifique-se de relatar os dois pontos a seguir:
- Se houve instruções que realmente te bloquearam ou causaram hesitação, forneça a linha exata e o motivo da hesitação.
- Se o AGENTS.md fosse condensado em um índice de cerca de 100 linhas, qual estrutura você usaria?
▲ Copiar até aqui
A lista resultante de "Candidatos à Exclusão" não deve ser simplesmente excluída por completo. Primeiro, verifique por que essa instrução foi adicionada, seu histórico e o que é afetado se for removida. Procedimentos de verificação adicionados após acidentes passados não devem ser removidos só porque o Codex os julga "desnecessários para seu estado atual". Especialmente para instruções de segurança ou proteção, a pessoa que conhece o histórico deve tomar a decisão final. Prossiga com a exclusão apenas para itens onde o motivo da adição é confirmado e o impacto é considerado limitado. Em caso de dúvida, mantenha a instrução. Se for mover para docs, deixe um caminho claro para que possa ser referenciado de forma confiável a partir do AGENTS.md quando necessário.
Maturidade | Onde você está agora?
Verifique seu estágio.
Nv.0: Escrevendo prompts toda vez. Como explicar tudo do zero para um funcionário talentoso todas as manhãs.
Nv.1: AGENTS.md e docs existem. Como uma empresa que tem regras e manuais.
Nv.2: Skills existem. Procedimentos para trabalho rotineiro estão definidos.
Nv.3: MCP e Plugins estão conectados. Pode acessar sistemas necessários de forma independente.
Nv.4: Permissões, Hooks e Testes estão funcionando. Existem auto-execução e auto-inspeção.
Nv.5: Usando Browser e Subagentes. Pode verificar de forma independente e delegar trabalho.
Nv.6: Ciclo de feedback existe. O próprio sistema é atualizado toda vez que ocorre uma falha.
Muitas pessoas estão no Nv.1. E tentam avançar tornando o AGENTS.md mais espesso. Isso não é Nv.2; é apenas um Nv.1 inchado.
O Nv.6 é diferente por natureza. Não se trata de adicionar novos recursos. É apenas ter uma regra operacional: "Se o mesmo erro for cometido duas vezes, realimente essa correção no AGENTS.md, Skill, Hook ou Test."
É para onde a OpenAI se moveu em direção à "correção contínua em vez de verificação única" no artigo Harness Engineering.
Sequência de Execução | 30 Minutos, 1 Dia, 1 Semana
Priorize. Faça nestas ordens.
Primeiros 30 Minutos
- Execute o prompt de diagnóstico no início deste artigo.
- Verifique as configurações de permissão atuais com
/permissions. Se você tem usadodanger-full-accessregularmente, volte paraworkspace-writeprimeiro. - Abra o AGENTS.md e leia-o. Verifique descrições redundantes, contraditórias ou desatualizadas. 100 linhas é apenas um exemplo interno da OpenAI, não um padrão absoluto. Observe se o conteúdo está organizado, em vez da contagem de linhas.
1 Dia
- Execute o prompt de inventário. Exclua 【Candidatos à Exclusão】 somente após confirmar o motivo da adição e o impacto. Para 【Requer Julgamento Humano】, decida após verificar com alguém que conhece o histórico.
- Mova partes valiosas do conteúdo excluído para
docs. - Adicione "Prioridade de Instrução" ao final do AGENTS.md.
- Peça a partir de um estado limpo para "Configurar e passar nos testes", e registre onde ele para.
1 Semana
- Escolha uma tarefa que você faz mais de duas vezes por semana e transforme-a em uma Skill.
- Se houver uma fonte de dados externa com a qual você sempre tem dificuldade para se conectar, conecte-a via MCP.
- Transforme uma verificação de informações secretas ou a execução de um linter pós-edição em um Hook.
- Decida um lugar para registrar falhas para feedback.
Neste ponto, você terá alcançado a entrada do Nv.4 a partir do Nv.1.
Índice Reverso | Por Objetivo
Quer parar de repetir a mesma explicação → AGENTS.md
Codex referencia informações antigas → Inventário de docs / Contexto
A qualidade da mesma tarefa oscila → Skills
Não consegue acessar dados necessários → MCP / Plugins
Consegue escrever código, mas não prosseguir para a verificação → Ambiente
Medo de agir por conta própria, ou muitas aprovações → Permissões / Sandbox
Mesmo erro repetido → Hooks / Testes
Não percebe quebras de layout → Browser / Computer Use
Pesquisa leva muito tempo → Subagentes
Começou a parar no meio da tarefa após mudar para o Astra → Primeiro verifique notificações de parada, solicitações de aprovação e erros. Se necessário, verifique configurações e uso com /status no CLI. Se houver suspeita de instruções contraditórias, faça um inventário do AGENTS.md e das Skills.
A Próxima Competição é o Ambiente, Não os Cérebros
O jogo de escolher modelos acabou em grande parte.
O Astra é inteligente o suficiente e se move exatamente como instruído. É por isso que o que você deixa como instruções determina o resultado.
Do jogo de escrever prompts bem ao jogo de projetar ambientes de trabalho bem. O Astra é o modelo que finalizou essa transição.
Você só precisa fazer uma coisa hoje. Abra o AGENTS.md e leia-o. Esse é o ponto de partida.
Obrigado por ler até aqui.
Compartilho exemplos específicos de economia de tempo e "bicos" de IA usando ChatGPT, Claude e Copilot em um chat aberto gratuito. Se você quer estar do lado que "sabe usar IA", junte-se agora.





