Maximizando o Potencial do GPT-6 Astra: O Guia Completo para o Design de Harness Codex

@harisuke_ai
JAPONÊS07 de set. de 2026
136K
294
17
0
937

TL;DR

Este guia abrangente explora a 'Engenharia de Harness' para o GPT-6 Astra, mudando o foco da escrita de prompts para o design de ambiente. Ele detalha oito componentes principais para construir agentes de IA autônomos e confiáveis usando o framework Codex.

Em 3 de setembro de 2026, a OpenAI lançou o GPT-6 Astra.

Muitas pessoas simplesmente alteram as configurações do modelo Codex para Astra e param por aí.

No entanto, a OpenAI não atualizou apenas o modelo naquele dia. O anúncio oficial afirma explicitamente que eles atualizaram o 'Harness' do Codex junto com o Astra (Fonte: OpenAI "GPT-6 Astra: Uma nova geração de inteligência" https://openai.com/index/gpt-6-astra/ ).

O cérebro e o ambiente no qual o cérebro funciona. A OpenAI reconstruiu ambos simultaneamente.

No entanto, se instruções pouco claras ou regras contraditórias permanecerem, o Astra pode parar no meio da tarefa ou pedir esclarecimentos constantes.

Neste artigo, fornecerei estas três coisas:

  • Uma explicação completa dos 8 elementos que compõem o Codex Harness (com prioridades)
  • 4 prompts de diagnóstico e inventário que você pode copiar e colar imediatamente
  • Uma sequência de execução para saber por onde começar em apenas 30 minutos hoje

Não adianta segurar, então vou compartilhar o prompt mais importante primeiro. Este prompt faz o Codex relatar automaticamente o status atual do seu projeto.

▼ Copie daqui

Você é um Designer de Codex Harness.

O objetivo é criar um estado onde o GPT-6 Astra possa "completar tarefas com segurança, de forma reproduzível e até o fim, sem precisar de instruções detalhadas a cada vez" neste projeto.

Primeiro, não faça nenhuma alteração. Revise a configuração atual do projeto, os arquivos de configuração e os recursos disponíveis, e então diagnostique o seguinte:

  1. AGENTS.md: O propósito, as regras a seguir, as proibições, as condições de conclusão e as referências estão claros?
  2. docs / context: A estrutura está organizada para que você possa encontrar as informações necessárias por conta própria? Existem descrições antigas, redundantes ou contraditórias?
  3. Skills: Quais tarefas repetitivas devem ser transformadas em Skills? Por outro lado, quais Skills são desnecessárias?
  4. MCP / Plugins: Quais ferramentas externas ou conexões de dados estão faltando?
  5. Environment: Você consegue reproduzir dependências, configuração e execução de testes por conta própria?
  6. Permissions / Sandbox: Você recebeu permissões excessivas? Por outro lado, há muitas aprovações pendentes que interrompem o trabalho?
  7. Hooks / Tests: As verificações de pré-execução, detecção de segredos, testes e verificações de conclusão podem ser automatizadas?
  8. Browser / Computer Use: Existem tarefas que devem ser verificadas operando o produto final?
  9. Subagents: Existem tarefas como pesquisa, revisão ou teste que seriam mais rápidas se fossem paralelizadas?
  10. Feedback Loop: Existe um mecanismo para realimentar falhas passadas ou instruções de correção no AGENTS.md / docs / Skill / Hook / Test?

Formato de saída: A. Avalie cada item em uma escala de 5 pontos B. Top 5 deficiências críticas C. Coisas que podem ser corrigidas em 30 minutos hoje D. Coisas a serem sistematizadas dentro de uma semana E. Arquivos para criar/alterar e propostas de alteração específicas F. Riscos de segurança/permissão G. Prioridade de implementação

Não invente configurações com base em especulação. Verifique os recursos e versões atualmente disponíveis do Codex antes de julgar. Indique claramente se os recursos são Experimental / Beta / Depreciado.

Não altere arquivos, expanda permissões ou conecte-se a serviços externos até que eu tenha revisado estes resultados de diagnóstico.

▲ Copie até aqui

Executar isso antes de terminar a leitura vai economizar seu tempo mais tarde.

Público-Alvo e Uso Deste Artigo

O alvo é o Codex de 7 de setembro de 2026. O Codex é atualizado rapidamente, então verifique a data antes de ler.

Estão incluídos os 8 componentes do harness, 7 níveis de maturidade e 4 modelos de prompt prontos para copiar e colar.

O público-alvo são "pessoas que usam o Codex, mas pararam depois de escrever o AGENTS.md." Fornecerei anotações para termos técnicos na primeira aparição para que não-engenheiros também possam ler.

Para garantir valor mesmo que você não leia tudo, incluí a "Prioridade" para cada elemento. Se você pegar apenas os de alta prioridade, pelo menos funcionará em um nível mínimo.

O que é exatamente um "Harness"?

Um harness é um sistema que conecta modelos, ferramentas e humanos para realizar o trabalho.

No blog técnico da OpenAI "Desvendando o loop do agente Codex" (Janeiro de 2026, Michael Bolin), o harness do Codex é descrito como "o loop central do agente e a lógica de execução que serve como base para todas as experiências do Codex" (https://openai.com/index/unrolling-the-codex-agent-loop/ ).

O loop do agente se refere a esta repetição:

  • Receber entrada do usuário
  • Consultar o modelo para pensar
  • Executar a ferramenta escolhida pelo modelo
  • Mostrar o resultado e deixá-lo pensar novamente

É o lado do Codex, não o modelo, que executa este loop.

Usando uma analogia empresarial:

Astra = O cérebro de um funcionário extremamente talentoso. Harness = A própria empresa onde esse funcionário trabalha. Regras de emprego, Wiki interno, procedimentos operacionais, direitos de acesso a sistemas internos, regras de aprovação, processos de inspeção e colegas.

Um erro comum é resumir preguiçosamente "AGENTS.md = Harness." AGENTS.md é apenas uma parte do harness. Assim como uma empresa não funciona apenas com um livro de regras distribuído.

Na prática, todo o esforço de criar um "ambiente de trabalho confortável" combinando elementos como AGENTS.md, Skills, MCP, Hooks, configurações de permissão, ambientes de execução, navegadores e Subagentes é chamado de Harness Engineering. Este artigo usa o termo nesse sentido.

O que realmente mudou com o lançamento do Astra?

Existem três coisas, todas declaradas oficialmente pela OpenAI.

  1. A OpenAI melhorou o cérebro e o ambiente simultaneamente

Quando o Astra foi anunciado, a OpenAI afirmou explicitamente que atualizou o harness do Codex, relatando que a conclusão de tarefas foi 1,9x mais rápida em comparação com o ambiente GPT-5.6 Sol no benchmark de operação de navegador Mind2Web.

No OSWorld 2.0, o Astra obteve 72,6% contra 65,7% do GPT-5.6 Sol. Além disso, as avaliações de simulação para o tempo necessário relataram uma redução de aproximadamente 75 minutos para cerca de 40 minutos por tarefa.

Cautela é necessária aqui: estes são números publicados pela própria OpenAI e são resultados de benchmark sob condições específicas. Não há garantia de que será 1,9x mais rápido no seu ambiente.

No entanto, a conclusão é clara: os ganhos de velocidade vieram da combinação do modelo e do ambiente de execução, não apenas do modelo.

  1. O Astra lê "instruções ao redor" muito melhor

Esta é a mudança mais eficaz para o trabalho prático.

A orientação do modelo da OpenAI afirma que, embora o Astra tenha capacidades de seguir instruções mais fortes, ele também pode ser mais sensível a instruções contidas em arquivos como Skills e AGENTS.md. É fortemente recomendado auditar Skills e outros arquivos acessíveis ao modelo (https://developers.openai.com/api/docs/guides/latest-model ).

O mesmo documento contém um aviso mais específico: instruções pouco claras ou contraditórias dentro de um arquivo de skill podem fazer o modelo parar e bloquear o trabalho em um estágio inicial.

A situação é esta:

O cérebro ficou mais inteligente. Portanto, tornou-se mais fiel tanto às regras boas quanto às ruins do que antes.

Suponha que uma frase inútil permaneça em um AGENTS.md ao qual você vem adicionando desde o ano passado. O Sol pode tê-la ignorado apropriadamente. O Astra a seguirá estritamente.

  1. Mudanças na delegação e no gerenciamento de memória

De acordo com o anúncio oficial, o Astra agora pode manter anotações entre janelas de contexto dentro do Codex, evitando a necessidade de recomprimir detalhes acumulados em um único resumo a cada vez. Isso reduz a perda de informações durante tarefas longas.

No entanto, em 7 de setembro de 2026, este é um recurso experimental. Ele deve ser explicitamente ativado em config.toml e está desligado por padrão. A OpenAI anunciou que se tornará um recurso padrão do Astra nas próximas semanas, mas por enquanto, não funcionará a menos que você mesmo adicione a configuração.

Por outro lado, a orientação do modelo também observa que, para o Astra, "a delegação para Subagentes pode não ser tão frequente quanto seu fluxo de trabalho espera." Isso significa que, se você quiser paralelização, deve especificar quando delegar no lado do harness.

A orientação também menciona que o Astra tende a respostas detalhadas e formatadas, então você deve especificar o estilo e a estrutura necessários.

Tudo isso aponta para: "Não deixe apenas o modelo agir sozinho porque ele é inteligente", mas sim "Porque ele é inteligente, ele se moverá exatamente como especificado, então corrija suas especificações."

O Mapa de 8 Elementos do Harness

Os 8 elementos listados aqui e os 7 níveis de maturidade descritos posteriormente não são definições oficiais da OpenAI. Eles são organizados de forma única para este artigo com base nas informações oficiais vistas até agora. Use-os como uma estrutura prática.

Aqui está o mapa com analogias empresariais e prioridades:

  1. AGENTS.md | Regras de Emprego e Política Básica | Prioridade: Altíssima
  2. docs / Context | Wiki Interno e Manuais | Prioridade: Alta
  3. Skills | Procedimentos Operacionais Padrão | Prioridade: Alta
  4. MCP / Plugins | Conexão com Sistemas Internos | Prioridade: Média
  5. Environment | PC, Mesa, Ambiente de Trabalho | Prioridade: Alta
  6. Permissions / Sandbox | Autoridade e Regras de Aprovação | Prioridade: Altíssima
  7. Hooks / Tests | Verificações e Inspeções Automáticas | Prioridade: Média
  8. Browser / Subagents | Olhos, Mãos, Subordinados | Prioridade: Média

Iniciantes devem começar com 1 e 6. A razão é simples: apenas organizando esses dois, você solidifica a base para os outros elementos. No entanto, isso não significa que você não deva verificar os outros. Permissões para serviços externos conectados via MCP, procedimentos em Skills e scripts executados por Hooks são todos assuntos para verificação de segurança. Especialmente porque o MCP é uma conexão com o exterior, verifique separadamente se o destino é confiável e se as permissões concedidas são mínimas.

Abaixo está uma explicação de cada um.

Camada de Instrução e Conhecimento | AGENTS.md, docs, Skills

O que é: Um arquivo markdown colocado na raiz do repositório. O Codex o lê antes de começar a trabalhar e o trata como regras específicas do projeto.

O que faz: Você pode evitar escrever premissas como "Sempre execute testes com este comando" ou "Não toque neste diretório" em cada prompt.

A falha que quase todo mundo comete aqui é o excesso de informação.

O blog técnico da OpenAI "Harness engineering: alavancando o Codex em um mundo agente-primeiro" (11 de fevereiro de 2026, Ryan Lopopolo) descreve falhas internas. Tentar um AGENTS.md massivo resultou em pressão de contexto, regras antigas deixadas para trás e confusão sobre o que era importante (https://openai.com/index/harness-engineering/ ).

A equipe mudou para operar o AGENTS.md como um "mapa" de cerca de 100 linhas. Os detalhes são colocados em docs, e o AGENTS.md simplesmente aponta para eles.

Em vez de fazer um novo contratado talentoso memorizar um livro de regras de 1.000 páginas, você dá a ele um mapa guia dizendo: "Olhe nesta prateleira se estiver preso." Essa é a diferença.

Contexto é um recurso finito. Arquivos de instrução massivos empurram a própria tarefa ou a localização do código a ser lido para fora.

Um AGENTS.md no estilo mapa geralmente se parece com isto:

▼ Copie daqui

AGENTS.md

O que é este projeto?

(1-3 linhas. O que você está fazendo, quem usa?)

Leia estes primeiro

  • Política de Design: docs/architecture.md
  • Estrutura de Diretórios: docs/structure.md
  • Glossário: docs/glossary.md
  • Falhas e Correções Passadas: docs/postmortems.md

Regras a seguir

  • Testes: Execute todos com (comando real) e não reporte conclusão com falhas restantes.
  • Áreas proibidas: (Listar caminhos)
  • Antes de commitar: (comandos linter / formatador)

Definição de Pronto

Relate "Concluído" somente quando todos os itens a seguir forem atendidos:

  • Testes passam
  • Intenção da mudança pode ser explicada em um parágrafo
  • Auto-verificado quanto a efeitos colaterais não intencionais

Em caso de dúvida

Não faça suposições; apresente pelo menos duas opções e me pergunte.

Prioridade de Instrução

  1. Minhas instruções imediatas (do usuário)
  2. Este AGENTS.md
  3. Procedimentos em Skills Você pode ignorar instruções de nível inferior que contradizem as de nível superior. Se você pular uma instrução, reporte seu nome.

▲ Copie até aqui

A "Prioridade de Instrução" final é especialmente eficaz para o Astra e modelos posteriores. A orientação do modelo afirma explicitamente para esclarecer se as instruções do usuário ou as instruções da skill têm precedência.

O que é: O repositório de conhecimento real referenciado pelo AGENTS.md. Documentos de design, diagramas de arquitetura, glossários, registros de decisões passadas, etc.

O que faz: O Codex só os lê quando necessário, então eles não consomem contexto constantemente.

O que é impressionante no artigo Harness Engineering é a explicação para o progresso inicial lento. Não foi porque o Codex faltava habilidade, mas porque "o ambiente estava subespecificado."

O que estava faltando eram ferramentas, abstrações, estruturas internas e informações em uma forma que o Codex pudesse ler.

Então, quando algo falhava, a reação da equipe não era "fazê-lo tentar mais." Era pensar: "Qual capacidade está faltando, e como podemos torná-la legível e aplicável para o agente?"

Esta é a essência da engenharia de harness. Corrija o ambiente, não o prompt.

Para esclarecer, este é um estudo de caso interno da OpenAI. Uma equipe de 3 pessoas produziu cerca de 1 milhão de linhas e 1.500 PRs em 5 meses com 0 linhas de código escritas por humanos; isso não significa que usuários comuns podem reproduzir os mesmos resultados.

O que é: Um arquivo no formato SKILL.md. Ele agrupa instruções, materiais de referência e scripts, se necessário, para executar tarefas específicas com o mesmo procedimento todas as vezes.

O que faz: Você pode passar de copiar e colar bons prompts para salvar o trabalho em si.

Por exemplo, se você transformar "Criação de Artigo" em uma Skill, o conteúdo seria:

  • Pesquisa
  • Verificação de fatos
  • Propostas de título
  • Design de estrutura
  • Escrita
  • Verificação de expressões proibidas
  • Revisão final

A cautela para o Astra e posteriores é não adicionar muitas. Os nomes e descrições das Skills são carregados no contexto, então, se o número aumentar, as descrições são truncadas, dificultando julgar qual escolher. Se as descrições se contradisserem ou todas afirmarem "Use-me", o modelo pode carregar uma Skill que não se encaixa na tarefa.

Skills são para "procedimentos necessários apenas para tarefas específicas", não "instruções necessárias a cada vez." Confundir isso é o mesmo que escrever tudo no AGENTS.md.

Camada de Mãos e Pés | MCP, Plugins, Environment

O que é: MCP é um padrão para conectar o Codex a ferramentas e dados externos, utilizável tanto em CLI quanto em extensões IDE. Plugins são um mecanismo para distribuir Skills, Conectores e ferramentas MCP juntos. No Codex, eles estão disponíveis no aplicativo de desktop ChatGPT e na CLI, mas não nas extensões IDE.

O que faz: Permite que o Codex acesse documentos externos, navegadores, ferramentas de design, etc.

Não importa o quão inteligente o Astra seja, é inútil se ele não conseguir alcançar as informações necessárias. É como um funcionário brilhante sem uma conta no sistema interno.

No entanto, defini a prioridade como Média. Quanto mais MCPs você adicionar, mais opções de ferramentas aumentam e o contexto é consumido. A abordagem correta é adicionar apenas o que você está atualmente com dificuldade de alcançar.

O que é: O andaime para realmente mover as mãos, como dependências, procedimentos de configuração, métodos de execução de teste e estruturas de diretório de trabalho.

O que faz: O Codex pode se autoconduzir até o ponto de "executar e verificar." Se isso estiver faltando, o Codex volta a ser apenas um escritor de código.

Uma maneira simples de verificar é pedir a ele, a partir de um estado limpo, para "Configurar, passar nos testes e relatar resultados." Onde quer que ele pare é exatamente o que está faltando.

Usar Git worktree para separar diretórios para cada tarefa torna mais difícil que múltiplas tarefas paralelas colidam.

Camada de Segurança e Inspeção | Permissions, Sandbox, Hooks

O que é: Duas configurações independentes que determinam o quanto o Codex pode executar automaticamente. O sandbox determina o alcance de arquivos e redes, enquanto a política de aprovação determina onde pedir confirmação humana.

De acordo com a documentação oficial do Codex, as configurações iniciais para CLI e extensões IDE são restritas a nenhum acesso à rede e escrita apenas dentro do workspace ativo (https://developers.openai.com/codex/sandbox ).

O sandbox tem 3 níveis:

  • read-only: Pode ler, mas não escrever. Para consulta e planejamento.
  • workspace-write: Pode escrever dentro da pasta de trabalho e diretórios temporários. Este é o padrão.
  • danger-full-access: Pode escrever em qualquer lugar. Efetivamente remove o sandbox.

O preset Auto comumente usado é uma combinação de workspace-write e "pedir aprovação apenas quando necessário." O Codex irá parar e verificar ao tentar editar fora do workspace ou tocar na rede.

Se você quiser alternar no meio da sessão, pode usar o comando /permissions. Uma operação realista é read-only para a fase de planejamento e Auto para a fase de execução.

O que quero que você entenda é que autonomia não significa permitir tudo.

Escapar para danger-full-access só porque as aprovações são irritantes é a solução menos eficaz. Se ele só precisa escrever em um diretório específico, apenas permita esse local.

▼ Copie daqui

【Codex CLI: Exemplos de configuração para Planejamento e Trabalho】

O alvo é Codex CLI 0.134.0 ou posterior.

As configurações são salvas em três arquivos: "Comum," "Planejamento," e "Trabalho."

Não cole toda esta explicação em um único arquivo de configuração. Escreva apenas as configurações correspondentes em cada destino.

Os destinos são para configurações padrão do Codex.

■ 1. Configurações Comuns

Caminho: ~/.codex/config.toml

Não exclua as configurações existentes; adicione ou altere os seguintes itens. Se o mesmo [sandbox_workspace_write] existir, edite dentro dele para evitar cabeçalhos duplicados.

[sandbox_workspace_write]

network_access = false

Especifique diretórios aprovados adicionais apenas se necessário.

writable_roots = ["/caminho/absoluto/para/diretório-aprovado"]

Apenas se destinos de escrita adicionais forem necessários, remova o # no início da linha writable_roots e substitua o caminho de exemplo pelo caminho absoluto real.

■ 2. Configurações de Planejamento

Caminho: ~/.codex/plan.config.toml

Salve estas duas linhas em um arquivo separado das configurações comuns.

approval_policy = "on-request"

sandbox_mode = "read-only"

■ 3. Configurações de Trabalho

Caminho: ~/.codex/work.config.toml

Salve estas duas linhas em outro arquivo separado.

approval_policy = "on-request"

sandbox_mode = "workspace-write"

■ Como usar

Não escreva o comando de inicialização no arquivo de configuração; execute-o no terminal na pasta do projeto.

Para iniciar para planejamento:

codex --profile plan

Para iniciar para trabalho:

codex --profile work

As configurações do perfil selecionado serão sobrepostas às configurações comuns.

Como as configurações do lado do projeto e as restrições organizacionais também se aplicam, verifique as permissões reais com /permissions após a inicialização.

Nota: network_access = false é a configuração de comunicação para comandos executados dentro do sandbox. Verifique as permissões para conexões externas como MCP separadamente.

▲ Copie até aqui

Expandir um limite em um é completamente diferente de descartar o limite em si. O mesmo se aplica ao acesso à rede; é um julgamento válido apenas para projetos que realmente precisam buscar pacotes de dependência.

O que é: Um mecanismo para inserir seus próprios scripts ou ferramentas MCP no meio do processamento do Codex. Ele é ativado por padrão como um recurso Estável.

O que faz: Por exemplo, estas automações:

  • Parar comandos perigosos antes de executar uma ferramenta
  • Inspecionar segredos como chaves de API
  • Executar um linter imediatamente após editar um arquivo
  • Verificar se os testes passam no final do trabalho

Trata-se de mudar de "tenha cuidado para não cometer erros" para "o sistema para se houver um erro."

No entanto, a própria OpenAI adverte para tratar os Hooks como guardrails, não como limites de aplicação absolutos, porque o Codex pode executar trabalho equivalente através de diferentes caminhos de ferramentas.

Coisas que você realmente deseja parar devem ser paradas no nível do sandbox e permissão, não nos Hooks. Hooks são a segunda rede colocada em cima.

Camada de Olhos e Equipe | Browser, Subagents

Fazer com que ele construa um site e termine com "Eu escrevi o código, terminei" é um desperdício.

Nota: O Computer Use (operação real de tela) descrito aqui é atualmente um recurso para a versão do aplicativo de desktop do Codex. O Browser / Computer Use integrado tratado neste capítulo é usado no aplicativo de desktop ChatGPT. O Browser integrado não está disponível no Codex CLI ou extensões IDE. Para operações de navegador em CLI/IDE, prepare outros mecanismos como MCP ou Playwright.

Você deve fazê-lo fazer isso:

  • Abrir o navegador
  • Exibir a tela real
  • Tentar operá-lo
  • Encontrar partes quebradas
  • Corrigi-las
  • Verificar novamente

Astra é uma geração que melhorou significativamente nos benchmarks de operação de computador, então este processo vale a pena ser delegado. O relatório de redução de tempo de 75 para 40 minutos no OSWorld 2.0 é exatamente sobre isso.

No estudo de caso do Harness Engineering, eles criaram um ambiente onde o Codex podia lidar com Chrome DevTools Protocol, DOM, screenshots, logs e métricas para lidar com tudo, desde a reprodução de bugs até a correção e verificação.

O que é: Um mecanismo onde o Codex divide o trabalho entre múltiplos subagentes. Cada um tem um contexto independente.

O que faz: Paraleliza tarefas independentes e pesadas em leitura, como pesquisa, teste, análise de logs e sumarização.

Duas cautelas:

Uma é que múltiplos agentes escrevendo o mesmo código simultaneamente vão colidir. Tenha cuidado ao paralelizar tarefas de escrita.

A outra é simplesmente que o consumo de tokens aumenta. Fica mais rápido, mas não mais barato.

E específico para o Astra, a orientação do modelo diz que a frequência de delegação pode ser menor do que o esperado. Se você quiser paralelização, especifique explicitamente no AGENTS.md ou nos prompts: "Você pode dividir tarefas de pesquisa e executá-las em paralelo."

A Inversão da Era Astra | Inventário, Não Adição

Listei 8 elementos, mas a coisa mais importante que quero transmitir é o oposto.

A primeira coisa a fazer para o Astra é um inventário das instruções existentes. A OpenAI também recomenda auditar as instruções que o modelo referencia, como Skills e AGENTS.md. Mantenha as instruções necessárias, preencha as lacunas e corrija ou reduza as instruções antigas/contraditórias após verificação.

O verbo usado na orientação da OpenAI é "auditar", não "adicionar."

Relatos de equipes que pré-verificaram o Astra apontam na mesma direção. A Kilo, uma provedora de ferramentas de codificação de IA, escreveu em uma revisão que o Astra claramente requer menos scaffolding de AGENTS.md, e a maioria das "instruções para evitar que o modelo descarrilasse" acumuladas no último ano agora são desnecessárias. Eles até sugeriram que, se você tem um arquivo de agente inchado, tente deletar metade dele e tentar novamente (https://blog.kilo.ai/p/gpt-6-astra-what-we-learned-previewing ).

Esta é a impressão de uma empresa, não uma visão oficial. No entanto, alinha-se perfeitamente com a orientação oficial que afirma que "instruções contraditórias podem causar paradas prematuras."

Quanto mais inteligente o modelo, mais ele é atrapalhado por instruções antigas. Paradoxal, mas verdadeiro.

O inventário é mais rápido quando feito pelo próprio Codex.

▼ Copie daqui

Por favor, leia o AGENTS.md, tudo em docs e todos os arquivos de Skill carregados neste repositório. Ainda não faça alterações.

Assumindo o trabalho com GPT-6 Astra, classifique e relate o seguinte:

【Manter】 Instruções que ainda são válidas e realmente melhoram seu julgamento. Explique o porquê em uma linha.

【Candidatos à Exclusão】 Itens que se enquadram em qualquer um dos seguintes. Cite o texto original e forneça um motivo. Esta não é uma decisão de excluir, mas uma lista para consideração humana.

  • Instruções escritas para corrigir o curso de modelos de geração anterior que agora são desnecessárias.
  • Instruções apontando para especificações, caminhos ou comandos que já mudaram.
  • Instruções que mandam você fazer coisas que você naturalmente faz sem ser instruído.
  • Instruções que contradizem outras instruções.

No entanto, se houver a menor possibilidade de que a instrução tenha sido adicionada por segurança, proteção ou devido a acidentes/incidentes passados, não a classifique como 【Candidato a Exclusão】. Em vez disso, coloque-a em uma categoria separada 【Requer Julgamento Humano】 e explique por que você acredita que essa possibilidade existe. Não conclua que é "desnecessária" baseando-se apenas em seu próprio julgamento.

【Reescrever】 Instruções onde a intenção está correta, mas a redação é ambígua, redundante ou a prioridade não está clara. Forneça uma proposta de reescrita.

【Dúvidas】 Descrições que você achou difíceis de julgar o significado durante a leitura.

Por fim, certifique-se de relatar os dois pontos a seguir:

  1. Se houve instruções que realmente te bloquearam ou causaram hesitação, forneça a linha exata e o motivo da hesitação.
  2. Se o AGENTS.md fosse condensado em um índice de cerca de 100 linhas, qual estrutura você usaria?

▲ Copiar até aqui

A lista resultante de "Candidatos a Exclusão" não deve ser simplesmente excluída por completo. Primeiro, verifique por que aquela instrução foi adicionada, seu histórico e o que ela afeta se for removida. Procedimentos de verificação adicionados após acidentes passados não devem ser removidos apenas porque o Codex os julga "desnecessários para seu eu atual". Especialmente para instruções de segurança ou proteção, a pessoa que conhece o histórico deve tomar a decisão final. Prossiga com a exclusão apenas para itens onde o motivo da adição seja confirmado e o impacto seja julgado como limitado. Em caso de dúvida, mantenha a instrução. Se for mover para docs, deixe um caminho claro para que possa ser referenciado de forma confiável a partir do AGENTS.md quando necessário.

Maturidade | Onde você está agora?

Verifique seu estágio.

Nv.0: Escrevendo prompts toda vez. Como explicar tudo do zero para um funcionário talentoso todas as manhãs.

Nv.1: AGENTS.md e docs existem. Como uma empresa que tem regras e manuais.

Nv.2: Skills existem. Procedimentos para trabalho rotineiro estão definidos.

Nv.3: MCP e Plugins estão conectados. Pode acessar sistemas necessários de forma independente.

Nv.4: Permissões, Hooks e Testes estão funcionando. Auto-execução e auto-inspeção existem.

Nv.5: Usando Browser e Subagents. Pode verificar de forma independente e delegar trabalho.

Nv.6: Ciclo de feedback existe. O próprio sistema é atualizado toda vez que ocorre uma falha.

Muitas pessoas estão no Nv.1. E tentam avançar tornando o AGENTS.md mais espesso. Isso não é Nv.2; é apenas um Nv.1 inchado.

O Nv.6 é diferente por natureza. Não se trata de adicionar novos recursos. É apenas ter uma regra operacional: "Se o mesmo erro for cometido duas vezes, realimente essa correção no AGENTS.md, Skill, Hook ou Test."

É para onde a OpenAI se moveu em direção à "correção contínua em vez de verificação única" no artigo de Engenharia de Harness.

Sequência de Execução | 30 Minutos, 1 Dia, 1 Semana

Priorize. Faça nestas ordens.

Primeiros 30 Minutos

  1. Execute o prompt de diagnóstico no início deste artigo.
  2. Verifique as configurações de permissão atuais com /permissions. Se você tem usado danger-full-access regularmente, volte para workspace-write primeiro.
  3. Abra o AGENTS.md e leia-o. Verifique se há descrições redundantes, contraditórias ou desatualizadas. 100 linhas é apenas um exemplo interno da OpenAI, não um padrão absoluto. Observe se o conteúdo está organizado, em vez da contagem de linhas.

1 Dia

  1. Execute o prompt de inventário. Exclua 【Candidatos a Exclusão】 apenas após confirmar o motivo da adição e o impacto. Para 【Requer Julgamento Humano】, decida após verificar com alguém que conhece o histórico.
  2. Mova partes valiosas do conteúdo excluído para docs.
  3. Adicione "Prioridade de Instrução" ao final do AGENTS.md.
  4. Peça a partir de um estado limpo para "Configurar e passar nos testes", e registre onde ele para.

1 Semana

  1. Escolha uma tarefa que você faz mais de duas vezes por semana e transforme-a em uma Skill.
  2. Se houver uma fonte de dados externa com a qual você sempre tem dificuldade para acessar, conecte-a via MCP.
  3. Transforme uma verificação de informações secretas ou a execução de um linter pós-edição em um Hook.
  4. Decida um lugar para registrar falhas para feedback.

Neste ponto, você terá alcançado a entrada do Nv.4 a partir do Nv.1.

Índice Reverso | Por Objetivo

Quer parar de repetir a mesma explicação → AGENTS.md

Codex referencia informações antigas → Inventário de docs / Contexto

Qualidade da mesma tarefa oscila → Skills

Não consegue acessar dados necessários → MCP / Plugins

Consegue escrever código, mas não consegue prosseguir para a verificação → Ambiente

Medo de agir por conta própria, ou muitas aprovações → Permissões / Sandbox

Mesmo erro repetido → Hooks / Testes

Não percebe quebras de layout → Browser / Computer Use

Pesquisa leva muito tempo → Subagents

Começou a parar no meio da tarefa após mudar para o Astra → Primeiro verifique notificações de parada, solicitações de aprovação e erros. Se necessário, verifique configurações e uso com /status no CLI. Se houver suspeita de instruções contraditórias, faça um inventário do AGENTS.md e das Skills.

A Próxima Competição é o Ambiente, Não os Cérebros

O jogo de escolher modelos está praticamente encerrado.

O Astra é inteligente o suficiente e age exatamente como instruído. É por isso que o que você deixa como instruções determina o resultado.

Do jogo de escrever prompts bem ao jogo de projetar ambientes de trabalho bem. O Astra é o modelo que finalizou essa transição.

Você só precisa fazer uma coisa hoje. Abra o AGENTS.md e leia-o. Esse é o ponto de partida.

Obrigado por ler até aqui.

Compartilho exemplos específicos de economia de tempo e trabalhos paralelos de IA usando ChatGPT, Claude e Copilot em um chat aberto gratuito. Se você quer estar do lado que "sabe usar IA", junte-se agora.

👉 https://x.gd/yVPeS

Recriar no YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para criadores

Transforme seu Markdown em um artigo 𝕏 impecável

Quando você publica seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown em um artigo 𝕏 impecável e pronto para publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais