TL;DR
Em uma organização de engenharia nativa de IA, gerar código não é mais a parte mais lenta do processo de lançamento de software. Revisão, verificação, correção e tomada de decisão humana tornam-se os gargalos e, em última análise, definem o quanto mais rápido a organização pode avançar. Ferramentas de codificação com IA independentes podem proporcionar um ganho de 30–40% em velocidade, mas alcançar uma mudança de patamar na produtividade exige otimizar tudo o que acontece depois que o código é escrito.
Em nosso post anterior sobre como resolver a revisão de código com o Cosmos, descrevemos um sistema de revisão que ajudou nossa organização de engenharia a aumentar a produção de código em 3× enquanto reduzia o tempo mediano de merge e mantinha a qualidade. Desde então, expandimos esse sistema para além da revisão, cobrindo todo o loop de PR até o merge: agentes especializados lidam com o trabalho mecânico, verificam a correção e tratam o feedback, enquanto humanos fornecem julgamento e transferência de conhecimento e sempre detêm a decisão final de merge.
Isso é engenharia de loop: melhorar o sistema completo que transforma código gerado em uma mudança verificada, compreendida e pronta para merge, em vez de otimizar qualquer ferramenta isoladamente.
Por que uma “ferramenta de revisão de código com IA” não é suficiente
Uma ferramenta convencional de revisão de código com IA, como CodeRabbit ou Greptile, analisa um diff e publica comentários. É útil, mas a revisão é apenas uma etapa. O verdadeiro gargalo é a cadeia de transferências manuais:
- Reconstruir a intenção e a arquitetura.
- Triar alterações de baixo risco.
- Aplicar o feedback da revisão.
- Corrigir falhas de CI e conflitos de merge.
- Verificar o comportamento do recurso de ponta a ponta.
- Reunir evidências suficientes para lançar com segurança.
- Revisar novamente após cada push.
Um loop de PR até o merge mantém Experts especializados trabalhando em revisão, correção, verificação e suporte à decisão até que um humano possa fazer o merge com confiança. Cada Expert da frota é responsável por uma ou mais dessas transferências, transformando uma sequência fragmentada de tarefas manuais em um sistema coordenado. O objetivo é otimizar o loop completo: tempo humano, custo, qualidade e latência de merge, não o tempo até o primeiro comentário.
1. Visão geral: engenharia do loop completo

leia a descrição da imagem
ALT
Um loop de revisão de código nativo de IA: agentes encontram e corrigem bugs, verificam alterações e avaliam políticas; humanos resolvem questões de julgamento e tomam a decisão final de merge.
Nosso sistema original separava a análise de risco (Risk Analyzer), a revisão de correção linha por linha (Deep Reviewer) e a revisão de design guiada por humanos (Pair Review). O sistema expandido adiciona correção, verificação em tempo de execução e aprovação automática ampliada, reduzindo ainda mais o gargalo humano. Para uma visão geral do Cosmos e seus Experts configuráveis, consulte nosso post anterior sobre como resolver a revisão de código com o Cosmos.
Experts e capacidades, não um revisor de uso geral
Expert ou capacidade
Responsabilidade
Risk Analyzer
Classifica o risco e aplica a política de aprovação automática
Deep Reviewer
Realiza análise exaustiva, linha por linha, para defeitos objetivos de correção
Pair Reviewer
Reconstrói a intenção, a arquitetura, o contexto do produto e as compensações
Memory Manager
Lembra o feedback das sessões de PR e Pair Review para melhorar execuções futuras
Verifier
<sup>
NEW
</sup>
Exercita o comportamento afetado de ponta a ponta em um ambiente de teste (
)
PR Fixer
<sup>
NEW
</sup>
Corrige achados da revisão, falhas de CI e conflitos de merge
Review Dashboard
<sup>
NEW
</sup>
Observa e resume o estado dos Experts
cosmos approve
<sup>
NEW
</sup>
Avalia uma política de aprovação configurável mediante solicitação do autor
A distinção entre Deep Reviewer e Pair Reviewer é particularmente importante:
- O Deep Reviewer pergunta: “Existe um bug objetivo nesta implementação?” Ele é executado de forma autônoma e verifica o PR em relação às diretrizes de AGENTS.md ou CLAUDE.md.
- O Pair Reviewer pergunta: “Essa alteração faz sentido no sistema mais amplo e quais decisões exigem julgamento humano?” Ele é executado de forma interativa com o humano. O humano também pode instruí-lo a monitorar o PR após publicar os comentários de revisão e aprovar em seu nome assim que esses comentários forem respondidos.
O Expert PR Author anteriormente acumulava duas funções: escrever um PR e corrigir comentários de revisão, falhas de CI e outros trabalhos de acompanhamento. No design desacoplado, o PR Author para na criação do PR como rascunho e o PR Fixer assume. Isso dá aos usuários mais controle sobre como as correções são executadas e oferece suporte a PRs criados sem o PR Author.

O Review Dashboard reúne em uma única visualização o status dos Experts, os commits revisados, as evidências e as ações disponíveis.
- Projetando o humano no loop
A revisão e a verificação humanas estão se tornando os recursos escassos nas organizações de engenharia nativas de IA. O objetivo não é remover humanos indiscriminadamente. É gastar a atenção humana apenas onde ela tem o maior poder de alavancagem.
Por que os humanos permanecem no loop
Os agentes podem executar uma grande parcela da análise e da execução mecânicas, mas não têm o contexto completo de negócios e da organização. Os humanos continuam sendo essenciais para:
- Decisões de julgamento: Essa lógica deve ficar no frontend ou no backend? Essa compensação é adequada para o produto? Esse risco é aceitável agora?
- Transferência de conhecimento: A revisão é uma das formas de os engenheiros construírem um entendimento compartilhado da arquitetura e do comportamento do produto.
- Propriedade e responsabilidade: Os agentes não são donos do software depois que ele é lançado; os desenvolvedores humanos e as organizações de engenharia é que são. Portanto, um humano sempre toma a decisão final e clica em Merge. Nenhum desses Experts faz merge de um PR.
O objetivo do design é, portanto:
Agentes fazem o trabalho mecânico. Humanos tomam as decisões de alto impacto.
O fluxo de trabalho do autor e do revisor: antes e depois
Fluxo de trabalho tradicional
Fluxo de trabalho com humano no loop
Triar manualmente cada PR e identificar alterações de baixo risco
Deixar o
Risk Analyzer
classificar o risco e aplicar a política de aprovação automática da organização
Ler o PR linha por linha
Confiar no
Deep Reviewer
para realizar uma análise exaustiva linha por linha
Reconstruir o contexto, a intenção e a arquitetura a partir do diff
Usar o briefing do
Pair Reviewer
para entender a alteração e identificar decisões de julgamento
Implantar e exercitar o recurso manualmente
Inspecionar as evidências do
Verifier
: capturas de tela, logs, rastreamentos e saídas capturadas
Revisar cada correção do zero
Deixar o
Pair Reviewer
monitorar se os comentários autorizados foram respondidos
Triar o feedback, implementar correções, reparar a CI, resolver conflitos e explicar cada alteração
Deixar o
PR Fixer
—ou o
PR Author
quando ele é responsável por todo o ciclo de vida—cuidar do acompanhamento mecânico e relatar o que mudou
Pesquisar em comentários e verificações para entender o estado atual
Usar o
Review Dashboard
como ponto de entrada
Reunir manualmente evidências de revisão, propriedade e verificação antes de solicitar aprovação
Invocar
cosmos approve
para avaliar a política de aprovação configurada em relação às evidências atuais
Decidir se fará o merge
Você ainda decide se fará o merge
A intuição econômica do uso de múltiplos Experts
Tokens que reduzem de forma mensurável o tempo humano no gargalo da revisão valem o investimento. Quando os Experts transformam horas de revisão e condução de PRs em minutos, eles liberam o escasso julgamento de engenharia para as decisões de alto impacto que apenas humanos podem tomar, além de ajudar os recursos a chegarem aos clientes mais rapidamente.
Um dos compromissos centrais da Augment é ajudar organizações a otimizar custos. Isso significa otimizar o custo total por tarefa: esforço humano mais custo de tokens. Não significa minimizar o uso de tokens às custas de resultados bem-sucedidos. Um único Expert sobrecarregado com seis responsabilidades fará um trabalho abaixo do padrão em cada uma e exigirá mais intervenção humana. Seis Experts dedicados podem se concentrar cada um em uma parte diferente da revisão de PR, produzir artefatos de revisão de maior qualidade e conduzir mais do processo de forma autônoma.
3. Custo e qualidade: otimize o custo por resultado bem-sucedido
O modelo mais barato pelo preço do token muitas vezes é uma falsa economia. Um defeito não detectado, uma correção ruim ou uma nova tentativa podem custar mais do que acertar a tarefa de primeira. Avaliamos trabalhos representativos e escolhemos o modelo de menor custo que atinge o padrão de qualidade de cada Expert, o mesmo princípio de custo por sucesso que usamos em todo o Cosmos.
Hoje, usamos o GPT-5.6 Sol para trabalhos que exigem muito julgamento, como análise de risco, revisão Deep e Pair e correção de código. Tarefas delimitadas e mecanicamente verificáveis, como agregação de dashboard e monitoramento de conflitos de merge, são executadas no GPT-5.6 Luna. Modelos com TTLs de cache mais longos também favorecem agentes de longa duração, porque a entrada em cache normalmente tem 90% de desconto.
4. Um caminho de aprovação configurável com cosmos approve
O Risk Analyzer sempre pôde aprovar alterações intrinsecamente de baixo risco sob uma política conservadora. Agora oferecemos um segundo modo de aprovação, desabilitado por padrão, para outras alterações.
O autor do PR pode comentar cosmos approve para solicitar uma avaliação em relação a uma política de aprovação. Um humano ainda detém e executa o merge final.
As organizações definem sua própria política de aprovação. Nossa política interna verifica:
- Propriedade: O solicitante é o autor do PR, e o autor é um CODEOWNER efetivo de todos os arquivos modificados.
- Revisão do estado atual: Nenhum achado não resolvido do Deep Reviewer, bloqueador do Pair Reviewer ou comentário humano sem resposta.
- Nenhuma evidência de runtime contraditória: O Verifier não relatou um defeito não tratado no commit atual.
5. A personalização faz parte da arquitetura
Projetamos a frota para que as equipes possam personalizar o loop com o Cosmos Advisor.
- Frota: Adicionar, remover ou substituir Experts; escolher o modelo e o prompt para cada responsabilidade.
- Operação: Configurar gatilhos, ferramentas, integrações e ambientes de verificação.
- Controle: Restringir quem pode invocar ações e quais credenciais, repositórios e sistemas cada Expert pode acessar.
- Política: Definir regras de aprovação, verificações obrigatórias, requisitos de CODEOWNER e evidências aceitáveis.
O modelo operacional para revisão de PR nativa de IA
A lição da nossa primeira versão foi que a revisão de código não poderia escalar pedindo que humanos lessem código gerado por IA mais rápido. A lição desta versão é mais ampla: nenhum agente de revisão individual consegue otimizar o caminho completo até o merge.
Um loop de PR até o merge de alto desempenho precisa de:
- Especialização de agentes: Separar risco, correção, julgamento de design, verificação de runtime e reparo.
- Checkpoints humanos mínimos: Envolver humanos apenas para julgamento de decisões de alto impacto e transferência de conhecimento.
- Evidências: Dar aos revisores provas inspecionáveis em vez de veredictos sem fundamentação.
- Loops de reparo: Deixar os achados fluírem de volta para a implementação sem esperar intervenção manual.
- Observabilidade: Tornar o estado de toda a frota legível em um só lugar.
- Disciplina de custos: Usar o modelo mais barato que atinge o padrão de qualidade de cada responsabilidade.
- Configurabilidade: Personalizar o loop de acordo com os requisitos exclusivos de cada organização.
- Propriedade humana: Manter a decisão final de merge com as pessoas responsáveis pelo software.
Esta é a engenharia de loop aplicada ao ciclo de vida do PR: otimizar o sistema que produz uma alteração verificada, compreendida e pronta para merge, e não a quantidade de saída produzida por um único agente.
Crie seu próprio loop de PR até o merge
O Cosmos dá às equipes de engenharia o contexto compartilhado, os controles de runtime, as integrações e os checkpoints humanos para executar agentes em revisão, verificação, reparo e no restante do ciclo de vida do software.





