Rumo à Automação da Engenharia de Avaliação

@Vtrivedy10
INGLÊShá 1 dia · 22 de jul. de 2026
222K
631
62
15
1.7K

TL;DR

O LangChain Labs lançou uma Skill de Engenharia de Avaliação que automatiza a criação de avaliações de agentes de IA ao analisar repositórios e traces para gerar tarefas no formato Harbor.

Hoje estamos lançando nossa Habilidade de Engenharia de Avaliação (Eval Engineering Skill), uma habilidade que ajuda agentes de codificação a construir avaliações usando contexto de um repositório e rastros de agentes.

A habilidade inspeciona como um agente é estruturado, minera padrões dos rastros, se disponíveis, e propõe capacidades a serem testadas.

A habilidade foi projetada para entrevistar o usuário, que pode dar feedback sobre as propostas e aprovar iterativamente cada avaliação. O produto final é um conjunto de avaliações executáveis no formato Harbor.

Construindo o Ambiente e a Tarefa

A habilidade primeiro lê o repositório e mapeia a superfície do agente, incluindo prompts, modelos, ferramentas, habilidades, hooks, etc. Ela também identifica os dados e serviços que sustentam esses comportamentos, como chamadas de API.

Os usuários também podem apontar o agente para rastros que podem ser recuperados usando ferramentas como o langsmith-cli. Os rastros mostram como as ferramentas se comportam na prática, como seus argumentos, resultados e erros. Esses contratos observados ajudam a habilidade a reproduzir comportamentos de produção relevantes em um ambiente controlado.

Analisar o repositório e os rastros dá ao agente conhecimento sobre quais capacidades são importantes para ele ao propor tarefas de avaliação. Descobrimos que entrevistar o usuário leva a uma aceitação muito melhor da avaliação do que a geração única. O usuário escolhe entre as direções de avaliação propostas e dá orientações sobre questões como quais ferramentas e dependências devem ser executadas ao vivo ou precisam ser simuladas. Por exemplo, chamadas de ferramentas que incorrem em custos ou exigem gravações em produção podem ser simuladas em vez de serem executadas em toda invocação de avaliação.

Testamos esse fluxo em nosso agente de perguntas e respostas sobre documentação, o chat-langchain. Para este agente, o ambiente exigia um corpus de dados exposto por meio de ferramentas de busca do agente modeladas no agente de produção. As tarefas incluíam perguntas realistas de documentação extraídas de rastros reais e um verificador que conferia a resposta usando uma string de resposta dourada e documentos citados.

Viv - inline image

O Design da Avaliação é Iterativo

Descobrimos que, embora os agentes às vezes sejam capazes de gerar avaliações de uma única vez, as melhores avaliações vieram de usuários fornecendo feedback e especificando quais capacidades valiam a pena ser medidas nos agentes. Agentes de codificação e habilidades fornecem uma interface natural onde o conhecimento de domínio sobre como construir uma boa avaliação é codificado e os usuários podem iterar sobre eles ao longo do tempo.

Por exemplo, descobrimos que, ao construir verificadores, o primeiro verificador raramente era o final. Uma maneira útil de melhorá-lo era executar a avaliação e inspecionar ambos os lados do resultado:

  • a trajetória do agente, incluindo suas mensagens, chamadas de ferramenta e ações.
  • a trajetória do verificador, evidências, raciocínio e pontuação final.

Isso ajudou a revelar se o design da tarefa ou do verificador estava medindo o que nos importava ou se poderia ser recompensado indevidamente (reward hacked), onde os agentes poderiam tomar atalhos. Esses atalhos poderiam incluir citar em excesso fontes irrelevantes para receber crédito total na avaliação, alegar uma ação que nunca realizou, explorar material de resposta exposto ou satisfazer um proxy sem completar a tarefa. Observar os rastros de como os agentes resolvem problemas frequentemente revela a origem dessas falhas. A tarefa, o ambiente e o verificador podem então ser revisados e executados novamente.

As Avaliações estão no Formato Harbor

A habilidade constrói avaliações como tarefas Harbor:

  1. Uma Instrução: a mensagem dada ao agente no início descrevendo a tarefa
  2. Um ambiente: dado como um Dockerfile contendo a configuração para a tarefa, como quais ferramentas instalar ou quais dados povoar no sistema de arquivos
  3. Um verificador que pontua se o agente completou a tarefa corretamente.

A habilidade constrói esses componentes juntos como uma tarefa Harbor:

markdown
1avaliacoes/<id-da-tarefa>/
2├── tarefa.toml
3├── instrucao.md
4├── ambiente/
5└── testes/

O Harbor executa o agente no ambiente e registra sua trajetória, artefatos, recompensa e erros. A mesma avaliação pode então ser executada contra diferentes modelos, prompts, ferramentas e versões de agente.

Por que isso é importante

O aprendizado contínuo pode ser pensado como um problema contínuo de mineração de dados onde dados de produção são usados para construir avaliações que melhoram os agentes ao longo do tempo. As equipes mineram rastros para encontrar solicitações recorrentes de usuários, erros, chamadas de ferramenta com falha e mudanças de estado incorretas, que se tornam avaliações para que o mesmo comportamento possa ser medido e prevenido no futuro.

As avaliações são dados de treinamento para agentes. As equipes podem ajustar o comportamento do agente a elas por meio de engenharia de harness, como alterar prompts e ferramentas ou fazer fine-tuning. A avaliação fornece um alvo fixo para decidir se essas mudanças melhoraram a capacidade pretendida.

Avaliações containerizadas tornam esse processo mais rápido. A tarefa e o ambiente permanecem estáveis enquanto a configuração do agente muda, então os construtores podem trocar modelos, ferramentas, prompts ou versões completas do agente e comparar os resultados diretamente. Múltiplas configurações podem ser executadas em paralelo.

Ambientes reproduzíveis são críticos para esse sinal. Quando uma avaliação espelha as ferramentas, dados, permissões, estado e modos de falha relevantes da produção, os construtores obtêm uma bancada de testes estável que ainda é representativa de como o agente opera. Eles podem experimentar rapidamente sem depender de sistemas de produção em mudança ou escrever em estado de produção.

O loop resultante é:

minerar rastros -> identificar uma falha -> construir uma avaliação -> melhorar o agente -> reexecutar

Experimente hoje

A Habilidade de Engenharia de Avaliação está disponível no repositório langchain-ai/langchain-skills.

Instale a habilidade no Codex ou no Claude Code, abra o repositório contendo o agente que você deseja avaliar, aponte o agente para um conjunto de rastros, se disponível, e comece com um prompt simples:

Estamos ansiosos para expandir esta habilidade e construir ferramentas para facilitar a construção automática de avaliações e o ajuste autônomo de agentes a elas.

Salvar com um clique

Faça leitura profunda de artigos virais com IA no YouMind

Salve a fonte, faça perguntas específicas, resuma o argumento e transforme um artigo viral em notas reutilizáveis em um único espaço de trabalho com IA.

Explorar o YouMind
Para criadores

Transforme seu Markdown em um artigo 𝕏 impecável

Quando você publica seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown em um artigo 𝕏 impecável e pronto para publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais