Rumo à Automação da Engenharia de Avaliação

@Vtrivedy10
INGLÊShá 1 dia · 22/07/2026
222K
631
62
15
1.7K

TL;DR

O LangChain Labs lançou uma Skill de Engenharia de Avaliação que automatiza a criação de avaliações de agentes de IA ao analisar repositórios e traces para gerar tarefas no formato Harbor.

Hoje, estamos lançando nossa Skill de Engenharia de Avaliação (Eval Engineering Skill), uma skill que ajuda agentes de código a construir avaliações (evals) usando contexto de um repositório e traces de agentes.

A skill inspeciona como um agente é estruturado, minera padrões de traces quando disponíveis e propõe capacidades a serem testadas.

A skill é projetada para entrevistar o usuário, que pode dar feedback sobre as propostas e aprovar iterativamente cada avaliação. O produto final é um conjunto de avaliações executáveis no formato Harbor.

Construindo o Ambiente e a Tarefa

A skill primeiro lê o repositório e mapeia a superfície do agente, incluindo prompts, modelos, ferramentas, skills, hooks, etc. Ela também identifica os dados e serviços que sustentam esses comportamentos, como chamadas de API.

Os usuários também podem apontar o agente para traces, que podem ser recuperados usando ferramentas como o langsmith-cli. Os traces mostram como as ferramentas se comportam na prática, como seus argumentos, resultados e erros. Esses contratos observados ajudam a skill a reproduzir comportamentos relevantes de produção em um ambiente controlado.

Varrer o repositório e os traces dá ao agente conhecimento sobre quais capacidades são importantes para ele, enquanto propõe tarefas de avaliação. Descobrimos que entrevistar o usuário leva a uma aceitação muito melhor das avaliações do que a geração única. O usuário escolhe entre as direções de avaliação propostas e dá orientações sobre questões como quais ferramentas e dependências devem ser executadas ao vivo ou precisam ser simuladas. Por exemplo, chamadas de ferramentas que incorrem em custos ou exigem escrita em produção podem ser simuladas em vez de serem executadas em cada invocação de avaliação.

Testamos esse fluxo em nosso agente de Q&A de documentação, chat-langchain. Para este agente, o ambiente exigia um corpus de dados exposto através de ferramentas de busca do agente modeladas no agente de produção. As tarefas incluíam perguntas realistas de documentação extraídas de traces reais e um verificador que verificava a resposta usando uma string de resposta dourada e documentos citados.

Viv - inline image

O Design da Avaliação é Iterativo

Descobrimos que, embora os agentes às vezes sejam capazes de gerar avaliações de uma só vez, as melhores avaliações vieram de usuários fornecendo feedback e especificando quais capacidades valiam a pena medir nos agentes. Agentes de código e skills fornecem uma interface natural onde o conhecimento de domínio sobre como construir uma boa avaliação é codificado e os usuários podem iterar sobre eles ao longo do tempo.

Por exemplo, descobrimos que, ao construir verificadores, o primeiro verificador raramente era o final. Uma maneira útil de melhorá-lo era executar a avaliação e inspecionar ambos os lados do resultado:

  • a trajetória do agente, incluindo suas mensagens, chamadas de ferramenta e ações.
  • a trajetória do verificador, evidências, raciocínio e pontuação final.

Isso ajudou a revelar se o design da tarefa ou do verificador estava medindo o que nos importava ou se poderia ser enganado por recompensas (reward hacked), onde os agentes poderiam tomar atalhos. Esses atalhos poderiam incluir citar em excesso fontes irrelevantes para receber crédito total na avaliação, alegar uma ação que nunca realizou, explorar material de resposta exposto ou satisfazer um proxy sem completar a tarefa. Observar os traces de como os agentes resolvem problemas frequentemente revela a origem dessas falhas. A tarefa, o ambiente e o verificador podem então ser revisados e executados novamente.

As Avaliações Estão no Formato Harbor

A skill constrói avaliações como tarefas do Harbor:

  1. Uma Instrução: a mensagem dada ao agente no início descrevendo a tarefa
  2. Um ambiente: dado como um Dockerfile contendo a configuração para a tarefa, como quais ferramentas instalar ou quais dados popular no sistema de arquivos
  3. Um verificador que pontua se o agente completou a tarefa corretamente.

A skill constrói esses componentes juntos como uma tarefa do Harbor:

markdown
1evals/<task-id>/
2├── task.toml
3├── instruction.md
4├── environment/
5└── tests/

O Harbor executa o agente no ambiente e registra sua trajetória, artefatos, recompensa e erros. A mesma avaliação pode então ser executada contra diferentes modelos, prompts, ferramentas e versões de agente.

Por Que Isso é Importante

Aprendizado contínuo pode ser pensado como um problema contínuo de mineração de dados, onde dados de produção são usados para construir avaliações que melhoram os agentes ao longo do tempo. Equipes mineram traces para encontrar solicitações recorrentes de usuários, erros, chamadas de ferramenta com falha e mudanças de estado incorretas. Isso se torna avaliações, para que o mesmo comportamento possa ser medido e prevenido no futuro.

Avaliações são dados de treinamento para agentes. Equipes podem ajustar o comportamento do agente a elas através de engenharia de harness, como mudar prompts e ferramentas ou fazer fine-tuning. A avaliação fornece um alvo fixo para decidir se essas mudanças melhoraram a capacidade pretendida.

Avaliações em contêineres tornam esse processo mais rápido. A tarefa e o ambiente permanecem estáveis enquanto a configuração do agente muda, então os construtores podem trocar modelos, ferramentas, prompts ou versões completas de agentes e comparar resultados diretamente. Múltiplas configurações podem ser executadas em paralelo.

Ambientes reproduzíveis são críticos para esse sinal. Quando uma avaliação espelha as ferramentas, dados, permissões, estado e modos de falha relevantes da produção, os construtores obtêm um ambiente de teste estável que ainda é representativo de como o agente opera. Eles podem experimentar rapidamente sem depender de sistemas de produção em mudança ou escrever no estado de produção.

O loop resultante é:

minerar traces -> identificar uma falha -> construir uma avaliação -> melhorar o agente -> reexecutar

Experimente Hoje

A Skill de Engenharia de Avaliação está disponível no repositório langchain-ai/langchain-skills.

Instale a skill no Codex ou no Claude Code, abra o repositório contendo o agente que você deseja avaliar, aponte o agente para um conjunto de traces, se disponível, e comece com um prompt simples:

Estamos ansiosos para expandir esta skill e construir ferramentas para tornar mais fácil construir automaticamente avaliações e ajustar agentes a elas de forma autônoma.

Guardar com um clique

Faça leitura aprofundada de artigos virais com IA no YouMind

Guarde a fonte, faça perguntas específicas, resuma o argumento e transforme um artigo viral em notas reutilizáveis num único espaço de trabalho com IA.

Explorar o YouMind
Para criadores

Transforme o seu Markdown num artigo 𝕏 impecável

Quando publica os seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown num artigo 𝕏 impecável e pronto a publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais