Hacia la automatización de la ingeniería de evaluación

@Vtrivedy10
INGLÉShace 1 día · 22 jul 2026
222K
631
62
15
1.7K

TL;DR

LangChain Labs lanzó una habilidad de ingeniería de evaluación que automatiza la creación de evaluaciones de agentes de IA mediante el análisis de repositorios y trazas para generar tareas en formato Harbor.

Hoy lanzamos nuestra Habilidad de Ingeniería de Evaluaciones, una habilidad que ayuda a los agentes de codificación a construir evaluaciones utilizando el contexto de un repositorio y las trazas del agente.

La habilidad inspecciona cómo está estructurado un agente, extrae patrones de las trazas si están disponibles, y propone capacidades a probar.

La habilidad está diseñada para entrevistar al usuario, quien puede dar retroalimentación sobre las propuestas y aprobar cada evaluación de forma iterativa. El producto final es un conjunto de evaluaciones ejecutables en formato Harbor.

Construyendo el Entorno y la Tarea

La habilidad primero lee el repositorio y mapea la superficie del agente, incluyendo prompts, modelos, herramientas, habilidades, hooks, etc. También identifica los datos y servicios que respaldan esos comportamientos, como llamadas a API.

Los usuarios también pueden apuntar el agente a trazas que se pueden recuperar usando herramientas como langsmith-cli. Las trazas muestran cómo se comportan las herramientas en la práctica, como sus argumentos, resultados y errores. Estos contratos observados ayudan a la habilidad a reproducir el comportamiento relevante de producción en un entorno controlado.

Analizar el repositorio y las trazas le da al agente conocimiento de qué capacidades son importantes para el agente a medida que propone tareas de evaluación. Descubrimos que entrevistar al usuario conduce a una aceptación de las evaluaciones mucho mejor que la generación única. El usuario elige entre las direcciones de evaluación propuestas y da orientación sobre preguntas como qué herramientas y dependencias deben ejecutarse en vivo o necesitan ser simuladas. Por ejemplo, las llamadas a herramientas que incurren en costos o requieren escrituras en producción pueden simularse en lugar de ejecutarse en cada invocación de evaluación.

Probamos este flujo en nuestro agente de preguntas y respuestas de documentación, chat-langchain. Para este agente, el entorno requería un corpus de datos expuesto a través de herramientas de búsqueda del agente modeladas a partir del agente de producción. Las tareas incluían preguntas de documentación realistas extraídas de trazas reales y un verificador que comprobaba la respuesta usando una cadena de respuesta dorada y documentos citados.

Viv - inline image

El Diseño de Evaluaciones es Iterativo

Descubrimos que, aunque los agentes a veces pueden generar evaluaciones de una sola vez, las mejores evaluaciones provinieron de usuarios que proporcionaban retroalimentación y especificaban qué capacidades valía la pena medir en los agentes. Los agentes de codificación y las habilidades proporcionan una interfaz natural donde se codifica el conocimiento del dominio sobre cómo construir una buena evaluación y los usuarios pueden iterar sobre ellas con el tiempo.

Por ejemplo, descubrimos que al construir verificadores, el primer verificador rara vez era el definitivo. Una forma útil de mejorarlo era ejecutar la evaluación e inspeccionar ambos lados del resultado:

  • la trayectoria del agente, incluyendo sus mensajes, llamadas a herramientas y acciones.
  • la trayectoria del verificador, evidencia, razonamiento y puntuación final.

Esto ayudó a revelar si el diseño de la tarea o del verificador estaba midiendo lo que nos importaba o si podía ser explotado por recompensa, donde los agentes podían tomar atajos. Estos atajos podían incluir citar en exceso fuentes irrelevantes para obtener crédito completo en la evaluación, afirmar una acción que nunca tomaron, explotar material de respuesta expuesto, o satisfacer un proxy sin completar la tarea. Observar las trazas de cómo los agentes resuelven problemas a menudo revela la fuente de estos fallos. Luego, la tarea, el entorno y el verificador pueden revisarse y ejecutarse de nuevo.

Las Evaluaciones están en formato Harbor

La habilidad construye evaluaciones como tareas de Harbor:

  1. Una Instrucción: el mensaje dado al agente al inicio describiendo la tarea
  2. Un entorno: dado como un Dockerfile que contiene la configuración para la tarea, como qué herramientas instalar o qué datos poblar en el sistema de archivos
  3. Un verificador que puntúa si el agente completó la tarea correctamente.

La habilidad construye estos componentes juntos como una tarea de Harbor:

markdown
1evals/<task-id>/
2├── task.toml
3├── instruction.md
4├── environment/
5└── tests/

Harbor ejecuta el agente en el entorno y registra su trayectoria, artefactos, recompensa y errores. La misma evaluación puede entonces ejecutarse contra diferentes modelos, prompts, herramientas y versiones de agente.

Por qué esto es importante

El aprendizaje continuo puede considerarse como un problema de minería de datos continua, donde los datos de producción se utilizan para construir evaluaciones que mejoran los agentes con el tiempo. Los equipos extraen trazas para encontrar solicitudes de usuario recurrentes, errores, llamadas a herramientas fallidas y cambios de estado incorrectos, que se convierten en evaluaciones para que el mismo comportamiento pueda medirse y prevenirse en el futuro.

Las evaluaciones son datos de entrenamiento para los agentes. Los equipos pueden ajustar el comportamiento del agente a ellas mediante ingeniería de arneses, como cambiar prompts y herramientas o realizar fine-tuning. La evaluación proporciona un objetivo fijo para decidir si esos cambios mejoraron la capacidad prevista.

Las evaluaciones contenerizadas hacen este proceso más rápido. La tarea y el entorno permanecen estables mientras la configuración del agente cambia, por lo que los constructores pueden intercambiar modelos, herramientas, prompts o versiones completas de agentes y comparar resultados directamente. Múltiples configuraciones pueden ejecutarse en paralelo.

Los entornos reproducibles son críticos para esa señal. Cuando una evaluación refleja las herramientas, datos, permisos, estado y modos de fallo relevantes de la producción, los constructores obtienen un banco de pruebas estable que sigue siendo representativo de cómo opera el agente. Pueden experimentar rápidamente sin depender de sistemas de producción cambiantes ni escribir en el estado de producción.

El bucle resultante es: extraer trazas -> identificar un fallo -> construir una evaluación -> mejorar el agente -> volver a ejecutar

Pruébalo hoy

La Habilidad de Ingeniería de Evaluaciones está disponible en el repositorio langchain-ai/langchain-skills.

Instala la habilidad en Codex o Claude Code, abre el repositorio que contiene el agente que deseas evaluar, apunta el agente a un conjunto de trazas si están disponibles, y comienza con un prompt simple:

Esperamos expandir esta habilidad y construir herramientas para facilitar la construcción automática de evaluaciones y ajustar agentes a ellas de forma autónoma.

Guardar con un clic

Lee artículos virales en profundidad con IA en YouMind

Guarda la fuente, haz preguntas concretas, resume el argumento y convierte un artículo viral en notas reutilizables en un único espacio de trabajo con IA.

Explora YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales