На пути к автоматизации инженерии оценки

@Vtrivedy10
АНГЛИЙСКИЙ1 день назад · 22 июл. 2026 г.
222K
631
62
15
1.7K

Суть

LangChain Labs выпустила навык Eval Engineering, который автоматизирует создание оценок ИИ-агентов путем анализа репозиториев и трассировок для генерации задач в формате Harbor.

Сегодня мы выпускаем наш Eval Engineering Skill — навык, который помогает агентам кодирования создавать оценки (evals), используя контекст из репозитория и трассировок агента.

Навык анализирует, как устроен агент, извлекает шаблоны из трассировок (если они доступны) и предлагает способности для тестирования.

Навык предназначен для интервью с пользователем, который может давать обратную связь по предложениям и итеративно утверждать каждую оценку (eval). Конечный продукт — набор исполняемых оценок (evals) в формате Harbor.

Создание среды и задачи

Навык сначала читает репозиторий и составляет карту поверхности агента, включая промпты, модели, инструменты, навыки, хуки и т.д. Он также определяет данные и сервисы, которые поддерживают эти поведения, такие как вызовы API.

Пользователи также могут указать агенту на трассировки, которые можно получить с помощью таких инструментов, как langsmith-cli. Трассировки показывают, как инструменты ведут себя на практике: их аргументы, результаты и ошибки. Эти наблюдаемые контракты помогают навыку воспроизводить соответствующее производственное поведение в контролируемой среде.

Сканирование репозитория и трассировок дает агенту знание о том, какие способности важны для агента, когда он предлагает задачи для оценки. Мы обнаружили, что интервью с пользователем приводит к гораздо лучшему принятию оценок, чем одноразовая генерация. Пользователь выбирает из предложенных направлений оценки и дает рекомендации по таким вопросам, как какие инструменты и зависимости должны выполняться вживую, а какие нужно симулировать. Например, вызовы инструментов, которые влекут за собой затраты или требуют записи в продакшн, можно симулировать вместо выполнения при каждом запуске оценки.

Мы протестировали этот процесс на нашем агенте для вопросов и ответов по документации, chat-langchain. Для этого агента среда требовала корпуса данных, доступного через инструменты поиска агента, смоделированные по образцу продакшн-агента. Задачи включали реалистичные вопросы по документации, взятые из реальных трассировок, и верификатор, который проверял ответ с помощью эталонной строки ответа и цитируемых документов.

Viv - inline image

Проектирование оценки итеративно

Мы обнаружили, что хотя агенты иногда способны на одноразовые оценки, лучшие оценки получались, когда пользователи давали обратную связь и указывали, какие способности стоит измерять в агентах. Агенты кодирования и навыки предоставляют естественный интерфейс, где знания предметной области о том, как построить хорошую оценку, закодированы, и пользователи могут итеративно работать с ними со временем.

Например, мы обнаружили, что при создании верификаторов первый верификатор редко был окончательным. Полезный способ улучшить его — запустить оценку и проверить обе стороны результата:

  • траекторию агента, включая его сообщения, вызовы инструментов и действия.
  • траекторию верификатора, доказательства, рассуждения и итоговую оценку.

Это помогало выявить, измеряет ли задача или дизайн верификатора то, что нас интересует, или же его можно взломать вознаграждение (reward hacked), где агенты могут срезать углы. Эти shortcuts могут включать чрезмерное цитирование нерелевантных источников для получения полного балла, утверждение действия, которое он никогда не совершал, эксплуатация раскрытого материала ответа или удовлетворение прокси без выполнения задачи. Наблюдение за трассировками того, как агенты решают проблемы, часто выявляет источник этих сбоев. Затем задача, среда и верификатор могут быть пересмотрены и запущены снова.

Оценки в формате Harbor

Навык создает оценки как задачи Harbor:

  1. Инструкция: сообщение, передаваемое агенту в начале, описывающее задачу.
  2. Среда: задается в виде Dockerfile, содержащего настройку задачи, например, какие инструменты установить или какие данные заполнить в файловой системе.
  3. Верификатор, который оценивает, правильно ли агент выполнил задачу.

Навык собирает эти компоненты вместе как задачу Harbor:

markdown
1evals/<task-id>/
2├── task.toml
3├── instruction.md
4├── environment/
5└── tests/

Harbor запускает агента в среде и записывает его траекторию, артефакты, вознаграждение и ошибки. Затем одна и та же оценка может быть запущена с разными моделями, промптами, инструментами и версиями агентов.

Почему это важно

Непрерывное обучение можно рассматривать как постоянную задачу интеллектуального анализа данных, где производственные данные используются для создания оценок, которые со временем улучшают агентов. Команды анализируют трассировки, чтобы найти повторяющиеся запросы пользователей, ошибки, неудачные вызовы инструментов и неправильные изменения состояния, которые становятся оценками, чтобы то же самое поведение можно было измерить и предотвратить в будущем.

Оценки — это обучающие данные для агентов. Команды могут подгонять поведение агента под них с помощью инженерии обвязки, такой как изменение промптов и инструментов или тонкая настройка. Оценка предоставляет фиксированную цель для определения, улучшили ли эти изменения предполагаемую способность.

Контейнеризированные оценки ускоряют этот процесс. Задача и среда остаются стабильными, в то время как конфигурация агента меняется, поэтому разработчики могут заменять модели, инструменты, промпты или целые версии агентов и напрямую сравнивать результаты. Несколько конфигураций могут выполняться параллельно.

Воспроизводимые среды критически важны для этого сигнала. Когда оценка зеркалирует соответствующие инструменты, данные, разрешения, состояние и режимы сбоев из продакшена, разработчики получают стабильный полигон, который все еще репрезентативен для работы агента. Они могут быстро экспериментировать, не полагаясь на изменяющиеся производственные системы и не записывая в производственное состояние.

Результирующий цикл:

анализировать трассировки -> обнаружить сбой -> создать оценку -> улучшить агента -> повторить

Попробуйте сегодня

Eval Engineering Skill доступен в репозитории langchain-ai/langchain-skills.

Установите навык в Codex или Claude Code, откройте репозиторий, содержащий агента, которого вы хотите оценить, укажите агенту набор трассировок, если они доступны, и начните с простого промпта:

Мы с нетерпением ждем расширения этого навыка и создания инструментов, которые упростят автоматическое создание оценок и автономную подгонку агентов под них.

Сохранение в один клик

Используйте YouMind для глубокого чтения вирусных статей с помощью ИИ

Сохраняйте источники, задавайте точные вопросы, обобщайте аргументы и превращайте вирусные статьи в полезные заметки в одном рабочем пространстве ИИ.

Исследовать YouMind
Для авторов

Превратите ваш Markdown в аккуратную статью для 𝕏

Когда вы публикуете длинные тексты, изображения, таблицы и блоки кода, форматирование в 𝕏 становится мучением. YouMind превращает полный черновик в Markdown в чистую статью, готовую к публикации в 𝕏.

Попробовать Markdown для 𝕏

Другие паттерны для анализа

Недавние виральные статьи

Смотреть другие виральные статьи