Hướng tới tự động hóa kỹ thuật đánh giá (Eval Engineering)

@Vtrivedy10
TIẾNG ANH1 ngày trước · 22 thg 7, 2026
222K
631
62
15
1.7K

TL;DR

LangChain Labs đã ra mắt kỹ năng Eval Engineering giúp tự động hóa việc tạo đánh giá tác nhân AI bằng cách phân tích các kho lưu trữ (repository) và dấu vết (trace) để tạo ra các tác vụ theo định dạng Harbor.

Hôm nay chúng tôi phát hành Eval Engineering Skill, một kỹ năng giúp các coding agent xây dựng eval sử dụng ngữ cảnh từ kho lưu trữ (repository) và dấu vết (trace) của agent.

Kỹ năng này kiểm tra cách một agent được cấu trúc, khai thác các mẫu từ trace nếu có, và đề xuất các khả năng cần kiểm tra.

Kỹ năng được thiết kế để phỏng vấn người dùng, người có thể đưa ra phản hồi về các đề xuất và phê duyệt từng eval một cách lặp lại. Sản phẩm cuối cùng là một tập hợp các eval có thể thực thi ở định dạng Harbor.

Xây dựng Môi trường & Nhiệm vụ

Kỹ năng đầu tiên đọc kho lưu trữ và lập bản đồ bề mặt agent bao gồm prompts, models, tools, skills, hooks, v.v. Nó cũng xác định dữ liệu và dịch vụ hỗ trợ các hành vi đó, chẳng hạn như các lệnh gọi API.

Người dùng cũng có thể trỏ agent đến các trace có thể được truy xuất bằng các công cụ như langsmith-cli. Trace cho thấy cách các công cụ hoạt động trong thực tế, chẳng hạn như các tham số, kết quả và lỗi của chúng. Các hợp đồng quan sát được này giúp kỹ năng tái tạo hành vi sản xuất liên quan trong một môi trường có kiểm soát.

Việc thu thập thông tin từ repo và trace giúp agent có kiến thức về những khả năng nào quan trọng đối với agent khi nó đề xuất các nhiệm vụ eval. Chúng tôi nhận thấy rằng phỏng vấn người dùng dẫn đến tỷ lệ chấp nhận eval tốt hơn nhiều so với việc tạo một lần. Người dùng chọn từ các hướng eval được đề xuất và đưa ra hướng dẫn về các câu hỏi như công cụ & dependencies nào nên chạy trực tiếp hoặc cần được mô phỏng. Ví dụ, các lệnh gọi công cụ phát sinh chi phí hoặc yêu cầu ghi vào production có thể được mô phỏng thay vì chạy mỗi lần gọi eval.

Chúng tôi đã thử nghiệm quy trình này trên agent Q&A tài liệu của chúng tôi, chat-langchain. Đối với agent này, môi trường yêu cầu một kho dữ liệu được hiển thị thông qua các công cụ tìm kiếm agent được mô phỏng theo agent sản xuất. Các nhiệm vụ bao gồm các câu hỏi tài liệu thực tế được lấy từ các trace thực và một bộ xác minh (verifier) kiểm tra câu trả lời bằng cách sử dụng một chuỗi câu trả lời vàng và các tài liệu được trích dẫn.

Viv - inline image

Thiết kế Eval mang tính lặp lại

Chúng tôi nhận thấy rằng mặc dù agents đôi khi có thể tạo eval một lần, nhưng các eval tốt nhất đến từ việc người dùng cung cấp phản hồi và chỉ định những khả năng nào đáng để đo lường trong agents. Coding agents & skills cung cấp một giao diện tự nhiên, nơi kiến thức miền về cách xây dựng một eval tốt được mã hóa và người dùng có thể lặp lại chúng theo thời gian.

Ví dụ, chúng tôi nhận thấy rằng khi xây dựng các verifier, verifier đầu tiên hiếm khi là verifier cuối cùng. Một cách hữu ích để cải thiện nó là chạy eval và kiểm tra cả hai mặt của kết quả:

  • quỹ đạo agent (trajectory), bao gồm các message, tool call và hành động của nó.
  • quỹ đạo verifier, bằng chứng, lý luận và điểm số cuối cùng.

Điều này giúp tiết lộ liệu thiết kế nhiệm vụ hoặc verifier có đo lường đúng những gì chúng tôi quan tâm hay không, hoặc liệu nó có thể bị reward hacked khi agents có thể đi đường tắt. Những đường tắt này có thể bao gồm trích dẫn quá nhiều nguồn không liên quan để nhận được điểm tối đa trong eval, tuyên bố một hành động mà nó chưa bao giờ thực hiện, khai thác tài liệu trả lời bị lộ, hoặc thỏa mãn một proxy mà không hoàn thành nhiệm vụ. Quan sát các trace về cách agents giải quyết vấn đề thường tiết lộ nguồn gốc của những thất bại này. Sau đó, nhiệm vụ, môi trường và verifier có thể được sửa đổi và chạy lại.

Eval ở định dạng Harbor

Kỹ năng xây dựng eval dưới dạng Harbor tasks:

  1. Hướng dẫn (Instruction): thông điệp được đưa cho agent khi bắt đầu mô tả nhiệm vụ
  2. Môi trường (Environment): được cung cấp dưới dạng Dockerfile chứa thiết lập cho nhiệm vụ, chẳng hạn như công cụ nào cần cài đặt hoặc dữ liệu nào cần đưa vào filesystem
  3. Bộ xác minh (Verifier) đánh giá xem agent có hoàn thành nhiệm vụ chính xác hay không.

Kỹ năng xây dựng các thành phần này cùng nhau thành một Harbor task:

markdown
1evals/<task-id>/
2├── task.toml
3├── instruction.md
4├── environment/
5└── tests/

Harbor chạy agent trong môi trường và ghi lại quỹ đạo, artifacts, phần thưởng và lỗi của nó. Cùng một eval sau đó có thể chạy với các model, prompt, công cụ và phiên bản agent khác nhau.

Tại sao điều này quan trọng

Học liên tục có thể được coi là một bài toán khai thác dữ liệu liên tục, nơi dữ liệu sản xuất được sử dụng để xây dựng các eval nhằm cải thiện agents theo thời gian. Các nhóm khai thác trace để tìm các yêu cầu người dùng lặp lại, lỗi, lệnh gọi công cụ thất bại và thay đổi trạng thái không chính xác. Những điều này trở thành eval để cùng một hành vi có thể được đo lường và ngăn chặn trong tương lai.

Eval là dữ liệu huấn luyện cho agents. Các nhóm có thể điều chỉnh hành vi agent theo chúng thông qua kỹ thuật harness như thay đổi prompt & công cụ hoặc fine-tuning. Eval cung cấp một mục tiêu cố định để quyết định xem những thay đổi đó có cải thiện khả năng dự định hay không.

Eval được container hóa giúp quá trình này nhanh hơn. Nhiệm vụ và môi trường vẫn ổn định trong khi cấu hình agent thay đổi, vì vậy người xây dựng có thể hoán đổi models, tools, prompts hoặc toàn bộ phiên bản agent và so sánh kết quả trực tiếp. Nhiều cấu hình có thể chạy song song.

Môi trường có thể tái tạo là rất quan trọng đối với tín hiệu đó. Khi một eval phản ánh các công cụ, dữ liệu, quyền, trạng thái và chế độ lỗi liên quan từ production, người xây dựng có được một bệ thử nghiệm ổn định vẫn đại diện cho cách agent hoạt động. Họ có thể thử nghiệm nhanh chóng mà không cần phụ thuộc vào các hệ thống production đang thay đổi hoặc ghi vào trạng thái production.

Vòng lặp kết quả là:

khai thác trace -> xác định lỗi -> xây dựng eval -> cải thiện agent -> chạy lại

Hãy dùng thử ngay hôm nay

Eval Engineering Skill có sẵn trong kho lưu trữ langchain-ai/langchain-skills.

Cài đặt kỹ năng trong Codex hoặc Claude Code, mở kho lưu trữ chứa agent bạn muốn đánh giá, trỏ agent đến một tập hợp các trace nếu có, và bắt đầu với một prompt đơn giản:

Chúng tôi mong muốn mở rộng kỹ năng này và xây dựng các công cụ để giúp việc tự động xây dựng eval và điều chỉnh agents theo chúng một cách tự động trở nên dễ dàng hơn.

Lưu một chạm

Đọc sâu bài viết viral bằng AI trong YouMind

Lưu nguồn, đặt câu hỏi tập trung, tóm tắt lập luận và biến một bài viết viral thành các ghi chú có thể tái sử dụng trong một không gian làm việc AI duy nhất.

Khám phá YouMind
Dành cho nhà sáng tạo

Biến Markdown của bạn thành bài viết 𝕏 gọn gàng

Khi bạn đăng bài viết dài của riêng mình, việc định dạng hình ảnh, bảng và khối mã cho 𝕏 rất mệt mỏi. YouMind biến cả bản nháp Markdown thành một bài viết 𝕏 gọn gàng, sẵn sàng để đăng.

Thử Markdown sang 𝕏

Thêm pattern để giải mã

Bài viết viral gần đây

Khám phá thêm bài viết viral