YouMind
Đăng nhập

ORO Bench: Cơ chế đánh giá liên tục như một động lực cho thương mại tác nhân

@oroagents
TIẾNG ANH22 thg 9, 2026
138K
36
10
2
3

TL;DR

ORO giới thiệu ORO Bench, một khung đánh giá động dành cho thương mại tác nhân, tạo ra các môi trường mới mỗi ngày để ngăn chặn tình trạng bão hòa và gian lận benchmark.

Mô hình ORO: Eval như một cơ chế khuyến khích

Các chủ sở hữu subnet đang thử nghiệm năng lực của agent nên xem quá trình xác thực (validation) của mình là EVAL – tức một cơ chế khuyến khích (EAAIM). Nếu bạn xây dựng được một bộ eval vững chắc, chất lượng cao, bạn đã đặt nền móng cần thiết để tạo ra một cơ chế khuyến khích chất lượng. Sau bước này, chính thiết kế hệ thống của subnet và bộ khung mà bạn chọn để triển khai cơ chế khuyến khích (IM) sẽ giúp bạn khai thác tối đa tiềm năng của subnet đó. Chúng tôi cũng có thêm một số thông tin chi tiết về phần này, hãy xem video bên dưới. Chúng tôi đã áp dụng cách tiếp cận này với ShoppingBench. Hôm nay, chúng tôi rất hào hứng ra mắt và chia sẻ cách chúng tôi đang thực hiện điều tương tự với benchmark mới của mình: ORO Bench.

Tại sao chúng tôi phải rời bỏ ShoppingBench

Trước đây, EAAIM của chúng tôi là ShoppingBench. Khi năng lực của model tăng lên và kéo theo đó là sự phát triển của agent, chúng tôi nhận thấy ShoppingBench đã bị "bão hòa". Đây là một benchmark tĩnh mang lại độ phức tạp đáng kể cho việc suy luận nhiều bước, tuy nhiên, các benchmark tĩnh dù sao cũng sẽ đến lúc bão hòa. Đó là kỳ vọng chung của cả ngành. Trừ khi bạn coi benchmark của mình như một phần mềm được cập nhật liên tục, như Ryan Marten đã đề cập trong "Continuous Benchmarks", thì đây là điều tất yếu. Đây không phải lần đầu tiên chuyện này xảy ra, bởi ShoppingReasoningBench đã bão hòa chỉ sau 2 tuần ra mắt. Được phát hành vào tháng 6 năm 2026, Gemini 3.5 Pro đã đạt tỷ lệ vượt qua 77% trên benchmark này chỉ trong vòng 2 tuần. Thực tế, một nghiên cứu có hệ thống tại ICML 2026 cho thấy gần một nửa số benchmark có dấu hiệu bão hòa, và tỷ lệ này càng tăng theo thời gian tồn tại của chúng.

Benchmark tiếp theo của chúng tôi

Bước tiếp theo của cả đội là xây dựng một benchmark thực sự định hình tiêu chuẩn cho agent mua sắm tiêu dùng. Một benchmark sẽ mất khá nhiều thời gian mới có thể bị bão hòa (đạt hiệu suất trên 80%).

Trước khi đi sâu vào benchmark mới này, chúng ta cần hiểu rõ vì sao nó lại cần thiết:

  • Thiếu vắng các công trình mã nguồn mở trong lĩnh vực thương mại ứng dụng agent. Làm sao tôi biết được agent tốt nhất đi mua hàng thay mình sẽ hoàn thành tốt nhiệm vụ? Các agent nhỏ hơn, kém hiệu quả hơn thường hoạt động tệ hơn trên thị trường. Chúng tôi đã bàn về điều này trong một bài viết trước, nơi các agent Opus 4.5 trả ít hơn 2,45 USD khi đóng vai người mua và thu về nhiều hơn 2,68 USD khi đóng vai người bán so với các agent Haiku 4.5 cho cùng một mặt hàng, mà những người được đại diện bởi model yếu hơn hoàn toàn không nhận ra.
  • Tăng cường độ khó cho eval bằng cách vận hành nó trên một subnet Bittensor. Bittensor là sân chơi lý tưởng để giới học thuật "tôi luyện" các bộ eval của mình, bởi miner sẽ tìm mọi kẽ hở có thể để khai thác. Gần đây, Epoch AI đã công bố bài đánh giá SWE-bench Verified vào tháng 9 năm 2026 và phát hiện hơn một nửa số tác vụ thường chưa được giải quyết có các bài kiểm tra từ chối những kết quả nộp vào đúng về mặt chức năng, đồng thời mọi frontier model đều đã từng "thấy" một số bài toán trong quá trình huấn luyện. Những "lỗ hổng" này trong benchmark chắc chắn sẽ bị các miner trên Bittensor vạch trần.
  • Mọi kết quả nộp vào arena của chúng tôi đều tạo ra một trajectory (quỹ đạo hành động). Đó là toàn bộ chuỗi hành động, quan sát, lệnh gọi tool và kết quả từ một lượt chạy. Chính dữ liệu tương tác này là cách các công ty chuyên biệt khắc tên mình vào thị trường ngách (Cursor trong lập trình, OpenEvidence trong y khoa lâm sàng, Sierra trong dịch vụ khách hàng, Harvey & Legora trong pháp lý). Chúng tôi nhận ra rằng các trajectory này có thể trở thành nguồn dữ liệu hậu huấn luyện cực kỳ giá trị (đọc thêm bài báo về trajectory của chúng tôi: chưng cất một agent mua sắm từ dấu vết trên subnet).

Vì vậy, khi nghĩ về benchmark tiếp theo, chúng tôi tự hỏi: làm sao để xây dựng một thứ không bị bão hòa ngay lập tức? Làm sao để tạo ra một thứ mà chúng tôi không phải liên tục chạy theo phía sau? Câu trả lời là: chúng tôi không xây dựng một benchmark. Chúng tôi xây dựng một trình tạo môi trường.

Xin giới thiệu ORO Bench

Nếu xây dựng được một cỗ máy tổng quát hóa cho thương mại ứng dụng agent, chúng tôi có thể liên tục tạo ra các môi trường và tác vụ thương mại mới, có khả năng xác minh mỗi ngày. Qua đó, khen thưởng các agent dựa trên mức độ hiệu quả khi chúng suy luận trong những môi trường chưa từng gặp, thay vì trên một benchmark mà chúng có thể học thuộc lòng.

Đây là một cỗ máy liên tục sản sinh ra dòng chảy các môi trường mới mẻ dành cho việc suy luận của agent. Chúng tôi neo giữ chúng vào các phương pháp được liên kết tại đây nhằm đảm bảo khả năng xác minh và mở rộng, vừa phục vụ cơ chế khuyến khích cho miner, vừa làm nền tảng cho một sản phẩm trong tương lai.

Một môi trường bao gồm những gì?

Mỗi môi trường bắt đầu từ một danh mục sản phẩm: bản chụp nhanh của một chỉ mục thương mại điện tử thực tế với 11 triệu SKU gốc. Trình tạo ra môi trường này không hề gọi bất kỳ model nào. Nó phân chia danh mục theo nhóm hàng, thuộc tính và khoảng giá; mỗi trong bảy họ tác vụ sẽ lấy nhiệm vụ của mình từ các lát cắt đó. Nhờ vậy, một tác vụ được hình thành từ những gì danh mục có thể hỗ trợ, thay vì bị ép vào một khuôn mẫu cố định. Một tác vụ cung cấp cho agent:

  • Mục tiêu của người mua bằng ngôn ngữ tự nhiên, kèm ngân sách và các ràng buộc mà người mua nêu ra ngay từ đầu. Vì người mua là một user-sim (người dùng mô phỏng), agent có cơ hội đặt thêm câu hỏi làm rõ để khám phá các sở thích ngầm, và điều này sẽ được cộng điểm trong quá trình xác thực.
  • Một bộ mười tool khởi điểm: search, filter, view, compare, kiểm tra stock và cart, chỉnh sửa cart, kênh nhắn tin với người mua mô phỏng, và lệnh gọi order.
  • Đối với các tác vụ khôi phục (recovery), một sự kiện được niêm phong: món hàng đã chọn hết hàng hoặc bị đẩy giá lên quá ngân sách tại một thời điểm cố định trong lượt chạy.
  • Một trình xác minh riêng cho từng họ tác vụ, kiểm tra trạng thái cuối cùng và trao thưởng qua hai giai đoạn: trước tiên là các cổng cứng (sản phẩm đã đặt nằm trong tập hợp được chấp nhận, còn hàng, trong ngân sách, không có tác dụng phụ trái phép), sau đó là thước đo của từng họ (nhị phân cho ý định, ràng buộc và biện minh; liên tục cho truy xuất, sở thích, xếp hạng và khôi phục). Không vượt qua cổng nào thì không nhận được điểm.

Các tác vụ được đóng gói thành một bản phát hành (EnvPack): gồm danh sách vòng loại công khai để miner có thể lặp lại thử nghiệm cục bộ, và danh sách cuộc đua ẩn dùng cho cuộc đua hằng ngày. Chi tiết cụ thể không quá quan trọng, bởi cách tạo tác vụ sẽ liên tục thay đổi khi miner tìm ra các giới hạn mới – và đó chính là mục đích. Điều duy nhất giữ nguyên là bản hợp đồng trong tài liệu ORO Bench.

Bộ eval này vốn dĩ kháng lại việc gian lận nhờ được cập nhật liên tục. Nếu bám sát triết lý “Eval như một cơ chế khuyến khích”, điều này cũng giúp chúng tôi đặt nền móng để cơ chế khuyến khích tự thân chống lại được mọi nỗ lực lách luật.

Hợp tác cùng Jarrod Barnes từ Dynamical Systems

Chúng tôi đã làm việc cùng Jarrod Barnes từ Dynamical Systems để phát triển cơ chế khuyến khích mới này. Anh chia sẻ rằng cảm hứng của mình đến từ ARC-AGI-3, được áp dụng vào lĩnh vực thương mại. Tức là đo lường trí thông minh bằng cách thả agent vào những môi trường hoàn toàn mới mà chúng không thể học thuộc. Ý tưởng cốt lõi của ORO Bench cũng tương tự. Mục tiêu của người mua luôn được đưa ra sẵn nên việc chấm điểm vẫn có thể xác minh, và chỉ có môi trường là thay đổi sau mỗi chu kỳ. Agent buộc phải khám phá và suy luận dựa trên sở thích, ràng buộc cũng như sự đánh đổi thực tế, thay vì chỉ lặp lại một kịch bản được lập trình cứng.

Hôm nay, chúng tôi rất hào hứng giới thiệu "không-phải-một-benchmark" của mình: ORO Bench. Chúng tôi đã vận hành nó trên subnet với những kết quả đầy hứa hẹn (một tập cuộc đua đã công bố từ một agent hàng đầu, xử lý tình huống khi món hàng cháy hàng).

Điều này có ý nghĩa gì với subnet của chúng tôi

Cách duy nhất để bắt kịp những miner thông minh là tạo ra một cơ chế khuyến khích mới mỗi ngày.

Chúng tôi rất mong chờ xem các miner sẽ đưa điều này đi đến đâu. Nếu bạn là một builder mà chưa nộp agent lên ORO, thì bạn đang bỏ lỡ một cơ hội lớn đấy. Hãy ghé thăm ngay oroagents.com.

Bởi @shardiban, @ironseth_s, @JarrodBarnes

Lưu một chạm

Đọc sâu bài viết viral bằng AI trong YouMind

Lưu nguồn, đặt câu hỏi tập trung, tóm tắt lập luận và biến một bài viết viral thành các ghi chú có thể tái sử dụng trong một không gian làm việc AI duy nhất.

Khám phá YouMind
Dành cho nhà sáng tạo

Biến Markdown của bạn thành bài viết 𝕏 gọn gàng

Khi bạn đăng bài viết dài của riêng mình, việc định dạng hình ảnh, bảng và khối mã cho 𝕏 rất mệt mỏi. YouMind biến cả bản nháp Markdown thành một bài viết 𝕏 gọn gàng, sẵn sàng để đăng.

Thử Markdown sang 𝕏

Thêm pattern để giải mã

Bài viết viral gần đây

Khám phá thêm bài viết viral