YouMind
登录

ORO Bench:作为智能体商业激励机制的持续评估

@oroagents
英语2026年9月22日
138K
36
10
2
3

TL;DR

ORO 推出了 ORO Bench,这是一个针对智能体商业的动态评估框架,通过每日生成全新环境来防止基准测试饱和和作弊行为。

ORO 模型:将 Eval 作为激励机制

正在测试 Agent 能力的子网所有者,应该把验证环节理解为“将 Eval 作为激励机制”(EVAL as an Incentive Mechanism,简称 EAAIM)。只要你能构建出稳健、高质量的 eval,就等于为打造一套高质量的激励机制打好了地基。在此基础上,真正帮你把子网价值最大化的,是子网的系统设计,以及你用来承载激励机制(IM)的整体架构。关于这部分我们还有更多细节,点击下方视频查看。我们在 ShoppingBench 上就是这么做的。今天,我们非常激动地宣布并介绍,如何用全新的基准 ORO Bench 来落地这套思路。

为什么我们必须告别 ShoppingBench

此前,我们的 EAAIM 是 ShoppingBench。随着模型能力不断提升,Agent 能力也水涨船高,我们发现 ShoppingBench 已经被“刷满”了。它是一个静态基准,在多步推理的复杂度上确实很有料,但静态基准终究逃不过被饱和的命运。这是整个行业的共识。除非你把基准当成持续迭代的软件来做——正如 Ryan Marten 在《Continuous Benchmarks》一文中所提到的——否则这就是必然结局。这已经不是第一次了:ShoppingReasoningBench 上线仅 2 周就被刷到饱和。2026 年 6 月发布的 Gemini 3.5 Pro,在上线两周内就拿到了 77% 的通过率。事实上,一项 ICML 2026 的系统性研究发现,近半数基准都存在饱和现象,而且越老的基准饱和率越高。

我们的下一个基准

作为团队,我们的下一步很明确:打造一个能定义消费级购物 Agent 的标杆基准,一个需要花很长时间才能被刷到饱和(80%+ 表现)的基准。

在深入介绍这个新基准之前,有必要先说清楚它为什么非做不可:

  • Agentic commerce(智能体商业)领域缺乏开源成果。我怎么知道那个号称最会帮我购物的 Agent 真的靠谱?性能较弱的小 Agent 在市场里表现明显更差。我们在上一篇文章中聊过这一点:对于同样的商品,Opus 4.5 Agents 作为买家平均少花 2.45 美元,作为卖家则比 Haiku 4.5 Agents 多赚 2.68 美元,而由弱模型代表的用户对此毫无察觉。
  • 通过托管在 Bittensor 子网上来加固 eval。对学术界来说,Bittensor 是打磨和加固 eval 的完美试验场,因为矿工一定会想尽办法钻空子。最近,Epoch AI 在 2026 年 9 月发布了 SWE-bench Verified 评测报告,发现超过一半的常见未解决任务中,测试用例会把功能正确的提交直接拒掉,而且每个前沿模型都在训练阶段见过其中部分题目。这些基准里的“漏洞”,放在 Bittensor 上肯定会被矿工挖出来。
  • 在我们 arena 上的每一次提交都会生成一条轨迹(trajectory),也就是一次运行中完整的动作、观察、工具调用和结果序列。正是这类交互数据,让垂直领域公司在各自赛道里杀出了一片天(编程领域的 Cursor、临床医学领域的 OpenEvidence、客服领域的 Sierra、法律领域的 Harvey 与 Legora)。我们意识到,这些轨迹可以成为极具价值的后训练数据(欢迎阅读我们的轨迹论文:从子网 traces 中蒸馏购物 Agent)。

所以在构思下一个基准时,我们问自己:怎么才能造出一个不会立刻被刷满的东西?怎么才能不用一直疲于奔命地追赶?答案很简单:我们不造基准,我们造一个环境生成器。

隆重推出:ORO Bench

如果我们能为 agentic commerce 造一台泛化引擎,就能每天持续生成全新、可验证的商业环境和任务,奖励那些能在从未见过的环境中高效推理的 Agent,而不是奖励死记硬背某套题库的选手。

这是一台源源不断产出新鲜环境的机器,专为 agentic 推理而生。我们通过此处介绍的方法为其提供支撑,确保可验证性与可扩展性,既能喂饱矿工的激励需求,也能服务于未来的产品。

一个环境包含什么?

每个环境都始于一份商品目录:一个真实电商索引的快照,包含 1100 万个源 SKU。生成该环境的过程完全不需要调用模型。它会按类目、属性和价格带对目录进行切片,七大任务族各自从这些切片中提取任务,因此任务是“目录能支持什么就生成什么”,而不是硬套模板。单个任务会给 Agent 提供:

  • 一段自然语言描述的购物目标,包含预算以及买家事先声明的限制条件。由于买家是模拟用户(user-sim),Agent 有机会进一步追问以挖掘软性偏好,而这在验证环节会获得奖励。
  • 一套初始的十个工具:搜索、筛选、查看、对比、库存与购物车检查、购物车编辑、与模拟买家的消息通道,以及下单调用。
  • 对于恢复类任务,还会有一个密封事件:在 episode 的某个固定节点,选中的商品突然缺货,或者涨价超出预算。
  • 一个特定任务族的验证器,负责检查最终状态并分两阶段发放奖励:先看硬性门槛(下单商品是否在允许集合内、是否有货、是否在预算内、有无非法副作用),再算任务族指标(意图、约束和理由为二值指标;检索、偏好、排序和恢复为连续指标)。门槛没过,奖励为零。

任务会被打包成一个发布版本(EnvPack):一份公开的资格赛清单,供矿工在本地反复迭代;以及一份隐藏的竞速清单,用于每日竞速。具体细节其实没那么重要,因为随着矿工不断试探边界,任务生成方式也会持续演进——这正是设计初衷。真正固定不变的,是 ORO Bench 文档里的那份契约。

由于持续更新,这套 eval 天生抗刷。顺着我们“将 Eval 作为激励机制”的思路,这也为打造一套天然防作弊的激励机制打下了基础。

与 Dynamical Systems 的 Jarrod Barnes 合作

我们一直在和 Dynamical Systems 的 Jarrod Barnes 合作开发这套新的激励机制。他提到,灵感来自 ARC-AGI-3,只是把它应用到了商业场景:把 Agent 丢进它们不可能背过的新环境里,以此来衡量智能水平。ORO Bench 想做的也是同一件事。购物目标是给定的,所以评分依然可验证,每个周期只有环境是全新的。Agent 必须去探索、去针对真实的偏好、约束和取舍做推理,而不是重放一套写死的流程。

今天,我们非常激动能推出这款“不是基准的基准”——ORO Bench。我们已经把它跑在了自己的子网上,结果相当有戏(这是一个顶尖 Agent 在商品售罄后成功补救的竞速 episode)。

这对我们的子网意味着什么

要跟上聪明矿工的脚步,唯一的办法就是每天造出一套新的激励机制。

我们很期待矿工们能把它玩出什么花样。如果你是开发者,却还没在 ORO 上提交 Agent,那你真的亏大了。快去 oroagents.com 看看吧。

作者:@shardiban@ironseth_s@JarrodBarnes

一键保存

使用 YouMind AI 深度阅读爆款文章

保存原文、追问细节、总结观点,并在一个 AI 工作空间里把爆款文章沉淀成可复用笔记。

了解 YouMind
写给创作者

把你的 Markdown 变成干净的 𝕏 文章

图片上传、表格、代码块,往 𝕏 上手动重排太痛苦。YouMind 把整篇 Markdown 一键转成干净、可直接发布的 𝕏 文章草稿。

试试 Markdown 转 𝕏

更多可拆解样本

近期爆款文章

探索更多爆款文章