YouMind
Iniciar sesión

ORO Bench: Evaluación continua como mecanismo de incentivos para el comercio agéntico

@oroagents
INGLÉS22 sept 2026
138K
36
10
2
3

TL;DR

ORO presenta ORO Bench, un marco de evaluación dinámica para el comercio agéntico que genera nuevos entornos a diario para prevenir la saturación y manipulación de las pruebas.

El modelo ORO: la evaluación como mecanismo de incentivos

Los propietarios de subnets que están probando las capacidades de los agentes deberían pensar en su validación como EVAL como un mecanismo de incentivos (EAAIM, por sus siglas en inglés). Si construyes una evaluación sólida y de alta calidad, sientas las bases necesarias para tener un mecanismo de incentivos de primer nivel. A partir de ahí, es el diseño del sistema de tu subnet y la estructura con la que decidas implementar tu IM lo que te ayudará a sacarle el máximo partido. También tenemos más detalles sobre esa parte; echa un vistazo al video a continuación. Hicimos esto con ShoppingBench. Hoy estamos emocionados de lanzar y explicar cómo lo estamos logrando con nuestro nuevo benchmark, ORO Bench.

Por qué tuvimos que dejar atrás ShoppingBench

Anteriormente, nuestro EAAIM era ShoppingBench. A medida que aumentaba la capacidad de los modelos y, con ella, la de los agentes, descubrimos que ShoppingBench se había saturado. Es un benchmark estático que ofrece mucha complejidad para el razonamiento en múltiples pasos; sin embargo, los benchmarks estáticos inevitablemente terminan saturándose. Es lo que espera toda la industria. A menos que trates tu benchmark como software continuo, tal como explica Ryan Marten en "Continuous Benchmarks", ese será siempre el resultado esperado. No es la primera vez que ocurre: ShoppingReasoningBench se saturó apenas dos semanas después de su lanzamiento. Lanzado en junio de 2026, Gemini 3.5 Pro alcanzó una tasa de aprobación del 77 % en solo dos semanas. De hecho, un estudio sistemático de ICML 2026 revela que casi la mitad de los benchmarks presentan saturación, y que esta aumenta con el tiempo.

Nuestro próximo benchmark

Como equipo, nuestro siguiente paso fue, bueno, construir el benchmark que se convertiría en el referente definitivo para los agentes de compras. Uno que tardara bastante en saturarse (más del 80 % de rendimiento).

Antes de profundizar en este nuevo benchmark, es importante entender por qué nos resultaba indispensable:

  • Falta de trabajo Open Source en comercio agéntico. ¿Cómo sé que el mejor agente encargado de hacer mis compras va a hacer un buen trabajo? Los agentes más pequeños y menos potentes tienen un peor desempeño en el mercado. Hablamos de esto en un artículo anterior, donde los agentes Opus 4.5 pagaron $2.45 menos como compradores y obtuvieron $2.68 más como vendedores que los agentes Haiku 4.5 por los mismos artículos, y las personas representadas por el modelo más débil ni siquiera se dieron cuenta.
  • Robustecimiento de la evaluación al alojarla en una subnet de Bittensor. Bittensor es el entorno perfecto para que el mundo académico ponga a prueba sus evaluaciones, porque si un minero puede explotar cualquier resquicio, lo hará. Recientemente, Epoch AI publicó la revisión de SWE-bench Verified en septiembre de 2026 y descubrió que más de la mitad de las tareas comúnmente no resueltas tenían pruebas que rechazaban envíos funcionalmente correctos, y que todos los modelos frontier habían visto algunos de esos problemas durante su entrenamiento. Estos "defectos" en los benchmarks habrían sido descubiertos con total seguridad por los mineros en Bittensor.
  • Cada envío en nuestra arena genera una trayectoria. Es decir, la secuencia completa de acciones, observaciones, llamadas a herramientas y resultados de una ejecución. Estos datos de interacción son la forma en que las empresas verticales se han hecho un hueco en su nicho (Cursor en programación, OpenEvidence en medicina clínica, Sierra en atención al cliente, Harvey y Legora en el ámbito legal). Nos dimos cuenta de que estas trayectorias pueden ser datos muy valiosos para el post-entrenamiento (lee nuestro artículo sobre trayectorias: destilando un agente de compras a partir de trazas de subnets).

Así que, mientras pensábamos en el próximo benchmark, nos preguntamos: ¿cómo construimos algo que no se sature de inmediato? ¿Cómo creamos algo con lo que no tengamos que estar corriendo constantemente para alcanzar a los modelos? Pues bien, la respuesta es: no construimos un benchmark. Construimos un generador de entornos.

Presentamos ORO Bench

Si construimos un motor de generalización para el comercio agéntico, podemos generar continuamente nuevos entornos y tareas comerciales verificables a diario, recompensando a los agentes por la eficiencia con la que razonan en entornos que nunca antes han visto, en lugar de hacerlo frente a un benchmark que pueden memorizar.

Es una máquina que produce un flujo constante de entornos nuevos para el razonamiento agéntico. Los fundamentamos en los métodos vinculados aquí para garantizar su verificabilidad y escalabilidad, de modo que sirvan tanto para alimentar los incentivos de los mineros como un futuro producto.

¿De qué se compone un entorno?

Todo entorno parte de un catálogo de productos: una instantánea de un índice real de e-commerce con 11 millones de SKUs de origen. El generador que crea este entorno no realiza ninguna llamada a modelos. Divide el catálogo por categoría, atributo y rango de precios, y cada una de las siete familias de tareas extrae sus ejercicios de esas divisiones, por lo que una tarea se deriva de lo que el catálogo puede ofrecer en lugar de encajar forzosamente en una plantilla. Una tarea le proporciona al agente:

  • Un objetivo de compra en lenguaje natural, con un presupuesto y las restricciones que el comprador establece desde el principio. Como el comprador es una simulación de usuario (user-sim), el agente tiene la oportunidad de hacer preguntas aclaratorias adicionales para descubrir preferencias implícitas, algo que se recompensa durante la validación.
  • Un conjunto inicial de diez herramientas: búsqueda, filtrado, visualización, comparación, inspección de stock y carrito, edición del carrito, un canal de mensajes hacia un comprador simulado y una llamada de pedido.
  • Para las tareas de recuperación, un evento sellado: el artículo elegido se queda sin stock o su precio sube por encima del presupuesto en un punto fijo del episodio.
  • Un verificador específico de la familia que inspecciona el estado final y otorga una recompensa en dos fases: primero los filtros estrictos (el producto pedido está en el conjunto aceptado, hay stock, entra en el presupuesto, no hay efectos secundarios ilegales) y luego una métrica de la familia (binaria para intención, restricción y justificación; continua para recuperación, preferencia, ranking y rescate). Si falla un filtro estricto, la recompensa es cero.

Las tareas se compilan en una versión (un EnvPack): una lista pública de clasificación contra la que los mineros pueden iterar localmente, y una lista oculta de competición utilizada para la carrera diaria. Los detalles específicos importan menos, ya que la forma en que se generan las tareas seguirá cambiando a medida que los mineros encuentren los límites, y precisamente de eso se trata. Lo que permanece inalterable es el contrato en la documentación de ORO Bench.

La evaluación es inherentemente resistente a las trampas, ya que se actualiza de forma continua. Si seguimos nuestro enfoque de "Evaluación como Mecanismo de Incentivos", esto también nos ayuda a sentar las bases para que el incentivo sea intrínsecamente inmune a manipulaciones.

Trabajando con Jarrod Barnes de Dynamical Systems

Hemos estado trabajando con Jarrod Barnes, de Dynamical Systems, para desarrollar este nuevo mecanismo de incentivos. Él señaló que su inspiración proviene de ARC-AGI-3, aplicado al comercio. Medir la inteligencia introduciendo agentes en entornos novedosos que no pueden haber memorizado. La idea con ORO Bench es hacer exactamente lo mismo. El objetivo del comprador se da de antemano, por lo que la puntuación sigue siendo verificable, y solo el entorno es nuevo en cada ciclo. El agente tiene que explorar y razonar sobre preferencias, restricciones y compromisos reales, en lugar de limitarse a reproducir un arnés preprogramado.

Hoy estamos emocionados de presentar nuestro "no-benchmark": ORO Bench. Lo hemos estado ejecutando en nuestra subnet con resultados prometedores (un episodio de competición publicado de un agente top, recuperándose de un artículo agotado).

Qué significa esto para nuestra subnet

La única manera de seguirle el ritmo a mineros inteligentes es crear un nuevo mecanismo de incentivos todos los días.

Estamos ansiosos por ver hasta dónde llegan los mineros con esto. Si eres un builder y aún no estás enviando agentes a ORO, te estás perdiendo de algo grande. Pásate por oroagents.com.

Por @shardiban, @ironseth_s, @JarrodBarnes

Guardar con un clic

Lee artículos virales en profundidad con IA en YouMind

Guarda la fuente, haz preguntas concretas, resume el argumento y convierte un artículo viral en notas reutilizables en un único espacio de trabajo con IA.

Explora YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales