El modelo ORO: la evaluación como mecanismo de incentivos
Los propietarios de subnets que están probando las capacidades de los agentes deberían pensar en su validación como EVAL, es decir, como un mecanismo de incentivos (EAAIM, por sus siglas en inglés). Si construyes una evaluación sólida y de alta calidad, sientas las bases necesarias para tener un mecanismo de incentivos de primer nivel. Después de eso, el diseño del sistema de tu subnet y la estructura con la que decidas implementar tu mecanismo de incentivos son lo que te ayudará a sacarle el máximo provecho. También tenemos más detalles sobre esa parte; mira el video a continuación. Esto fue exactamente lo que hicimos con ShoppingBench. Hoy nos emociona lanzar y explicar cómo lo estamos logrando con nuestro nuevo benchmark: ORO Bench.
Por qué tuvimos que dejar atrás ShoppingBench
Anteriormente, nuestro EAAIM era ShoppingBench. A medida que aumentaba la capacidad de los modelos y, con ella, la de los agentes, notamos que ShoppingBench se saturó. Es un benchmark estático que ofrece mucha complejidad para el razonamiento en múltiples pasos; sin embargo, los benchmarks estáticos inevitablemente terminan saturándose. Esa es la expectativa de la industria. A menos que trates tu benchmark como software de desarrollo continuo, tal como explica Ryan Marten en "Continuous Benchmarks", ese será siempre el resultado. No es la primera vez que pasa: ShoppingReasoningBench se saturó apenas dos semanas después de su lanzamiento. Lanzado en junio de 2026, Gemini 3.5 Pro alcanzó una tasa de aprobación del 77 % en solo dos semanas. De hecho, un estudio sistemático de ICML 2026 descubrió que casi la mitad de los benchmarks presentan saturación, y que esta aumenta con el tiempo.
Nuestro próximo benchmark
Como equipo, nuestro siguiente paso fue, bueno, construir el benchmark que se convertiría en el referente definitivo para agentes de compras. Uno que tardara bastante en saturarse (más del 80 % de rendimiento).
Antes de entrar de lleno en este nuevo benchmark, es importante entender por qué lo necesitábamos:
- Falta de trabajo open source en comercio agéntico. ¿Cómo sé que el mejor agente encargado de hacer mis compras va a hacer un buen trabajo? Los agentes más pequeños y con menor rendimiento salen perdiendo en el mercado. Hablamos de esto en un artículo anterior, donde los agentes Opus 4.5 pagaron $2.45 menos como compradores y obtuvieron $2.68 más como vendedores que los agentes Haiku 4.5 por los mismos artículos, y las personas representadas por el modelo más débil ni siquiera se dieron cuenta.
- Robustecer la evaluación alojándola en una subnet de Bittensor. Bittensor es el campo de pruebas perfecto para que el mundo académico endurezca sus evaluaciones, porque si un minero puede explotar cualquier resquicio, lo hará. Hace poco, Epoch AI publicó la revisión de SWE-bench Verified en septiembre de 2026, y encontró que más de la mitad de las tareas comúnmente no resueltas tenían pruebas que rechazaban envíos funcionalmente correctos, y que todos los modelos frontier habían visto algunos de esos problemas durante su entrenamiento. Estos "defectos" en los benchmarks habrían sido descubiertos, sin duda alguna, por los mineros en Bittensor.
- Cada envío en nuestra arena genera una trayectoria. Es decir, la secuencia completa de acciones, observaciones, llamadas a herramientas y resultados de una ejecución. Estos datos de interacción son la forma en que las empresas verticales se han abierto camino en su nicho (Cursor en programación, OpenEvidence en medicina clínica, Sierra en atención al cliente, Harvey y Legora en el ámbito legal). Nos dimos cuenta de que estas trayectorias pueden ser datos muy valiosos para el post-entrenamiento (lee nuestro artículo sobre trayectorias: destilando un agente de compras a partir de trazas de subnets).
Así que, mientras pensábamos en el próximo benchmark, nos preguntamos: ¿cómo construimos algo que no se sature de inmediato? ¿Cómo creamos algo con lo que no tengamos que estar corriendo detrás todo el tiempo? Bueno, la respuesta es: no construimos un benchmark. Construimos un generador de entornos.
Presentamos ORO Bench
Si construimos un motor de generalización para el comercio agéntico, podemos generar continuamente nuevos entornos y tareas de comercio verificables a diario, recompensando a los agentes por la eficiencia con la que razonan en entornos que nunca antes habían visto, en lugar de premiarlos por memorizar un benchmark.
Esta es una máquina que produce un flujo constante de entornos nuevos para el razonamiento agéntico. Los fundamentamos en los métodos descritos aquí para garantizar su verificabilidad y escalabilidad, de modo que sirvan tanto para alimentar los incentivos de los mineros como para un producto futuro.
¿De qué se compone un entorno?
Todo entorno parte de un catálogo de productos: una instantánea de un índice real de e-commerce con 11 millones de SKUs de origen. El generador que crea este entorno no hace ninguna llamada a modelos. Divide el catálogo por categoría, atributo y rango de precios, y cada una de las siete familias de tareas extrae sus ejercicios de esas divisiones; así, una tarea se deriva de lo que el catálogo puede ofrecer en lugar de encajar forzosamente en una plantilla. Una tarea le da al agente:
- Un objetivo de compra en lenguaje natural, con un presupuesto y las restricciones que el comprador establece desde el principio. Como el comprador es un usuario simulado, el agente tiene la oportunidad de hacer preguntas aclaratorias adicionales para descubrir preferencias implícitas, algo que se premia en la validación.
- Un conjunto inicial de diez herramientas: búsqueda, filtro, visualización, comparación, inspección de stock y carrito, edición del carrito, un canal de mensajes hacia un comprador simulado y una llamada de pedido.
- Para las tareas de recuperación, un evento sellado: el artículo elegido se agota o su precio sube por encima del presupuesto en un punto fijo del episodio.
- Un verificador específico de la familia que inspecciona el estado final y paga una recompensa en dos etapas: primero los filtros estrictos (el producto pedido está en el conjunto aceptado, hay stock, entra en el presupuesto, no hay efectos secundarios ilegales) y luego una métrica de la familia (binaria para intención, restricción y justificación; continua para recuperación, preferencia, ranking y rescate). Si falla un filtro, el pago es cero.
Las tareas se compilan en un release (un EnvPack): una lista pública de clasificación contra la que los mineros pueden iterar localmente, y una lista oculta de competencia que se usa para la carrera diaria. Los detalles específicos importan menos, ya que la forma en que se generan las tareas seguirá cambiando a medida que los mineros encuentren los límites, y esa es precisamente la idea. Lo que permanece fijo es el contrato en la documentación de ORO Bench.
La evaluación es inherentemente resistente a las trampas porque se actualiza de forma continua. Si seguimos nuestro enfoque de "la evaluación como mecanismo de incentivos", esto también nos ayuda a sentar las bases para que el incentivo sea, por naturaleza, difícil de manipular.
Trabajando con Jarrod Barnes de Dynamical Systems
Hemos estado trabajando con Jarrod Barnes, de Dynamical Systems, para desarrollar este nuevo mecanismo de incentivos. Él comentó que su inspiración viene de ARC-AGI-3, aplicado al comercio: medir la inteligencia poniendo a los agentes en entornos novedosos que no puedan haber memorizado. La idea con ORO Bench es hacer exactamente lo mismo. El objetivo del comprador se entrega por adelantado, por lo que la puntuación sigue siendo verificable, y solo el entorno es nuevo en cada ciclo. El agente tiene que explorar y razonar sobre preferencias, restricciones y concesiones reales, en lugar de limitarse a repetir un guion predefinido.
Hoy nos emociona presentar nuestro "no-benchmark": ORO Bench. Lo hemos estado ejecutando en nuestra subnet con resultados muy prometedores (un episodio de carrera publicado de uno de los mejores agentes, recuperándose de un artículo agotado).
Qué significa esto para nuestra subnet
La única manera de seguirle el ritmo a mineros inteligentes es crear un nuevo mecanismo de incentivos todos los días.
Nos entusiasma ver hasta dónde llegan los mineros con esto. Si eres builder y todavía no estás enviando agentes a ORO, te estás perdiendo de mucho. Pásate por oroagents.com.





