YouMind
Iniciar sessão

ORO Bench: Avaliação Contínua como Mecanismo de Incentivo para o Comércio Agêntico

@oroagents
INGLÊS22/09/2026
138K
36
10
2
3

TL;DR

O ORO apresenta o ORO Bench, uma estrutura de avaliação dinâmica para o comércio agêntico que gera novos ambientes diariamente para evitar a saturação e manipulação dos benchmarks.

O modelo ORO: Eval como um Mecanismo de Incentivo

Os proprietários de subnets que estão testando as capacidades de agentes deveriam pensar na validação como EVAL enquanto mecanismo de incentivo (EAAIM). Se você construir um eval robusto e de alta qualidade, estará criando a base necessária para ter um mecanismo de incentivo igualmente forte. Depois disso, é o design do sistema da sua subnet e a estrutura na qual você escolhe entregar seu IM (Mecanismo de Incentivo) que vão te ajudar a extrair o máximo dela. Também temos mais detalhes sobre essa parte — confira o vídeo abaixo. Fizemos isso com o ShoppingBench. Hoje, estamos animados para lançar e anunciar como estamos aplicando esse conceito no nosso novo benchmark, o ORO Bench.

Por que precisávamos deixar o ShoppingBench para trás

Anteriormente, nosso EAAIM era o ShoppingBench. Conforme a capacidade dos modelos aumentou e a dos agentes acompanhou o ritmo, percebemos que o ShoppingBench saturou. É um benchmark estático com muito a oferecer em termos de complexidade para raciocínio em múltiplas etapas; no entanto, benchmarks estáticos inevitavelmente acabam saturando. Essa é a expectativa do mercado. A menos que você trate seu benchmark como um software contínuo, como explica Ryan Marten, links em "Continuous Benchmarks", esse será sempre o resultado. Não é a primeira vez que isso acontece: o ShoppingReasoningBench saturou apenas duas semanas após o lançamento. Lançado em junho de 2026, o Gemini 3.5 Pro atingiu uma taxa de aprovação de 77% nele em menos de duas semanas. Na verdade, um estudo sistemático do ICML 2026 descobriu que quase metade dos benchmarks apresenta saturação, com taxas que aumentam conforme envelhecem.

Nosso próximo Benchmark

Como equipe, nosso próximo passo foi, bem, construir o benchmark que vai se tornar a referência definitiva para agentes de compras voltados ao consumidor. Um que demoraria a saturar (desempenho acima de 80%).

Antes de mergulharmos nesse novo benchmark, é importante entender por que ele é necessário para nós:

  • Falta de trabalho Open Source em comércio agêntico. Como eu sei que o melhor agente para fazer minhas compras vai realmente fazer um bom trabalho? Agentes menores e com menor desempenho saem perdendo no mercado. Falamos sobre isso em um artigo anterior, onde agentes Opus 4.5 pagaram US$ 2,45 a menos como compradores e extraíram US$ 2,68 a mais como vendedores do que os agentes Haiku 4.5 pelos mesmos itens, e as pessoas representadas pelo modelo mais fraco não perceberam.
  • Endurecimento do eval hospedando-o em uma subnet Bittensor. O Bittensor é o playground perfeito para a academia endurecer seus evals, porque um minerador vai explorar qualquer brecha possível. Recentemente, a Epoch AI publicou a revisão do SWE-bench Verified, em setembro de 2026, e descobriu que mais da metade das tarefas comumente não resolvidas tinha testes que rejeitavam envios funcionalmente corretos, e todos os modelos de fronteira já tinham visto alguns desses problemas durante o treinamento. Essas "falhas" nos benchmarks teriam, com certeza, sido descobertas pelos mineradores no Bittensor.
  • Cada envio na nossa arena gera uma trajetória. A sequência completa de ações, observações, chamadas de ferramentas e resultados de uma execução. Esses dados de interação são a forma como empresas verticais conquistaram espaço em seus nichos (Cursor em programação, OpenEvidence em medicina clínica, Sierra em atendimento ao cliente, Harvey & Legora no setor jurídico). Percebemos que essas trajetórias podem ser dados valiosos de pós-treinamento (leia nosso artigo sobre trajetórias: destilando um agente de compras a partir de rastros de subnets).

Então, enquanto pensávamos no próximo benchmark, nos perguntamos: como construímos algo que não sature imediatamente? Como criamos algo com o qual não precisemos ficar correndo atrás o tempo todo? Bem, a resposta é: não construímos um benchmark. Construímos um gerador de ambientes.

Apresentando o ORO Bench

Se construirmos um motor de generalização para o comércio agêntico, podemos gerar continuamente novos ambientes e tarefas de comércio verificáveis diariamente, recompensando os agentes pela eficiência com que raciocinam em ambientes que nunca viram antes, em vez de avaliá-los em um benchmark que eles podem simplesmente memorizar.

É uma máquina que produz um fluxo constante de ambientes inéditos para o raciocínio agêntico. Nós os fundamentamos nos métodos descritos aqui para garantir verificabilidade e escalabilidade, alimentando tanto os incentivos dos mineradores quanto um produto futuro.

Do que um ambiente é composto?

Todo ambiente começa a partir de um catálogo de produtos: um recorte de um índice real de e-commerce com 11 milhões de SKUs de origem. O gerador que cria esse ambiente não faz nenhuma chamada de modelo. Ele fatia o catálogo por categoria, atributo e faixa de preço, e cada uma das sete famílias de tarefas extrai suas tarefas dessas fatias, de modo que uma tarefa deriva daquilo que o catálogo pode suportar, em vez de ser forçada a caber em um template. Uma tarefa entrega ao agente:

  • Um objetivo de compra em linguagem natural, com um orçamento e as restrições declaradas previamente pelo comprador. Como o comprador é uma simulação de usuário (user-sim), o agente tem a oportunidade de fazer perguntas adicionais de esclarecimento para revelar preferências implícitas, o que é recompensado na validação.
  • Um conjunto inicial de dez ferramentas: busca, filtro, visualização, comparação, inspeção de estoque e carrinho, edições no carrinho, um canal de mensagens para um comprador simulado e uma chamada de pedido.
  • Para tarefas de recuperação, um evento selado: o item escolhido sai de estoque ou tem o preço reajustado para além do orçamento, em um ponto fixo do episódio.
  • Um verificador específico da família que inspeciona o estado final e paga uma recompensa em duas etapas: primeiro os hard gates (o produto pedido está no conjunto aceito, em estoque, dentro do orçamento, sem efeitos colaterais ilegais), depois uma métrica da família (binária para intenção, restrição e justificativa; contínua para recuperação, preferência, ranking e recovery). Um gate reprovado paga zero.

As tarefas são compiladas em uma release (um EnvPack): uma lista pública de qualificação na qual os mineradores podem iterar localmente, e uma lista oculta usada na corrida diária. Os detalhes específicos importam menos, já que a forma como as tarefas são geradas continuará mudando à medida que os mineradores encontrarem as bordas do sistema — e esse é exatamente o objetivo. O que permanece fixo é o contrato descrito na documentação do ORO Bench.

O eval é inerentemente resistente a manipulações, pois é atualizado continuamente. Se seguirmos nossa abordagem de “Eval como um Mecanismo de Incentivo”, isso também nos ajuda a criar a base para que o incentivo seja naturalmente à prova de trapaças.

Trabalhando com Jarrod Barnes, da Dynamical Systems

Temos trabalhado com Jarrod Barnes, da Dynamical Systems, para desenvolver esse novo mecanismo de incentivo. Ele comentou que sua inspiração aqui vem do ARC-AGI-3, aplicado ao comércio. Medir a inteligência colocando agentes em ambientes inéditos que eles não poderiam ter memorizado. A ideia com o ORO Bench é fazer exatamente o mesmo. O objetivo do comprador é fornecido, então a pontuação continua verificável, e apenas o ambiente é novo a cada ciclo. O agente precisa explorar e raciocinar sobre preferências, restrições e trade-offs reais, em vez de apenas reproduzir um script pré-definido.

Estamos animados para apresentar hoje o nosso "não-benchmark", o ORO Bench. Já o estamos rodando em nossa subnet com resultados promissores (um episódio de corrida divulgado de um agente top, se recuperando de um item esgotado).

O que isso significa para a nossa subnet

A única maneira de acompanhar mineradores inteligentes é criar um novo mecanismo de incentivo todos os dias.

Estamos ansiosos para ver até onde os mineradores vão levar isso. Se você é um builder e ainda não está enviando agentes no ORO, está perdendo uma grande oportunidade. Dá uma olhada em oroagents.com.

Por @shardiban, @ironseth_s, @JarrodBarnes

Guardar com um clique

Faça leitura aprofundada de artigos virais com IA no YouMind

Guarde a fonte, faça perguntas específicas, resuma o argumento e transforme um artigo viral em notas reutilizáveis num único espaço de trabalho com IA.

Explorar o YouMind
Para criadores

Transforme o seu Markdown num artigo 𝕏 impecável

Quando publica os seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown num artigo 𝕏 impecável e pronto a publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais