O Reef é totalmente open source: https://github.com/Human-Agent-Society/reef
1. Antes que todo o hype do "RSI" se torne realidade
Antes que o entusiasmo atual em torno do RSI se concretize totalmente, queremos abrir o código do Reef, uma infraestrutura que estamos construindo para o mesmo problema mais amplo: permitir que agentes (ferramenta + modelo) evoluam continuamente a partir de sua experiência.
O objetivo é facilitar para a comunidade open source a experimentação com autoaperfeiçoamento contínuo e fornecer acesso imediato a uma infraestrutura de nível de produção para isso. Usamos autoaperfeiçoamento contínuo como o enquadramento mais amplo e prático aqui, com o RSI representando uma forma mais completamente recursiva da mesma ideia.¹
2. Por que o autoaperfeiçoamento contínuo precisa de uma nova infraestrutura?

GIF
A maioria das infraestruturas de LLM assume um ciclo de vida relativamente simples. Treinamos um modelo, avaliamos, implantamos e o usamos para inferência. Para agentes que se autoaperfeiçoam continuamente, acreditamos que duas suposições por trás dessa configuração começam a falhar.
Primeiro, a inferência não é mais o fim do pipeline. Os agentes geram experiência útil enquanto trabalham, incluindo trajetórias, resultados de execução, feedback do usuário e outros sinais que podem impulsionar melhorias futuras. O que acontece no momento da inferência não é mais algo que simplesmente servimos e descartamos. Torna-se parte do próprio processo de aprendizado.
Segundo, o modelo não é mais a única coisa que evolui. Um agente é mais do que um modelo, e o autoaperfeiçoamento contínuo não deve ser restrito aos pesos do modelo. Prompts, memória, habilidades, ferramentas e lógica de orquestração podem todos potencialmente melhorar com a experiência. Um modelo mais forte expande as capacidades do agente, enquanto uma ferramenta melhor ajuda a eliciar essas capacidades de forma mais eficaz e exercitá-las de forma mais confiável em tarefas complexas.
Juntas, essas mudanças transformam o que antes era um pipeline majoritariamente sequencial em um loop de evolução contínua. Os agentes interagem, geram experiência, melhoram diferentes partes de si mesmos, avaliam se essas mudanças valem a pena ser mantidas e retornam para servir como novas versões do sistema.
É por isso também que não consideramos o Reef como mera infraestrutura de treinamento. O treinamento é apenas uma parte do loop. Acreditamos que a infraestrutura para autoaperfeiçoamento contínuo tem que começar a partir da inferência ao vivo e apoiar a evolução de todo o agente.

GIF
3. Do que essa infraestrutura precisa e como o Reef a implementa?

Arquitetura do Reef
A infraestrutura para autoaperfeiçoamento contínuo precisa possuir três coisas de ponta a ponta: a experiência, o agente e as atualizações. Isso significa (1) aprender com o tráfego ao vivo, (2) atualizar tanto o modelo quanto a ferramenta, e (3) avaliar, versionar e controlar adequadamente como as atualizações são lançadas.
Possuir a experiência — o aprendizado tem que ser construído sobre o serviço ao vivo
Inferência e treinamento foram historicamente dissociados. Algumas infraestruturas de RL (por exemplo, Slime, veRL) incorporam um mecanismo de inferência para gerar dados, mas esses sistemas são projetados para treinamento de modelo, não para servir o modelo. Postulamos que uma infraestrutura de autoaperfeiçoamento contínuo deve primeiro ser uma infraestrutura de inferência e construir sua capacidade de treinamento em torno da inferência ao vivo: o sistema atende aplicações reais, coleta experiência em tempo de teste e permite que receitas de aprendizado a consumam continuamente. Essa crença leva a uma reformulação de muitas escolhas de design, incluindo a geração de sinais de treinamento e a seleção de amostras de treinamento.
A inferência é nativa do Reef. O Reef expõe endpoints de inferência padrão, facilitando a integração em aplicações existentes e transformando-as em sistemas de autoevolução.
1# client = xxx # inicializa o cliente httpx para o endpoint de serviço do Reef23# Chamada de inferência padrão através do Reef, formato Open-AI4response = client.post(5 "/v1/chat/completions",6 json={"model": xxx, "messages": xxx},7)89# Referência ao registro de inferência armazenado pelo Reef10receipt = response.headers["x-reef-agent-record-id"]
As aplicações também podem reportar recompensas, feedback do avaliador ou outros sinais associados a chamadas de inferência específicas através de:
1# Anexa feedback ao registro de inferência correspondente2client.post(3 "/reef/report",4 json={"feedback": "resposta errada", "references": [receipt]},5)
Diferente dos mecanismos de inferência existentes que permanecem estáticos ao longo de seus ciclos de vida, o Reef oferece inferência com estado: o Reef armazena rastros de inferência e feedback como um fluxo de experiência estruturado, lidando com questões como obsolescência fora da política, mesclagem de sessões e deduplicação. Receitas de aprendizado definem como esse fluxo é processado, qual algoritmo de aprendizado é usado e quando as atualizações são avaliadas e implantadas. Isso permite que diferentes aplicações evoluam com suas próprias estratégias de aprendizado sobre a mesma infraestrutura.
Possuir todo o agente — tanto o modelo quanto a ferramenta são evoluídos via inferência com estado
Um agente de IA capaz de entregar resultados de ponta a ponta consiste não apenas em um modelo, mas também em uma ferramenta. O modelo fornece as capacidades subjacentes necessárias para resolver tarefas, enquanto a ferramenta permite a execução confiável em trajetórias complexas e de longo horizonte, gerenciando ferramentas, contexto, memória, feedback e orquestração. Os dois são fortemente acoplados: a ferramenta determina como as capacidades do modelo são eliciadas, fundamentadas e exercitadas, enquanto o modelo determina quais formas de execução a ferramenta pode suportar de forma confiável. Avanços em qualquer um podem, portanto, alterar o design ideal do outro. Uma infraestrutura de autoaperfeiçoamento contínuo deve apoiar a evolução conjunta de toda a pilha do agente, incluindo não apenas os pesos do modelo, mas também prompts, memória, habilidades, ferramentas e lógica de orquestração.
O Reef suporta atualizações tanto para o modelo quanto para a ferramenta.
No lado da ferramenta, o Reef usa Cordis como um "backend de treinamento". Uma receita de evolução de ferramenta normalmente analisa trajetórias e feedback do agente e, em seguida, propõe edições na ferramenta. Esse processo acontece inteiramente dentro do Reef, e cada versão evoluída da ferramenta é lançada para o usuário como uma atualização instalável (assumindo que o Reef está sendo servido em localhost:8900):
1curl -fsS -H "Authorization: Bearer $REEF_TOKEN" \2 'http://localhost:8900/reef/harness/install?adapter=pi' | bash
O comando acima instala uma ferramenta Pi Pi encapsulada pelo Reef da mesma forma que um agente de codificação típico. A ferramenta é configurada para usar o endpoint de inferência com estado do Reef, então seu tráfego de inferência flui através do Reef. À medida que o usuário trabalha, o Cordis evolui a ferramenta seguindo a receita de evolução de ferramenta configurada, e novas versões são disponibilizadas através do Reef. Na próxima vez que o usuário abrir a ferramenta, ele poderá ver:

No lado do modelo, receitas de aprendizado consomem registros do Reef para atualizar os pesos do modelo. O treinamento é executado de forma assíncrona com o serviço ao vivo usando um backend de treinamento distribuído, atualmente adaptado do Slime, e produz atualizações de peso candidatas, como checkpoints ou adaptadores LoRA.
Depois que um candidato passa na avaliação e é aprovado para implantação, o Reef o publica como uma nova versão do artefato do modelo do cenário e atualiza a quente o mecanismo de serviço usando sincronização de peso baseada em NCCL, sem reiniciar o serviço.
Possuir as atualizações — os lançamentos evoluídos são avaliados e versionados
Um agente em evolução contínua está sujeito à degradação da qualidade do serviço, especialmente porque a evolução não garante melhoria de desempenho. Como tal, cada candidato evoluído deve ser avaliado antes do lançamento. O Reef controla se um candidato evoluído pode substituir o artefato que atualmente atende a um cenário. Se o candidato for rejeitado, o serviço permanece inalterado. Caso contrário, o Reef o publica como um novo lançamento auditável.
Qualquer coisa que o Reef possa evoluir — como um checkpoint de modelo, adaptador LoRA, árvore de ferramentas ou política de roteamento — é representada como um artefato gerenciado por um controlador de versão. O Reef adota o Git LFS para gerenciar os artefatos, especialmente aqueles que ocupam muito espaço em disco, como pesos de modelo. O caminho de lançamento é:

Cada cenário tem uma cadeia de lançamento somente para anexação. O Reef avança o cabeçalho de lançamento do cenário usando compare-and-swap, para que um editor desatualizado não possa substituir um lançamento mais recente. O pipeline de lançamento permite que o Reef rastreie com eficiência as mudanças contínuas de versão e os processos de lançamento.
4. Métodos de autoaperfeiçoamento contínuo no Reef
A infraestrutura acima fornece as abstrações comuns para autoaperfeiçoamento contínuo. A lógica real de como um agente melhora é implementada através de receitas de aprendizado modulares.
Temos visto um zoológico crescente de métodos para transformar sinais gerados em tempo de teste em agentes melhores: aprendizado por reforço online, treinamento em tempo de teste, evolução de habilidades, evolução de ferramentas, autojogo e muito mais. Apesar de seus diferentes nomes e mecanismos, eles compartilham o mesmo padrão básico: sinais gerados em tempo de teste são transformados em atualizações para o sistema que gera a próxima interação.
Essas receitas diferem principalmente ao longo de três dimensões:
Sinal de aprendizado: Qual forma de sinal impulsiona a melhoria e de onde ele vem?
Aquisição de experiência: Como a experiência de aprendizado é gerada? Ela é proativamente buscada pelo agente ou reativamente gerada a partir de uma tarefa ou interação externa?
Alvo em evolução: O que realmente muda: o modelo, a ferramenta ou ambos?

Receitas já suportadas ou em breve no Reef
O Reef é projetado para que esses métodos possam ser amplamente expressos através de diferentes receitas de aprendizado sobre a mesma infraestrutura. Usar uma receita é simples: escolha uma e configure-a ao iniciar o serviço Reef.
1# serve.yaml2reef:3 recipe: recipes.sao.recipe:SAORecipe # Conecta uma receita de evolução4 batch_size: 1 # Configuração específica da receita5 max_staleness: 18
Em seguida, inicie o Reef com a configuração:
1reef serve -c recipes/sao/examples/sao/serve.yaml
Abaixo, mostramos dois exemplos, OpenClaw-RL e TTT-Discover, que seguem estratégias de evolução muito diferentes, mas podem ser implementados no Reef.

GIF
O visual demonstra uma integração do OpenClaw-RL no Reef. O usuário interage com um agente cujo modelo é continuamente evoluído pelo Reef de forma assíncrona, sem interromper o usuário. À medida que mais e mais rodadas se acumulam, o agente gradualmente aprende a interpretar corretamente a preferência do usuário e dá uma resposta satisfatória.

GIF
O visual demonstra como o TTT melhora iterativamente uma solução Packing 32. À medida que a otimização avança, soluções cada vez mais eficazes são descobertas e retidas, levando a pontuações de empacotamento progressivamente mais altas.
5. Conclusão
O Reef é nossa tentativa de transformar a ideia ampla de autoaperfeiçoamento contínuo em um problema concreto de sistemas. Ao abrir o código do Reef, esperamos tornar esse problema mais fácil de estudar e dar à comunidade uma base prática para construir agentes que não apenas servem, mas continuamente aprendem e evoluem a partir da experiência.
Convidamos você a experimentar o Reef, construir suas próprias receitas de aprendizado e integrá-lo com seus agentes. Explore o código, a documentação e as receitas de exemplo em https://github.com/Human-Agent-Society/reef. Se você achar o Reef útil, agradeceríamos uma estrela no repositório. Se você quiser construir conosco ou discutir autoaperfeiçoamento contínuo de forma mais ampla, você é mais do que bem-vindo para se juntar ao nosso Discord: https://discord.gg/5y8e5f937k.
- Usamos autoaperfeiçoamento contínuo como um enquadramento mais amplo e prático do que RSI. Ele abrange sistemas que melhoram repetidamente a partir da experiência sem exigir o loop totalmente fechado frequentemente associado ao RSI, onde a própria IA participa da construção e melhoria do sistema que produz sua próxima versão. O Reef é projetado para esse problema mais amplo, deixando espaço para formas mais recursivas de autoaperfeiçoamento emergirem sobre ele.
Lista Crescente de Contribuidores (ordem alfabética): Chai Wenhao (@wenhaocha1), Ding Shuangrui (@ShuangruiDing), He Hao, He Haoze, Jiang Chonhe (@JiangChonghe), Jiang Nan (@nanjiangwill), Jiang Xuan, Li Xiaochen (@jacobli99), Liang Paul (@pliang279), Liu Bo (@Benjamin_eecs), Long Boyuan, Mang Qiuyang (@MangQiuyang), Qi Zhenting (@ZhentingQi), Qu Ao (@ao_qu18465), Qu Mingruo, Wang Zhaokai, Yan Xuezhi, Yu Hanfei (@yhfchitanda), Yu Haofei (@haofeiyu44), Yu Simon (@simon_ycl), Zheng Han (@hanzheng_7), Zhou Kaichen (@alex_kai2020), Zhou Zijian (@BobbyZhouZijian), Zhu Jiacheng (@JiachengZhu_ML), Zhuang Dingyi





