Tu servidor de inferencia es secretamente un aprendiz: presentamos Reef, infraestructura de código abierto para agentes de autoaprendizaje continuo

@ao_qu18465
INGLÉS01 sept 2026
121K
216
46
9
262

TL;DR

Reef es una infraestructura de código abierto diseñada para el autoaprendizaje continuo de agentes de IA, permitiendo que tanto los pesos del modelo como la lógica de ejecución evolucionen a partir de la experiencia y la retroalimentación de la inferencia en tiempo real.

Reef es completamente de código abierto: https://github.com/Human-Agent-Society/reef

1. Antes de que todo el hype de "RSI" se vuelva realidad

Antes de que el entusiasmo actual en torno a RSI se materialice por completo, queremos publicar como código abierto Reef, una infraestructura que hemos estado construyendo para el mismo problema general: permitir que los agentes (combinación de arnés y modelo) evolucionen continuamente a partir de su experiencia.

El objetivo es facilitar que la comunidad de código abierto experimente con la automejora continua y tenga acceso a infraestructura de nivel productivo para ello. Usamos automejora continua como un marco más amplio y práctico aquí, siendo RSI una forma más completamente recursiva de la misma idea.¹

2. ¿Por qué la automejora continua necesita una nueva infraestructura?

Ao Qu - inline image

GIF

La mayoría de la infraestructura para LLM asume un ciclo de vida relativamente simple. Entrenamos un modelo, lo evaluamos, lo desplegamos y luego lo usamos para inferencia. Para agentes que se automejoran continuamente, creemos que dos supuestos detrás de esta configuración comienzan a romperse.

Primero, la inferencia ya no es el final del pipeline. Los agentes generan experiencia útil mientras trabajan, incluyendo trayectorias, resultados de ejecución, comentarios de usuarios y otras señales que pueden impulsar mejoras futuras. Lo que sucede en el momento de la inferencia ya no es algo que simplemente servimos y descartamos. Se convierte en parte del proceso de aprendizaje en sí mismo.

Segundo, el modelo ya no es lo único que evoluciona. Un agente es más que un modelo, y la automejora continua no debería restringirse a los pesos del modelo. Los prompts, la memoria, las habilidades, las herramientas y la lógica de orquestación pueden mejorar potencialmente a partir de la experiencia. Un modelo más fuerte expande las capacidades del agente, mientras que un mejor arnés ayuda a extraer esas capacidades de manera más efectiva y a ejercitarlas de forma más confiable en tareas complejas.

Juntos, estos cambios transforman lo que antes era un pipeline mayormente secuencial en un bucle de evolución continua. Los agentes interactúan, generan experiencia, mejoran diferentes partes de sí mismos, evalúan si esos cambios valen la pena y regresan para servir como nuevas versiones del sistema.

Por eso tampoco consideramos Reef como una mera infraestructura de entrenamiento. El entrenamiento es solo una parte del bucle. Creemos que la infraestructura para la automejora continua debe comenzar desde la inferencia en vivo y apoyar la evolución de todo el agente.

Ao Qu - inline image

GIF

3. ¿Qué necesita dicha infraestructura y cómo la implementa Reef?

Ao Qu - inline image

Arquitectura de Reef

La infraestructura para la automejora continua necesita poseer tres cosas de principio a fin: la experiencia, el agente y las actualizaciones. Eso significa (1) aprender del tráfico en vivo, (2) actualizar tanto el modelo como el arnés, y (3) evaluar, versionar y controlar adecuadamente cómo se lanzan las actualizaciones.

Poseer la experiencia: el aprendizaje debe construirse sobre el servicio en vivo

Históricamente, la inferencia y el entrenamiento han estado desacoplados. Alguna infraestructura de RL (por ejemplo, Slime, veRL) incorpora un motor de inferencia para generar datos, pero estos sistemas están diseñados para el entrenamiento de modelos, no para servir modelos. Postulamos que una infraestructura de automejora continua debería ser primero una infraestructura de inferencia y construir su capacidad de entrenamiento alrededor de la inferencia en vivo: el sistema sirve aplicaciones reales, recopila experiencia en tiempo de prueba y permite que las recetas de aprendizaje la consuman continuamente. Esta creencia lleva a repensar muchas decisiones de diseño, incluyendo la generación de señales de entrenamiento y la selección de muestras de entrenamiento.

La inferencia es nativa en Reef. Reef expone endpoints de inferencia estándar, lo que facilita su integración en aplicaciones existentes y convertirlas en sistemas que evolucionan por sí mismos.

python
1# client = xxx # inicializa el cliente httpx al endpoint de servicio de Reef
2
3# Llamada de inferencia estándar a través de Reef, formato Open-AI
4response = client.post(
5 "/v1/chat/completions",
6 json={"model": xxx, "messages": xxx},
7)
8
9# Referencia al registro de inferencia almacenado por Reef
10receipt = response.headers["x-reef-agent-record-id"]

Las aplicaciones también pueden reportar recompensas, comentarios del evaluador u otras señales asociadas con llamadas de inferencia específicas a través de:

python
1# Adjuntar comentarios al registro de inferencia correspondiente
2client.post(
3 "/reef/report",
4 json={"feedback": "respuesta incorrecta", "references": [receipt]},
5)

A diferencia de los motores de inferencia existentes que permanecen estáticos durante todo su ciclo de vida, Reef ofrece inferencia con estado: Reef almacena los rastros de inferencia y los comentarios como un flujo de experiencia estructurado, manejando problemas como la obsolescencia fuera de política, la fusión de sesiones y la deduplicación. Las recetas de aprendizaje definen cómo se procesa este flujo, qué algoritmo de aprendizaje se utiliza y cuándo se evalúan y despliegan las actualizaciones. Esto permite que diferentes aplicaciones evolucionen con sus propias estrategias de aprendizaje sobre la misma infraestructura.

Poseer todo el agente: tanto el modelo como el arnés evolucionan mediante inferencia con estado

Un agente de IA capaz de ofrecer resultados de principio a fin consiste no solo en un modelo, sino también en un arnés. El modelo proporciona las capacidades subyacentes necesarias para resolver tareas, mientras que el arnés permite una ejecución confiable en trayectorias complejas y de largo alcance al gestionar herramientas, contexto, memoria, comentarios y orquestación. Ambos están estrechamente acoplados: el arnés determina cómo se extraen, fundamentan y ejercitan las capacidades del modelo, mientras que el modelo determina qué formas de ejecución puede soportar de manera confiable el arnés. Por lo tanto, los avances en cualquiera de ellos pueden cambiar el diseño óptimo del otro. Una infraestructura de automejora continua debe apoyar la evolución conjunta de toda la pila del agente, incluyendo no solo los pesos del modelo, sino también los prompts, la memoria, las habilidades, las herramientas y la lógica de orquestación.

Reef admite actualizaciones tanto del modelo como del arnés.

En el lado del arnés, Reef utiliza Cordis como un "backend de entrenamiento". Una receta de evolución del arnés típicamente analiza las trayectorias del agente y los comentarios, y luego propone ediciones al arnés. Este proceso ocurre completamente dentro de Reef, y cada versión evolucionada del arnés se lanza al usuario como una actualización instalable (asumiendo que Reef se sirve en localhost:8900):

bash
1curl -fsS -H "Authorization: Bearer $REEF_TOKEN" \
2 'http://localhost:8900/reef/harness/install?adapter=pi' | bash

El comando anterior instala un arnés Pi envuelto en Reef de manera muy similar a un agente de codificación típico. El arnés está configurado para usar el endpoint de inferencia con estado de Reef, por lo que su tráfico de inferencia fluye a través de Reef. Mientras el usuario trabaja, Cordis evoluciona el arnés siguiendo la receta de evolución del arnés configurada, y las nuevas versiones se ponen a disposición a través de Reef. La próxima vez que el usuario abra el arnés, podría ver:

Ao Qu - inline image

En el lado del modelo, las recetas de aprendizaje consumen los registros de Reef para actualizar los pesos del modelo. El entrenamiento se ejecuta de forma asíncrona con el servicio en vivo utilizando un backend de entrenamiento distribuido, actualmente adaptado de Slime, y produce actualizaciones de pesos candidatas, como checkpoints o adaptadores LoRA.

Una vez que un candidato pasa la evaluación y se aprueba para su despliegue, Reef lo publica como una nueva versión del artefacto del modelo del escenario y actualiza en caliente el motor de servicio utilizando la sincronización de pesos basada en NCCL, sin reiniciar el servicio.

Poseer las actualizaciones: los lanzamientos evolucionados se evalúan y versionan

Un agente que evoluciona continuamente está sujeto a la degradación de la calidad del servicio, especialmente porque no se garantiza que la evolución traiga una mejora en el rendimiento. Por lo tanto, cada candidato evolucionado debe ser evaluado antes de su lanzamiento. Reef controla si un candidato evolucionado puede reemplazar el artefacto que actualmente sirve a un escenario. Si el candidato es rechazado, el servicio permanece sin cambios. De lo contrario, Reef lo publica como un nuevo lanzamiento auditable.

Cualquier cosa que Reef pueda evolucionar, como un checkpoint de modelo, un adaptador LoRA, un árbol de arnés o una política de enrutamiento, se representa como un artefacto gestionado por un controlador de versiones. Reef adopta Git LFS para gestionar los artefactos, especialmente aquellos que ocupan mucho espacio en disco, como los pesos del modelo. La ruta de lanzamiento es:

Ao Qu - inline image

Cada escenario tiene una cadena de lanzamiento de solo adición. Reef avanza el cabezal de lanzamiento del escenario usando comparar e intercambiar, por lo que un publicador obsoleto no puede sobrescribir un lanzamiento más nuevo. El pipeline de lanzamiento permite a Reef rastrear de manera eficiente los cambios de versión continuos y los procesos de lanzamiento.

4. Métodos de automejora continua en Reef

La infraestructura anterior proporciona las abstracciones comunes para la automejora continua. La lógica real de cómo un agente mejora se implementa a través de recetas de aprendizaje modulares.

Hemos visto un zoológico creciente de métodos para convertir las señales generadas en tiempo de prueba en mejores agentes: aprendizaje por refuerzo en línea, entrenamiento en tiempo de prueba, evolución de habilidades, evolución del arnés, autoaprendizaje y más. A pesar de sus diferentes nombres y mecanismos, comparten el mismo patrón básico: las señales generadas en tiempo de prueba se convierten en actualizaciones del sistema que genera la siguiente interacción.

Estas recetas difieren principalmente en tres dimensiones:

Señal de aprendizaje: ¿Qué forma de señal impulsa la mejora y de dónde proviene?

Adquisición de experiencia: ¿Cómo se genera la experiencia de aprendizaje? ¿Es buscada proactivamente por el agente o generada de forma reactiva a partir de una tarea o interacción externa?

Objetivo en evolución: ¿Qué cambia realmente: el modelo, el arnés o ambos?

Ao Qu - inline image

Recetas ya compatibles o próximas en Reef

Reef está diseñado para que estos métodos puedan expresarse en gran medida a través de diferentes recetas de aprendizaje sobre la misma infraestructura. Usar una receta es simple: elige una y configúrala al iniciar el servicio Reef.

yaml
1# serve.yaml
2reef:
3 recipe: recipes.sao.recipe:SAORecipe # Conecta una receta de evolución
4 batch_size: 1 # Configuración específica de la receta
5 max_staleness: 18

Luego inicia Reef con la configuración:

bash
1reef serve -c recipes/sao/examples/sao/serve.yaml

A continuación, mostramos dos ejemplos, OpenClaw-RL y TTT-Discover, que siguen estrategias de evolución muy diferentes pero que pueden implementarse en Reef.

Ao Qu - inline image

GIF

El video demuestra una integración de OpenClaw-RL en Reef. El usuario interactúa con un agente cuyo modelo es evolucionado continuamente por Reef de forma asíncrona sin interrumpir al usuario. A medida que se acumulan más y más rondas, el agente aprende gradualmente a interpretar correctamente la preferencia del usuario y da una respuesta satisfactoria.

Ao Qu - inline image

GIF

El video demuestra cómo TTT mejora iterativamente una solución de Packing 32. A medida que avanza la optimización, se descubren y retienen soluciones cada vez más efectivas, lo que lleva a puntuaciones de empaquetado progresivamente más altas.

5. Conclusión

Reef es nuestro intento de convertir la amplia idea de la automejora continua en un problema de sistemas concreto. Al publicar Reef como código abierto, esperamos facilitar el estudio de este problema y brindar a la comunidad una base práctica para construir agentes que no solo sirvan, sino que aprendan y evolucionen continuamente a partir de la experiencia.

Te invitamos a probar Reef, crear tus propias recetas de aprendizaje e integrarlo con tus agentes. Explora el código, la documentación y las recetas de ejemplo en https://github.com/Human-Agent-Society/reef. Si encuentras útil Reef, agradeceríamos una estrella en el repositorio. Si quieres construir con nosotros o discutir la automejora continua de manera más amplia, eres más que bienvenido a unirte a nuestro Discord: https://discord.gg/5y8e5f937k.

  1. Usamos automejora continua como un marco más amplio y práctico que RSI. Abarca sistemas que mejoran repetidamente a partir de la experiencia sin requerir el bucle completamente cerrado a menudo asociado con RSI, donde la propia IA participa en la construcción y mejora del sistema que produce su siguiente versión. Reef está diseñado para este problema más amplio, dejando espacio para que surjan formas más recursivas de automejora sobre él.

Lista creciente de contribuyentes (en orden alfabético): Chai Wenhao (@wenhaocha1), Ding Shuangrui (@ShuangruiDing), He Hao, He Haoze, Jiang Chonhe (@JiangChonghe), Jiang Nan (@nanjiangwill), Jiang Xuan, Li Xiaochen (@jacobli99), Liang Paul (@pliang279), Liu Bo (@Benjamin_eecs), Long Boyuan, Mang Qiuyang (@MangQiuyang), Qi Zhenting (@ZhentingQi), Qu Ao (@ao_qu18465), Qu Mingruo, Wang Zhaokai, Yan Xuezhi, Yu Hanfei (@yhfchitanda), Yu Haofei (@haofeiyu44), Yu Simon (@simon_ycl), Zheng Han (@hanzheng_7), Zhou Kaichen (@alex_kai2020), Zhou Zijian (@BobbyZhouZijian), Zhu Jiacheng (@JiachengZhu_ML), Zhuang Dingyi

Guardar con un clic

Lee artículos virales en profundidad con IA en YouMind

Guarda la fuente, haz preguntas concretas, resume el argumento y convierte un artículo viral en notas reutilizables en un único espacio de trabajo con IA.

Explora YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales