Ваш сервер вывода тайно обучается: представляем Reef, инфраструктуру с открытым исходным кодом для самообучающихся агентов

@ao_qu18465
АНГЛИЙСКИЙ01 сент. 2026 г.
121K
216
46
9
262

Суть

Reef — это инфраструктура с открытым исходным кодом, предназначенная для непрерывного самообучения ИИ-агентов. Она позволяет как весам моделей, так и логике их работы эволюционировать на основе опыта и обратной связи, полученных в процессе реального вывода.

Reef полностью с открытым исходным кодом: https://github.com/Human-Agent-Society/reef

1. Прежде чем весь ажиотаж вокруг "RSI" станет реальностью

Прежде чем сегодняшний ажиотаж вокруг RSI полностью реализуется, мы хотим открыть исходный код Reef — инфраструктуры, которую мы создавали для той же более широкой задачи: предоставление агентам (связка "обвязка + модель") возможности непрерывно развиваться на основе своего опыта.

Цель — упростить для сообщества с открытым исходным кодом эксперименты с непрерывным самосовершенствованием и предоставить готовую к продакшену инфраструктуру для этого. Мы используем непрерывное самосовершенствование как более широкую и практичную формулировку, где RSI представляет собой более полностью рекурсивную форму той же идеи.¹

2. Почему непрерывное самосовершенствование требует новой инфраструктуры?

Ao Qu - inline image

GIF

Большинство LLM-инфраструктур предполагают относительно простой жизненный цикл. Мы обучаем модель, оцениваем её, развёртываем, а затем используем для инференса. Для непрерывно самосовершенствующихся агентов, как мы считаем, два допущения, лежащие в основе этой схемы, начинают рушиться.

Во-первых, инференс больше не является концом конвейера. Агенты генерируют полезный опыт во время работы, включая траектории, результаты выполнения, отзывы пользователей и другие сигналы, которые могут быть использованы для будущего улучшения. То, что происходит во время инференса, больше не является чем-то, что мы просто обслуживаем и отбрасываем. Это становится частью самого процесса обучения.

Во-вторых, модель — это не единственное, что развивается. Агент — это нечто большее, чем модель, и непрерывное самосовершенствование не должно ограничиваться весами модели. Промпты, память, навыки, инструменты и логика оркестрации — всё это потенциально может улучшаться на основе опыта. Более сильная модель расширяет возможности агента, в то время как лучшая обвязка помогает более эффективно раскрывать эти возможности и более надёжно применять их в сложных задачах.

Вместе эти изменения превращают то, что раньше было в основном последовательным конвейером, в непрерывный цикл эволюции. Агенты взаимодействуют, генерируют опыт, улучшают различные свои части, оценивают, стоит ли сохранять эти изменения, и возвращаются к работе в качестве новых версий системы.

Вот почему мы не рассматриваем Reef просто как инфраструктуру для обучения. Обучение — это лишь часть цикла. Мы считаем, что инфраструктура для непрерывного самосовершенствования должна исходить из живого инференса и поддерживать эволюцию всего агента.

Ao Qu - inline image

GIF

3. Что нужно такой инфраструктуре и как Reef это реализует?

Ao Qu - inline image

Архитектура Reef

Инфраструктура для непрерывного самосовершенствования должна владеть тремя вещами "от начала до конца": опытом, агентом и обновлениями. Это означает (1) обучение на живом трафике, (2) обновление как модели, так и обвязки, и (3) правильную оценку, версионирование и контроль того, как выпускаются обновления.

Владение опытом — обучение должно быть встроено в живое обслуживание

Инференс и обучение исторически были разделены. Некоторая RL-инфраструктура (например, Slime, veRL) включает движок инференса для генерации данных, но эти системы предназначены для обучения модели, а не для её обслуживания. Мы утверждаем, что инфраструктура непрерывного самосовершенствования должна в первую очередь быть инфраструктурой инференса и строить свои обучающие возможности вокруг живого инференса: система обслуживает реальные приложения, собирает опыт, полученный во время тестирования, и позволяет рецептам обучения постоянно его потреблять. Это убеждение приводит к переосмыслению многих проектных решений, включая генерацию обучающих сигналов и отбор обучающих примеров.

Инференс является родным для Reef. Reef предоставляет стандартные конечные точки инференса, что упрощает интеграцию в существующие приложения и превращение их в саморазвивающиеся системы.

python
1# client = xxx # инициализация httpx клиента для конечной точки обслуживания Reef
2
3# Стандартный вызов инференса через Reef, формат OpenAI
4response = client.post(
5 "/v1/chat/completions",
6 json={"model": xxx, "messages": xxx},
7)
8
9# Ссылка на запись инференса, хранящуюся в Reef
10receipt = response.headers["x-reef-agent-record-id"]

Приложения также могут сообщать о вознаграждениях, оценках или других сигналах, связанных с конкретными вызовами инференса, через:

python
1# Прикрепить отзыв к соответствующей записи инференса
2client.post(
3 "/reef/report",
4 json={"feedback": "wrong answer", "references": [receipt]},
5)

В отличие от существующих движков инференса, которые остаются статичными на протяжении всего своего жизненного цикла, Reef предлагает инференс с сохранением состояния: Reef хранит трассы инференса и отзывы в виде структурированного потока опыта, обрабатывая такие проблемы, как устаревание вне политики, слияние сессий и дедупликацию. Рецепты обучения определяют, как обрабатывается этот поток, какой алгоритм обучения используется, а также когда обновления оцениваются и развёртываются. Это позволяет различным приложениям развиваться, используя свои собственные стратегии обучения, поверх одной и той же инфраструктуры.

Владение всем агентом — и модель, и обвязка развиваются через инференс с сохранением состояния

AI-агент, способный выдавать сквозные результаты, состоит не только из модели, но и из обвязки. Модель обеспечивает базовые возможности, необходимые для решения задач, в то время как обвязка обеспечивает надёжное выполнение в сложных, долгосрочных траекториях, управляя инструментами, контекстом, памятью, обратной связью и оркестрацией. Эти две части тесно связаны: обвязка определяет, как раскрываются, обосновываются и применяются возможности модели, в то время как модель определяет, какие формы выполнения обвязка может надёжно поддерживать. Таким образом, достижения в одной из них могут изменить оптимальный дизайн другой. Инфраструктура непрерывного самосовершенствования должна поддерживать совместную эволюцию всего стека агента, включая не только веса модели, но и промпты, память, навыки, инструменты и логику оркестрации.

Reef поддерживает обновления как модели, так и обвязки.

Со стороны обвязки Reef использует Cordis в качестве "бэкенда для обучения". Рецепт эволюции обвязки обычно анализирует траектории агента и отзывы, а затем предлагает изменения в обвязку. Этот процесс происходит полностью внутри Reef, и каждая развитая версия обвязки выпускается для пользователя в виде устанавливаемого обновления (при условии, что Reef обслуживается на localhost:8900):

bash
1curl -fsS -H "Authorization: Bearer $REEF_TOKEN" \
2 'http://localhost:8900/reef/harness/install?adapter=pi' | bash

Приведённая выше команда устанавливает обёрнутую в Reef обвязку Pi примерно так же, как и типичный агент для написания кода. Обвязка настроена на использование конечной точки инференса с сохранением состояния Reef, поэтому её трафик инференса проходит через Reef. Пока пользователь работает, Cordis развивает обвязку в соответствии с настроенным рецептом эволюции обвязки, и новые версии становятся доступными через Reef. При следующем открытии обвязки пользователь может увидеть:

Ao Qu - inline image

Со стороны модели рецепты обучения потребляют записи Reef для обновления весов модели. Обучение выполняется асинхронно с живым обслуживанием с использованием распределённого бэкенда обучения, в настоящее время адаптированного из Slime, и создаёт кандидатов на обновление весов, таких как контрольные точки или LoRA-адаптеры.

Как только кандидат проходит оценку и утверждается для развёртывания, Reef публикует его как новую версию артефакта модели для сценария и выполняет горячее обновление движка обслуживания с использованием синхронизации весов на основе NCCL, без перезапуска сервиса.

Владение обновлениями — развитые релизы оцениваются и версионируются

Непрерывно развивающийся агент подвержен риску снижения качества обслуживания, особенно потому, что эволюция не гарантирует повышения производительности. Таким образом, каждый развитый кандидат должен быть оценён перед выпуском. Reef контролирует, разрешено ли развитому кандидату заменять артефакт, который в данный момент обслуживает сценарий. Если кандидат отклонён, обслуживание остаётся без изменений. В противном случае Reef публикует его как новый, проверяемый релиз.

Всё, что Reef может развивать — например, контрольную точку модели, LoRA-адаптер, дерево обвязки или политику маршрутизации — представлено в виде артефакта, управляемого контроллером версий. Reef использует Git LFS для управления артефактами, особенно теми, которые занимают много дискового пространства, такими как веса модели. Путь релиза:

Ao Qu - inline image

Каждый сценарий имеет цепочку релизов, доступную только для добавления. Reef продвигает голову релиза сценария, используя операцию "сравнить и обменять", поэтому устаревший издатель не может перезаписать более новый релиз. Конвейер релизов позволяет Reef эффективно отслеживать непрерывные изменения версий и процессы релизов.

4. Методы непрерывного самосовершенствования в Reef

Вышеописанная инфраструктура предоставляет общие абстракции для непрерывного самосовершенствования. Фактическая логика того, как агент улучшается, реализуется через модульные рецепты обучения.

Мы наблюдаем растущий зоопарк методов для превращения сигналов, генерируемых во время тестирования, в лучших агентов: онлайн-обучение с подкреплением, обучение во время тестирования, эволюция навыков, эволюция обвязки, самовоспроизведение и многое другое. Несмотря на разные названия и механизмы, все они имеют один и тот же базовый шаблон: сигналы, генерируемые во время тестирования, превращаются в обновления системы, которая генерирует следующее взаимодействие.

Эти рецепты различаются в основном по трём параметрам:

Обучающий сигнал: Какую форму сигнала обеспечивает улучшение и откуда он берётся?

Получение опыта: Как генерируется обучающий опыт? Он активно запрашивается агентом или реактивно генерируется из внешней задачи или взаимодействия?

Цель эволюции: Что на самом деле меняется: модель, обвязка или и то, и другое?

Ao Qu - inline image

Рецепты, уже поддерживаемые или скоро появятся в Reef

Reef спроектирован так, чтобы эти методы могли быть в основном выражены через различные рецепты обучения поверх одной и той же инфраструктуры. Использовать рецепт просто: выберите один и настройте его при запуске сервиса Reef.

yaml
1# serve.yaml
2reef:
3 recipe: recipes.sao.recipe:SAORecipe # Подключение рецепта эволюции
4 batch_size: 1 # Конфигурация, специфичная для рецепта
5 max_staleness: 18

Затем запустите Reef с этой конфигурацией:

bash
1reef serve -c recipes/sao/examples/sao/serve.yaml

Ниже мы показываем два примера: OpenClaw-RL и TTT-Discover, которые следуют очень разным стратегиям эволюции, но оба могут быть реализованы в Reef.

Ao Qu - inline image

GIF

Визуализация демонстрирует интеграцию OpenClaw-RL в Reef. Пользователь взаимодействует с агентом, модель которого непрерывно развивается Reef асинхронно, не прерывая пользователя. По мере накопления всё большего количества раундов агент постепенно учится правильно интерпретировать предпочтения пользователя и даёт удовлетворительный ответ.

Ao Qu - inline image

GIF

Визуализация демонстрирует, как TTT итеративно улучшает решение Packing 32. По мере оптимизации обнаруживаются и сохраняются всё более эффективные решения, что приводит к постепенно возрастающим показателям упаковки.

5. Заключение

Reef — это наша попытка превратить широкую идею непрерывного самосовершенствования в конкретную системную задачу. Открывая исходный код Reef, мы надеемся сделать эту задачу более доступной для изучения и дать сообществу практическую основу для создания агентов, которые не просто обслуживают, но постоянно учатся и развиваются на основе опыта.

Мы приглашаем вас попробовать Reef, создать свои собственные рецепты обучения и интегрировать его со своими агентами. Изучайте код, документацию и примеры рецептов на https://github.com/Human-Agent-Society/reef. Если вы найдёте Reef полезным, мы будем благодарны за звезду на репозитории. Если вы хотите создавать вместе с нами или обсудить непрерывное самосовершенствование в более широком смысле, добро пожаловать в наш Discord: https://discord.gg/5y8e5f937k.

  1. Мы используем непрерывное самосовершенствование как более широкую и практичную формулировку, чем RSI. Оно охватывает системы, которые многократно улучшаются на основе опыта, не требуя полностью замкнутого цикла, часто ассоциируемого с RSI, где сам ИИ участвует в создании и улучшении системы, которая производит его следующую версию. Reef спроектирован для этой более широкой задачи, оставляя при этом место для более рекурсивных форм самосовершенствования, которые могут возникнуть на его основе.

Растущий список участников (в алфавитном порядке): Chai Wenhao (@wenhaocha1), Ding Shuangrui (@ShuangruiDing), He Hao, He Haoze, Jiang Chonhe (@JiangChonghe), Jiang Nan (@nanjiangwill), Jiang Xuan, Li Xiaochen (@jacobli99), Liang Paul (@pliang279), Liu Bo (@Benjamin_eecs), Long Boyuan, Mang Qiuyang (@MangQiuyang), Qi Zhenting (@ZhentingQi), Qu Ao (@ao_qu18465), Qu Mingruo, Wang Zhaokai, Yan Xuezhi, Yu Hanfei (@yhfchitanda), Yu Haofei (@haofeiyu44), Yu Simon (@simon_ycl), Zheng Han (@hanzheng_7), Zhou Kaichen (@alex_kai2020), Zhou Zijian (@BobbyZhouZijian), Zhu Jiacheng (@JiachengZhu_ML), Zhuang Dingyi

Сохранение в один клик

Используйте YouMind для глубокого чтения вирусных статей с помощью ИИ

Сохраняйте источники, задавайте точные вопросы, обобщайте аргументы и превращайте вирусные статьи в полезные заметки в одном рабочем пространстве ИИ.

Исследовать YouMind
Для авторов

Превратите ваш Markdown в аккуратную статью для 𝕏

Когда вы публикуете длинные тексты, изображения, таблицы и блоки кода, форматирование в 𝕏 становится мучением. YouMind превращает полный черновик в Markdown в чистую статью, готовую к публикации в 𝕏.

Попробовать Markdown для 𝕏

Другие паттерны для анализа

Недавние виральные статьи

Смотреть другие виральные статьи