Ваш сервер висновків таємно навчається: відкриваємо Reef для агентів, що постійно самовдосконалюються

@ao_qu18465
АНГЛІЙСЬКА01 вер. 2026 р.
121K
216
46
9
262

Коротко

Reef — це інфраструктура з відкритим кодом, розроблена для безперервного самовдосконалення ШІ-агентів, що дозволяє як вагам моделі, так і логіці обв'язки розвиватися на основі досвіду висновків у реальному часі та зворотного зв'язку.

Reef є повністю з відкритим кодом: https://github.com/Human-Agent-Society/reef

1. Перш ніж шум навколо “RSI” стане реальністю

Перш ніж сьогоднішнє захоплення RSI повністю реалізується, ми хочемо відкрити вихідний код Reef — інфраструктури, яку ми будували для тієї ж ширшої проблеми: надання агентам (зв'язка + модель) можливості безперервно еволюціонувати на основі власного досвіду.

Мета — полегшити спільноті з відкритим кодом експериментувати з безперервним самовдосконаленням та отримати доступ до інфраструктури виробничого рівня для цього. Ми використовуємо безперервне самовдосконалення як ширше та більш практичне формулювання, де RSI є більш повною рекурсивною формою тієї ж ідеї.¹

2. Чому безперервне самовдосконалення потребує нової інфраструктури?

Ao Qu - inline image

GIF

Більшість інфраструктури LLM передбачає відносно простий життєвий цикл. Ми навчаємо модель, оцінюємо її, розгортаємо, а потім використовуємо для інференсу. Для агентів, що постійно самовдосконалюються, ми вважаємо, що два припущення, на яких базується ця схема, починають руйнуватися.

По-перше, інференс більше не є кінцевою точкою конвеєра. Агенти генерують корисний досвід під час роботи, включаючи траєкторії, результати виконання, відгуки користувачів та інші сигнали, які можуть сприяти подальшому вдосконаленню. Те, що відбувається під час інференсу, більше не є чимось, що ми просто обслуговуємо та відкидаємо. Це стає частиною самого процесу навчання.

По-друге, модель більше не є єдиним, що еволюціонує. Агент — це більше, ніж просто модель, і безперервне самовдосконалення не повинно обмежуватися вагами моделі. Підказки, пам'ять, навички, інструменти та логіка оркестрації — все це потенційно може покращуватися на основі досвіду. Сильніша модель розширює можливості агента, тоді як краща оболонка допомагає ефективніше використовувати ці можливості та надійніше застосовувати їх у складних завданнях.

Разом ці зміни перетворюють те, що колись було переважно послідовним конвеєром, на безперервний цикл еволюції. Агенти взаємодіють, генерують досвід, вдосконалюють різні частини себе, оцінюють, чи варто зберігати ці зміни, і повертаються до обслуговування як нові версії системи.

Ось чому ми не розглядаємо Reef просто як інфраструктуру для навчання. Навчання — це лише одна частина циклу. Ми вважаємо, що інфраструктура для безперервного самовдосконалення повинна починатися з живого інференсу та підтримувати еволюцію всього агента.

Ao Qu - inline image

GIF

3. Що потрібно такій інфраструктурі, і як Reef це реалізує?

Ao Qu - inline image

Архітектура Reef

Інфраструктура для безперервного самовдосконалення повинна володіти трьома речами від початку до кінця: досвідом, агентом та оновленнями. Це означає (1) навчання на основі живого трафіку, (2) оновлення як моделі, так і оболонки, та (3) належне оцінювання, версіонування та контроль за випуском оновлень.

Володіти досвідом — навчання має бути побудоване на основі живого обслуговування

Інференс та навчання історично були розділені. Деяка інфраструктура RL (наприклад, Slime, veRL) включає механізм інференсу для генерації даних, але ці системи призначені для навчання моделі, а не для її обслуговування. Ми вважаємо, що інфраструктура безперервного самовдосконалення спочатку має бути інфраструктурою інференсу та будувати свої навчальні потужності навколо живого інференсу: система обслуговує реальні застосунки, збирає досвід під час тестування та дозволяє навчальним рецептам постійно його споживати. Це переконання призводить до переосмислення багатьох проектних рішень, включаючи генерацію навчальних сигналів та відбір навчальних зразків.

Інференс є рідним для Reef. Reef надає стандартні кінцеві точки інференсу, що полегшує інтеграцію в існуючі застосунки та перетворення їх на системи, що самостійно еволюціонують.

python
1# client = xxx # ініціалізація httpx клієнта до кінцевої точки обслуговування Reef
2
3# Стандартний виклик інференсу через Reef, формат OpenAI
4response = client.post(
5 "/v1/chat/completions",
6 json={"model": xxx, "messages": xxx},
7)
8
9# Посилання на запис інференсу, збережений Reef
10receipt = response.headers["x-reef-agent-record-id"]

Застосунки також можуть повідомляти про винагороди, оцінки або інші сигнали, пов'язані з конкретними викликами інференсу, через:

python
1# Прикріплення зворотного зв'язку до відповідного запису інференсу
2client.post(
3 "/reef/report",
4 json={"feedback": "неправильна відповідь", "references": [receipt]},
5)

На відміну від існуючих механізмів інференсу, які залишаються статичними протягом усього свого життєвого циклу, Reef пропонує інференс зі збереженням стану: Reef зберігає траси інференсу та зворотний зв'язок як структурований потік досвіду, обробляючи такі проблеми, як застарілість політики, об'єднання сесій та дедуплікацію. Навчальні рецепти визначають, як обробляється цей потік, який алгоритм навчання використовується та коли оновлення оцінюються та розгортаються. Це дозволяє різним застосункам еволюціонувати з власними стратегіями навчання на основі тієї ж інфраструктури.

Володіти всім агентом — і модель, і оболонка еволюціонують через інференс зі збереженням стану

AI-агент, здатний надавати наскрізні результати, складається не лише з моделі, але й з оболонки. Модель забезпечує базові можливості, необхідні для вирішення завдань, тоді як оболонка забезпечує надійне виконання в складних, довгострокових траєкторіях, керуючи інструментами, контекстом, пам'яттю, зворотним зв'язком та оркестрацією. Вони тісно пов'язані: оболонка визначає, як використовуються, обґрунтовуються та застосовуються можливості моделі, тоді як модель визначає, які форми виконання оболонка може надійно підтримувати. Таким чином, досягнення в одній з них можуть змінити оптимальний дизайн іншої. Інфраструктура безперервного самовдосконалення повинна підтримувати спільну еволюцію всього стеку агента, включаючи не лише ваги моделі, але й підказки, пам'ять, навички, інструменти та логіку оркестрації.

Reef підтримує оновлення як моделі, так і оболонки.

На стороні оболонки Reef використовує Cordis як "бекенд для навчання". Рецепт еволюції оболонки зазвичай аналізує траєкторії агента та зворотний зв'язок, а потім пропонує зміни до оболонки. Цей процес відбувається повністю в межах Reef, і кожна еволюціонована версія оболонки випускається для користувача як оновлення, яке можна встановити (за умови, що Reef працює на localhost:8900):

bash
1curl -fsS -H "Authorization: Bearer $REEF_TOKEN" \
2 'http://localhost:8900/reef/harness/install?adapter=pi' | bash

Команда вище встановлює оболонку Pi, обгорнуту Reef, майже так само, як типовий агент для кодування. Оболонка налаштована на використання кінцевої точки інференсу зі збереженням стану Reef, тому її інференс-трафік проходить через Reef. Поки користувач працює, Cordis еволюціонує оболонку відповідно до налаштованого рецепту еволюції оболонки, і нові версії стають доступними через Reef. Наступного разу, коли користувач відкриє оболонку, він може побачити:

Ao Qu - inline image

На стороні моделі навчальні рецепти використовують записи Reef для оновлення ваг моделі. Навчання виконується асинхронно з живим обслуговуванням, використовуючи розподілений бекенд для навчання, наразі адаптований з Slime, і створює кандидатів на оновлення ваг, такі як контрольні точки або адаптери LoRA.

Коли кандидат проходить оцінку та отримує дозвіл на розгортання, Reef публікує його як нову версію артефакту моделі сценарію та гаряче оновлює механізм обслуговування за допомогою синхронізації ваг на основі NCCL, не перезапускаючи службу.

Володіти оновленнями — еволюційні релізи оцінюються та версіонуються

Агент, що постійно еволюціонує, схильний до погіршення якості обслуговування, особливо оскільки еволюція не гарантує покращення продуктивності. Таким чином, кожен еволюційний кандидат повинен бути оцінений перед випуском. Reef контролює, чи дозволено еволюційному кандидату замінити артефакт, який наразі обслуговує сценарій. Якщо кандидат відхиляється, обслуговування залишається без змін. В іншому випадку Reef публікує його як новий, контрольований реліз.

Все, що Reef може еволюціонувати — наприклад, контрольна точка моделі, адаптер LoRA, дерево оболонки або політика маршрутизації — представлено як артефакт, яким керує контролер версій. Reef використовує Git LFS для керування артефактами, особливо тими, що займають багато дискового простору, наприклад, вагами моделей. Шлях випуску виглядає так:

Ao Qu - inline image

Кожен сценарій має ланцюжок релізів, доступний лише для додавання. Reef просуває голову релізу сценарію, використовуючи compare-and-swap, тому застарілий видавець не може перезаписати новіший реліз. Конвеєр релізів дозволяє Reef ефективно відстежувати безперервні зміни версій та процеси випуску.

4. Методи безперервного самовдосконалення в Reef

Вищеописана інфраструктура надає загальні абстракції для безперервного самовдосконалення. Власне логіка того, як агент вдосконалюється, реалізується через модульні навчальні рецепти.

Ми спостерігаємо зростаючий зоопарк методів для перетворення сигналів, згенерованих під час тестування, на кращих агентів: онлайн-навчання з підкріпленням, навчання під час тестування, еволюція навичок, еволюція оболонки, самостійна гра тощо. Незважаючи на різні назви та механізми, вони мають однаковий базовий патерн: сигнали, згенеровані під час тестування, перетворюються на оновлення системи, яка генерує наступну взаємодію.

Ці рецепти відрізняються в основному за трьома вимірами:

Навчальний сигнал: Яка форма сигналу спонукає до вдосконалення, і звідки він береться?

Отримання досвіду: Як генерується навчальний досвід? Чи активно його шукає агент, чи він реактивно генерується із зовнішнього завдання або взаємодії?

Ціль еволюції: Що насправді змінюється: модель, оболонка чи обидва?

Ao Qu - inline image

Рецепти, які вже підтримуються або скоро з'являться в Reef

Reef розроблений таким чином, що ці методи можна значною мірою виразити через різні навчальні рецепти на основі тієї ж інфраструктури. Використання рецепту просте: виберіть його та налаштуйте під час запуску служби Reef.

yaml
1# serve.yaml
2reef:
3 recipe: recipes.sao.recipe:SAORecipe # Підключіть рецепт еволюції
4 batch_size: 1 # Конфігурація, специфічна для рецепту
5 max_staleness: 18

Потім запустіть Reef з цією конфігурацією:

bash
1reef serve -c recipes/sao/examples/sao/serve.yaml

Нижче ми показуємо два приклади: OpenClaw-RL та TTT-Discover, які використовують дуже різні стратегії еволюції, але обидва можуть бути реалізовані в Reef.

Ao Qu - inline image

GIF

Візуалізація демонструє інтеграцію OpenClaw-RL в Reef. Користувач взаємодіє з агентом, модель якого безперервно еволюціонує Reef асинхронно, не перериваючи роботу користувача. У міру накопичення все більшої кількості раундів агент поступово вчиться правильно інтерпретувати вподобання користувача та дає задовільну відповідь.

Ao Qu - inline image

GIF

Візуалізація демонструє, як TTT ітеративно покращує рішення для Packing 32. У міру оптимізації виявляються та зберігаються все більш ефективні рішення, що призводить до поступово вищих показників пакування.

5. Висновок

Reef — це наша спроба перетворити широку ідею безперервного самовдосконалення на конкретну системну проблему. Відкриваючи вихідний код Reef, ми сподіваємося полегшити вивчення цієї проблеми та надати спільноті практичну основу для створення агентів, які не просто обслуговують, а постійно навчаються та еволюціонують на основі досвіду.

Ми запрошуємо вас спробувати Reef, створити власні навчальні рецепти та інтегрувати його з вашими агентами. Досліджуйте код, документацію та приклади рецептів на https://github.com/Human-Agent-Society/reef. Якщо ви знайшли Reef корисним, ми будемо вдячні за зірочку на репозиторії. Якщо ви хочете будувати разом з нами або обговорити безперервне самовдосконалення в ширшому сенсі, ласкаво просимо приєднатися до нашого Discord: https://discord.gg/5y8e5f937k.

  1. Ми використовуємо безперервне самовдосконалення як ширше та більш практичне формулювання, ніж RSI. Воно охоплює системи, які неодноразово вдосконалюються на основі досвіду, не вимагаючи повністю замкнутого циклу, який часто асоціюється з RSI, де сам AI бере участь у створенні та вдосконаленні системи, яка створює його наступну версію. Reef розроблений для цієї ширшої проблеми, залишаючи місце для більш рекурсивних форм самовдосконалення, які можуть виникнути на його основі.

Зростаючий список учасників (в алфавітному порядку): Chai Wenhao (@wenhaocha1), Ding Shuangrui (@ShuangruiDing), He Hao, He Haoze, Jiang Chonhe (@JiangChonghe), Jiang Nan (@nanjiangwill), Jiang Xuan, Li Xiaochen (@jacobli99), Liang Paul (@pliang279), Liu Bo (@Benjamin_eecs), Long Boyuan, Mang Qiuyang (@MangQiuyang), Qi Zhenting (@ZhentingQi), Qu Ao (@ao_qu18465), Qu Mingruo, Wang Zhaokai, Yan Xuezhi, Yu Hanfei (@yhfchitanda), Yu Haofei (@haofeiyu44), Yu Simon (@simon_ycl), Zheng Han (@hanzheng_7), Zhou Kaichen (@alex_kai2020), Zhou Zijian (@BobbyZhouZijian), Zhu Jiacheng (@JiachengZhu_ML), Zhuang Dingyi

Збереження в один клік

Використовуйте YouMind для AI-глибокого читання віральних статей

Зберігайте джерела, ставте цілеспрямовані запитання, підсумовуйте аргументи та перетворюйте віральні статті на корисні нотатки в одному AI-робочому просторі.

Дослідити YouMind
Для авторів

Перетворіть свій Markdown на охайну статтю для 𝕏

Коли ви публікуєте власні лонгріди, зображення, таблиці та блоки коду роблять форматування в 𝕏 складним. YouMind перетворює повну чернетку в Markdown на чисту статтю для 𝕏, готову до публікації.

Спробувати Markdown для 𝕏

Більше патернів для аналізу

Останні віральні статті

Переглянути більше віральних статей