Máy chủ suy luận của bạn đang âm thầm học hỏi: Ra mắt mã nguồn mở Reef cho các tác nhân tự cải thiện liên tục

@ao_qu18465
TIẾNG ANH01 thg 9, 2026
121K
216
46
9
262

TL;DR

Reef là cơ sở hạ tầng mã nguồn mở được thiết kế để các tác nhân AI tự cải thiện liên tục, cho phép cả trọng số mô hình và logic khai thác phát triển dựa trên trải nghiệm suy luận và phản hồi thực tế.

Reef là mã nguồn mở hoàn toàn: https://github.com/Human-Agent-Society/reef

1. Trước khi mọi “cơn sốt” RSI trở thành hiện thực

Trước khi sự phấn khích ngày nay xoay quanh RSI trở nên rõ ràng, chúng tôi muốn công bố mã nguồn mở Reef, một cơ sở hạ tầng mà chúng tôi đã xây dựng cho cùng một vấn đề rộng lớn hơn: cho phép các tác tử (harness + mô hình) liên tục tiến hóa từ trải nghiệm của chúng.

Mục tiêu là giúp cộng đồng mã nguồn mở dễ dàng thử nghiệm với khả năng tự cải thiện liên tục và dễ dàng tiếp cận cơ sở hạ tầng cấp sản xuất cho việc đó. Chúng tôi sử dụng tự cải thiện liên tục như một khuôn khổ rộng hơn và thực tế hơn ở đây, với RSI đại diện cho một dạng đệ quy hoàn chỉnh hơn của cùng một ý tưởng.¹

2. Tại sao tự cải thiện liên tục lại cần cơ sở hạ tầng mới?

Ao Qu - inline image

GIF

Hầu hết cơ sở hạ tầng LLM đều giả định một vòng đời tương đối đơn giản. Chúng ta huấn luyện một mô hình, đánh giá nó, triển khai nó, và sau đó sử dụng nó cho suy luận. Đối với các tác tử tự cải thiện liên tục, chúng tôi nghĩ rằng hai giả định đằng sau thiết lập này bắt đầu bị phá vỡ.

Đầu tiên, suy luận không còn là điểm cuối của quy trình nữa. Các tác tử tạo ra trải nghiệm hữu ích trong khi chúng hoạt động, bao gồm quỹ đạo, kết quả thực thi, phản hồi của người dùng và các tín hiệu khác có thể thúc đẩy cải tiến trong tương lai. Những gì xảy ra tại thời điểm suy luận không còn là thứ chúng ta chỉ phục vụ và loại bỏ. Nó trở thành một phần của chính quá trình học tập.

Thứ hai, mô hình không còn là thứ duy nhất tiến hóa. Một tác tử không chỉ là một mô hình, và việc tự cải thiện liên tục không nên bị giới hạn ở các trọng số mô hình. Lời nhắc, bộ nhớ, kỹ năng, công cụ và logic điều phối đều có thể cải thiện từ trải nghiệm. Một mô hình mạnh hơn mở rộng khả năng của tác tử, trong khi một harness tốt hơn giúp khai thác các khả năng đó hiệu quả hơn và thực thi chúng đáng tin cậy hơn trong các tác vụ phức tạp.

Cùng nhau, những thay đổi này biến những gì từng là một quy trình phần lớn tuần tự thành một vòng lặp tiến hóa liên tục. Các tác tử tương tác, tạo ra trải nghiệm, cải thiện các phần khác nhau của chính chúng, đánh giá xem những thay đổi đó có đáng để giữ lại hay không, và quay trở lại phục vụ như các phiên bản mới của hệ thống.

Đó cũng là lý do tại sao chúng tôi không coi Reef chỉ đơn thuần là cơ sở hạ tầng huấn luyện. Huấn luyện chỉ là một phần của vòng lặp. Chúng tôi nghĩ rằng cơ sở hạ tầng cho việc tự cải thiện liên tục phải bắt đầu từ suy luận trực tiếp và hỗ trợ sự tiến hóa của toàn bộ tác tử.

Ao Qu - inline image

GIF

3. Cơ sở hạ tầng như vậy cần những gì, và Reef triển khai nó như thế nào?

Ao Qu - inline image

Kiến trúc Reef

Cơ sở hạ tầng cho việc tự cải thiện liên tục cần sở hữu ba thứ từ đầu đến cuối: trải nghiệm, tác tử và các bản cập nhật. Điều đó có nghĩa là (1) học hỏi từ lưu lượng truy cập trực tiếp, (2) cập nhật cả mô hình và harness, và (3) đánh giá, quản lý phiên bản và kiểm soát cách các bản cập nhật được phát hành một cách phù hợp.

Sở hữu trải nghiệm — việc học phải được xây dựng trên nền tảng phục vụ trực tiếp

Suy luận và huấn luyện trong lịch sử đã được tách rời. Một số cơ sở hạ tầng RL (ví dụ: Slime, veRL) kết hợp một công cụ suy luận để tạo dữ liệu, nhưng các hệ thống này được thiết kế cho việc huấn luyện mô hình hơn là phục vụ mô hình. Chúng tôi cho rằng một cơ sở hạ tầng tự cải thiện liên tục trước tiên nên là một cơ sở hạ tầng suy luận và xây dựng năng lực huấn luyện của nó xoay quanh suy luận trực tiếp: hệ thống phục vụ các ứng dụng thực tế, thu thập trải nghiệm tại thời điểm kiểm tra và để các công thức học tập liên tục tiêu thụ nó. Niềm tin này dẫn đến việc xem xét lại nhiều lựa chọn thiết kế, bao gồm cả việc tạo tín hiệu huấn luyện và lựa chọn mẫu huấn luyện.

Suy luận là bản địa của Reef. Reef hiển thị các điểm cuối suy luận tiêu chuẩn, giúp dễ dàng tích hợp vào các ứng dụng hiện có và biến chúng thành các hệ thống tự tiến hóa.

python
1# client = xxx # khởi tạo httpx client đến điểm cuối phục vụ của Reef
2
3# Lệnh gọi suy luận tiêu chuẩn thông qua Reef, định dạng Open-AI
4response = client.post(
5 "/v1/chat/completions",
6 json={"model": xxx, "messages": xxx},
7)
8
9# Tham chiếu đến bản ghi suy luận được Reef lưu trữ
10receipt = response.headers["x-reef-agent-record-id"]

Các ứng dụng cũng có thể báo cáo phần thưởng, phản hồi của người đánh giá hoặc các tín hiệu khác liên quan đến các lệnh gọi suy luận cụ thể thông qua:

python
1# Đính kèm phản hồi vào bản ghi suy luận tương ứng
2client.post(
3 "/reef/report",
4 json={"feedback": "câu trả lời sai", "references": [receipt]},
5)

Khác với các công cụ suy luận hiện có vẫn giữ nguyên trạng thái tĩnh trong suốt vòng đời của chúng, Reef cung cấp suy luận trạng thái: Reef lưu trữ các dấu vết suy luận và phản hồi dưới dạng một luồng trải nghiệm có cấu trúc, xử lý các vấn đề như sự lỗi thời ngoài chính sách, hợp nhất phiên và khử trùng lặp. Các công thức học tập xác định cách luồng này được xử lý, thuật toán học nào được sử dụng và khi nào các bản cập nhật được đánh giá và triển khai. Điều này cho phép các ứng dụng khác nhau tiến hóa với các chiến lược học tập của riêng chúng trên cùng một cơ sở hạ tầng.

Sở hữu toàn bộ tác tử - cả mô hình và harness đều được tiến hóa thông qua suy luận trạng thái

Một tác tử AI có khả năng mang lại kết quả từ đầu đến cuối không chỉ bao gồm một mô hình, mà còn bao gồm một harness. Mô hình cung cấp các khả năng cơ bản cần thiết để giải quyết các tác vụ, trong khi harness cho phép thực thi đáng tin cậy trên các quỹ đạo phức tạp, dài hạn bằng cách quản lý các công cụ, ngữ cảnh, bộ nhớ, phản hồi và điều phối. Hai thành phần này được kết hợp chặt chẽ: harness xác định cách các khả năng của mô hình được khai thác, căn cứ và thực thi, trong khi mô hình xác định các hình thức thực thi mà harness có thể hỗ trợ một cách đáng tin cậy. Do đó, những tiến bộ trong một thành phần có thể thay đổi thiết kế tối ưu của thành phần kia. Một cơ sở hạ tầng tự cải thiện liên tục nên hỗ trợ sự tiến hóa chung của toàn bộ ngăn xếp tác tử, bao gồm không chỉ các trọng số mô hình, mà còn cả lời nhắc, bộ nhớ, kỹ năng, công cụ và logic điều phối.

Reef hỗ trợ cập nhật cho cả mô hình và harness.

Về phía harness, Reef sử dụng Cordis như một "backend huấn luyện". Một công thức tiến hóa harness thường phân tích các quỹ đạo và phản hồi của tác tử, sau đó đề xuất các chỉnh sửa cho harness. Quá trình này diễn ra hoàn toàn trong Reef và mỗi phiên bản harness đã tiến hóa được phát hành cho người dùng dưới dạng một bản cập nhật có thể cài đặt (giả sử Reef được phục vụ trên localhost:8900):

bash
1curl -fsS -H "Authorization: Bearer $REEF_TOKEN" \
2 'http://localhost:8900/reef/harness/install?adapter=pi' | bash

Lệnh trên cài đặt một harness Pi được bọc bởi Reef theo cách tương tự như một tác tử mã hóa điển hình. Harness được cấu hình để sử dụng điểm cuối suy luận trạng thái của Reef, do đó lưu lượng suy luận của nó chảy qua Reef. Khi người dùng làm việc, Cordis tiến hóa harness theo công thức tiến hóa harness đã được cấu hình và các phiên bản mới được cung cấp thông qua Reef. Lần tiếp theo người dùng mở harness, họ có thể thấy:

Ao Qu - inline image

Về phía mô hình, các công thức học tập tiêu thụ các bản ghi của Reef để cập nhật trọng số mô hình. Việc huấn luyện chạy không đồng bộ với việc phục vụ trực tiếp bằng cách sử dụng một backend huấn luyện phân tán, hiện được điều chỉnh từ Slime và tạo ra các bản cập nhật trọng số ứng viên như điểm kiểm tra hoặc bộ điều hợp LoRA.

Khi một ứng viên vượt qua đánh giá và được phê duyệt để triển khai, Reef công bố nó như một phiên bản mới của artifact mô hình của kịch bản và cập nhật nóng công cụ phục vụ bằng cách sử dụng đồng bộ hóa trọng số dựa trên NCCL, mà không cần khởi động lại dịch vụ.

Sở hữu các bản cập nhật - các bản phát hành đã tiến hóa được đánh giá và quản lý phiên bản

Một tác tử liên tục tiến hóa có thể bị suy giảm chất lượng dịch vụ, đặc biệt là khi sự tiến hóa không được đảm bảo mang lại cải thiện hiệu suất. Do đó, mỗi ứng viên đã tiến hóa nên được đánh giá trước khi phát hành. Reef kiểm soát xem một ứng viên đã tiến hóa có được phép thay thế artifact hiện đang phục vụ một kịch bản hay không. Nếu ứng viên bị từ chối, việc phục vụ vẫn không thay đổi. Nếu không, Reef công bố nó như một bản phát hành mới, có thể kiểm toán được.

Bất cứ thứ gì Reef có thể tiến hóa—chẳng hạn như điểm kiểm tra mô hình, bộ điều hợp LoRA, cây harness hoặc chính sách định tuyến—đều được biểu diễn dưới dạng một artifact được quản lý bởi bộ điều khiển phiên bản. Reef áp dụng Git LFS để quản lý các artifact, đặc biệt là những artifact chiếm nhiều dung lượng đĩa như trọng số mô hình. Đường dẫn phát hành là:

Ao Qu - inline image

Mỗi kịch bản có một chuỗi phát hành chỉ nối thêm. Reef tiến triển đầu phát hành của kịch bản bằng cách sử dụng so sánh và hoán đổi, do đó một nhà xuất bản cũ không thể ghi đè lên một bản phát hành mới hơn. Đường ống phát hành cho phép Reef theo dõi hiệu quả các thay đổi phiên bản liên tục và các quy trình phát hành.

4. Các phương pháp tự cải thiện liên tục trong Reef

Cơ sở hạ tầng trên cung cấp các trừu tượng hóa chung cho việc tự cải thiện liên tục. Logic thực tế về cách một tác tử cải thiện được thực hiện thông qua các công thức học tập mô-đun.

Chúng tôi đã thấy một vườn thú ngày càng phát triển các phương pháp để biến các tín hiệu được tạo ra tại thời điểm kiểm tra thành các tác tử tốt hơn: học tăng cường trực tuyến, huấn luyện tại thời điểm kiểm tra, tiến hóa kỹ năng, tiến hóa harness, tự chơi, v.v. Mặc dù có tên gọi và cơ chế khác nhau, chúng đều chia sẻ cùng một mẫu cơ bản: các tín hiệu được tạo ra tại thời điểm kiểm tra được chuyển đổi thành các bản cập nhật cho hệ thống tạo ra tương tác tiếp theo.

Các công thức này khác nhau chủ yếu ở ba khía cạnh:

Tín hiệu học tập: Hình thức tín hiệu nào thúc đẩy cải tiến và nó đến từ đâu?

Thu nhận trải nghiệm: Trải nghiệm học tập được tạo ra như thế nào? Nó được tác tử chủ động tìm kiếm, hay được tạo ra một cách thụ động từ một tác vụ hoặc tương tác bên ngoài?

Mục tiêu tiến hóa: Thứ gì thực sự thay đổi: mô hình, harness, hay cả hai?

Ao Qu - inline image

Các công thức đã được hỗ trợ hoặc sắp có trong Reef

Reef được thiết kế để các phương pháp này phần lớn có thể được thể hiện thông qua các công thức học tập khác nhau trên cùng một cơ sở hạ tầng. Sử dụng một công thức rất đơn giản: chọn một công thức và cấu hình nó khi khởi động dịch vụ Reef.

yaml
1# serve.yaml
2reef:
3 recipe: recipes.sao.recipe:SAORecipe # Cắm một công thức tiến hóa
4 batch_size: 1 # Cấu hình dành riêng cho công thức
5 max_staleness: 18

Sau đó khởi động Reef với cấu hình:

bash
1reef serve -c recipes/sao/examples/sao/serve.yaml

Dưới đây, chúng tôi đưa ra hai ví dụ, OpenClaw-RL và TTT-Discover, tuân theo các chiến lược tiến hóa rất khác nhau nhưng đều có thể được triển khai trong Reef.

Ao Qu - inline image

GIF

Hình ảnh minh họa sự tích hợp của OpenClaw-RL trong Reef. Người dùng tương tác với một tác tử có mô hình được Reef liên tục tiến hóa một cách không đồng bộ mà không làm gián đoạn người dùng. Khi ngày càng nhiều vòng tích lũy, tác tử dần dần học cách diễn giải chính xác sở thích của người dùng và đưa ra câu trả lời thỏa đáng.

Ao Qu - inline image

GIF

Hình ảnh minh họa cách TTT cải thiện lặp đi lặp lại một giải pháp Packing 32. Khi quá trình tối ưu hóa tiến triển, các giải pháp ngày càng hiệu quả được khám phá và giữ lại, dẫn đến điểm số đóng gói ngày càng cao.

5. Kết luận

Reef là nỗ lực của chúng tôi nhằm biến ý tưởng rộng lớn về tự cải thiện liên tục thành một vấn đề hệ thống cụ thể. Bằng cách công bố mã nguồn mở Reef, chúng tôi hy vọng sẽ làm cho vấn đề này dễ nghiên cứu hơn và cung cấp cho cộng đồng một nền tảng thực tế để xây dựng các tác tử không chỉ phục vụ, mà còn liên tục học hỏi và tiến hóa từ trải nghiệm.

Chúng tôi mời bạn dùng thử Reef, xây dựng các công thức học tập của riêng bạn và tích hợp nó với các tác tử của bạn. Khám phá mã nguồn, tài liệu và các công thức ví dụ tại https://github.com/Human-Agent-Society/reef. Nếu bạn thấy Reef hữu ích, chúng tôi rất cảm kích nếu bạn cho một ngôi sao trên kho lưu trữ. Nếu bạn muốn xây dựng cùng chúng tôi hoặc thảo luận về tự cải thiện liên tục một cách rộng rãi hơn, bạn luôn được chào đón tham gia Discord của chúng tôi: https://discord.gg/5y8e5f937k.

  1. Chúng tôi sử dụng tự cải thiện liên tục như một khuôn khổ rộng hơn và thực tế hơn so với RSI. Nó bao gồm các hệ thống liên tục cải thiện từ trải nghiệm mà không yêu cầu vòng lặp khép kín hoàn toàn thường được liên kết với RSI, nơi bản thân AI tham gia vào việc xây dựng và cải thiện hệ thống tạo ra phiên bản tiếp theo của nó. Reef được thiết kế cho vấn đề rộng hơn này, đồng thời để lại không gian cho các hình thức tự cải thiện đệ quy hơn xuất hiện trên nền tảng của nó.

Danh sách người đóng góp ngày càng tăng (theo thứ tự bảng chữ cái): Chai Wenhao (@wenhaocha1), Ding Shuangrui (@ShuangruiDing), He Hao, He Haoze, Jiang Chonhe (@JiangChonghe), Jiang Nan (@nanjiangwill), Jiang Xuan, Li Xiaochen (@jacobli99), Liang Paul (@pliang279), Liu Bo (@Benjamin_eecs), Long Boyuan, Mang Qiuyang (@MangQiuyang), Qi Zhenting (@ZhentingQi), Qu Ao (@ao_qu18465), Qu Mingruo, Wang Zhaokai, Yan Xuezhi, Yu Hanfei (@yhfchitanda), Yu Haofei (@haofeiyu44), Yu Simon (@simon_ycl), Zheng Han (@hanzheng_7), Zhou Kaichen (@alex_kai2020), Zhou Zijian (@BobbyZhouZijian), Zhu Jiacheng (@JiachengZhu_ML), Zhuang Dingyi

Lưu một chạm

Đọc sâu bài viết viral bằng AI trong YouMind

Lưu nguồn, đặt câu hỏi tập trung, tóm tắt lập luận và biến một bài viết viral thành các ghi chú có thể tái sử dụng trong một không gian làm việc AI duy nhất.

Khám phá YouMind
Dành cho nhà sáng tạo

Biến Markdown của bạn thành bài viết 𝕏 gọn gàng

Khi bạn đăng bài viết dài của riêng mình, việc định dạng hình ảnh, bảng và khối mã cho 𝕏 rất mệt mỏi. YouMind biến cả bản nháp Markdown thành một bài viết 𝕏 gọn gàng, sẵn sàng để đăng.

Thử Markdown sang 𝕏

Thêm pattern để giải mã

Bài viết viral gần đây

Khám phá thêm bài viết viral