Mọi agent bạn từng dùng đến nay đều được đóng gói thành một khối thống nhất. Phần khung — máy tính, tài khoản đăng nhập, bộ nhớ, các quy trình tự động — và "bộ não" điều khiển nó đều do cùng một công ty xây dựng và bán kèm với nhau.
Vào ngày 7 tháng 10, Grok Bot đã tách chúng ra:
https://x.com/elonmusk/status/2107724314451878104
Từ giờ trở đi, SpaceX sẽ định tuyến mọi tác vụ đến mô hình back-end tốt nhất — và cái tên đầu tiên trong danh sách là Claude Opus 5.5. SpaceX giữ lại phần khung. Còn bộ não giờ đây thuộc về Anthropic.
Sự kết hợp đó tạo ra phiên bản mạnh mẽ nhất của sản phẩm cho đến thời điểm hiện tại: một agent sở hữu máy tính riêng và làm việc ngay cả khi bạn đang ngủ, được dẫn dắt bởi mô hình đang dẫn đầu các bảng xếp hạng độc lập về tác vụ agentic nhiều bước.
Đây là hướng dẫn 10 bước
từ việc hiểu những gì vừa thay đổi cho đến khi vận hành một đội ngũ chuyên gia chạy bằng Opus biết chuyền việc cho nhau — và chỉ gọi bạn vào những cuộc trao đổi thực sự cần con người.
01. Hiểu chuyện gì vừa xảy ra
Mọi thứ bắt đầu từ một bài đăng. Khuya ngày 6 tháng 10 (giờ Mỹ), Musk viết trên X rằng SpaceX sẽ sử dụng mô hình back-end tốt nhất cho từng tác vụ cụ thể — ông nhắc đến Claude Opus 5.5, Midjourney và Suno. Câu chốt của ông: "Bất cứ thứ gì có khả năng mang lại kết quả tốt nhất cho bạn."
Vài giờ sau, Lauren (@poteto) từ đội ngũ Grok Bot đã cụ thể hóa điều này: toàn bộ bot sẽ được vận hành bởi Opus 5.5, và chúng có thể khởi tạo các cloud agent chạy mô hình của Cursor. 9to5Mac xác nhận thông tin này đã chính thức áp dụng từ ngày 7 tháng 10.
https://x.com/claudeai/status/2107894039626277339
Tại sao lại dùng mô hình của đối thủ? Bởi vì khoảng cách hiệu năng ở những việc mà một agent thực sự phải làm là rất lớn. Artificial Analysis đã đo lường cả hai phòng thí nghiệm trên cùng một hệ thống:

Một lưu ý nhỏ: đó là Grok 4.6, không phải Grok 4.7 của tháng 9, và hai phép đo được thực hiện cách nhau một tháng. Nhưng Terminal-Bench mới là con số dự báo liệu bạn có thể giao hẳn một công việc cho mô hình thay vì chỉ đặt câu hỏi hay không — và ở đó, khoảng cách gần như gấp 3 lần.
https://x.com/zhuokaiz/status/2102825912471527738
Cộng đồng X phản ứng trước cả giới truyền thông:
Vào ngày 7 tháng 10, Grok Bot đã tách chúng rađến mô hình back-end tốt nhất — và cái tên đầu tiên trong danh sách là Claude Opus 5.5. SpaceX giữ lại phần khung. Bộ não giờ đây thuộc về Anthropic.
Ai
Họ nói gì
Theo - t3.gg (@theo)
"Tin buồn đây mọi người: Grok Bot thực sự rất xịn" — 4,4 triệu lượt xem, đăng vài giờ trước khi tin tức nổ ra. Hôm sau, Lauren trả lời rằng nó vừa trở nên còn xịn hơn nữa.
Lauren (@poteto)
Quote-post bài của Musk để thông báo Grok Bot sắp được nâng cấp.
Iorel (@Iorel_X)
Định nghĩa đây là lúc Grok Bot mở cửa đón các mô hình bên ngoài thay vì bị khóa chặt vào một mô hình duy nhất.
02. Cài đặt và làm quen với "Sếp tổng"
Grok Bot là một ứng dụng, không phải một tab trình duyệt. Nó chạy trên Mac, iPhone và iPad. Bạn đăng nhập bằng tài khoản Grok hoặc Cursor — nó không được bán lẻ mà đi kèm trong hầu hết các gói SuperGrok và gói Cursor trả phí.
Bạn sẽ bước vào một giao diện giống ứng dụng nhắn tin hơn là chatbot: danh sách bot ở bên trái, khung hội thoại ở bên phải. Mỗi bot được cấp một máy tính riêng trên đám mây.

Bạn không cần bật tắt gì thêm để dùng Opus 5.5. Theo đội ngũ Grok Bot, đây là mặc định cho mọi bot. Cũng không có gói đăng ký Claude nào riêng biệt cả.
Hãy bắt đầu với một bot đa năng — gọi nó là Sếp tổng. Nhiệm vụ của nó là nơi bạn nhắn tin khi chưa biết nên giao việc đó cho chuyên gia nào.
Giao cho nó một việc thực tế với kết quả bạn có thể kiểm tra trong ba mươi giây. Mọi bước sau đây đều xoay quanh việc tin tưởng giao cho nó những việc lớn hơn — nên hãy bắt đầu bằng một việc bạn có thể tự xác minh.
03. Viết bản mô tả vai trò cho một bộ não mạnh hơn
Prompt là một yêu cầu. Bot là một vai trò — nó tồn tại liên tục, tích lũy bộ nhớ và phụ trách một lĩnh vực. Vì vậy, hãy đặt tên nó theo công việc: Quản lý Hộp thư, Trưởng nhóm Nghiên cứu, Sales Outbound.

Sau đó, briefing cho nó như một nhân viên mới: nó phụ trách gì, thế nào là làm tốt, và đâu là giới hạn nó phải dừng lại để hỏi bạn.
Đây là những gì thay đổi với Opus 5.5. Các bản mô tả viết cho mô hình mặc định cũ thường mang tính phòng thủ — chuỗi lệnh ngắn, check-in liên tục — vì mô hình hay khựng lại sau vài bước. Với một bộ não đạt điểm cao gần gấp 3 lần ở tác vụ nhiều bước, bạn có thể giao trọn cả công việc, chứ không chỉ bước đầu tiên.
Opus 5.5 cũng hỗ trợ context window 1 triệu token và tối đa 128K token đầu ra qua API. Grok Bot cho phép dùng bao nhiêu trong số đó thì chưa được công bố — nhưng điểm mấu chốt giờ đây là những tác vụ dài hơi.
1Bản mô tả vai trò — thiết kế cho Opus 5.52Bạn là Trưởng nhóm Nghiên cứu của tôi.34// phạm vi bạn phụ trách5Khi nhận một chủ đề, hãy làm trọn vẹn từ đầu đến cuối: tìm nguồn sơ cấp,6mở mọi trang bạn trích dẫn, đối chiếu số liệu qua ít nhất hai nguồn,7và soạn một bản tóm tắt 1.500 từ.89// tiêu chuẩn hoàn thành10Mỗi con số phải có link đính kèm. Các nguồn mâu thuẫn nhau phải được đánh dấu,11không được tự lấy trung bình. Bản nháp lưu vào thư mục Drive của tôi, không gửi qua chat.1213// giới hạn phải dừng14Tuyệt đối không xuất bản. Tuyệt đối không email cho ai. Chỉ làm bản nháp.15Nếu hai nguồn mâu thuẫn mà bạn không tự giải quyết được, hãy tạm dừng và hỏi tôi.
Nguyên tắc: bộ não thông minh hơn thì được giao nhiều bước hơn, chứ không phải nhiều quyền hạn hơn. Khối "giới hạn phải dừng" vẫn phải nghiêm ngặt y như trước.
04. Kết nối công cụ một lần — và vạch rõ ranh giới dữ liệu

Grok Bot tích hợp sẵn bảng plugin với khả năng kết nối một cú nhấp: Notion, Slack, Google Drive, AWS Agents, AWS SageMaker, Browserbase, Composio và Context7, cùng các kết nối tùy chỉnh.
Kết nối hoạt động ở cấp tài khoản. Kết nối Gmail một lần, mọi bot bạn tạo sau đó đều dùng được. Bot thứ năm của bạn có thể bắt tay vào việc chỉ trong vài giây.
Điểm mới: dữ liệu của bạn giờ có thêm một đích đến thứ hai. Khi bot suy luận bằng Opus 5.5, những gì nó đọc sẽ được gửi đến Anthropic cho bước đó. Câu hỏi xin chọn không tham gia (opt-out) của Tom dưới bài đăng của Musk hiện chưa có lời đáp, và SpaceXAI cũng chưa công bố điều khoản về những gì được chia sẻ.
Bạn không thể chọn nơi mô hình chạy. Nhưng bạn có thể chọn những gì bot được chạm vào. Hãy thêm đoạn này vào mọi bản mô tả vai trò:
1// ranh giới dữ liệu — thêm vào mọi bản mô tả vai trò2Không được mở, đọc hoặc tóm tắt:3 - bất cứ thứ gì trong thư mục /Legal hoặc /Finance trên Drive của tôi4 - email từ luật sư, kế toán hoặc ngân hàng của tôi5 - bất kỳ tin nhắn nào chứa mật khẩu, seed phrase hoặc mã 2FA67Nếu tác vụ cần đến những thứ này, hãy dừng lại và hỏi tôi trước.8Khi xử lý tài liệu, chỉ dùng đúng phần tác vụ yêu cầu.
Chỉ kết nối những gì bạn thực sự cần, bỏ qua phần còn lại. Trong giai đoạn beta, mọi kết nối đều truy cập được bởi mọi bot — và giờ đây là bởi nhiều hơn một công ty.
05. Giao phiên đăng nhập, tuyệt đối không giao mật khẩu
Phần lớn phần mềm trong một doanh nghiệp thực tế không có API và cũng chẳng có MCP server. Đây là cơ chế giúp Grok Bot vẫn xử lý được chúng.
Bot tự điều hướng trình duyệt đám mây của nó cho đến khi gặp màn hình đăng nhập. Lúc đó, nó nhường màn hình lại cho bạn. Bạn đăng nhập, bấm xong, và bot tiếp tục công việc trên chính phiên trình duyệt đó.
Bot chỉ nhận được một phiên làm việc, không phải bí mật của bạn. Bạn không bao giờ phải gõ thông tin đăng nhập vào khung chat — và khi có thêm một mô hình bên thứ ba tham gia, điều này càng quan trọng hơn bao giờ hết. Mật khẩu dán vào đoạn chat là văn bản mô hình sẽ đọc. Còn đăng nhập trên màn hình được nhường quyền thì không.
Nguyên tắc cần tuân thủ: nếu bất kỳ công cụ nào yêu cầu bạn dán mật khẩu vào tin nhắn, đó là cách làm sai.
06. Làm mẫu một lần, rồi biến nó thành quy trình tự động
Bạn có thể dạy bot một luồng công việc bằng cách tự làm một lần trong khi nó quan sát. Nó sẽ lưu lại các bước và tự chạy vào lần sau.

Lần ghi hình đầu tiên tốt nhất nên là việc lặp lại thường xuyên, dùng nhiều công cụ và ít thay đổi: thứ bạn làm hàng tuần, qua hai ứng dụng trở lên, với các bước hiếm khi khác đi. Mô tả bằng lời thì lằng nhằng, nhưng làm mẫu chỉ mất bốn mươi giây.
Sau đó, hãy cho quy trình này một lý do để kích hoạt. Có hai lựa chọn, cả hai đều thiết lập bằng ngôn ngữ tự nhiên — không cần node canvas, không cần workflow builder:
1// lịch trình — bản tin buổi sáng2Vào 7h sáng mỗi ngày trong tuần, kiểm tra lịch, hộp thư đến và3kênh #launches trên Slack. Gửi tôi một bản tin ngắn: hôm nay có gì,4cái gì cần trả lời, có gì thay đổi qua đêm.56// điều kiện kích hoạt — bẫy tin nhắn đến7Bất cứ khi nào có email từ một domain không nằm trong danh bạ8và có nhắc đến giá cả, hãy soạn phản hồi theo mẫu rồi lưu nháp.910// phím tắt tạo ra phần lớn các quy trình11Chạy việc này mỗi tuần.12 ^ nói câu này ngay sau một tác vụ bạn thấy ưng ý.
Đây là lúc Opus 5.5 phát huy giá trị: các quy trình tự động thường gãy khi một trang web đổi giao diện hoặc dữ liệu đầu vào trông hơi khác. Một mô hình giỏi hơn ở tác vụ nhiều bước sẽ dễ dàng tự phục hồi khi trang web thay đổi thay vì âm thầm thất bại.
07. Tuyển chuyên gia có khả năng khởi tạo Cursor agent
Hãy chạy song song nhiều bot, mỗi bot phụ trách một lĩnh vực. Bot riêng đồng nghĩa với bộ nhớ riêng, ngữ cảnh riêng và một luồng hội thoại sạch sẽ để dò lại khi có sự cố. SpaceXAI cho biết chính các đội ngũ nội bộ của họ đang chạy bot cho sales outreach, marketing, vận hành văn phòng và sửa lỗi.
Chia theo lĩnh vực, đừng chia theo độ lớn tác vụ. Một bot Quản lý Chi tiêu chỉ tập trung nghĩ về hóa đơn sẽ ngày càng thạo việc xử lý hóa đơn của bạn.
Lớp tính năng mới chính là nửa còn lại, ít ồn ào hơn trong thông báo của đội ngũ Grok Bot: bot có thể khởi tạo cloud agent chạy bất kỳ mô hình nào của Cursor. Điều này khớp với bức tranh sở hữu — SpaceX đã mua lại Cursor vào tháng 8 trong thương vụ 60 tỷ USD.
Vậy nên một bot code giờ trở thành quản lý. Bot chạy bằng Opus sẽ lên kế hoạch và nắm ngữ cảnh. Các Cursor agent song song đảm nhận phần việc nặng nhọc. Bot sẽ review lại kết quả trả về.
1// Người Bảo trì Repo — một bot quản lý các agent2Bạn là Người Bảo trì Repo của tôi.34Khi một issue trên GitHub bị gắn nhãn "bug":51. Tái hiện lỗi trên máy của bạn và viết một test case thất bại.62. Khởi tạo một Cursor cloud agent để sửa lỗi trên một branch mới.73. Chạy toàn bộ test suite trên kết quả thu được.84. Mở một draft PR kèm test, bản sửa và tóm tắt 3 dòng.910Tuyệt đối không merge. Tuyệt đối không push vào main.11Nếu bản sửa đụng đến auth, billing hoặc migration, hãy tạm dừng để tôi duyệt.
Người dùng trên X thực chất đã làm một phiên bản tương tự trước cả thông báo này — từng có bài đăng vào cuối tháng 9 về việc khởi tạo Cursor cloud agent từ Grok Bot
https://x.com/mikepat711/status/2103551603102126149
08. Gom chúng vào một group chat
Các bot có thể nhắn tin cho nhau và chia sẻ ngữ cảnh trong thread. Gom vài bot vào một group chat, chúng sẽ tự phối hợp — chuyền việc, phân công người phụ trách, và chỉ kéo bạn vào những quyết định cần phán đoán của con người.
Ví dụ từ chính SpaceXAI: một bot kỹ thuật tái hiện lỗi, tạo ticket, rồi chuyển cho bot thứ hai để debug. Việc một bot tự nhận ra bot khác phù hợp hơn — và chuyển giao quyền phụ trách — là điều không công cụ chat đơn lẻ nào làm được.
Từ cuối tháng 9, các nhóm cũng có thể xuất bản một bot dùng chung để đồng nghiệp sử dụng trong ứng dụng hoặc trên Slack.
Bí quyết là hãy giao cho nhóm một mục tiêu, chứ không phải danh sách tác vụ. Danh sách tác vụ nghĩa là bạn đã tự phân rã công việc rồi. Mục tiêu cho phép chúng tự chia việc — và phân rã công việc chính xác là kiểu suy luận nhiều bước mà Opus 5.5 mạnh nhất.
1// mục tiêu, không phải danh sách tác vụ2Mục tiêu: phát hành newsletter tháng 10 trước 17h thứ Sáu.34Trưởng nhóm Nghiên cứu phụ trách dữ kiện và nguồn.5Quản lý Hộp thư phụ trách phản hồi từ người đăng ký.6Sếp tổng phụ trách tiến độ và báo tôi biết chỗ nào đang tắc.78Tự chia việc với nhau. Việc nào liên quan đến công khai thì để tôi duyệt.
09. Vạch rõ ranh giới phê duyệt
Tiền đề của Grok Bot là bot sẽ làm trọn vẹn công việc từ đầu đến cuối và chỉ quay lại khi có việc cần bạn phê duyệt. Điều đó buộc bạn phải tự định nghĩa "cần phê duyệt" — vì mặc định của bot có thể không khớp với bạn.

Ranh giới hiệu quả không nằm ở độ lớn tác vụ. Nó nằm ở khả năng đảo ngược. Bất cứ gì bot có thể hoàn tác, nó tự làm xong. Bất cứ gì thế giới bên ngoài nhìn thấy, liên quan đến tiền bạc, hoặc không thể rút lại, đều phải được giữ lại để bạn duyệt.
Điều này giờ đây còn quan trọng hơn, chứ không hề giảm đi. Một bộ não mạnh hơn sẽ tiến sâu hơn vào công việc trước khi chạm ngưỡng của bạn — nên ngưỡng đó phải được quy định thật rõ ràng.
1// luôn tự làm xong những việc này2soạn nháp · lưu file · gắn thẻ · tóm tắt · nghiên cứu · chuẩn bị · đối soát3 tất cả đều đảo ngược được. đừng hỏi, cứ làm và ghi log lại.45// luôn giữ lại những việc này để tôi duyệt6gửi bất cứ thứ gì cho người ngoài công ty7chi tiêu, chuyển tiền hoặc chốt giá8xuất bản bất cứ thứ gì công khai9xóa bất cứ thứ gì không phải rác hiển nhiên10chấp nhận điều khoản hoặc đăng ký dịch vụ mới1112// khi không chắc chắn13Nếu bạn không thể hoàn tác trong vòng một phút, hãy tạm dừng và hỏi tôi.
Hình mẫu cần hướng tới cho mọi bot: 36 bản nháp đang chờ, 0 bản đã gửi. Mọi bước đảo ngược được đều hoàn tất, dừng cứng ngay ở bước không thể đảo ngược đầu tiên.
10. Theo dõi chi phí, review hàng tuần
Opus 5.5 không phải bộ não rẻ. Trên API, giá của nó cao hơn hẳn Grok:

Với một tác vụ nhỏ — 30K token đầu vào, 8K đầu ra — chi phí rơi vào khoảng 28 cent so với 11 cent. Nhưng với ngữ cảnh rất dài, trật tự này đảo ngược, vì giá Grok tăng gấp đôi khi vượt 200K token còn Opus vẫn giữ nguyên.
Bạn không trả tiền theo token trong Grok Bot — nó nằm trong gói cước của bạn. Câu hỏi ngỏ, cũng là điều Adam Hincu thắc mắc trên X, là liệu các tác vụ chạy bằng Opus có đốt giới hạn gói nhanh hơn không. SpaceXAI chưa lên tiếng. Vậy nên hãy theo dõi mức sử dụng trong tuần đầu trước khi bổ sung thêm quy trình tự động.

Và không phải mọi thứ được công bố đều đã hoạt động. Midjourney và Suno chưa có lịch cụ thể, và bot của ít nhất một người dùng đã báo Suno chưa khả dụng trong ngày đầu tiên. Hãy xây dựng trên nền Opus 5.5 — thứ đã được xác nhận. Những thứ còn lại thì cứ chờ.
Sau đó, hãy dành mười lăm phút mỗi tuần trên lịch và để các bot tự báo cáo:
1Liệt kê mọi quy trình bạn đã chạy tuần này. Với mỗi quy trình:23 - số lần được kích hoạt4 - kết quả tạo ra5 - những gì bị bỏ qua, thất bại hoặc phải đoán mò6 - những gì bạn giữ lại chờ tôi duyệt mà tôi chưa phản hồi78Rồi cho tôi biết quy trình nào kém hữu ích nhất, và tại sao.9Nếu bạn không xác định được mô hình nào xử lý một bước cụ thể, hãy nói rõ.
Hãy tự tay kiểm tra ngẫu nhiên một kết quả của mỗi quy trình. Bot tự chấm điểm bài làm của mình cũng có điểm mù y như bạn.
Kết luận: phần khung mới là sản phẩm
Suốt ba năm qua, câu hỏi luôn là mô hình nào tốt nhất. Tuần này, nhà xây dựng mô hình táo bạo nhất thị trường đã trả lời một câu hỏi khác: phần khung nào tốt nhất — rồi nhét bộ não của đối thủ vào trong đó.
Đó chính là bước ngoặt. Phần khung sở hữu máy tính, tài khoản đăng nhập, bộ nhớ và các quy trình. Bộ não bên dưới có thể hoán đổi, và ngay lúc này, lựa chọn tốt nhất cho tác vụ agent là Opus 5.5.
Việc của bạn không thay đổi. Bạn quyết định ủy quyền những gì, quyền hạn của bot dừng ở đâu, và nó được chạm vào dữ liệu nào. Hãy viết cả ba điều đó vào bản mô tả vai trò — và để bộ não mạnh nhất thị trường lo phần click chuột.





