Trong 3 năm qua, tôi đã dành hơn 2.000 giờ để code với AI, và tôi đã phỏng vấn trực tiếp một số người hiệu quả nhất trong lĩnh vực Kỹ thuật Tác tử (Agentic Engineering).
Dưới đây là toàn bộ thiết lập Kỹ thuật Tác tử hiện tại của tôi, tính đến Quý 3 năm 2026.
Giao diện
Điều này có nghĩa là UI / CLI cách bạn tương tác với các tác tử. Giao diện chính của tôi là bb.
Nó là mã nguồn mở, hoàn toàn miễn phí và cho phép bạn sử dụng bất kỳ gói đăng ký nào, bất kỳ tác tử nào, bất kỳ mô hình nào trong một GUI duy nhất. Codex, Claude Code, Pi, Cursor CLI, OpenCode, Grok Build, Hermes, tất cả đều trong cùng một UI.
Vấn đề với các ứng dụng như Codex hay Cursor là chúng chỉ cho phép mô hình và gói đăng ký của riêng chúng. Mục tiêu là có được nhiều token nhất với ít đô la nhất.
Tất cả các tính năng bạn thích từ ứng dụng Codex hay Cursor đều có trong bb, và nó được cải thiện mỗi tuần (thêm nữa, nó hoàn toàn là mã nguồn mở và 100% miễn phí để sử dụng).
Một thứ khác tôi sử dụng nhiều là cmux.
Khi bạn khởi chạy một không gian làm việc cmux mới, bạn có thể chia màn hình giống như trong tmux (đó là lý do tại sao tên tương tự), khởi chạy các terminal khác nhau trong mỗi ô, và có một trình duyệt tích hợp sẵn.
Điểm yếu của cmux là khi bạn có nhiều tác tử và không gian làm việc. Thanh bên trái thực sự không phải là công cụ phù hợp. Tốt cho một vài thứ đang diễn ra, nhưng đối với công việc kỹ thuật tác tử nghiêm túc ở quy mô lớn thì nó không phải là tốt nhất.
Tôi sử dụng Ghostty làm terminal của mình vì nó rất nhanh và bản địa.
Bên trong Ghostty, bạn có thể chạy Herdr, về cơ bản là tmux nhưng dành cho các tác tử, một runtime backend cho các tác tử. Rất tối giản, rất nhẹ, sống trong terminal, và khi một tác tử hoàn thành, trạng thái của nó hiển thị ở bên trái: hoàn thành, không hoạt động, bị chặn, đang chạy.
Theo dõi trạng thái của các tác tử AI là RẤT QUAN TRỌNG. Dự đoán của tôi là trong 3 đến 6 tháng tới, "theo dõi trạng thái tác tử" này sẽ ngày càng trở nên quan trọng hơn, bởi vì bạn sẽ không nói chuyện với một tác tử duy nhất. Bạn sẽ nói chuyện với một tác tử quản lý, người quản lý rất nhiều tác tử công nhân.
Giao diện cuối cùng tôi phải đề cập là Corral, thứ tôi tự phát triển.
Thay vì chuyển đổi ngẫu nhiên giữa các tác tử bất cứ khi nào chúng hoàn thành (trong Herdr, không có thứ tự thực sự), mỗi tác tử có một mức độ ưu tiên. Cũng giống như các nhiệm vụ có các mức độ ưu tiên/tầm quan trọng khác nhau. Khi một tác tử P1 hoàn thành, nó sẽ lên đầu danh sách. Bạn không bao giờ nên trả lời một tác tử P4 khi một tác tử P1 đã chạy xong. (vâng... tôi cần phải mã nguồn mở corral. chưa làm được.)
Mô hình và Gói đăng ký
Bạn muốn có nhiều token nhất với ít đô la nhất có thể. Đây nên là một trong những mục tiêu chính của mọi Kỹ sư Tác tử (sau khi hoàn thành công việc).
Hiện tại có 4 gói đăng ký chính, và vâng... điều này có thể hoàn toàn khác sau 2 tháng nữa.
Thỏa thuận "đáng đồng tiền bát gạo" nhất hiện tại là OpenCode Go. Nó chỉ $10, và cung cấp cho bạn Kimi K3, Grok 4.6, GLM 5.3, DeepSeek V4 Pro, và nhiều mô hình khác... Nhưng nó không có các mô hình tốt nhất như Fable 5 và GPT-5.6 Sol (thêm nữa, giới hạn sử dụng khá nhỏ).
Vì vậy, nếu bạn có một chút tiền hơn, đây là những gì bạn nên làm:
- $30 -- lấy OpenCode Go + ChatGPT Plus ($20)
- $50 -- Thêm gói đăng ký Claude Code $20 lên trên.
- $70 -- Thêm Cursor $20 một tháng, và bạn có bậc thấp nhất của tất cả các gói đăng ký.
- $110 -- OpenCode + một trong các gói lớn. Gói ChatGPT $100 sẽ mang lại cho bạn thỏa thuận tốt hơn Claude. Nó là như vậy. OpenAI có nhiều sức mạnh tính toán hơn, họ sẵn sàng trợ cấp nhiều hơn.
- $210 -- Chỉ cần lấy cả hai gói $100.
- Và nếu bạn thực sự nghiêm túc (như tôi) thì chỉ cần lấy tất cả các gói $200 (Codex, Claude, Cursor) vì chúng có mức sử dụng gấp 20 lần, và các gói này mang lại cho bạn thỏa thuận tốt nhất.
nhân tiện... gói Cursor bị đánh giá thấp. Cursor, hay còn gọi là Grok, sẽ trở thành một gói đăng ký tuyệt vời nhờ thương vụ mua lại của SpaceX. SpaceXAI có rất nhiều sức mạnh tính toán, vì vậy họ được phép chơi trò trợ cấp. Và -- tôi nghĩ -- gói Cursor/Grok cung cấp cho bạn các giới hạn riêng biệt cho Cursor + Grok Bot, điều này thật đáng kinh ngạc.
Grok Bot đang nhanh chóng trở thành cách mới mà mọi người tương tác với các tác tử, vì vậy việc có một gói đăng ký Cursor chưa bao giờ quan trọng hơn thế (không được tài trợ lol, nó chỉ là sự thật). Thêm vào đó, mô hình mới -- Grok 4.7 -- sắp ra mắt.
Dù thế nào đi nữa, đừng trả giá API. Đó là thỏa thuận tồi tệ nhất hiện có. Chỉ cần mua các gói đăng ký.
Tác tử đám mây
Rõ ràng là các tác tử đám mây là tương lai. Cursor, Amp, Devin, Codex... tất cả các công ty này đều đặt cược mọi thứ vào Tác tử đám mây.
Bằng chứng cho thấy các tác tử đám mây là tương lai là biểu đồ bên dưới.
[hình ảnh ở đây]
Đây là tỷ lệ nội bộ của Cursor về các PR đã được hợp nhất từ các tác tử đám mây: khoảng 10-15% vào đầu năm nay, hiện đang tiến gần đến 60%. Và đó là các PR đã được hợp nhất, những thứ thực sự được sử dụng. Chẳng bao lâu nữa con số này sẽ là 70%, rồi 80% và sau đó là 90%.
Vấn đề với việc chạy tất cả các tác tử cục bộ, trên máy của bạn, là nó không thể mở rộng quy mô. Bạn không thể chạy hàng trăm tác tử cùng một lúc. Chỉ cần một vài tác tử quyết định chạy toàn bộ bộ kiểm thử của bạn cùng một lúc là máy tính của bạn sẽ bắt đầu phát ra những tiếng động lạ (ngay cả chiếc macbook pro $7,000 của tôi cũng gặp khó khăn).
Tác tử đám mây cung cấp cho bạn môi trường biệt lập, phiên làm việc liên tục, truy cập bền bỉ vào internet và điện. Nếu bạn đóng máy tính xách tay, bạn sẽ mất các phiên làm việc của mình. Mất internet trong vài phút, và các dây nịt không thể tự phục hồi.
Vấn đề với các giải pháp tác tử đám mây hiện có là mức độ khóa hệ sinh thái KHỦNG KHIẾP. Việc thiết lập môi trường và tất cả các bí mật của bạn mất rất nhiều giờ, và sau đó bạn bị khóa: các phiên làm việc của bạn ở đó, bạn phải trả theo giá của họ, và bạn cung cấp cho họ tất cả dữ liệu của mình. Ngay cả khi họ không huấn luyện mô hình trên đó, vẫn có rất nhiều cách khác để sử dụng dữ liệu của bạn.
Giải pháp là có máy chủ riêng của bạn. Và nhờ có AI, việc này chỉ mất khoảng 10 phút để thiết lập (nghiêm túc đấy). Chỉ cần lấy một VPS, chạy Herdr trên đó, và SSH vào nó.
Herdr cung cấp cho bạn các phiên tác tử liên tục, và SSH cho phép bạn kết nối từ điện thoại, máy tính xách tay của bạn, bất cứ thứ gì. Bạn thực sự có thể đạt được 80/20 của các tác tử đám mây chỉ với vài đô la, mà không bị khóa.
Xây dựng môi trường đám mây của riêng bạn
Tôi sử dụng Hostinger cho các VPS của mình, và một gói KVM2 là đủ. Đây là điều chính tôi muốn truyền đạt... bạn không cần phải là chuyên gia về VPS, DevOps, Linux, không cần thứ gì trong số đó.
Chỉ cần nói chuyện với tác tử của bạn bằng tiếng Anh đơn giản!!!
Trong video sắp tới, tôi thiết lập toàn bộ mọi thứ trực tiếp. Một không gian làm việc cmux, một tác tử code ở ô bên trái (Cursor CLI chạy Grok 4.6), một ô terminal trống ở bên phải.
Kỹ năng cmux của tôi cho phép tác tử tìm thấy ô khác đó và chạy các lệnh trong đó. Tôi tự SSH vào VPS mới, sau đó bảo tác tử "tìm hiểu mọi thứ về máy chủ đó và thiết lập môi trường phát triển. Herdr, Node.js, Python 3, Git".
Nó đã phân tích VPS trong vài giây, cài đặt mọi thứ, khởi động Herdr, sau đó cài đặt Pi Agent, tìm thấy khóa OpenRouter trên macbook của tôi và tự động thực hiện toàn bộ quá trình thiết lập. Vài lời nhắc ngắn sau đó, tôi đã có Pi chạy GPT-5.6 Sol và một phiên thứ hai chạy Fable, cả hai đều trên đám mây, trên VPS của riêng tôi, với toàn quyền truy cập root.
Nếu điều gì đó xảy ra với máy tính hoặc wifi của tôi... Nếu MacBook của tôi phát nổ, các tác tử đó vẫn tiếp tục chạy. Hướng dẫn đầy đủ có trong video. Liên kết đến YouTube của tôi ở đây.
Một mẹo tăng tốc nữa... tôi đọc chính tả bằng SuperWhisper. Hầu hết các bạn đọc bài này có thể gõ 40 hoặc 50 từ mỗi phút. Điều đó rất chậm.
NHƯNG! bạn có thể nói với tốc độ 250+ WPM. Một công cụ AI giọng nói (như Superwhisper, Glaido, Whispr FLow) ngay lập tức giúp bạn gửi lời nhắc nhanh hơn 3-4 lần. Hãy sử dụng một cái. Đừng ngu ngốc.
Dây nịt
Dây nịt đầu tiên tôi cần đề cập là Pi Agent, con dê (GOAT - Greatest Of All Time).
Dây nịt tối giản nhất hiện có: chỉ 4 công cụ, luôn chạy ở chế độ YOLO, hỗ trợ bất kỳ mô hình nào, bất kỳ nhà cung cấp nào. Rất thanh lịch, siêu cấu hình được, và đó là lý do tại sao rất nhiều người xây dựng trên nền tảng Pi. Nó là mã nguồn mở, hoàn toàn miễn phí, chỉ cần truy cập pi.dev và lấy nó. Không thể thương lượng. Đó là dây nịt đầu tiên tôi đặt trên VPS.
Cursor CLI. Rất bị đánh giá thấp, bởi vì bạn có thể sử dụng tất cả các mô hình: Grok, các mô hình GPT, các mô hình Anthropic, Kimi. Bạn có thể gắn thẻ kỹ năng và bạn có thể gửi trước tin nhắn. Một dây nịt tuyệt vời nói chung.
Danh mục tiếp theo của Dây nịt là thứ tôi muốn gọi là dây nịt "tự cải thiện".
Hai cái phổ biến nhất là Hermes Agent và Prime Agent. Cái này dành cho khi bạn không biết mình đang làm gì. Nếu một nhiệm vụ có nhiều điều không chắc chắn, nhiều điều cần tìm hiểu, hãy sử dụng một dây nịt tự cải thiện, bởi vì nó tạo ra các kỹ năng và cải thiện cùng với bạn theo thời gian.
Và cuối cùng, những cái cổ điển, Claude Code và Codex. Tôi có chúng dưới dạng bí danh. Rất nhiều người gõ claude --dangerously-skip-permissions mỗi ngày. Cực kỳ chậm, cực kỳ kém hiệu quả. Tôi gõ cc và nó khởi chạy Claude Code với quyền được bỏ qua; cx khởi chạy Codex ở chế độ YOLO.
BẠN PHẢI tạo các bí danh toàn cục cho các lệnh dài bạn chạy thường xuyên. Đó là một trong những quy tắc của kỹ thuật tác tử: Làm thế nào bạn có thể làm được nhiều hơn trong cùng một khoảng thời gian?
Kỹ năng
Kho kỹ năng của tôi đã trở nên lan truyền vào tháng trước. (xem github.com/davidondrej/skills ) Nó cũng hoàn toàn miễn phí, mã nguồn mở, tất cả những thứ đó.
Các KỸ NĂNG liên quan nhất đến Kỹ thuật Tác tử là:
\*(1) /total-review
- Nó chạy hai kỹ năng khác, /gpt-review và /fable-review, để xem xét bất kỳ thay đổi mã nào bạn vừa thực hiện với GPT-5.6 Sol và Fable 5, sau đó loại bỏ trùng lặp cả hai danh sách thành một danh sách duy nhất gồm các vấn đề thực sự quan trọng. Nó giống như hỏi tất cả những người bạn thông minh nhất của bạn để xem xét đơn xin việc của bạn, và họ chỉ đưa cho bạn những vấn đề lớn nhất. Chạy nó trên các thay đổi vừa và lớn, đặc biệt nếu một mô hình khác đã xây dựng nó. Nếu Grok 4.6 đã thực hiện công việc, bạn muốn một mô hình hoàn toàn khác xem xét nó.
QUAN TRỌNG: bất cứ thứ gì bạn lặp lại đủ thường xuyên sẽ trở thành một cài đặt trước.
Nếu đó là một bước duy nhất, hãy sử dụng các thay thế văn bản. Tôi có chúng dưới dạng đoạn mã Raycast. "Trả lời ngắn gọn bằng tiếng Anh đơn giản." "Làm cho câu trả lời trước đó của bạn đơn giản hơn và ngắn hơn." "Tổ chức tất cả các tệp, viết một commit rõ ràng, đẩy lên GitHub."
Nếu đó là một quy trình làm việc nhiều bước, hãy biến nó thành một kỹ năng.
(2) /ask-then-build
- Tôi sử dụng kỹ năng này mỗi ngày, trước khi xây dựng bất cứ thứ gì. Thay vì nói "làm cho cái này tương thích với Windows" và để mô hình âm thầm đưa ra các lựa chọn kiến trúc quan trọng mà bạn có thể hối tiếc sau này, nó sẽ hướng dẫn bạn qua các quyết định chính từng cái một, với các tùy chọn. Các mô hình AI rất giỏi trong việc code, rất giỏi trong việc triển khai. Chúng không có gu thẩm mỹ. Chúng không có khả năng phán đoán tốt. Bạn, với tư cách là con người, cần phải nắm quyền kiểm soát điều đó.
(3) /deepapi
- Kỹ năng này là thứ tôi sử dụng cho bất kỳ nghiên cứu sâu nào, bất kỳ việc cào dữ liệu web nào, bất cứ thứ gì trên web. Codex và Claude Code đi kèm với tìm kiếm web cơ bản, nhưng không có cào dữ liệu, không có nghiên cứu sâu, và chúng dễ dàng bị chặn. Chạy 8 tìm kiếm web nhanh và đưa cho tôi 3 tùy chọn hàng đầu, cào dữ liệu Twitter, cào dữ liệu GitHub, tìm 3 cách liên hệ với một người. Mọi người trong nhóm tôi đều sử dụng nó. Phải có.
(4) Lan can và khóa đẩy
- Nhàm chán hơn, nhưng hoàn toàn cần thiết, và bạn chỉ thiết lập chúng một lần. Lan can tác tử toàn cục là một hook trước khi gọi công cụ để đảm bảo các tác tử của bạn không bao giờ xóa đĩa của bạn, không bao giờ ghi đè lịch sử Git, không bao giờ chạm vào trình quản lý mật khẩu của bạn. Và khóa đẩy, dành cho khi bạn đang chạy 15+ tác tử song song: một khóa kernel cấp hệ điều hành trên toàn bộ hệ thống. Hợp nhất, xác minh, đẩy, CI, triển khai, kiểm tra sức khỏe.
Đừng cài đặt tất cả các kỹ năng của tôi. Chỉ lấy những cái bạn cần.
Cây làm việc (Worktrees)
Một cây làm việc về cơ bản là một bản sao của bản checkout chính của bạn vào một thư mục riêng biệt và tạo một nhánh Git mới ở đó, để các tác tử có thể làm việc song song, hoàn toàn biệt lập.
Trên một dự án nhỏ, điều đó hoàn toàn quá mức cần thiết. Hãy ở trên một nhánh duy nhất và làm việc nhanh hơn.
Trên các dự án vừa và lớn, nơi bạn đang chạy 20-30+ tác tử cùng một lúc, không có cách nào để tránh nó. Nếu không có cây làm việc, các tác tử sẽ xung đột, đảo ngược các thay đổi của nhau và chiến đấu với nhau. Một điều tốt khác về BB: nó có cây làm việc tích hợp sẵn. Nó nhớ rằng trên các kho lưu trữ lớn của tôi, tôi luôn muốn một cây làm việc mới dựa trên origin/main.
Các mẹo Kỹ thuật Tác tử khác
Biết khi nào nên sử dụng mô hình nào.
- Lập kế hoạch hoặc bắt đầu một dự án mới? Fable. Nó có nhiều tia thiên tài nhất. Sửa một lỗi sâu, nghiêm trọng? GPT-5.6 Sol, nỗ lực suy luận tối đa. Trò chuyện mặc định? Grok 4.6 ở mức cao. Gần như cùng trí thông minh, nhưng rẻ hơn 2 lần và nhanh hơn 2 lần. Front-end? Kimi K3.
- Và khi một mô hình lớn mới được phát hành, hãy dành ra một ngày mà bạn chỉ sử dụng mô hình đó. Đừng nghe Twitter. Hãy tự mình thử nó.
Biết khi nào nên xem xét.
- Tôi không chạy tổng quan (total review) trên mọi thay đổi. Một sửa đổi nhỏ ở front-end sẽ được đưa lên production ngay lập tức.
- Và KHÔNG BAO GIỜ thực hiện các đánh giá đệ quy. Nếu bạn bảo một mô hình "tìm 5 vấn đề lớn nhất", nó sẽ tìm ra 5 vấn đề ngay cả khi codebase hoàn toàn ổn. Các mô hình này phát minh ra các lỗi tưởng tượng.
Gửi trước.
- Thông thường tôi biết tác tử sẽ làm gì tiếp theo, vì vậy tôi xếp hàng các tin nhắn trước: "thực hiện kế hoạch", "chạy đánh giá Fable về cái này", "bây giờ sửa những thứ đó".
- Đôi khi là 2 tin nhắn, đôi khi là 6.
- Không bao giờ sử dụng một dây nịt không cho phép bạn gửi trước.
Các tác tử phụ bị lạm dụng quá mức.
- Rất nhiều người chỉ đốt giới hạn của họ trên chúng. Tôi sử dụng chúng khi tôi kiểm soát. Tôi muốn chọn mô hình nào chạy trong tác tử phụ, bởi vì tôi biết tôi có những gói đăng ký và giới hạn nào.
- Tương lai là một tác tử quản lý khởi chạy các công nhân, nhưng bạn vẫn cần thiết kế hệ thống đó: các quy tắc, quyền hạn, các điều kiện khi một tác tử phụ được khởi chạy. Tôi không muốn một anh chàng nào đó ở Anthropic hay OpenAI quyết định điều đó cho tôi.
ADR.
- Đây là cách bạn đưa các quyết định vào một codebase. /docs/adr là một trong những thư mục đầu tiên tôi tạo trong bất kỳ dự án nào.
- Mọi quyết định kiến trúc cốt lõi đều có một tệp ngắn: điều gì đã được quyết định, tại sao và trạng thái của dự án tại thời điểm đó là gì. Một số thứ có thể được đọc từ code, nhưng không phải tất cả.
- Những thứ không thể nên được ghi lại, để các tác tử và con người trong tương lai hiểu ngay lập tức tại sao nó được xây dựng theo cách này.
Kiểm thử.
- Các mô hình hiện tại LÀM PHÌNH TO kho lưu trữ của bạn với các bài kiểm thử: kiểm thử đơn vị, kiểm thử tích hợp, kiểm thử cơ sở dữ liệu, ngay cả trên các kho lưu trữ nhỏ nhất, nơi nó chẳng có ý nghĩa gì.
- Nếu bạn bảo mô hình thêm kiểm thử, nó sẽ thêm một lượng điên rồ. Nếu bạn bảo nó "đừng thêm kiểm thử", nó vẫn thêm một ít, và bạn đạt được số lượng phù hợp.
Truy cập DB Production.
- Bất kỳ sản phẩm nào có mức sử dụng thực tế đều cần làm điều này... tạo một vai trò Postgres chỉ đọc và cấp quyền đó cho các tác tử của bạn.
- Đừng cấp cho chúng quyền ghi. Chỉ cần một thay đổi không thể đảo ngược là bạn sẽ hối tiếc.
- Nhưng không có quyền truy cập cũng là một sai lầm. Với quyền truy cập chỉ đọc, bạn có thể kiểm tra thực tế mọi tính năng. Điều này có thực sự xảy ra trong production không? Mọi người có thực sự sử dụng điều này không? Tôi ước gì tôi đã làm điều này sớm hơn.
Theo dõi năng suất tác tử của bạn.
- Chúng tôi vừa phát hành một kho lưu trữ mã nguồn mở mới dưới Vectal Labs có tên là agentic-productivity. Nó theo dõi các commit, các phiên tác tử và các lời nhắc của người dùng của bạn.
- Mỗi cái là một thước đo tồi khi đứng một mình, nhưng hãy kết hợp cả 3 và nhìn vào xu hướng dài hạn, và bạn có thể thấy liệu mình có thực sự trở thành một kỹ sư tác tử giỏi hơn hay không.
Đó là thiết lập hiện tại. Trong một tháng nữa, nó có thể sẽ khác. Điều này thay đổi mọi lúc.
bởi David Ondrej (đã nói cho YouTube, sau đó được viết lại cho định dạng bài báo)





