YouMind
Đăng nhập

Một câu duy nhất để nâng tầm hiệu quả AI

@coltonconley
TIẾNG ANH23 thg 9, 2026
272K
16
0
3
61

TL;DR

Bài viết này minh họa cách thêm định nghĩa vai trò 'tốt nhất thế giới' vào lời nhắc (prompt) của AI để nâng cao rõ rệt chất lượng đầu ra. Đồng thời, bài viết hướng dẫn chi tiết cách xây dựng kỹ năng tự động hóa mang tên Prompt Lab, áp dụng logic này cho nhiều tác vụ khác nhau.

Tôi đã tìm ra một câu duy nhất giúp chất lượng đầu ra từ AI tăng vọt. Trước khi tiết lộ đó là câu gì, bạn hãy xem thử hai trang web được tạo ra từ những prompt gần như giống hệt nhau dưới đây.

Colton Conley 🛡️ on X — cover
Colton Conley 🛡️ - inline image

Tôi đoán là bạn thích thiết kế của Marginalia hơn Folio. Đây là các prompt tôi đã dùng cho từng trang:

Folio

Xây dựng một ứng dụng danh sách đọc có khả năng responsive. Người dùng có thể thêm sách, đánh dấu là đã đọc và lọc giữa sách đã đọc và chưa đọc. Lưu lại danh sách ngay cả khi tải lại trang. Đảm bảo ứng dụng hoạt động tốt trên cả máy tính và điện thoại.

Marginalia

Bạn là nhà thiết kế UX/UI giỏi nhất thế giới.

Xây dựng một ứng dụng danh sách đọc có khả năng responsive. Người dùng có thể thêm sách, đánh dấu là đã đọc và lọc giữa sách đã đọc và chưa đọc. Lưu lại danh sách ngay cả khi tải lại trang. Đảm bảo ứng dụng hoạt động tốt trên cả máy tính và điện thoại.

Chỉ cần thêm đúng một câu khẳng định mô hình là "giỏi nhất thế giới" ở một lĩnh vực nào đó đã tạo ra khác biệt rất lớn. Bạn có thể thấy sự thay đổi rõ rệt trong cách chọn font chữ, bố cục trang, cách phối màu, khoảng cách giữa các phần và hệ thống phân cấp trong UX.

Cả hai đều dùng GPT-6 Astra Ultra, chạy trong các thư mục trống, được xây dựng cùng lúc và hoàn toàn không biết đến sự tồn tại của nhau. Tôi đã kiểm tra reasoning trace để chắc chắn không có sự nhiễu chéo nào. Một vài lựa chọn thiết kế nhỏ có thay đổi qua các lần chạy lại, nhưng câu bổ sung kia luôn mang về kết quả tốt hơn.

Tôi đã áp dụng cách này cho hầu hết các prompt của mình suốt một thời gian qua. Tôi sẽ nói với Claude hoặc Chat rằng nó là nhà thiết kế giỏi nhất thế giới, một kiến trúc sư phần mềm chuyên nghiệp, cây viết nổi tiếng nhất hành tinh, nhà đầu tư thông minh nhất, v.v. Kết quả là chất lượng code cải thiện đáng kể, số lỗi bị phát hiện nhiều hơn và văn bản viết ra cũng mạch lạc hơn hẳn.

Thế là tôi quyết định tự động hóa nó

Việc phải gõ thêm câu này mỗi lần khá phiền phức, nên tôi quyết định tạo một skill để đỡ tốn công gõ phím và bớt phải canh chừng. Skill đơn giản chỉ là một tập hợp hướng dẫn mà agent của bạn có thể tái sử dụng. Bạn có thể tìm thấy nó trên GitHub, và tôi có kèm hướng dẫn cài đặt ở cuối bài. Hóa ra, việc tạo ra skill này phức tạp hơn tôi tưởng rất nhiều.

Ở lần thử đầu tiên, tôi yêu cầu Astra tạo một skill có thể liên tục tạo ra sự khác biệt mà tôi đã thấy giữa Folio và Marginalia. Tôi dặn nó hãy định vị mô hình là "giỏi nhất thế giới" trong bất kỳ lĩnh vực chuyên môn nào mà tác vụ hiện tại đòi hỏi. Tôi đưa cho nó cả hai prompt rồi để nó tự xử lý. Và nó thất bại.

Astra quyết định tạo ra một bộ hướng dẫn dài dòng phức tạp đến mức kinh khủng, khiến cái prompt tôi muốn lại bị chôn vùi trong đống hướng dẫn đó. Tôi xem lại reasoning trace và nhận ra toàn bộ hướng dẫn đã bị bỏ qua hoàn toàn vì quá rườm rà.

Nhưng tôi lại lười tự viết skill. Vậy nên tôi bảo Astra thử lại lần nữa, lần này tôi dặn nó đừng dừng việc lặp lại (iterate) cho đến khi chứng minh được skill thực sự mang lại cải thiện rõ rệt. Thú thật là tôi khá ấn tượng với vòng lặp mà nó tạo ra; có nhiều subagent đảm nhiệm việc chỉnh sửa skill, kiểm thử skill và đánh giá đầu ra của từng prompt. Nó còn tạo các container riêng biệt để chạy từng bài test. Ban đầu tôi khá nghi ngờ việc dùng thuật toán leo đồi (hill climbing) cho một tác vụ prompt đơn giản, nhưng cứ kệ nó chạy. Sau 20 phút, tôi nhận được thông báo đã chạm đỉnh đồi, và kết quả test thì hoàn hảo.

Tuy nhiên, vẫn còn một vấn đề: ẩn sâu trong skill là một prompt được viết riêng cho chính ví dụ này. Đây là những gì Chat phản hồi khi bị tôi "chất vấn": "Bạn nói đúng—tôi đã overfit một skill đa năng vào trường hợp test UI cụ thể của chúng ta." Thế là chúng tôi loại bỏ phần ngôn ngữ dành riêng cho tác vụ đó, và skill lại trở nên vô dụng.

Mô hình thực sự đang chú ý đến điều gì?

Tôi có hai giả thuyết về lý do cách định vị "giỏi nhất thế giới" lại hiệu quả:

  1. Tiêu chuẩn cao hơn buộc mô hình phải chạy nhiều vòng lặp hơn
  2. Vai trò nhà thiết kế UI/UX nhấn mạnh tầm quan trọng của việc làm đúng phần thiết kế

Tôi xem lại reasoning trace từ những lần chạy cho kết quả tốt hơn và tìm thấy bằng chứng cho cả hai giả thuyết. Có thêm một giai đoạn thiết kế mới và tổng thời gian suy luận cũng dài hơn. Skill tôi tạo ra đã chọn gọi vai trò này là "kỹ sư front end", do đó mô hình dành thêm thời gian cho độ ổn định của ứng dụng và các trường hợp biên (edge case) có thể gây lỗi. Cả hai vai trò đều quan trọng, nhưng AI lại ưu tiên tính chính xác về mặt kỹ thuật và việc đáp ứng đúng từng yêu cầu trong prompt gốc. Làm sao để đẩy nó đi xa hơn nữa?

Vậy nên tôi quyết định đặt ra hai câu hỏi:

Nếu mọi yêu cầu theo nghĩa đen đều được đáp ứng, thì kết quả vẫn có thể thất bại ở mục đích sử dụng thực tế bằng cách nào?

Điều gì sẽ khiến người dùng thích một kết quả đúng chuẩn này hơn một kết quả đúng chuẩn khác?

Điều gì đã làm nên chuyện

Kết quả là quy trình bốn bước dưới đây, nhằm xác định những vai trò cụ thể cho AI đảm nhận, sau đó thúc đẩy nó đạt tiêu chuẩn đầu ra cao hơn:

  1. Xác định điểm mạnh tạo khác biệt trước khi bắt tay vào làm. Điều gì sẽ khiến kết quả trở nên nổi bật? LLM cần một trọng tâm cụ thể để tạo ra đầu ra tốt nhất. Chỉ nói "hãy xây trang web xịn nhất" sẽ không hiệu quả bằng "hãy thiết kế UX tốt nhất cho trang web này, chú ý đến khoảng cách, font chữ và màu sắc trong UI, đồng thời kiểm thử dưới góc độ người dùng để đảm bảo trải nghiệm mượt mà nhất có thể". Việc tự tay viết ra prompt cuối cùng đó khá mất công, nhưng một prompt ép LLM tự đánh giá tổng quan (meta assessment) về các vai trò cần thiết trước khi bắt đầu dường như cũng mang lại kết quả tương tự. Một nhân viên con người cũng sẽ làm việc theo cách tương tự; việc được đào tạo về những gì cần chú ý và cách sắp xếp suy nghĩ sẽ giúp họ làm việc năng suất hơn. Chúng ta cần xác định lăng kính mà AI sẽ dùng để nhìn nhận tác vụ, nhưng để skill có thể áp dụng rộng rãi, ta cần để AI tự quyết định lăng kính đó nên là gì. Chắc chắn chúng ta sẽ hy sinh một phần hiệu năng khi giao trách nhiệm này cho AI (vốn có thể không nắm chính xác ý định của người dùng), nhưng kết quả kiểm thử skill của tôi cho đến nay cho thấy chúng ta vẫn tiến rất gần đến mục tiêu.
  2. Chuẩn hóa tiêu chuẩn bằng một mẫu tham chiếu. Hãy xem xét một mẫu tham chiếu chất lượng, phù hợp hoặc tạo ra một phương án thay thế nhỏ nhưng cụ thể. Điều này giúp khái niệm "xuất sắc" có một mốc thực tế để so sánh. Sau khi đạt kết quả test hoàn hảo, AI sẽ tìm một mẫu tham chiếu phù hợp hoặc tự tạo ra một phương án thay thế. Với một trang web, đó có thể là thử một bố cục mới. Khi đã có thứ để đối chiếu, câu lệnh "hãy làm cho nó xuất sắc" sẽ mang nhiều ý nghĩa hơn hẳn.
  3. Đánh giá độ tinh xảo tách biệt với tính chính xác. Hãy hỏi: "Chỗ nào mới chỉ ở mức tạm chấp nhận được, và tinh chỉnh cụ thể nào sẽ cải thiện trải nghiệm người dùng nhiều nhất?" Hãy đánh giá tổng thể tác phẩm và cách các thành phần phối hợp với nhau. Điều này giúp đầu ra mạch lạc hơn, dù đó là cấu trúc của một bài luận hay chủ đề tổng thể của một trang web.
  4. Tinh chỉnh và giữ lại kết quả tốt hơn. Chỉnh sửa nhiều hơn không tự động đồng nghĩa với việc tốt hơn. Skill này sẽ lưu lại phiên bản trước đó, so sánh các thay đổi thực chất và giữ lại kết quả tốt hơn. Nếu một chỉnh sửa làm mọi thứ tệ đi, nó sẽ được khôi phục (rollback). Nếu không, tất cả công sức bỏ ra thêm đó chỉ để lại một mớ hỗn độn.
Colton Conley 🛡️ - inline image

Kết quả cuối cùng sử dụng màu sắc và font chữ rất đẹp mắt với khoảng cách hài hòa. Nó đã lược bỏ bớt sự rối mắt mà tôi không thích ở Marginalia (điều mà tôi đã xác minh là một chỉnh sửa có chủ đích trong reasoning trace), đồng thời xử lý màu sắc và thiết kế phần tử ở thanh bên (sidebar) cùng các bộ chọn (selector) tốt hơn cả Folio.

Tại sao các công cụ chưa tích hợp sẵn tính năng này?

Bất kỳ harness nào như Codex hay Claude Code đều phải cân bằng giữa chất lượng, tốc độ và chi phí. Đến một lúc nào đó, agent buộc phải quyết định rằng công việc đã "đủ tốt".

Nhưng "đủ tốt" vẫn còn rất nhiều dư địa để cải thiện. Bất kể tôi dùng harness nào, chúng đều dừng lại sớm hơn tôi mong muốn. Tôi thà dùng thêm token để có được kết quả tốt hơn. Và quan trọng là, khái niệm "tốt hơn" cần có cơ sở cụ thể. Một kết quả xuất sắc trông như thế nào? Phần nào của kết quả vẫn chỉ ở mức tạm chấp nhận được? Và thay đổi mới nhất có thực sự cải thiện điều gì không?

Tự mình thử nhé

Tôi đã đóng gói toàn bộ quy trình này vào Prompt Lab.

Tải Prompt Lab trên GitHub

Để cài đặt, hãy dán đoạn này vào Codex:

text
1$skill-installer Cài đặt skill từ https://github.com/coltonconley/prompt-lab/tree/main/skills/prompt-lab

Nếu skill không xuất hiện sau khi cài đặt, hãy khởi động lại Codex. Sau đó thêm nó vào trước tác vụ thông thường của bạn:

text
1$prompt-lab
2[Tác vụ, các ràng buộc, đối tượng độc giả và kết quả mong muốn của bạn]

Bạn không cần phải tự chọn vai trò chuyên gia hay viết ra quy trình đánh giá. Cứ đưa vào bối cảnh và các ràng buộc như bạn vẫn thường làm, đặc biệt là những thông tin quan trọng về việc kết quả này dành cho ai. Rồi để nó tự xử lý.

Gợi ý của tôi: hãy thử áp dụng cho một việc bạn từng nhờ AI làm nhưng chưa ưng ý. Chạy cùng một tác vụ trong các cuộc trò chuyện mới, một lần có skill và một lần không, dùng chung một mô hình và thiết lập. Sau đó so sánh kết quả thực tế và xem liệu sự cải thiện có xứng đáng với thời gian bỏ ra thêm hay không.

Tôi đặc biệt quan tâm đến các ví dụ ngoài mảng thiết kế website. Viết lách, lập trình, phân tích, hay bất cứ việc gì bạn đang thực sự dùng AI để làm. Nếu nó hiệu quả với bạn (hoặc thậm chí nếu không), hãy phản hồi kèm theo prompt của bạn cùng kết quả trước và sau. Càng có nhiều ví dụ, skill sẽ càng hoàn thiện hơn.

Viết lại trong YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Dành cho nhà sáng tạo

Biến Markdown của bạn thành bài viết 𝕏 gọn gàng

Khi bạn đăng bài viết dài của riêng mình, việc định dạng hình ảnh, bảng và khối mã cho 𝕏 rất mệt mỏi. YouMind biến cả bản nháp Markdown thành một bài viết 𝕏 gọn gàng, sẵn sàng để đăng.

Thử Markdown sang 𝕏

Thêm pattern để giải mã

Bài viết viral gần đây

Khám phá thêm bài viết viral