Vào ngày 3 tháng 9 năm 2026, OpenAI đã phát hành GPT-6 Astra.
Nhiều người chỉ đơn giản chuyển cài đặt mô hình Codex của họ sang Astra và dừng lại ở đó.
Tuy nhiên, OpenAI đã không chỉ cập nhật mô hình vào ngày hôm đó. Thông báo chính thức nêu rõ rằng họ đã cập nhật 'Harness' của Codex cùng với Astra (Nguồn: OpenAI "GPT-6 Astra: A new generation of intelligence" https://openai.com/index/gpt-6-astra/ ).
Bộ não và môi trường mà bộ não hoạt động. OpenAI đã xây dựng lại cả hai cùng một lúc.
Tuy nhiên, nếu vẫn còn những hướng dẫn không rõ ràng hoặc các quy tắc mâu thuẫn, Astra có thể dừng giữa chừng hoặc yêu cầu làm rõ liên tục.
Trong bài viết này, tôi sẽ cung cấp ba điều sau:
- Giải thích đầy đủ về 8 yếu tố cấu thành Codex Harness (kèm mức độ ưu tiên)
- 4 prompt chẩn đoán và kiểm kê mà bạn có thể sao chép và sử dụng ngay
- Một trình tự thực hiện để bắt đầu từ đâu chỉ trong 30 phút hôm nay
Không có lý do gì để giữ lại, vì vậy tôi sẽ chia sẻ prompt quan trọng nhất trước. Prompt này khiến Codex tự báo cáo trạng thái dự án hiện tại của nó.
▼ Sao chép từ đây
Bạn là một Nhà thiết kế Codex Harness.
Mục tiêu là tạo ra một trạng thái nơi GPT-6 Astra có thể "hoàn thành nhiệm vụ một cách an toàn, có thể tái tạo và đến cùng mà không cần hướng dẫn chi tiết mỗi lần" trong dự án này.
Đầu tiên, không thực hiện bất kỳ thay đổi nào. Xem xét cấu hình dự án hiện tại, các tệp cài đặt và các tính năng có sẵn, sau đó chẩn đoán những điều sau:
- AGENTS.md: Mục đích, các quy tắc cần tuân theo, những điều cấm, điều kiện hoàn thành và tài liệu tham khảo có rõ ràng không?
- docs / context: Cấu trúc có được tổ chức để bạn có thể tự tìm thông tin cần thiết không? Có mô tả cũ, dư thừa hoặc mâu thuẫn không?
- Skills: Những tác vụ lặp đi lặp lại nào nên được chuyển thành Skills? Ngược lại, Skills nào là không cần thiết?
- MCP / Plugins: Những công cụ bên ngoài hoặc kết nối dữ liệu nào đang bị thiếu?
- Environment: Bạn có thể tự tái tạo dependencies, thiết lập và thực thi kiểm tra không?
- Permissions / Sandbox: Bạn có được cấp quá nhiều quyền không? Ngược lại, có quá nhiều yêu cầu phê duyệt đang chờ xử lý làm gián đoạn công việc không?
- Hooks / Tests: Việc kiểm tra trước khi thực thi, phát hiện bí mật, kiểm thử và kiểm tra hoàn thành có thể được tự động hóa không?
- Browser / Computer Use: Có những tác vụ nào cần được xác minh bằng cách thực sự vận hành sản phẩm hoàn chỉnh không?
- Subagents: Có những tác vụ như nghiên cứu, đánh giá hoặc kiểm thử sẽ nhanh hơn nếu được song song hóa không?
- Feedback Loop: Có cơ chế nào để đưa những thất bại trong quá khứ hoặc hướng dẫn sửa lỗi trở lại AGENTS.md / docs / Skill / Hook / Test không?
Định dạng đầu ra: A. Đánh giá từng mục trên thang điểm 5 B. 5 điểm yếu nghiêm trọng nhất C. Những thứ có thể sửa trong 30 phút hôm nay D. Những thứ cần hệ thống hóa trong vòng một tuần E. Các tệp cần tạo/thay đổi và các đề xuất thay đổi cụ thể F. Rủi ro bảo mật/quyền hạn G. Ưu tiên thực hiện
Không bịa đặt cài đặt dựa trên suy đoán. Kiểm tra các tính năng và phiên bản Codex hiện có trước khi đánh giá. Nêu rõ nếu các tính năng là Experimental / Beta / Deprecated.
Không thay đổi tệp, mở rộng quyền hoặc kết nối với các dịch vụ bên ngoài cho đến khi tôi xem xét kết quả chẩn đoán này.
▲ Sao chép đến đây
Chạy cái này trước khi bạn đọc xong sẽ giúp bạn tiết kiệm thời gian sau này.
Mục tiêu và Cách sử dụng Bài viết này
Mục tiêu của bài viết này là Codex tính đến ngày 7 tháng 9 năm 2026. Codex cập nhật nhanh chóng, vì vậy hãy kiểm tra ngày tháng trước khi đọc.
Bao gồm 8 thành phần harness, 7 cấp độ trưởng thành và 4 mẫu prompt có thể sao chép và sử dụng.
Đối tượng mục tiêu là "những người sử dụng Codex nhưng dừng lại sau khi viết AGENTS.md." Tôi sẽ cung cấp chú thích cho các thuật ngữ kỹ thuật khi chúng xuất hiện lần đầu để những người không phải kỹ sư cũng có thể đọc được.
Để đảm bảo giá trị ngay cả khi bạn không đọc hết, tôi đã bao gồm "Mức độ ưu tiên" cho từng yếu tố. Nếu bạn chỉ chọn những yếu tố có mức độ ưu tiên cao, nó ít nhất sẽ hoạt động ở mức tối thiểu.
"Harness" Chính Xác Là Gì?
Harness là một hệ thống kết nối các mô hình, công cụ và con người để hoàn thành công việc.
Trong blog kỹ thuật của OpenAI "Unrolling the Codex agent loop" (Tháng 1 năm 2026, Michael Bolin), Codex harness được mô tả là "vòng lặp tác nhân cốt lõi và logic thực thi đóng vai trò là nền tảng cho tất cả trải nghiệm Codex" (https://openai.com/index/unrolling-the-codex-agent-loop/ ).
Vòng lặp tác nhân đề cập đến sự lặp lại này:
- Nhận đầu vào từ người dùng
- Truy vấn mô hình để suy nghĩ
- Thực thi công cụ được mô hình chọn
- Hiển thị kết quả và để nó suy nghĩ lại
Chính Codex, chứ không phải mô hình, là bên chạy vòng lặp này.
Để dùng một phép so sánh với công ty:
Astra = Bộ não của một nhân viên cực kỳ tài năng. Harness = Bản thân công ty nơi nhân viên đó làm việc. Các quy tắc tuyển dụng, Wiki nội bộ, quy trình vận hành, quyền truy cập vào hệ thống nội bộ, quy tắc phê duyệt, quy trình kiểm tra và đồng nghiệp.
Một sai lầm phổ biến là tóm tắt một cách lười biếng "AGENTS.md = Harness." AGENTS.md chỉ là một phần của harness. Cũng giống như một công ty không thể vận hành chỉ dựa trên một cuốn sổ tay quy tắc được phân phát.
Trên thực tế, toàn bộ nỗ lực tạo ra một "môi trường làm việc thoải mái" bằng cách kết hợp các yếu tố như AGENTS.md, Skills, MCP, Hooks, cài đặt quyền, môi trường thực thi, trình duyệt và Subagents được gọi là Harness Engineering. Bài viết này sử dụng thuật ngữ theo nghĩa đó.
Điều Gì Thực Sự Đã Thay Đổi Khi Phát Hành Astra?
Có ba điều, tất cả đều được OpenAI chính thức tuyên bố.
- OpenAI đã cải thiện bộ não và môi trường cùng một lúc
Khi Astra được công bố, OpenAI đã tuyên bố rõ ràng rằng họ đã cập nhật Codex harness, báo cáo rằng việc hoàn thành tác vụ nhanh hơn 1,9 lần so với môi trường GPT-5.6 Sol trong điểm chuẩn thao tác trình duyệt Mind2Web.
Trong OSWorld 2.0, Astra đạt 72,6% so với 65,7% của GPT-5.6 Sol. Hơn nữa, các đánh giá mô phỏng về thời gian yêu cầu báo cáo giảm từ khoảng 75 phút xuống còn khoảng 40 phút cho mỗi tác vụ.
Cần thận trọng ở đây: đây là những con số do chính OpenAI công bố và là kết quả điểm chuẩn trong các điều kiện cụ thể. Không có gì đảm bảo nó sẽ nhanh hơn 1,9 lần trong môi trường của bạn.
Tuy nhiên, thông điệp rất rõ ràng: tốc độ tăng lên đến từ sự kết hợp giữa mô hình và môi trường thực thi, chứ không chỉ riêng mô hình.
- Astra đọc "các hướng dẫn xung quanh" tốt hơn nhiều
Đây là thay đổi hiệu quả nhất cho công việc thực tế.
Hướng dẫn mô hình của OpenAI nêu rõ rằng mặc dù Astra có khả năng tuân theo hướng dẫn mạnh mẽ hơn, nhưng nó cũng có thể nhạy cảm hơn với các hướng dẫn có trong các tệp như Skills và AGENTS.md. Nó đặc biệt khuyến nghị kiểm tra các Skills và các tệp khác mà mô hình có thể truy cập (https://developers.openai.com/api/docs/guides/latest-model ).
Cùng một tài liệu chứa một cảnh báo cụ thể hơn: các hướng dẫn không rõ ràng hoặc mâu thuẫn trong một tệp skill có thể khiến mô hình dừng lại và chặn công việc ở giai đoạn đầu.
Tình hình là như thế này:
Bộ não trở nên thông minh hơn. Do đó, nó đã trở nên trung thành hơn với cả những quy tắc tốt và xấu hơn trước đây.
Giả sử một câu vô dụng vẫn còn trong một AGENTS.md mà bạn đã thêm vào từ năm ngoái. Sol có thể đã bỏ qua nó một cách thích hợp. Astra sẽ tuân theo nó một cách nghiêm ngặt.
- Những thay đổi trong cách xử lý ủy quyền và bộ nhớ
Theo thông báo chính thức, Astra hiện có thể duy trì ghi chú qua các cửa sổ ngữ cảnh trong Codex, tránh việc phải nén lại các chi tiết tích lũy thành một bản tóm tắt duy nhất mỗi lần. Điều này làm giảm mất mát thông tin trong các tác vụ dài.
Tuy nhiên, tính đến ngày 7 tháng 9 năm 2026, đây là một tính năng thử nghiệm. Nó phải được bật rõ ràng trong config.toml và bị tắt theo mặc định. OpenAI đã thông báo rằng nó sẽ trở thành một tính năng mặc định của Astra trong vài tuần tới, nhưng hiện tại, nó sẽ không hoạt động trừ khi bạn tự thêm cài đặt.
Mặt khác, hướng dẫn mô hình cũng lưu ý rằng đối với Astra, "việc ủy quyền cho Subagents có thể không thường xuyên như quy trình làm việc của bạn mong đợi." Điều này có nghĩa là nếu bạn muốn song song hóa, bạn phải chỉ định thời điểm ủy quyền ở phía harness.
Hướng dẫn cũng đề cập rằng Astra có xu hướng đưa ra các phản hồi chi tiết, có định dạng, vì vậy bạn nên chỉ rõ phong cách và cấu trúc cần thiết.
Tất cả những điều này đều chỉ ra: "Đừng chỉ để nó yên vì mô hình thông minh," mà đúng hơn là "Bởi vì nó thông minh, nó sẽ di chuyển chính xác như được chỉ định, vì vậy hãy sửa các thông số kỹ thuật của bạn."
Bản đồ 8 Yếu tố của Harness
8 yếu tố được liệt kê ở đây và 7 cấp độ trưởng thành được mô tả sau không phải là định nghĩa chính thức của OpenAI. Chúng được tổ chức một cách độc đáo cho bài viết này dựa trên thông tin chính thức đã thấy cho đến nay. Hãy sử dụng chúng như một khuôn khổ thực tế.
Đây là bản đồ với các phép so sánh công ty và mức độ ưu tiên:
- AGENTS.md | Quy tắc tuyển dụng & Chính sách cơ bản | Ưu tiên: Cao nhất
- docs / Context | Wiki nội bộ & Sổ tay hướng dẫn | Ưu tiên: Cao
- Skills | Quy trình vận hành tiêu chuẩn | Ưu tiên: Cao
- MCP / Plugins | Kết nối với Hệ thống nội bộ | Ưu tiên: Trung bình
- Environment | PC, Bàn làm việc, Môi trường làm việc | Ưu tiên: Cao
- Permissions / Sandbox | Thẩm quyền & Quy tắc phê duyệt | Ưu tiên: Cao nhất
- Hooks / Tests | Tự động kiểm tra & Thanh tra | Ưu tiên: Trung bình
- Browser / Subagents | Mắt, Tay, Cấp dưới | Ưu tiên: Trung bình
Người mới bắt đầu nên bắt đầu với 1 và 6. Lý do rất đơn giản: chỉ cần sắp xếp hai yếu tố này, bạn đã củng cố nền tảng cho các yếu tố khác. Tuy nhiên, điều này không có nghĩa là bạn không nên kiểm tra những yếu tố khác. Quyền đối với các dịch vụ bên ngoài được kết nối qua MCP, quy trình trong Skills và các tập lệnh được thực thi bởi Hooks đều là đối tượng để xác minh an toàn. Đặc biệt vì MCP là kết nối với bên ngoài, hãy kiểm tra riêng xem điểm đến có đáng tin cậy không và các quyền được cấp có ở mức tối thiểu không.
Dưới đây là giải thích cho từng yếu tố.
Lớp Hướng dẫn và Kiến thức | AGENTS.md, docs, Skills
Nó là gì: Một tệp markdown được đặt trong thư mục gốc của kho lưu trữ. Codex đọc nó trước khi bắt đầu công việc và coi nó như các quy tắc cụ thể của dự án.
Nó làm gì: Bạn có thể tránh việc phải viết các tiền đề như "Luôn chạy kiểm tra với lệnh này" hoặc "Đừng chạm vào thư mục này" trong mỗi prompt.
Thất bại mà hầu như ai cũng mắc phải ở đây là nhồi nhét quá nhiều.
Blog kỹ thuật của OpenAI "Harness engineering: leveraging Codex in an agent-first world" (Ngày 11 tháng 2 năm 2026, Ryan Lopopolo) mô tả những thất bại nội bộ. Việc thử một AGENTS.md quá lớn dẫn đến áp lực ngữ cảnh, các quy tắc cũ còn sót lại và sự nhầm lẫn về điều gì là quan trọng (https://openai.com/index/harness-engineering/ ).
Nhóm đã chuyển sang vận hành AGENTS.md như một "bản đồ" khoảng 100 dòng. Chi tiết được đặt trong docs, và AGENTS.md chỉ đơn giản trỏ đến chúng.
Thay vì bắt một nhân viên mới tài năng phải ghi nhớ một cuốn sổ tay quy tắc 1.000 trang, bạn đưa cho họ một bản đồ hướng dẫn nói rằng, "Hãy xem kệ này nếu bạn bị mắc kẹt." Đó là sự khác biệt.
Ngữ cảnh là một nguồn tài nguyên hữu hạn. Các tệp hướng dẫn khổng lồ sẽ đẩy bản thân tác vụ hoặc vị trí của mã cần đọc ra ngoài.
Một AGENTS.md kiểu bản đồ thường trông như thế này:
▼ Sao chép từ đây
AGENTS.md
Dự án này là gì?
(1-3 dòng. Bạn đang làm gì, ai sử dụng nó?)
Đọc những thứ này trước
- Chính sách Thiết kế: docs/architecture.md
- Cấu trúc Thư mục: docs/structure.md
- Bảng thuật ngữ: docs/glossary.md
- Thất bại & Sửa lỗi trong quá khứ: docs/postmortems.md
Các quy tắc cần tuân theo
- Kiểm tra: Chạy tất cả với (lệnh thực tế) và không báo cáo hoàn thành nếu vẫn còn lỗi.
- Các khu vực bị cấm: (Liệt kê đường dẫn)
- Trước khi commit: (linter / formatter commands)
Định nghĩa về Hoàn thành
Chỉ báo cáo "Hoàn thành" khi tất cả những điều sau đây được đáp ứng:
- Các bài kiểm tra đều đạt
- Có thể giải thích mục đích của thay đổi trong một đoạn văn
- Tự xác minh không có tác dụng phụ ngoài ý muốn
Khi nghi ngờ
Đừng đưa ra giả định; hãy trình bày ít nhất hai lựa chọn và hỏi tôi.
Mức độ ưu tiên của Hướng dẫn
- Hướng dẫn tức thời của tôi (người dùng)
- AGENTS.md này
- Quy trình trong Skills Bạn có thể bỏ qua các hướng dẫn cấp thấp hơn mâu thuẫn với các hướng dẫn cấp cao hơn. Nếu bạn bỏ qua một hướng dẫn, hãy báo cáo tên của nó.
▲ Sao chép đến đây
"Mức độ ưu tiên của Hướng dẫn" cuối cùng đặc biệt hiệu quả đối với Astra và các mô hình sau này. Hướng dẫn mô hình nêu rõ ràng cần làm rõ liệu hướng dẫn của người dùng hay hướng dẫn của skill có quyền ưu tiên hơn.
Nó là gì: Kho kiến thức thực tế được AGENTS.md tham chiếu. Tài liệu thiết kế, sơ đồ kiến trúc, bảng thuật ngữ, hồ sơ quyết định trong quá khứ, v.v.
Nó làm gì: Codex chỉ đọc chúng khi cần thiết, vì vậy chúng không tiêu tốn ngữ cảnh liên tục.
Điều nổi bật trong bài viết Harness Engineering là lời giải thích cho sự tiến triển chậm ban đầu. Đó không phải vì Codex thiếu khả năng, mà vì "môi trường còn thiếu các đặc tả."
Những thứ còn thiếu là các công cụ, sự trừu tượng hóa, cấu trúc nội bộ và thông tin ở dạng Codex có thể đọc được.
Vì vậy, khi một việc gì đó thất bại, phản ứng của nhóm không phải là "bắt nó cố gắng hơn nữa." Mà là suy nghĩ, "Khả năng nào đang bị thiếu, và làm thế nào chúng ta có thể làm cho nó có thể đọc được và có thể thực thi được đối với tác nhân?"
Đây là bản chất của kỹ thuật harness. Sửa môi trường, chứ không phải prompt.
Để làm rõ, đây là một nghiên cứu điển hình nội bộ của OpenAI. Một nhóm 3 người đã tạo ra khoảng 1 triệu dòng và 1.500 PR trong 5 tháng với 0 dòng mã do con người viết; điều này không có nghĩa là người dùng thông thường có thể tái tạo kết quả tương tự.
Nó là gì: Một tệp ở định dạng SKILL.md. Nó đóng gói các hướng dẫn, tài liệu tham khảo và tập lệnh nếu cần để thực thi các tác vụ cụ thể với cùng một quy trình mỗi lần.
Nó làm gì: Bạn có thể chuyển từ việc sao chép-dán các prompt tốt sang việc lưu chính công việc đó.
Ví dụ: nếu bạn tạo "Tạo bài viết" thành một Skill, nội dung sẽ bao gồm:
- Nghiên cứu
- Kiểm tra thực tế
- Đề xuất tiêu đề
- Thiết kế cấu trúc
- Viết lách
- Kiểm tra biểu thức bị cấm
- Đánh giá cuối cùng
Lời khuyên cho Astra và các phiên bản sau là không nên thêm quá nhiều. Tên và mô tả Skill được tải vào ngữ cảnh, vì vậy nếu số lượng tăng lên, mô tả sẽ bị cắt bớt, gây khó khăn cho việc đánh giá nên chọn cái nào. Nếu mô tả mâu thuẫn hoặc tất cả đều tuyên bố "Hãy sử dụng tôi," mô hình có thể tải một Skill không phù hợp với tác vụ.
Skills dành cho "các quy trình chỉ cần thiết cho các tác vụ cụ thể," chứ không phải "các hướng dẫn cần thiết mọi lúc." Nhầm lẫn điều này cũng giống như viết mọi thứ vào AGENTS.md.
Lớp Tay và Chân | MCP, Plugins, Environment
Nó là gì: MCP là một tiêu chuẩn để kết nối Codex với các công cụ và dữ liệu bên ngoài, có thể sử dụng trong cả CLI và tiện ích mở rộng IDE. Plugins là một cơ chế để phân phối Skills, Connectors và các công cụ MCP cùng nhau. Trong Codex, chúng có sẵn trong ứng dụng máy tính để bàn ChatGPT và CLI, nhưng không có trong tiện ích mở rộng IDE.
Nó làm gì: Cho phép Codex truy cập các tài liệu bên ngoài, trình duyệt, công cụ thiết kế, v.v.
Cho dù Astra có thông minh đến đâu, nó cũng vô nghĩa nếu không thể truy cập thông tin cần thiết. Nó giống như một nhân viên xuất sắc nhưng không có tài khoản hệ thống nội bộ.
Tuy nhiên, tôi đã đặt mức độ ưu tiên là Trung bình. Bạn càng thêm nhiều MCP, các lựa chọn công cụ càng tăng và ngữ cảnh càng bị tiêu tốn. Cách tiếp cận đúng đắn là chỉ thêm những thứ bạn hiện đang gặp khó khăn để tiếp cận.
Nó là gì: Giàn giáo để thực sự di chuyển bàn tay, chẳng hạn như dependencies, quy trình thiết lập, phương pháp thực thi kiểm tra và cấu trúc thư mục làm việc.
Nó làm gì: Codex có thể tự động điều khiển đến điểm "chạy và xác minh." Nếu thiếu điều này, Codex chỉ quay lại làm một người viết mã.
Một cách đơn giản để kiểm tra là yêu cầu nó từ trạng thái sạch sẽ "Thiết lập, vượt qua các bài kiểm tra và báo cáo kết quả." Bất cứ nơi nào nó dừng lại chính xác là những gì còn thiếu.
Sử dụng Git worktree để tách các thư mục cho từng tác vụ giúp giảm khả năng xung đột giữa nhiều tác vụ song song.
Lớp An toàn và Kiểm tra | Permissions, Sandbox, Hooks
Nó là gì: Hai cài đặt độc lập xác định mức độ Codex có thể thực thi tự động. Sandbox xác định phạm vi của các tệp và mạng, trong khi chính sách phê duyệt xác định nơi yêu cầu xác nhận của con người.
Theo tài liệu Codex chính thức, cài đặt ban đầu cho CLI và tiện ích mở rộng IDE bị hạn chế không có quyền truy cập mạng và chỉ ghi trong không gian làm việc đang hoạt động (https://developers.openai.com/codex/sandbox ).
Sandbox có 3 cấp độ:
- read-only: Có thể đọc nhưng không thể ghi. Dành cho tư vấn và lập kế hoạch.
- workspace-write: Có thể ghi trong thư mục làm việc và thư mục tạm thời. Đây là tiêu chuẩn.
- danger-full-access: Có thể ghi ở bất cứ đâu. Thực tế loại bỏ sandbox.
Cài đặt Auto thường được sử dụng là sự kết hợp của workspace-write và "chỉ yêu cầu phê duyệt khi cần thiết." Codex sẽ dừng và kiểm tra khi cố gắng chỉnh sửa bên ngoài không gian làm việc hoặc chạm vào mạng.
Nếu bạn muốn chuyển đổi giữa các phiên, bạn có thể sử dụng lệnh /permissions. Một thao tác thực tế là read-only cho giai đoạn lập kế hoạch và Auto cho giai đoạn thực thi.
Điều tôi muốn bạn hiểu là quyền tự chủ không đồng nghĩa với việc cho phép mọi thứ.
Chạy trốn sang danger-full-access chỉ vì các phê duyệt gây khó chịu là giải pháp kém hiệu quả nhất. Nếu nó chỉ cần ghi vào một thư mục cụ thể, chỉ cần cho phép vị trí đó.
▼ Sao chép từ đây
【Codex CLI: Ví dụ cấu hình cho Lập kế hoạch và Làm việc】
Mục tiêu là Codex CLI 0.134.0 trở lên.
Cài đặt được lưu trong ba tệp: "Chung," "Lập kế hoạch," và "Làm việc."
Không dán toàn bộ phần giải thích này vào một tệp cấu hình. Chỉ viết các cài đặt tương ứng vào mỗi đích đến.
Các đích đến dành cho cài đặt Codex tiêu chuẩn.
■ 1. Cài đặt Chung
Đường dẫn: ~/.codex/config.toml
Không xóa các cài đặt hiện có; thêm hoặc thay đổi các mục sau. Nếu [sandbox_workspace_write] đã tồn tại, hãy chỉnh sửa bên trong nó để tránh các tiêu đề trùng lặp.
[sandbox_workspace_write]
network_access = false
Chỉ chỉ định các thư mục được phép bổ sung nếu cần.
writable_roots = ["/absolute/path/to/approved-directory"]
Chỉ khi cần thêm đích ghi bổ sung, hãy xóa # ở đầu dòng writable_roots và thay thế đường dẫn ví dụ bằng đường dẫn tuyệt đối thực tế.
■ 2. Cài đặt Lập kế hoạch
Đường dẫn: ~/.codex/plan.config.toml
Lưu hai dòng này trong một tệp riêng biệt với cài đặt chung.
approval_policy = "on-request"
sandbox_mode = "read-only"
■ 3. Cài đặt Làm việc
Đường dẫn: ~/.codex/work.config.toml
Lưu hai dòng này trong một tệp riêng biệt khác.
approval_policy = "on-request"
sandbox_mode = "workspace-write"
■ Cách sử dụng
Không viết lệnh khởi động trong tệp cấu hình; hãy chạy nó từ terminal trong thư mục dự án.
Để bắt đầu cho lập kế hoạch:
codex --profile plan
Để bắt đầu cho làm việc:
codex --profile work
Các cài đặt hồ sơ đã chọn sẽ được xếp lớp trên các cài đặt chung.
Vì các hạn chế phía dự án và tổ chức cũng được áp dụng, hãy kiểm tra quyền thực tế bằng /permissions sau khi khởi động.
Lưu ý: network_access = false là cài đặt giao tiếp cho các lệnh chạy bên trong sandbox. Kiểm tra quyền cho các kết nối bên ngoài như MCP một cách riêng biệt.
▲ Sao chép đến đây
Mở rộng một ranh giới thêm một bước hoàn toàn khác với việc loại bỏ chính ranh giới đó. Điều tương tự cũng áp dụng cho quyền truy cập mạng; đó chỉ là một phán đoán hợp lệ cho các dự án thực sự cần tìm nạp các gói phụ thuộc.
Nó là gì: Một cơ chế để chèn các tập lệnh của riêng bạn hoặc các công cụ MCP vào giữa quá trình xử lý của Codex. Nó được bật theo mặc định như một tính năng Ổn định.
Nó làm gì: Ví dụ, các tự động hóa này:
- Dừng các lệnh nguy hiểm ngay trước khi thực thi một công cụ
- Kiểm tra các bí mật như khóa API
- Chạy một linter ngay sau khi chỉnh sửa tệp
- Xác minh các bài kiểm tra đạt vào cuối công việc
Đó là việc thay đổi từ "cẩn thận đừng phạm sai lầm" thành "hệ thống sẽ dừng lại nếu có sai lầm."
Tuy nhiên, chính OpenAI cũng cảnh báo nên coi Hooks như các lan can bảo vệ, chứ không phải ranh giới thực thi tuyệt đối, vì Codex có thể thực hiện công việc tương đương thông qua các đường dẫn công cụ khác nhau.
Những thứ bạn thực sự muốn dừng lại nên được dừng ở cấp độ sandbox và quyền, chứ không phải Hooks. Hooks là lưới thứ hai được đặt lên trên.
Lớp Mắt và Nhóm | Browser, Subagents
Việc để nó xây dựng một trang web và kết thúc bằng "Tôi đã viết mã, tôi xong rồi" là một sự lãng phí.
Lưu ý: Computer Use (thao tác màn hình thực tế) được mô tả ở đây hiện là một tính năng dành cho phiên bản ứng dụng máy tính để bàn của Codex. Trình duyệt tích hợp / Computer Use được xử lý trong chương này được sử dụng trong ứng dụng máy tính để bàn ChatGPT. Trình duyệt tích hợp không có sẵn trong Codex CLI hoặc tiện ích mở rộng IDE. Đối với các thao tác trình duyệt trong CLI/IDE, hãy chuẩn bị các cơ chế khác như MCP hoặc Playwright.
Bạn nên bắt nó làm điều này:
- Mở trình duyệt
- Hiển thị màn hình thực tế
- Thử vận hành nó
- Tìm các phần bị hỏng
- Sửa chúng
- Kiểm tra lại
Astra là một thế hệ đã cải thiện đáng kể trong các điểm chuẩn thao tác máy tính, vì vậy quy trình này đáng để ủy quyền. Báo cáo về thời gian giảm từ 75 xuống 40 phút trong OSWorld 2.0 chính xác là về điều này.
Trong nghiên cứu điển hình Harness Engineering, họ đã tạo ra một môi trường nơi Codex có thể xử lý Chrome DevTools Protocol, DOM, ảnh chụp màn hình, nhật ký và số liệu để xử lý mọi thứ từ tái tạo lỗi đến sửa chữa và xác minh.
Nó là gì: Một cơ chế nơi Codex phân chia công việc cho nhiều tác nhân phụ. Mỗi tác nhân có một ngữ cảnh độc lập.
Nó làm gì: Song song hóa các tác vụ đọc nặng, độc lập như nghiên cứu, kiểm thử, phân tích nhật ký và tóm tắt.
Hai lưu ý:
Một là nhiều tác nhân viết cùng một mã đồng thời sẽ xung đột. Hãy cẩn thận khi song song hóa các tác vụ ghi.
Điều còn lại đơn giản là mức tiêu thụ token tăng lên. Nó nhanh hơn, nhưng không rẻ hơn.
Và cụ thể đối với Astra, hướng dẫn mô hình nói rằng tần suất ủy quyền có thể thấp hơn dự kiến. Nếu bạn muốn song song hóa, hãy chỉ định rõ ràng trong AGENTS.md hoặc prompt: "Bạn có thể chia nhỏ các tác vụ nghiên cứu và chạy chúng song song."
Sự Đảo ngược Kỷ nguyên Astra | Kiểm kê, Không phải Bổ sung
Tôi đã liệt kê 8 yếu tố, nhưng điều quan trọng nhất tôi muốn truyền đạt lại là điều ngược lại.
Điều đầu tiên cần làm cho Astra là kiểm kê các hướng dẫn hiện có. OpenAI cũng khuyến nghị kiểm tra các hướng dẫn mà mô hình tham chiếu, chẳng hạn như Skills và AGENTS.md. Giữ lại các hướng dẫn cần thiết, lấp đầy khoảng trống và sửa chữa hoặc giảm bớt các hướng dẫn cũ/mâu thuẫn sau khi xác minh.
Động từ được sử dụng trong hướng dẫn của OpenAI là "kiểm tra" (auditing), chứ không phải "thêm vào" (adding).
Các báo cáo từ các nhóm đã xác minh trước Astra cũng chỉ theo cùng một hướng. Kilo, một nhà cung cấp công cụ viết mã AI, đã viết trong một bài đánh giá rằng Astra rõ ràng yêu cầu ít giàn giáo AGENTS.md hơn và hầu hết các "hướng dẫn để giữ cho mô hình không đi chệch hướng" được tích lũy trong năm qua giờ đây là không cần thiết. Họ thậm chí còn gợi ý rằng nếu bạn có một tệp tác nhân phình to, hãy thử xóa một nửa và thử lại (https://blog.kilo.ai/p/gpt-6-astra-what-we-learned-previewing ).
Đây là ấn tượng của một công ty, không phải quan điểm chính thức. Tuy nhiên, nó hoàn toàn phù hợp với hướng dẫn chính thức nói rằng "các hướng dẫn mâu thuẫn có thể gây ra dừng sớm."
Mô hình càng thông minh, nó càng dễ bị vấp bởi các hướng dẫn cũ. Nghịch lý, nhưng đúng.
Việc kiểm kê sẽ nhanh nhất khi được thực hiện bởi chính Codex.
▼ Sao chép từ đây
Vui lòng đọc AGENTS.md, mọi thứ trong docs và tất cả các tệp Skill đã tải trong kho lưu trữ này. Chưa thực hiện thay đổi nào.
Giả sử làm việc với GPT-6 Astra, hãy phân loại và báo cáo những điều sau:
【Giữ lại】 Các hướng dẫn vẫn còn hiệu lực và thực sự cải thiện khả năng phán đoán của bạn. Giải thích lý do trong một dòng.
【Ứng cử viên Xóa】 Các mục thuộc bất kỳ điều nào sau đây. Trích dẫn văn bản gốc và cung cấp lý do. Đây không phải là quyết định xóa, mà là danh sách để con người xem xét.
- Các hướng dẫn được viết để điều chỉnh hướng cho các mô hình thế hệ trước mà giờ đây không còn cần thiết.
- Các hướng dẫn trỏ đến các thông số kỹ thuật, đường dẫn hoặc lệnh đã thay đổi.
- Các hướng dẫn ra lệnh cho bạn làm những việc bạn tự nhiên làm mà không cần được bảo.
- Các hướng dẫn mâu thuẫn với các hướng dẫn khác.
Tuy nhiên, nếu có dù chỉ một khả năng nhỏ rằng hướng dẫn đó được thêm vào vì lý do an toàn, bảo mật, hoặc do các tai nạn/sự cố trong quá khứ, thì đừng phân loại nó là 【Ứng viên Xóa bỏ】. Thay vào đó, hãy đặt nó vào một danh mục riêng 【Yêu cầu Đánh giá của Con người】 và giải thích lý do tại sao bạn nghĩ khả năng đó tồn tại. Đừng kết luận nó là "không cần thiết" chỉ dựa trên đánh giá của riêng bạn.
【Viết lại】 Các hướng dẫn mà ý định là đúng nhưng cách diễn đạt mơ hồ, dư thừa, hoặc mức độ ưu tiên không rõ ràng. Đưa ra một đề xuất viết lại.
【Câu hỏi】 Những mô tả bạn thấy khó đánh giá ý nghĩa khi đọc.
Cuối cùng, hãy nhớ báo cáo hai điểm sau:
- Nếu có hướng dẫn nào thực sự cản trở bạn hoặc khiến bạn do dự, hãy cung cấp chính xác dòng đó và lý do tại sao bạn do dự.
- Nếu AGENTS.md được cô đọng thành một chỉ mục khoảng 100 dòng, bạn sẽ sử dụng cấu trúc nào?
▲ Sao chép đến đây
Danh sách "Ứng viên Xóa bỏ" kết quả không nên bị xóa hoàn toàn. Đầu tiên, hãy kiểm tra lý do tại sao hướng dẫn đó được thêm vào, lịch sử của nó và nó ảnh hưởng đến điều gì nếu bị xóa. Các quy trình xác minh được thêm vào sau các tai nạn trong quá khứ không nên bị loại bỏ chỉ vì Codex cho rằng chúng "không cần thiết cho trạng thái hiện tại của nó." Đặc biệt đối với các hướng dẫn về an toàn hoặc bảo mật, người biết lịch sử nên là người đưa ra quyết định cuối cùng. Chỉ tiến hành xóa đối với những mục mà lý do thêm vào đã được xác nhận và tác động được đánh giá là có giới hạn. Nếu nghi ngờ, hãy giữ lại hướng dẫn. Nếu chuyển sang docs, hãy để lại một đường dẫn rõ ràng để có thể tham chiếu đáng tin cậy từ AGENTS.md khi cần.
Mức độ Trưởng thành | Bạn đang ở đâu?
Kiểm tra giai đoạn của bạn.
Lv.0: Viết prompt mỗi lần. Giống như giải thích mọi thứ từ đầu cho một nhân viên tài năng mỗi sáng.
Lv.1: AGENTS.md và docs tồn tại. Giống như một công ty có nội quy và sổ tay hướng dẫn.
Lv.2: Skills tồn tại. Các quy trình cho công việc thường ngày đã được quyết định.
Lv.3: MCP và Plugins được kết nối. Có thể truy cập các hệ thống cần thiết một cách độc lập.
Lv.4: Permissions, Hooks và Tests đang hoạt động. Tự động thực thi và tự động kiểm tra tồn tại.
Lv.5: Sử dụng Browser và Subagents. Có thể xác minh độc lập và ủy thác công việc.
Lv.6: Vòng phản hồi tồn tại. Bản thân hệ thống được cập nhật mỗi khi xảy ra lỗi.
Nhiều người đang ở Lv.1. Và họ cố gắng tiến lên bằng cách làm cho AGENTS.md dày hơn. Đó không phải là Lv.2; nó chỉ là một Lv.1 phình to.
Lv.6 khác về bản chất. Nó không phải là thêm các tính năng mới. Nó chỉ đơn giản là có một quy tắc vận hành: "Nếu cùng một lỗi xảy ra hai lần, hãy đưa bản sửa lỗi đó trở lại AGENTS.md, Skill, Hook hoặc Test."
Đây là nơi OpenAI đã hướng tới "sửa chữa liên tục thay vì xác minh một lần" trong bài viết về Kỹ thuật Khai thác (Harness Engineering).
Trình tự Thực thi | 30 Phút, 1 Ngày, 1 Tuần
Ưu tiên. Thực hiện theo thứ tự này.
30 Phút Đầu Tiên
- Chạy prompt chẩn đoán ở đầu bài viết này.
- Kiểm tra cài đặt quyền hiện tại bằng
/permissions. Nếu bạn thường xuyên sử dụngdanger-full-access, trước tiên hãy chuyển lại vềworkspace-write. - Mở AGENTS.md và đọc qua. Kiểm tra các mô tả dư thừa, mâu thuẫn hoặc lỗi thời. 100 dòng chỉ là một ví dụ nội bộ của OpenAI, không phải là một tiêu chuẩn tuyệt đối. Hãy xem xét nội dung được tổ chức như thế nào thay vì số lượng dòng.
1 Ngày
- Chạy prompt kiểm kê. Chỉ xóa 【Ứng viên Xóa bỏ】 sau khi xác nhận lý do thêm vào và tác động. Đối với 【Yêu cầu Đánh giá của Con người】, hãy quyết định sau khi kiểm tra với người biết lịch sử.
- Di chuyển các phần có giá trị của nội dung đã xóa vào
docs. - Thêm "Mức độ Ưu tiên Hướng dẫn" vào cuối AGENTS.md.
- Yêu cầu nó từ trạng thái sạch sẽ "Thiết lập và vượt qua các bài kiểm tra," và ghi lại nơi nó dừng lại.
1 Tuần
- Chọn một nhiệm vụ bạn làm nhiều hơn hai lần một tuần và biến nó thành một Skill.
- Nếu có một nguồn dữ liệu bên ngoài mà bạn luôn phải vật lộn để truy cập, hãy kết nối nó qua MCP.
- Biến một trong hai việc kiểm tra thông tin bí mật hoặc thực thi linter sau chỉnh sửa thành một Hook.
- Quyết định một nơi để ghi lại các lỗi cho phản hồi.
Đến thời điểm này, bạn sẽ đến lối vào của Lv.4 từ Lv.1.
Chỉ mục Ngược | Theo Mục tiêu
Muốn ngừng lặp lại cùng một lời giải thích → AGENTS.md
Codex tham chiếu thông tin cũ → Kiểm kê docs / Context
Chất lượng của cùng một nhiệm vụ dao động → Skills
Không thể truy cập dữ liệu cần thiết → MCP / Plugins
Có thể viết code nhưng không thể tiến hành xác minh → Environment
Sợ nó tự động hành động, hoặc có quá nhiều phê duyệt → Permissions / Sandbox
Cùng một lỗi lặp lại → Hooks / Tests
Không nhận thấy bố cục bị hỏng → Browser / Computer Use
Nghiên cứu mất quá nhiều thời gian → Subagents
Bắt đầu dừng giữa chừng sau khi chuyển sang Astra → Đầu tiên hãy kiểm tra thông báo dừng, yêu cầu phê duyệt và lỗi. Nếu cần, hãy kiểm tra cài đặt và cách sử dụng bằng /status trong CLI. Nếu nghi ngờ có hướng dẫn mâu thuẫn, hãy kiểm kê AGENTS.md và Skills.
Cuộc Cạnh tranh Tiếp theo là Môi trường, Không phải Bộ não
Trò chơi chọn mô hình gần như đã kết thúc.
Astra đủ thông minh và di chuyển chính xác theo hướng dẫn. Đó là lý do tại sao những gì bạn để lại dưới dạng hướng dẫn sẽ quyết định kết quả.
Từ trò chơi viết prompt hay đến trò chơi thiết kế môi trường làm việc tốt. Astra là mô hình đã hoàn tất quá trình chuyển đổi đó.
Bạn chỉ cần làm một việc hôm nay. Mở AGENTS.md và đọc qua. Đó là điểm khởi đầu.
Cảm ơn bạn đã đọc đến đây.
Tôi chia sẻ các ví dụ cụ thể về tiết kiệm thời gian và công việc phụ kiếm tiền bằng AI sử dụng ChatGPT, Claude và Copilot trong một cuộc trò chuyện mở miễn phí. Nếu bạn muốn đứng về phía "có thể sử dụng AI", hãy tham gia ngay.





