Đừng tin tưởng vào kết quả từ một lần tạo duy nhất; chỉ đưa ra kết luận sau khi để nhiều mô hình đối đầu với nhau. Giải thích thiết kế của kỹ năng Claude Code, kỹ năng chuyển cấu trúc đối kháng của GAN vào giai đoạn suy luận.
- Tác giả: Ryousuke Wayama (@wayama_ryousuke
- Ngày: 2026-07-09
- Bối cảnh: Ý tưởng lấy cảm hứng từ GAN (tweet dự đoán năm 2023) / Thiết kế được động não với Claude Fable 5
- Kho lưu trữ: https://github.com/makinux/adversarial-panel
Bối Cảnh: Tại Sao Câu Trả Lời Từ Một Lần Tạo Là Chưa Đủ
Câu trả lời của LLM nguy hiểm nhất không phải khi chúng sai, mà là khi chúng sai nhưng lại tự tin. Một lần chạy đơn lẻ của một mô hình đơn lẻ về mặt cấu trúc thiếu cơ chế để phát hiện điều này. Ngay cả với khả năng tự phê bình, các điểm mù trong quá trình tạo và phê bình vẫn có tương quan vì chúng xuất phát từ cùng một bộ trọng số; hơn nữa, đã được chứng minh rằng các mô hình có thiên vị tự ưu tiên, đánh giá cao đầu ra của chính mình. Nói ngắn gọn, "viết và tự đánh giá" là một xung đột lợi ích ngay từ đầu đối với bất kỳ cuộc kiểm toán nào.
Nguồn cảm hứng của kỹ năng này đến từ GAN. Bản chất của GAN không chỉ là cấu trúc cạnh tranh giữa bộ sinh và bộ phân biệt, mà là nguyên lý cơ bản: sự bất đối xứng nơi mà phát hiện dễ hơn tạo ra. Thay vì bộ sinh tự đảm bảo tính đúng đắn của chính nó, chất lượng đảm bảo cao hơn sẽ đạt được với cùng một chi phí tính toán bằng cách để các đối thủ độc lập tấn công và chỉ thông qua những gì còn sống sót. Trong khi GAN thực hiện vòng lặp này thông qua gradient, adversarial-panel thực hiện nó thông qua phê bình bằng ngôn ngữ tự nhiên. Chỉ phương tiện truyền tín hiệu thay đổi; cấu trúc trò chơi vẫn giữ nguyên.
Tuy nhiên, chỉ đơn thuần xếp hàng nhiều mô hình lại với nhau thì không có giá trị. Có hiệu quả là hai đặc điểm thiết kế sau đây, mà kỹ năng này được cố ý tạo ra để có được:
- Giải Tương Quan Lỗi — Người đánh giá chỉ có thể bắt được sơ suất của người tạo nếu phương thức thất bại của họ khác nhau. Vì các hội đồng của cùng một mô hình có chung điểm mù, nên "sự đồng thuận nhất trí" là bằng chứng yếu hơn vẻ ngoài của nó. Việc kết hợp các dòng họ mô hình khác nhau là cốt lõi.
- Lợi Thế Xác Minh — Bác bỏ một câu trả lời có sẵn dễ hơn là tạo ra câu trả lời đó. Do đó, các nhà phê bình được hướng dẫn nhắm vào các tuyên bố có thể kiểm chứng. Không phải "Tôi nghĩ nó đáng ngờ", mà là "Nó thất bại với đầu vào X" — bác bỏ thông qua tái tạo, không chỉ là khẳng định.
Kiến Trúc: Người Điều Phối và Các Thành Viên Hội Đồng
Chỉ có hai loại thành phần. Phiên chính (bản thân Claude Code) đóng vai trò là người điều phối, xử lý tiến trình, xác minh và tích hợp, trong khi 2 đến 4 thành viên hội đồng xử lý các phản hồi và phê bình lẫn nhau. Người điều phối không được phát biểu ý kiến riêng của mình qua miệng của hội đồng (cấm chiếm đoạt người điều phối); nếu thêm ý kiến, nó phải được gắn nhãn là "Quan điểm của Người Điều Phối."

Hình 1 — Cấu hình của adversarial-panel. Người điều phối phân phát một bản tóm tắt độc lập (đường liền nét), và các thành viên hội đồng tấn công câu trả lời của nhau (Phê bình chéo) trước khi trả lại câu trả lời và lời phê bình cho người điều phối (đường đứt nét). Vòng lặp này chạy cho mỗi lượt.
Các thành viên hội đồng được lựa chọn với ưu tiên là tối đa hóa tính không đồng nhất:
- Các Dòng Họ Mô Hình Khác Nhau — CLI bên ngoài như Codex thông qua Bash. Điều này cung cấp sự giải tương quan lỗi mạnh nhất.
- Các Mô Hình Claude Khác Nhau — Thông qua tham số mô hình của công cụ agent (Opus/Sonnet/Haiku).
- Cùng Mô Hình + Phân Nhánh Phương Pháp Luận Cưỡng Bức — Một người lập luận từ các nguyên tắc đầu tiên, một người từ tỷ lệ cơ sở (quan điểm bên ngoài), một người chỉ tìm kiếm bằng chứng chống lại, và một người thực thi lại các tuyên bố có thể kiểm chứng. Phân biệt bằng phương pháp, không chỉ bằng tính cách.
Mặc định là 2 thành viên hội đồng × 3 lượt. Vì chi phí mở rộng theo số lượng thành viên hội đồng và lượt, việc mở rộng lên 3–4 thành viên hội đồng chỉ dành cho khi người dùng yêu cầu sự kỹ lưỡng.
Giao Thức: 4 Lượt + Tổng Hợp

Hình 2 — Tiến trình Giao thức. Màu trắng đại diện cho nhiệm vụ của người điều phối, màu tím đại diện cho nhiệm vụ của các thành viên hội đồng. Một cổng xác minh được chèn vào sau Lượt 1 để kiểm tra xem "câu trả lời có nội dung hay không." Đối với các truy vấn chi phí thấp, Lượt 2 và 3 có thể được hợp nhất thành một.
Lượt 0 — Đóng Khung và Đánh Giá Sự Cần Thiết
Đầu tiên, xác định xem có nên mở một hội đồng hay không. Đối với các truy vấn ít quan trọng hoặc các trường hợp có thể tin cậy, hãy trả lời trực tiếp và chỉ trình bày hội đồng như một tùy chọn. Một hội đồng đầy đủ chỉ được kích hoạt cho các truy vấn quan trọng, gây tranh cãi hoặc có thể kiểm chứng — bởi vì đó là nơi mà việc phê bình đáng giá với chi phí bỏ ra.
Biện pháp phòng thủ chống lại "bẫy phân loại" được tích hợp sẵn ở đây. Vì mô hình phải phát hiện điểm mù là mô hình vận hành cổng này, mô hình càng tự tin thất bại một nhiệm vụ, thì cổng càng ít có khả năng mở. Do đó, nếu người dùng yêu cầu rõ ràng một hội đồng, nó sẽ thực thi bất kể mức độ tự tin, và đối với các truy vấn quan trọng, việc đánh giá dựa trên quy mô của các mối quan tâm hơn là sự tự tin.
Tiếp theo, viết một bản tóm tắt độc lập. Vì các tác nhân con hoàn toàn không thể thấy ngữ cảnh trò chuyện, bản tóm tắt phải bao gồm truy vấn, ngữ cảnh, ràng buộc và định dạng đầu ra, cùng với hướng dẫn "tách biệt sự thật khỏi suy đoán và đính kèm mức độ tự tin cũng như điều kiện làm sai lệch (những quan sát nào sẽ làm đảo lộn điều này) cho các tuyên bố chính." Các điều kiện làm sai lệch phải cụ thể và có thể kiểm tra được, như "thất bại với đầu vào X" hoặc "mâu thuẫn với nguồn Y"; các cụm từ chung chung như "nếu bằng chứng trái ngược xuất hiện" được coi là dữ liệu thiếu (trò chơi hiệu chỉnh).
Lượt 1 — Câu Trả Lời Độc Lập (Song Song/Mù)
Khởi chạy tất cả các thành viên hội đồng song song. Một yêu cầu tuyệt đối là không ai được thấy câu trả lời của người khác; một thành viên hội đồng thấy câu trả lời của người khác sẽ bị neo vào nó, phá vỡ tiền đề về tính độc lập.
Sau khi nhận được kết quả, cổng xác minh: các dòng trạng thái hoặc kết xuất lỗi không phải là câu trả lời. Việc đưa chúng vào biên bản sẽ khiến các lượt tiếp theo phê bình những bóng ma (vấn đề thành viên hội đồng ma được mô tả sau). Các thành viên hội đồng thất bại sẽ được thử lại; nếu thất bại hai lần, mức độ không đồng nhất sẽ được hạ xuống một bậc để tiếp tục, và cấu hình hội đồng thực tế sẽ được tiết lộ cho người dùng.
Lượt 2 — Phê Bình Chéo (Song Song)
Mỗi thành viên hội đồng được cung cấp câu trả lời của các thành viên hội đồng khác. Họ phải tấn công các tuyên bố cụ thể với trích dẫn — lỗi thực tế, bằng chứng yếu, bước nhảy logic, các phương án bị bỏ qua hoặc các giả định ngầm. Các tuyên bố có thể kiểm chứng được bác bỏ thông qua tái tạo (chạy mã, tính toán lại giá trị, kiểm tra nguồn). Việc thổi phồng sự đồng ý, tóm tắt hoặc khen ngợi bị cấm. Cả sự nhượng bộ và tấn công đều phải có lý do.
Lượt 3 — Quan Điểm Cuối Cùng (Song Song)
Mỗi thành viên hội đồng được cung cấp các lời phê bình nhắm vào họ. Họ phải nhượng bộ trước các cuộc tấn công hợp lệ (có lý do, không phải vì phép xã giao), bảo vệ các tuyên bố còn sống sót với lý do, và nêu rõ những điều không chắc chắn còn lại cùng với mức độ tự tin đã hiệu chỉnh và các điều kiện làm sai lệch. Việc thay đổi hoàn toàn mà không có lý do là một dấu hiệu của sự xu nịnh, vì vậy cơ sở cho sự thay đổi sẽ bị nghi vấn trước khi chấp nhận.
Tổng Hợp — Tích Hợp bởi Người Điều Phối
Đầu ra cuối cùng bao gồm ba phần: Điểm Thống Nhất / Điểm Xung Đột / Kết Luận.
- Điểm Thống Nhất — Kèm theo lập luận hỗ trợ mạnh nhất duy nhất, xác định cụ thể liệu sự hội tụ là bằng chứng mạnh (hội đồng không đồng nhất) hay bằng chứng yếu (hội đồng đồng nhất, có điểm mù chung tiềm ẩn).
- Điểm Xung Đột — Được viết dưới dạng "Ai, Cái gì, với Bằng chứng nào" + phán quyết của người điều phối, được cân nhắc theo sức mạnh của bằng chứng. Nếu một bên có bằng chứng có thể tái tạo và bên kia có trực giác, một phán quyết sẽ được đưa ra. Trình bày cả hai bên một cách bình đẳng không phải là trung lập, mà là cân bằng sai lệch.
- Kết Luận — Bao gồm mức độ tự tin, các điều kiện có thể thay đổi kết luận, các ý kiến thiểu số đáng được bảo tồn và một dấu vết kiểm toán về các lời phê bình được chấp nhận/từ chối.
Ba Bất Biến Cần Duy Trì Trong Suốt Quá Trình
Bất Biến | Nội Dung |
|---|---|
Tính Độc Lập | Câu trả lời của Lượt 1 phải được tạo một cách mù. Các thành viên hội đồng thấy câu trả lời của người khác sẽ bị neo và không còn là các mẫu độc lập nữa. |
Tính Đối Kháng | Sự đồng ý mà không có lập luận mới là một sự thất bại của lượt. Buộc phải tuân theo hướng dẫn: "Phản đối ít nhất một tuyên bố trung tâm; hãy tìm ra nó." |
Không Lấy Trung Bình | Tổng hợp không phải là lấy trung bình. Các xung đột được bảo tồn và phân xử. Ngay khi bạn cộng và chia cho hai, tín hiệu được tạo ra bởi hội đồng sẽ biến mất. |
Sự Tương Ứng với GAN
Ý định thiết kế "chuyển quá trình tạo đối kháng sang suy luận" có thể được ánh xạ như sau. Điều quan trọng là các phương thức thất bại ở phía hội đồng tương ứng gọn gàng với các phương thức thất bại đã biết của GAN.
GAN (Huấn luyện) | adversarial-panel (Suy luận) |
|---|---|
Bộ sinh | Câu trả lời độc lập của các thành viên hội đồng (Lượt 1) |
Bộ phân biệt | Phía tấn công của phê bình chéo (Lượt 2) |
Cập nhật Gradient | Phê bình ngôn ngữ tự nhiên và sự nhượng bộ/biện hộ có lý do (Lượt 3) |
Cân bằng Minimax | Sự tổng hợp của người điều phối với phân xử (Tổng hợp) |
Lợi thế của Bộ phân biệt | Sự bất đối xứng xác minh — dễ phát hiện hơn là tạo ra |
Không chia sẻ trọng số | Sự tách biệt của các dòng họ mô hình — giải tương quan lỗi |
Sụp đổ chế độ | Sự hội tụ xu nịnh (thỏa thuận lẫn nhau) |
Các Phương Thức Thất Bại và Biện Pháp Đối Phó — Tất Cả Đã Được Quan Sát Trong Môi Trường Sản Xuất
Bộ sưu tập các phản mẫu hình kỹ năng này không phải là danh sách các mối quan tâm lý thuyết, mà là một danh mục các quả mìn thực tế đã gặp phải.
- Thành Viên Hội Đồng Ma Các chuỗi trạng thái hoặc kết xuất lỗi lẫn vào biên bản như câu trả lời, khiến tất cả các lượt tiếp theo tranh luận với không khí. → Biện pháp đối phó: Cổng xác minh ngay sau Lượt 1. Buộc thực thi nền trước cho CLI bên ngoài và cấm các trình bao bọc trả về trước khi hoàn thành.
- Hội Tụ Xu Nịnh Mọi người đều đồng ý trong Lượt 2 mà không có lập luận mới. Tương đương với sự sụp đổ chế độ trong GAN. → Biện pháp đối phó: Thêm "Bạn đang phản đối ít nhất một tuyên bố trung tâm. Hãy tìm ra nó" vào lời nhắc phê bình.
- Chiếm Đoạt Người Điều Phối Người điều phối làm cho hội đồng nói lên ý kiến riêng của nó, rửa sạch chúng thông qua thẩm quyền của sự đồng thuận. → Biện pháp đối phó: Quan điểm của người điều phối phải được tách biệt bằng nhãn.
- Trò Chơi Tự Tin Sự tự tin bằng số mà không có điều kiện làm sai lệch. "Tự tin 80%" là vô nghĩa trừ khi bạn có thể nói quan sát nào sẽ khiến bạn rút lại nó. → Biện pháp đối phó: Coi sự tự tin mà không có điều kiện làm sai lệch là thiếu.
- Ảo Tưởng Đa Dạng Coi các tính cách khác nhau của cùng một mô hình như những người đánh giá độc lập. Tên vai trò "Red Team" không giải tương quan lỗi — chỉ có các mô hình khác nhau, phương pháp luận khác nhau hoặc việc tái tạo thực tế các tuyên bố mới tạo ra sự giải tương quan. → Biện pháp đối phó: Hạ cấp rõ ràng sự hội tụ trong các hội đồng đồng nhất như bằng chứng yếu.
Các Trường Hợp Sử Dụng và Cách Gọi Nó
Bản thân kỹ năng này được công bố tại makinux/adversarial-panel. Bằng cách đặt nó trong Claude Code dưới dạng ~/.claude/skills/adversarial-panel/SKILL.md, nó sẽ được kích hoạt thông qua các lệnh gọi rõ ràng hoặc ngôn ngữ tự nhiên như:
"Hãy để Opus và Codex thực hiện một đánh giá đối kháng về thiết kế này." "Thật sao? Hãy để chúng tranh luận để chắc chắn." / "red-team điều này" / "Tôi muốn một ý kiến thứ hai." Nó cũng trở thành một ứng cử viên để kích hoạt khi bạn thúc ép về sự chắc chắn vào những điểm quan trọng với "bạn có chắc không?"
Nó phù hợp với các truy vấn quan trọng mà có thể gây tranh cãi hoặc có thể kiểm chứng. Lựa chọn kiến trúc, giả thuyết nguyên nhân gốc rễ cho các thất bại, dự báo kỹ thuật hoặc xác minh kết luận nghiên cứu. Ngược lại, mở nó cho các truy vấn ít quan trọng là lãng phí chi phí, mà Lượt 0 phân loại sẽ lọc ra. Chi phí tỷ lệ thuận với số lượng thành viên hội đồng × lượt; 2×3 là tiêu chuẩn cho sử dụng hàng ngày, mở rộng lên 3–4 cho những thời điểm quan trọng.
Sự suy giảm cho môi trường nghèo nàn cũng được xác định:
- Không có cơ chế tác nhân con → Thay thế bằng các phần riêng biệt trong thực thi tuần tự (yếu, vì trọng số và ngữ cảnh được chia sẻ — được ghi chú trong tổng hợp).
- Chỉ có một dòng họ khả dụng → Giảm xuống phân nhánh phương pháp luận (tầng thứ 3) và hạ cấp sức mạnh bằng chứng của sự hội tụ.
- CLI bên ngoài thất bại hai lần → Loại bỏ thành viên hội đồng đó, tiếp tục và tiết lộ.
Báo cáo tầng nào thực sự đã chạy dựa trên phép đo, không phải ý định — đây là chìa khóa cho khả năng kiểm toán.
Kết Luận: Từ Suy Luận Đến Huấn Luyện
Khi tôi dự đoán vào năm 2023 rằng "tạo đối kháng là bước tiếp theo cho LLM," tôi đã nghĩ đến một sơ đồ huấn luyện giống GAN.
https://x.com/wayama_ryousuke/status/1658698942161510400
Kiểm tra câu trả lời ba năm sau, các cấu trúc đối kháng đã được hiện thực hóa đầu tiên trong suy luận (phê bình ngôn ngữ tự nhiên) thay vì huấn luyện (gradient). Các mô hình chuyên phê bình như CriticGPT, nghiên cứu tranh luận đa tác nhân và các hoạt động đánh giá chéo trong lập trình — ngành đang hội tụ về cùng một cấu trúc từ những lối vào khác nhau.
Giai đoạn tiếp theo có khả năng là tái tích hợp. Trong khi kết quả đánh giá trong thời gian suy luận hiện đang là dùng một lần, việc chuyển đổi các lời phê bình thành tín hiệu phần thưởng RL (đường RLAIF) cho phép kết quả đối kháng tích lũy trong các trọng số — quay trở lại những gì GAN vốn đã làm. Nếu chúng ta đạt đến điểm "huấn luyện mô hình tiếp theo với kết quả của các đánh giá đối kháng," kỹ năng này sẽ là một nguyên mẫu của một giai đoạn chuyển tiếp. Cho đến lúc đó, việc cho các mô hình đối đầu với nhau trước khi đặt cược vào một câu trả lời từ một lần tạo là rất đáng giá.
Bài viết này là giải thích thiết kế cho kỹ năng Claude Code adversarial-panel (SKILL.md). Ý tưởng: [@wayama_ryousuke](https://x.com/@wayama_ryousuke) (Lấy cảm hứng từ GAN, thiết kế được động não với Claude Fable 5). Sơ đồ tuân theo các quy ước của cấu hình tác nhân Executor/Advisor.





