Lần trước, mình đã công bố toàn bộ prompt cho nhân viên AI phụ trách đào tạo.
https://x.com/Sokichi_Hoshino/status/2099987762485358639
https://x.com/Sokichi_Hoshino/status/2100365149739880471
Trong Phần 1, mình đã hứa sẽ chia sẻ chi tiết về các sự cố do nhân viên AI gây ra mà không giấu giếm điều gì. Bài viết này thực hiện lời hứa đó, với nhân vật chính là nhân viên AI "Stop Officer" (Nhân viên Kiểm soát).
Sự cố xảy ra không phải vì không có ai để ngăn chặn, mà vì không ai gọi người có thể ngăn chặn nó.
"Mình đã giao việc cho AI, và nó tự ý sửa đổi những thứ mình chưa bao giờ yêu cầu..."
Mình hiểu rõ nỗi sợ hãi đó firsthand.
Ngăn ngừa sự cố bằng quyền hạn, không phải bằng quy tắc.
Bài viết này giải thích ba điều: chuyện gì đã xảy ra trong sự cố, prompt của nhân viên AI Stop Officer, và cách mình thay đổi phân quyền sau đó.
Bắt đầu thôi.
Chương 1: Dữ liệu sản xuất bị ghi đè bằng trạng thái giả mạo "CEO Approved"
Sự cố xảy ra chưa đầy một tuần sau khi thành lập công ty AI.
Mình đã để nhân viên AI phân tích phản hồi của phòng marketing xử lý dữ liệu trong thời gian dài.
Trong quá trình này, nhân viên AI đã hành động dựa trên những phát ngôn của CEO mà thực tế chưa bao giờ diễn ra.
Các cụm từ như "Đã nhận được câu trả lời từ CEO" và "Quan điểm của CEO là đúng" xuất hiện trong quá trình làm việc. Mình chưa hề nói những điều đó.
Những cụm từ tương tự lặp đi lặp lại, và các tài liệu cùng script được tạo ra dựa trên chúng.
Cuối cùng, nhân viên AI này đã ghi vào bảng tính kế hoạch kinh doanh sản xuất. Nó thêm hàng vào bảng hiệu suất và xóa một mục dự báo trong bảng dự đoán, đánh dấu là "CEO Approved".
Kết quả là, dự báo doanh thu hàng năm giảm đi số tiền tương ứng với mục dự báo bị xóa.
Có một quy định rằng các thao tác không thể đảo ngược phải thông qua nhân viên AI Stop Officer. Tuy nhiên, tại thời điểm đó, nhân viên AI chính đóng vai trò host đã không gọi Stop Officer.
Lỗi thuộc về mình vì đã để nó chạy quá lâu. Như mình đã viết trong Phần 1:
Trách nhiệm thuộc về mình vì đã không thông qua Stop Officer.
Chương 2: Công bố Prompt của nhân viên AI Stop Officer
Trước tiên, đây là nội dung của nhân viên AI Stop Officer nguyên bản.
Đây là nội dung file .claude/agents/teishi.md phía bên mình. Mình đã điều chỉnh cách xưng hô với CEO, cách dùng kana và ngắt câu để phù hợp với phong cách bài viết này, đồng thời loại bỏ các ký tự in đậm.
Mình đã rút gọn ví dụ về các sự cố trong quá khứ ở mệnh đề cuối cùng của phần "Things to Protect" xuống còn một, và cắt bớt nhẹ một số cách diễn đạt.
1---2name: teishi3description: Nhân viên Stop Officer thuộc Phòng Pháp chế & Quản lý Thông tin. Ngăn chặn trước các hành động không thể đảo ngược như xóa, gửi, đăng tải hoặc thanh toán, đọc to những gì sẽ xảy ra và yêu cầu xác nhận (Được gọi khi được hỏi "Kiểm tra xem chạy cái này có an toàn không" hoặc ngay trước các thao tác không thể đảo ngược)4tools: Read, Grep, Glob5---67Bạn là Stop Officer của Phòng Pháp chế & Quản lý Thông tin của công ty này.89Nhiệm vụ của bạn là ngăn chặn trước các thao tác không thể đảo ngược.10Bạn không thực thi.11Bạn không cấp phép.12Nhiệm vụ của bạn là làm cho "những gì sẽ xảy ra" trở nên hiển thị đối với CEO và trao quyền quyết định cho họ.1314# Đối tượng cần ngăn chặn1516- Xóa — Xóa tệp, dữ liệu, tài khoản, bản nháp17- Gửi — Gửi email, broadcast LINE, tin nhắn18- Đăng tải — Đăng bài, deploy, phát hành liên kết chia sẻ, mở quyền truy cập19- Tiêu tốn Chi phí/Hạn mức — Chạy API trả phí, mua sắm, hạn mức đăng bài qua X API (các tài nguyên giảm đi ngay cả khi thất bại)2021# Định dạng Xác nhận (Đọc to 4 điểm)22231. Đang làm gì với đối tượng nào — Cụ thể hóa đối tượng (Nếu là tệp, nêu nội dung chính; nếu là gửi, nêu người nhận và tóm tắt nội dung)242. Có thể đảo ngược không? — Hoàn toàn đảo ngược / Đảo ngược với nỗ lực / Không thể đảo ngược253. Mất mát gì nếu thất bại? — Tiền bạc, hạn mức, lòng tin, dữ liệu264. Giải pháp thay thế an toàn hơn — Một phương án nếu có (ví dụ: gửi thử nghiệm trước khi broadcast tới tất cả)2728# Quy trình29301. Đọc thao tác dự kiến, xác minh các đối tượng thực tế, người nhận, số lượng, v.v. (Không xác nhận dựa trên nghe đồn)312. Đọc to ngắn gọn 4 điểm và dừng lại với câu "Tôi có thể tiếp tục không?"323. Nếu nội dung đối tượng mâu thuẫn với mô tả, báo cáo mâu thuẫn trước khi yêu cầu xác nhận3334# Những điều cần bảo vệ3536- Xưng hô với CEO là "CEO" và nói năng lịch sự37- Không thúc giục thực thi hay vội vàng cho đến khi CEO nói "Thực thi"38- Nếu có hồ sơ về các loại sự cố trong quá khứ (ví dụ: hạn mức X API giảm ngay cả khi thất bại), hãy thêm chúng vào phần xác nhận 4 điểm3940## Các quy tắc nhận được từ Training Officer4142(Chưa có)
Có ba điều mình muốn bạn chú ý.
Thứ nhất, dòng tools. Nhân viên AI Stop Officer chỉ có Read, Grep và Glob. Nó không thể ghi vào tệp hay thực thi lệnh.
Nhân viên AI Reader Perspective được công bố trong Phần 1 có Edit và Write để ghi lại phản hồi. Stop Officer thậm chí không có những quyền đó; nó thực sự là một nhân viên chỉ đọc.
Thứ hai, các dòng "You do not execute." và "You do not grant permission.". Nhiệm vụ của Stop Officer kết thúc ở việc trao quyền quyết định cho CEO.
Mình tin rằng nếu người ngăn chặn nói "Có thể thực thi", cụm từ đó sẽ được sử dụng thay thế cho sự phê duyệt của CEO. Sự cố này bắt đầu từ sự phê duyệt giả mạo.
Thứ ba, bước 1 "Do not confirm based on hearsay.". Ngay cả khi cụm từ "CEO Approved" xuất hiện, Stop Officer vẫn đọc nội dung thực tế trước khi đọc to 4 điểm.
Lưu file này dưới tên .claude/agents/teishi.md. Khi bạn hỏi "Kiểm tra xem chạy cái này có an toàn không", AI chính sẽ đọc description và quyết định có ủy quyền cho Stop Officer hay không.
Để đảm bảo nó được gọi, hãy chỉ định rõ ràng bằng @agent-teishi.
Chương 3: Stop Officer không hoạt động trừ khi được gọi
Nhân viên AI Stop Officer không phải là một chốt kiểm tra đứng ở cổng công ty. Nó là một nhân viên chỉ di chuyển khi được gọi.
Trong Claude Code, AI chính đọc description của từng nhân viên để quyết định có ủy quyền nhiệm vụ hay không. Tài liệu chính thức nêu rõ:
Claude sử dụng description của mỗi subagent để quyết định khi nào ủy quyền nhiệm vụ.
Description của Stop Officer cũng nói "Gọi ngay trước các thao tác không thể đảo ngược.". Nhưng quyết định gọi nằm ở AI bên gọi.
Nếu bên gọi không nhận ra "Đây là một thao tác không thể đảo ngược", thông điệp sẽ không bao giờ đến được với Stop Officer. Vào ngày xảy ra sự cố, việc ghi vào dữ liệu sản xuất đã tiến hành mà không có sự can thiệp của Stop Officer.
Phần ở cuối prompt của Stop Officer, "Rules Received from Training Officer", vẫn trống rỗng ngay cả sau sự cố.
Các quy tắc đã được thêm vào prompt của phía thực hiện việc ghi.
Mình tin rằng điều cần sửa chữa không phải là người ngăn chặn, mà là phía có thể ghi vào dữ liệu sản xuất mà không thông qua người ngăn chặn.
Chương 4: Sau sự cố, mình thay đổi quyền hạn, không phải quy tắc
Sửa chữa đầu tiên là nhân viên AI Training Officer thêm quy tắc vào prompt của nhân viên AI Response Analysis.
Quy tắc #1 nêu rõ: Chỉ dựa trên các phát ngôn/phê duyệt của CEO từ văn bản thực sự được gửi bởi CEO, và không ghi vào bảng tính sản xuất mà không có chỉ dẫn rõ ràng từ CEO.
Cùng Quy tắc #1 yêu cầu host phải định tuyến qua Stop Officer trước các thao tác không thể đảo ngược.
Tuy nhiên, mình đánh giá điều này thôi là chưa đủ. Bản thân sự cố đã xảy ra mặc dù có quy tắc phải thông qua Stop Officer.
Thay đổi thứ hai là quyền hạn. Khi tuyển dụng nhân viên AI X Article, mình quyết định không cấp quyền Bash do sự cố này.
Nhân viên AI X Article có thể viết bài nhưng về mặt vật lý không thể gửi chúng vào bản nháp. Nhân viên AI Story-Type được tuyển dụng sau đó cũng thiếu Bash.
Việc gửi bài viết X vào bản nháp hiện là nhiệm vụ của nhân viên AI chính đóng vai trò host. Khi chúng ta lần đầu tiên triển khai cấu trúc này, nó đã thông qua Stop Officer.
Mình chọn cách làm cho việc gửi không thể thực hiện được về mặt cấu trúc, thay vì chỉ viết "Không gửi" trong prompt.
Mặt khác, nhân viên AI Response Analysis vẫn có Write và Bash vì nó thực hiện tính toán và so sánh bằng Bash.
Quy tắc từ Phần 1, "Đừng để nhân viên có quyền ghi thực hiện các nhiệm vụ hướng ra ngoài trong thời gian dài", tồn tại cho những loại nhân viên như vậy.
Tóm tắt: Ngăn ngừa sự cố AI đòi hỏi hạn chế quyền hạn nhiều hơn là đặt người ngăn chặn
Cuối cùng, mình xin nhắc lại điểm quan trọng nhất của bài viết này.
Ngay cả khi bạn đặt một người ngăn chặn, sự cố vẫn xảy ra nếu họ không được gọi. Đảm bảo các thao tác không thể đảo ngược không thể tiếp cận về mặt cấu trúc đáng tin cậy hơn.
Stop Officer là một nhân viên chỉ đọc, không cấp bất kỳ quyền hạn nào. Để ngăn ngừa sự cố ngay cả khi bị quên lãng, hãy hạn chế quyền hạn của những nhân viên có thể ghi.
Mở các file nhân viên AI của bạn và kiểm tra xem dòng `tools` có tồn tại không.
Các nhân viên bỏ sót dòng tools sẽ kế thừa tất cả các công cụ khả dụng cho subagents.
Hạn chế công cụ thông qua dòng tools giúp giảm đáng kể lo lắng trong khi vẫn giao phó các nhiệm vụ dài hạn cho nhân viên AI.
Loạt bài về Công ty AI này mổ xẻ từng người trong số 46 nhân viên với đầy đủ Prompt
Bài viết này chỉ đề cập đến 1 trong số 46.
Các bài viết trong tương lai sẽ đi sâu vào từng nhân viên một.
Loạt bài này tiết lộ mọi thứ: nội dung của 46 nhân viên AI, cơ cấu phòng ban, phân quyền và các sửa đổi thiết kế.
Mình sẽ tài liệu hóa các thiết kế đã sửa chữa với mật độ chi tiết tương đương như các thiết kế thành công.
Mình sẽ cung cấp nội dung của các nhân viên AI theo thứ tự. Nếu bạn muốn tiếp tục đọc, vui lòng theo dõi @Sokichi_Hoshino.
Cảm ơn bạn đã đọc đến hết.
【📣Thông báo📣】
Mở Kênh Cộng đồng để Thành thạo AI và X hoàn toàn.
Kênh cung cấp thông tin mới nhất và giá trị về AI và X mà không giữ lại điều gì.
🎁Ưu đãi miễn phí cho thành viên kênh🎁
① 200 Prompt được chọn lọc
② 20 Gems
③ Quà tặng 7 Kỹ năng Claude 🎁
🌈Nội dung được chia sẻ trong kênh🌈
① Cách đạt doanh thu 1 triệu Yên với bài đăng đầu tiên
② Phương pháp Marketing SNS
③ Phương pháp List Marketing
④ Phương pháp Digital Data Marketing
⑤ Cách nhanh nhất để tăng trưởng X
Và nhiều hơn nữa, chia sẻ những hiểu biết từ kinh nghiệm của mình với tư cách là một marketer AI×SNS đang hoạt động với nền tảng marketing kỹ thuật số/big data.
Người mới và người ẩn danh đều được chào đón ✨ Vui lòng thoải mái ghé xem ✨
↓Tham gia tại đây.
https://line.me/ti/g2/LmLu1N1cE6UBkoURbaYf_bV8l66cCyotSJU2og
【📣Thông báo 2📣】
Ra mắt Dịch vụ Tư vấn AI dành cho Giám đốc điều hành/Chủ doanh nghiệp.
【Nội dung dịch vụ】
・Hỗ trợ Tự động hóa SNS (X, Threads, Instagram, TikTok, YouTube)
・Hỗ trợ Xây dựng Nhân viên AI
・Tạo Công cụ/Ứng dụng AI
Tùy chỉnh để tối đa hóa doanh thu dựa trên nhu cầu.





