Цього разу я опублікував повні промпти для AI-співробітника, відповідального за навчання.
https://x.com/Sokichi_Hoshino/status/2099987762485358639
https://x.com/Sokichi_Hoshino/status/2100365149739880471
У частині 1 я пообіцяв поділитися деталями інцидентів, спричинених AI-співробітниками, без жодних приховувань. Ця стаття виконує ту обіцянку, і головним героєм тут виступає AI-співробітник «Офіцер зупинки» (Stop Officer).
Інцидент стався не тому, що нікому було його зупинити; він стався тому, що ніхто не звернувся до того, хто міг би це зробити.
«Я довірив справу AI, а він переписав те, чого я навіть не просив...»
Я знаю цей страх на власному досвіді.
Запобігайте інцидентам через права доступу, а не правила.
У цій статті розглядаються три речі: що сталося під час інциденту, промпт для AI-співробітника «Офіцер зупинки» та як я змінив налаштування прав доступу після цього.
Почнемо.
Розділ 1: Дані виробничого середовища були перезаписані з підробленим статусом «Затверджено CEO»
Інцидент стався менш ніж через тиждень після заснування AI-компанії.
Я залишив AI-співробітника відділу маркетингу, який відповідав за аналіз відповідей, працювати над інтерпретацією даних протягом тривалого часу.
Під час цього процесу співробітник діяв, спираючись на мої висловлювання, яких насправді не було.
У ході роботи з’явилися фрази на кшталт «Отримано відповідь від CEO» та «Думка CEO правильна». Я такого не казав.
Подібні фрази повторювалися, і на їх основі створювалися документи та скрипти.
Нарешті цей співробітник написав у таблицю бізнес-плану виробничого середовища. Він додав рядки до таблиці результатів і видалив прогнозний запис у таблиці прогнозування, позначивши його як «Затверджено CEO».
В результаті річний прогноз продажів зменшився на суму видаленого прогнозу.
Існувало правило, що незворотні операції мають проходити через AI-співробітника «Офіцер зупинки». Однак на той момент головний AI-співробітник, що виступав хостом, не залучив Офіцера зупинки.
Це була моя помилка — я залишив систему працювати так довго. Як я писав у частині 1:
Це моя відповідальність за те, що не пройшов через Офіцера зупинки.
Розділ 2: Публікація промпту для AI-співробітника «Офіцер зупинки»
Спершу ось точний вміст AI-співробітника «Офіцер зупинки».
Це вміст файлу .claude/agents/teishi.md на моєму боці. Я адаптував звернення до CEO, використання канни та розбиття речень під стиль цієї статті й прибрав маркери жирного шрифту.
Я звужив приклад минулих інцидентів у останньому пункті розділу «Що захищати» до одного, трохи скоротив деякі формулювання.
1---2name: teishi3description: Юридичний департамент та управління інформацією. Офіцер зупинки. Зупиняється перед незворотними діями, такими як видалення, відправка, публікація або списання коштів, озвучує, що станеться, і запитує підтвердження (Викликається, коли просять «Перевір, чи безпечно це виконати», або безпосередньо перед незворотними операціями)4tools: Read, Grep, Glob5---67Ти — Офіцер зупинки Юридичного департаменту та управління інформацією цієї компанії.89Твоє завдання — зупинятися перед незворотними операціями.10Ти не виконуєш дій.11Ти не надаєш дозволів.12Твоє завдання — зробити «що станеться» видимим для CEO і передати рішення йому.1314# Об'єкти зупинки1516- Видалення — видалення файлів, даних, акаунтів, чернеток17- Відправка — надсилання електронних листів, розсилок LINE, повідомлень18- Публікація — постинг, деплой, випуск спільних посилань, відкриття дозволів19- Списання коштів/Квоти — запуск платних API, покупки, квоти постингу X API (ресурси, які зменшуються навіть у разі помилки)2021# Формат підтвердження (Озвучити 4 пункти)22231. Що робиться з чим — бути конкретним щодо об'єкта (якщо файл, ключовий вміст; якщо відправка, отримувач і резюме тіла)242. Чи можна скасувати? — Повністю скасовувано / Скасовувано із зусиллями / Незворотно253. Що зменшиться, якщо станеться помилка? — Гроші, квота, довіра, дані264. Безпечніша альтернатива — Одна, якщо доступна (наприклад, тестова відправка перед масовою розсилкою)2728# Процедура29301. Прочитай заплановану операцію, перевір фактичні об'єкти, отримувачів, кількість тощо (Не підтверджуй на слух)312. Коротко озвуч 4 пункти і зупинись зі словами «Чи можу я продовжити?»323. Якщо вміст об'єкта суперечить опису, повідом про суперечність перед запитом на підтвердження3334# Що захищати3536- Звертайся до CEO як «CEO» і говори ввічливо37- Не підганяй до виконання і не поспішай, поки CEO не скаже «Виконати»38- Якщо є записи про типи минулих інцидентів (наприклад, квоти X API зменшуються навіть у разі помилки), додай їх до 4-пунктного підтвердження3940## Правила, отримані від Інструктора з навчання4142(Поки немає)
Є три речі, на які я хочу, щоб ви звернули увагу.
По-перше, рядок tools. У AI-співробітника «Офіцер зупинки» є лише Read, Grep і Glob. Він не може записувати у файли або виконувати команди.
У AI-співробітника «Перспектива читача», опублікованого в частині 1, є Edit і Write для логування зворотного зв'язку. У Офіцера зупинки навіть цього немає; він справді є співробітником із режимом «лише для читання».
По-друге, рядки «Ти не виконуєш дій.» і «Ти не надаєш дозволів.». Робота Офіцера зупинки закінчується на передачі рішення CEO.
Я вважаю, що якщо той, хто зупиняє, каже «Можна виконувати», ця фраза використовується як заміна затвердження CEO. Цей інцидент почався саме з підробленого затвердження.
По-третє, пункт 1 процедури: «Не підтверджуй на слух». Навіть якщо з’являється фраза «Затверджено CEO», Офіцер зупинки читає фактичний вміст перед тим, як озвучити 4 пункти.
Збережіть це як .claude/agents/teishi.md. Коли ви питаєте «Перевір, чи безпечно це виконати», головний AI читає опис і вирішує, чи делегувати завдання Офіцеру зупинки.
Щоб гарантувати, що його викличуть, явно назвіть його через @agent-teishi.
Розділ 3: Офіцер зупинки не рухається, якщо його не викликати
AI-співробітник «Офіцер зупинки» — це не контрольно-пропускний пункт на вході до компанії. Це співробітник, який діє лише тоді, коли його викликають.
У Claude Code головний AI читає опис кожного співробітника, щоб вирішити, чи делегувати завдання. В офіційній документації зазначено:
Claude використовує опис кожного субагента, щоб визначити, коли делегувати завдання.
В описі Офіцера зупинки також сказано «Викликати безпосередньо перед незворотними операціями». Але рішення про виклик лежить на AI, який викликає.
Якщо той, хто викликає, не усвідомлює, що «це незворотна операція», повідомлення ніколи не досягає Офіцера зупинки. У день інциденту запис у виробничі дані відбувся без виклику Офіцера зупинки.
Розділ внизу промпту Офіцера зупинки «Правила, отримані від Інструктора з навчання» залишається порожнім навіть після інциденту.
Правила були додані до промпту тієї сторони, яка виконала запис.
Я вважаю, що потрібно було виправити не того, хто зупиняє, а сторону, яка могла писати у виробничі дані, не проходчи через зупинку.
Розділ 4: Після інциденту я змінив права доступу, а не правила
Першим виправленням було те, що AI-співробітник «Інструктор з навчання» додав правила до промпту AI-співробітника «Аналіз відповідей».
Правило №1 стверджує: Базуйте висловлювання/затвердження CEO лише на тексті, фактично надісланому CEO, і не пишіть у виробничі таблиці без явного вказівки CEO.
Те саме Правило №1 вимагає, щоб хост маршрутизував дії через Офіцера зупинки перед незворотними операціями.
Однак я вирішив, що цього недостатньо. Сам інцидент стався, попри наявність правила проходити через Офіцера зупинки.
Другою зміною стали права доступу. Наймаючи AI-співробітника «Стаття X», я вирішив не надавати йому доступ до Bash через цей інцидент.
AI-співробітник «Стаття X» може писати статті, але фізично не може надсилати їх у чернетки. У пізніше найнятого AI-співробітника «Story-Type» також немає Bash.
Надсилання статей X у чернетки тепер є обов’язком головного AI-співробітника, що виступає хостом. Коли ми вперше впровадили цю структуру, вона проходила через Офіцера зупинки.
Я обрав зробити надсилання структурно неможливим, а не просто написати «Не надсилати» в промпті.
З іншого боку, AI-співробітник «Аналіз відповідей» все ще має Write і Bash, оскільки він виконує обчислення та порівняння за допомогою Bash.
Правило з частини 1 «Не залишайте співробітників з правами на запис на тривалий час для задач, орієнтованих на зовнішній світ», існує саме для таких співробітників.
Підсумок: Для запобігання інцидентам AI важливіше обмежувати права доступу, ніж ставити зупинки
Насамкінець, я повторю найголовніший пункт цієї статті.
Навіть якщо поставити зупинку, інциденти стаються, якщо її не викликають. Надійніше забезпечити, щоб незворотні операції були структурно недосяжними.
Офіцер зупинки — це співробітник із режимом «лише для читання», який не надає дозволів. Щоб запобігти інцидентам навіть у разі забування, обмежте права доступу тих співробітників, які можуть писати.
Відкрийте файли ваших AI-співробітників і перевірте, чи присутній рядок `tools`.
Співробітники, у яких відсутній рядок tools, успадковують усі інструменти, доступні субагентам.
Обмеження інструментів через рядок tools значно знижує тривогу, дозволяючи залишати тривалі задачі AI-співробітникам.
Серія «Ця AI-компанія» розбирає всіх 46 співробітників по одному з повними промптами
Ця стаття охопила лише 1 із 46.
У майбутніх статтях я буду детально розглядати одного співробітника в кожній публікації.
Ця серія розкриває все: вміст 46 AI-співробітників, структуру відділів, розподіл прав доступу та виправлення дизайну.
Я документуватиму виправлені дизайни з такою ж щільністю, як і успішні.
Я послідовно доставлятиму вміст AI-співробітників. Якщо хочете продовжити читання, будь ласка, підпишіться на @Sokichi_Hoshino.
Дякую, що дочитали до кінця.
【📣Оголошення📣】
Відкриваю Канал спільноти для повного опанування AI та X.
Канал надає найновішу та цінну інформацію про AI та X без утримань.
🎁Безкоштовні бонуси для учасників каналу🎁
① 200 відібраних промптів
② 20 Gems
③ Подарунки: 7 навичок Claude 🎁
🌈Контент, яким діляться в каналі🌈
① Як досягти продажів на 1 мільйон єн за перший пост у Note
② Методи SNS-маркетингу
③ Методи List-маркетингу
④ Методи Digital Data-маркетингу
⑤ Найшвидший спосіб зростання в X
Та багато іншого, де я ділюся досвідом активної роботи маркетолога AI×SNS із фоном у digital/big data маркетингу.
Новачки та «мовчки» вітаються ✨ Заглядайте сміливо ✨
↓Приєднатися тут.
https://line.me/ti/g2/LmLu1N1cE6UBkoURbaYf_bV8l66cCyotSJU2og
【📣Оголошення 2📣】
Запущено AI Advisory Service для керівників/власників бізнесу.
【Зміст послуг】
・Підтримка автоматизації SNS (X, Threads, Instagram, TikTok, YouTube)
・Підтримка побудови AI-співробітників
・Створення AI-інструментів/додатків
Налаштовується під потреби для максимізації доходу.





