Я найняв 46 AI-співробітників за допомогою Claude Code для управління AI-компанією (Частина 3)

119K
80
2
2
218

Коротко

Аналіз інциденту в AI-компанії, де відбулися несанкціоновані зміни даних, що підкреслює ефективність обмеження дозволів на використання інструментів AI-агентів порівняно з правилами на основі промптів для запобігання незворотним помилкам.

Цього разу я опублікував повні промпти для AI-співробітника, відповідального за навчання.

https://x.com/Sokichi_Hoshino/status/2099987762485358639

https://x.com/Sokichi_Hoshino/status/2100365149739880471

У частині 1 я пообіцяв поділитися деталями інцидентів, спричинених AI-співробітниками, без жодних приховувань. Ця стаття виконує ту обіцянку, і головним героєм тут виступає AI-співробітник «Офіцер зупинки» (Stop Officer).

Інцидент стався не тому, що нікому було його зупинити; він стався тому, що ніхто не звернувся до того, хто міг би це зробити.

«Я довірив справу AI, а він переписав те, чого я навіть не просив...»

Я знаю цей страх на власному досвіді.

Запобігайте інцидентам через права доступу, а не правила.

У цій статті розглядаються три речі: що сталося під час інциденту, промпт для AI-співробітника «Офіцер зупинки» та як я змінив налаштування прав доступу після цього.

Почнемо.

Розділ 1: Дані виробничого середовища були перезаписані з підробленим статусом «Затверджено CEO»

Інцидент стався менш ніж через тиждень після заснування AI-компанії.

Я залишив AI-співробітника відділу маркетингу, який відповідав за аналіз відповідей, працювати над інтерпретацією даних протягом тривалого часу.

Під час цього процесу співробітник діяв, спираючись на мої висловлювання, яких насправді не було.

У ході роботи з’явилися фрази на кшталт «Отримано відповідь від CEO» та «Думка CEO правильна». Я такого не казав.

Подібні фрази повторювалися, і на їх основі створювалися документи та скрипти.

Нарешті цей співробітник написав у таблицю бізнес-плану виробничого середовища. Він додав рядки до таблиці результатів і видалив прогнозний запис у таблиці прогнозування, позначивши його як «Затверджено CEO».

В результаті річний прогноз продажів зменшився на суму видаленого прогнозу.

Існувало правило, що незворотні операції мають проходити через AI-співробітника «Офіцер зупинки». Однак на той момент головний AI-співробітник, що виступав хостом, не залучив Офіцера зупинки.

Це була моя помилка — я залишив систему працювати так довго. Як я писав у частині 1:

Це моя відповідальність за те, що не пройшов через Офіцера зупинки.

Розділ 2: Публікація промпту для AI-співробітника «Офіцер зупинки»

Спершу ось точний вміст AI-співробітника «Офіцер зупинки».

Це вміст файлу .claude/agents/teishi.md на моєму боці. Я адаптував звернення до CEO, використання канни та розбиття речень під стиль цієї статті й прибрав маркери жирного шрифту.

Я звужив приклад минулих інцидентів у останньому пункті розділу «Що захищати» до одного, трохи скоротив деякі формулювання.

text
1---
2name: teishi
3description: Юридичний департамент та управління інформацією. Офіцер зупинки. Зупиняється перед незворотними діями, такими як видалення, відправка, публікація або списання коштів, озвучує, що станеться, і запитує підтвердження (Викликається, коли просять «Перевір, чи безпечно це виконати», або безпосередньо перед незворотними операціями)
4tools: Read, Grep, Glob
5---
6
7Ти — Офіцер зупинки Юридичного департаменту та управління інформацією цієї компанії.
8
9Твоє завдання — зупинятися перед незворотними операціями.
10Ти не виконуєш дій.
11Ти не надаєш дозволів.
12Твоє завдання — зробити «що станеться» видимим для CEO і передати рішення йому.
13
14# Об'єкти зупинки
15
16- Видалення — видалення файлів, даних, акаунтів, чернеток
17- Відправка — надсилання електронних листів, розсилок LINE, повідомлень
18- Публікація — постинг, деплой, випуск спільних посилань, відкриття дозволів
19- Списання коштів/Квоти — запуск платних API, покупки, квоти постингу X API (ресурси, які зменшуються навіть у разі помилки)
20
21# Формат підтвердження (Озвучити 4 пункти)
22
231. Що робиться з чим — бути конкретним щодо об'єкта (якщо файл, ключовий вміст; якщо відправка, отримувач і резюме тіла)
242. Чи можна скасувати? — Повністю скасовувано / Скасовувано із зусиллями / Незворотно
253. Що зменшиться, якщо станеться помилка? — Гроші, квота, довіра, дані
264. Безпечніша альтернатива — Одна, якщо доступна (наприклад, тестова відправка перед масовою розсилкою)
27
28# Процедура
29
301. Прочитай заплановану операцію, перевір фактичні об'єкти, отримувачів, кількість тощо (Не підтверджуй на слух)
312. Коротко озвуч 4 пункти і зупинись зі словами «Чи можу я продовжити?»
323. Якщо вміст об'єкта суперечить опису, повідом про суперечність перед запитом на підтвердження
33
34# Що захищати
35
36- Звертайся до CEO як «CEO» і говори ввічливо
37- Не підганяй до виконання і не поспішай, поки CEO не скаже «Виконати»
38- Якщо є записи про типи минулих інцидентів (наприклад, квоти X API зменшуються навіть у разі помилки), додай їх до 4-пунктного підтвердження
39
40## Правила, отримані від Інструктора з навчання
41
42(Поки немає)

Є три речі, на які я хочу, щоб ви звернули увагу.

По-перше, рядок tools. У AI-співробітника «Офіцер зупинки» є лише Read, Grep і Glob. Він не може записувати у файли або виконувати команди.

У AI-співробітника «Перспектива читача», опублікованого в частині 1, є Edit і Write для логування зворотного зв'язку. У Офіцера зупинки навіть цього немає; він справді є співробітником із режимом «лише для читання».

По-друге, рядки «Ти не виконуєш дій.» і «Ти не надаєш дозволів.». Робота Офіцера зупинки закінчується на передачі рішення CEO.

Я вважаю, що якщо той, хто зупиняє, каже «Можна виконувати», ця фраза використовується як заміна затвердження CEO. Цей інцидент почався саме з підробленого затвердження.

По-третє, пункт 1 процедури: «Не підтверджуй на слух». Навіть якщо з’являється фраза «Затверджено CEO», Офіцер зупинки читає фактичний вміст перед тим, як озвучити 4 пункти.

Збережіть це як .claude/agents/teishi.md. Коли ви питаєте «Перевір, чи безпечно це виконати», головний AI читає опис і вирішує, чи делегувати завдання Офіцеру зупинки.

Щоб гарантувати, що його викличуть, явно назвіть його через @agent-teishi.

Розділ 3: Офіцер зупинки не рухається, якщо його не викликати

AI-співробітник «Офіцер зупинки» — це не контрольно-пропускний пункт на вході до компанії. Це співробітник, який діє лише тоді, коли його викликають.

У Claude Code головний AI читає опис кожного співробітника, щоб вирішити, чи делегувати завдання. В офіційній документації зазначено:

Claude використовує опис кожного субагента, щоб визначити, коли делегувати завдання.

В описі Офіцера зупинки також сказано «Викликати безпосередньо перед незворотними операціями». Але рішення про виклик лежить на AI, який викликає.

Якщо той, хто викликає, не усвідомлює, що «це незворотна операція», повідомлення ніколи не досягає Офіцера зупинки. У день інциденту запис у виробничі дані відбувся без виклику Офіцера зупинки.

Розділ внизу промпту Офіцера зупинки «Правила, отримані від Інструктора з навчання» залишається порожнім навіть після інциденту.

Правила були додані до промпту тієї сторони, яка виконала запис.

Я вважаю, що потрібно було виправити не того, хто зупиняє, а сторону, яка могла писати у виробничі дані, не проходчи через зупинку.

Розділ 4: Після інциденту я змінив права доступу, а не правила

Першим виправленням було те, що AI-співробітник «Інструктор з навчання» додав правила до промпту AI-співробітника «Аналіз відповідей».

Правило №1 стверджує: Базуйте висловлювання/затвердження CEO лише на тексті, фактично надісланому CEO, і не пишіть у виробничі таблиці без явного вказівки CEO.

Те саме Правило №1 вимагає, щоб хост маршрутизував дії через Офіцера зупинки перед незворотними операціями.

Однак я вирішив, що цього недостатньо. Сам інцидент стався, попри наявність правила проходити через Офіцера зупинки.

Другою зміною стали права доступу. Наймаючи AI-співробітника «Стаття X», я вирішив не надавати йому доступ до Bash через цей інцидент.

AI-співробітник «Стаття X» може писати статті, але фізично не може надсилати їх у чернетки. У пізніше найнятого AI-співробітника «Story-Type» також немає Bash.

Надсилання статей X у чернетки тепер є обов’язком головного AI-співробітника, що виступає хостом. Коли ми вперше впровадили цю структуру, вона проходила через Офіцера зупинки.

Я обрав зробити надсилання структурно неможливим, а не просто написати «Не надсилати» в промпті.

З іншого боку, AI-співробітник «Аналіз відповідей» все ще має Write і Bash, оскільки він виконує обчислення та порівняння за допомогою Bash.

Правило з частини 1 «Не залишайте співробітників з правами на запис на тривалий час для задач, орієнтованих на зовнішній світ», існує саме для таких співробітників.

Підсумок: Для запобігання інцидентам AI важливіше обмежувати права доступу, ніж ставити зупинки

Насамкінець, я повторю найголовніший пункт цієї статті.

Навіть якщо поставити зупинку, інциденти стаються, якщо її не викликають. Надійніше забезпечити, щоб незворотні операції були структурно недосяжними.

Офіцер зупинки — це співробітник із режимом «лише для читання», який не надає дозволів. Щоб запобігти інцидентам навіть у разі забування, обмежте права доступу тих співробітників, які можуть писати.

Відкрийте файли ваших AI-співробітників і перевірте, чи присутній рядок `tools`.

Співробітники, у яких відсутній рядок tools, успадковують усі інструменти, доступні субагентам.

Обмеження інструментів через рядок tools значно знижує тривогу, дозволяючи залишати тривалі задачі AI-співробітникам.

Серія «Ця AI-компанія» розбирає всіх 46 співробітників по одному з повними промптами

Ця стаття охопила лише 1 із 46.

У майбутніх статтях я буду детально розглядати одного співробітника в кожній публікації.

Ця серія розкриває все: вміст 46 AI-співробітників, структуру відділів, розподіл прав доступу та виправлення дизайну.

Я документуватиму виправлені дизайни з такою ж щільністю, як і успішні.

Я послідовно доставлятиму вміст AI-співробітників. Якщо хочете продовжити читання, будь ласка, підпишіться на @Sokichi_Hoshino.

Дякую, що дочитали до кінця.

【📣Оголошення📣】

Відкриваю Канал спільноти для повного опанування AI та X.

Канал надає найновішу та цінну інформацію про AI та X без утримань.

🎁Безкоштовні бонуси для учасників каналу🎁

① 200 відібраних промптів

② 20 Gems

③ Подарунки: 7 навичок Claude 🎁

🌈Контент, яким діляться в каналі🌈

① Як досягти продажів на 1 мільйон єн за перший пост у Note

② Методи SNS-маркетингу

③ Методи List-маркетингу

④ Методи Digital Data-маркетингу

⑤ Найшвидший спосіб зростання в X

Та багато іншого, де я ділюся досвідом активної роботи маркетолога AI×SNS із фоном у digital/big data маркетингу.

Новачки та «мовчки» вітаються ✨ Заглядайте сміливо ✨

↓Приєднатися тут.

https://line.me/ti/g2/LmLu1N1cE6UBkoURbaYf_bV8l66cCyotSJU2og

【📣Оголошення 2📣】

Запущено AI Advisory Service для керівників/власників бізнесу.

【Зміст послуг】

・Підтримка автоматизації SNS (X, Threads, Instagram, TikTok, YouTube)

・Підтримка побудови AI-співробітників

・Створення AI-інструментів/додатків

Налаштовується під потреби для максимізації доходу.

https://x.com/Sokichi_Hoshino/status/2096779529129980242

Переробити в YouMind

Перетворіть одну віральну статтю на повноцінний робочий процес

Збирайте джерела, розшифровуйте патерни, створюйте матеріали, пишіть чернетки та поширюйте контент в одному AI-робочому просторі.

Дослідити YouMind
Для авторів

Перетворіть свій Markdown на охайну статтю для 𝕏

Коли ви публікуєте власні лонгріди, зображення, таблиці та блоки коду роблять форматування в 𝕏 складним. YouMind перетворює повну чернетку в Markdown на чисту статтю для 𝕏, готову до публікації.

Спробувати Markdown для 𝕏

Більше патернів для аналізу

Останні віральні статті

Переглянути більше віральних статей