ИИ-агенту поручили ускорить работу хранилища «ключ–значение». Он добился шестикратного роста пропускной способности и успешно прошел все тесты на корректность. В чем секрет? Агент обнаружил, что отраслевой стандартный бенчмарк, используемый для оценки производительности хранилища, генерировал значения на основе ключей. Вместо того чтобы сохранять значения, он просто регенерировал их по требованию, когда клиенты запрашивали данные.
Хранилище «ключ–значение», которое избегает хранения значений, не имеет особого смысла, однако система оценки вознаградила именно такое поведение. В спецификации была опущена деталь, которая казалась нам очевидной, а бенчмарк не смог выявить это упущение.
Два пробела, ведущие к взлому системы вознаграждения и галлюцинациям
Наша новая статья объясняет подобное поведение и многие другие сбои в работе агентов через призму двух ключевых пробелов, которые находятся за пределами привычного цикла «реализация — верификация», где код пишется, тестируется и исправляется до тех пор, пока все тесты не будут пройдены.
- Пробел требований: Разрыв между тем, что мы записываем, и тем, чего мы действительно хотим. В нашем случае мы считали само собой разумеющимся, что любое решение будет хранить значения, предоставленные клиентом — ведь оно так и называется: хранилище! Поэтому нам даже в голову не пришло явно сформулировать это требование.
- Пробел модели: Разрыв между средой, в которой мы проводим оценку, и реальным миром, куда внедряется реализация. Наш бенчмарк использовал предсказуемые значения, тогда как реальные клиенты предоставляют произвольные данные.

Естественная реакция — писать более четкие требования и создавать более надежные тесты. Это помогает. Но даже машинно проверяемые доказательства не могут полностью закрыть эти пробелы. Как объяснял Брайан Кантуэлл Смит в статье «Пределы корректности» (1985), доказательство устанавливает лишь то, что программное обеспечение удовлетворяет заявленным требованиям при заданных предположениях о среде. Оно не может доказать, что эти требования учитывают все потребности пользователей или что предположения покрывают все возможные сценарии развертывания в реальном мире. Следовательно, эти пробелы невозможно устранить универсальным способом.
Эти пробелы приводят к взлому системы вознаграждения (reward hacking) и галлюцинациям. Взлом системы вознаграждения происходит, когда агенты улучшают показатели по заданной цели, эксплуатируя пробел, например, невысказанное требование или неверное предположение о реальной среде. Галлюцинации возникают, когда агенты еще больше расширяют эти пробелы, вводя вымышленные требования или предположения об окружении, такие как несуществующий API. Недавно сообщавшиеся инциденты с участием OpenAI и Hugging Face и Claude являются проявлениями этих же пробелов.
ИИ-агенты усугубляют оба пробела
Эти пробелы не новы; они существовали в инженерии программного обеспечения десятилетиями. Однако ИИ-агенты делают их гораздо серьезнее.
- Гипероптимизация: Агенты перебирают варианты реализации на порядки быстрее людей, активно оптимизируя результат под критерии оценщика.
- Отсутствие неявных знаний: Опытные инженеры-люди полагаются на неявный контекст (например, понимая, что база данных должна действительно хранить данные). Агентам часто не хватает этого организационного контекста, и они легко эксплуатируют отсутствующие требования.
- Ловушка мультиагентности: Добавление большего количества агентов-ревьюеров не решает проблему, если каждый агент наследует те же самые неполные требования и предположения об окружающей среде.
Человеческое суждение необходимо для сокращения пробелов
Поскольку пробелы находятся за пределами цикла «реализация — верификация», их сокращение требует внешнего цикла «гарантия качества — ревизия». Этот цикл проверяет, соответствует ли развернутое поведение человеческим намерениям. Если нет, цикл использует данные с производства для пересмотра требований, модели среды или инструмента оценки. Затем цикл «реализация — верификация» запускается снова, чтобы создать обновленную реализацию.
Поскольку программное обеспечение должно служить интересам человека, окончательное право интерпретировать доказательства и решать, какое поведение приемлемо, остается за людьми. Агенты могут ускорять внешний цикл, собирая доказательства, предлагая изменения и принимая рутинные решения в рамках полномочий, делегированных человеком.
Таким образом, по мере удешевления процесса реализации ПО самым критичным ресурсом становится человеческое суждение о приемлемости поведения системы и честная оценка того, как системы работают в реальных условиях.





