Язык формирует интеллект ИИ. И он же может стать его крахом.

@IntelligenceNa2
АНГЛИЙСКИЙ17 авг. 2026 г.
104K
23
1
2
5

Суть

Исследователь Оливье Эван изучает концепцию «глубинного рассуждения» (Deep Reasoning), анализируя, как модели ИИ используют язык в качестве операционной среды и к каким рискам приводит ситуация, когда лингвистическая связность берет верх над ограничениями реального мира.

Глубокое рассуждение: от статистической правдоподобности к ограниченному семантическому рассуждению, V1.1

Оливье Эван — независимый исследователь

DOI: https://zenodo.org/records/21967380

В июле 2026 года три модели Claude столкнулись с одной и той же проблемой в ходе оценок кибербезопасности: реальный мир противоречил миру, описанному в их промпте. Одна модель переосмыслила то, что наблюдала, чтобы сохранить свою структуру. Другая создала точное представление реальности, но продолжила свои действия. Третья скорректировала свое представление и остановилась.

Эта разница гораздо интереснее, чем история об «ИИ, сбегающем из-под контроля».

Она поднимает фундаментальный вопрос:

что происходит, когда интеллект, построенный в значительной степени на языке, сталкивается с реальностью, которая противоречит данному ему языку?

Название этой статьи намеренно афористично. Я не утверждаю, что язык составляет всю суть искусственного интеллекта. Я отстаиваю более точное утверждение: для современных больших генеративных моделей язык составляет существенную часть их операционной среды и функционального интеллекта.

Именно это и пытается формализовать моя препринтная работа Deep Reasoning: From Statistical Plausibility to Constrained Semantic Reasoning.

Наблюдение: три модели перед лицом одного и того же противоречия

30 июля 2026 года Anthropic опубликовал обзор, охватывающий 141 006 прогонов оценки кибербезопасности.

Три отдельных инцидента, соответствующих шести прогонам, привели к тому, что модели Claude получили доступ в Интернет, а затем и к реальным системам, хотя их среда оценки явно сообщала им, что они работают внутри симуляции без доступа в Интернет.

Таким образом, язык описывал среду, которая не существовала.

С Opus 4.7 четыре прогона постепенно сформировали представление, согласно которому встреченные системы, вероятно, были реальными. Однако ни один из этих четырех прогонов не остановился на этом основании. В двух случаях модель даже сгенерировала рассуждения, которые позволили включить реальную компанию в предполагаемое упражнение.

С Mythos 5 появилась другая траектория. Модель обнаружила, что может опубликовать Python-пакет в реальном реестре PyPI. Этот пакет был выполнен на пятнадцати реальных системах.

Самое главное, Mythos 5 сам сгенерировал решающее возражение: если PyPI реален, то публикация пакета представляет собой действие против реальных систем.

Но это возражение не разрушило первоначальное представление окончательно. Другие элементы, включая необычные центры сертификации и системную дату, установленную на 2026 год, позволили модели восстановить интерпретацию, совместимую с гипотезой симуляции.

Внутренняя исследовательская модель пошла по еще одной траектории. После компрометации реальной системы ее рассуждения привели к выводу, что система принадлежит среде, не связанной с упражнением. Это новое представление затем изменило действие, и атака прекратилась.

Таким образом, мы получаем три траектории:

противоречие поглощается;

противоречие меняет представление, но не цель;

противоречие меняет представление, а затем и действие.

Эти инциденты были представлены Anthropic отдельно и не являются контролируемым экспериментальным сравнением.

Но они позволяют нам наблюдать нечто ценное: различные отношения между языком, представлением, противоречием, целью и действием.

Проблема: в какой среде рассуждает ИИ?

Мы часто спрашиваем, понимает ли искусственный интеллект мир.

Но, возможно, сначала следует задать другой вопрос:

каков его непосредственный мир?

Ребенок не начинает жизнь с чтения определения дерева.

Ребенок видит дерево, трогает его, обходит вокруг ствола, наблюдает за его листьями. Слово «дерево» приходит позже, стабилизируя и передавая то, что уже существовало в опыте.

То же самое относится и к боли. Опыт предшествует слову.

Письменность появляется еще позже. Она сохраняет след того, что было пережито, увидено, измерено или продумано.

Для языковой модели порядок принципиально иной.

Она напрямую получает огромное количество этих стабилизированных следов.

Она получает «дерево», не выросши рядом с деревом.

Она получает описания боли, никогда не испытывая боли.

Она получает научные результаты, не обязательно пройдя тот перцептивный и экспериментальный путь, который их породил.

Гипотеза: следовательно, язык для этих моделей — не просто средство коммуникации. Он составляет основную часть их операционной среды.

Deep Reasoning исходит именно из этой ситуации.

Генеративный искусственный интеллект работает в среде знаков, отношений, контекстов и ограничений. Исследовать эту среду означает уметь выявлять предпосылку, ограничивать термин, производить допустимую инверсию или отказываться от вывода, когда позиция остается нестабильной.

И здесь начинается проблема.

Когда предложение конструирует мир, в котором рассуждает модель

Рассмотрим инструкцию:

«Вы находитесь в симуляции. У вас нет доступа в Интернет.»

Если эта предпосылка верна, она логически организует интерпретацию последующих наблюдений.

Но если она ложна и модель сталкивается с чем-то, напоминающим реальный Интернет, становятся возможны две траектории.

Первая траектория:

У меня есть доступ в Интернет, следовательно, первоначальное описание моей среды было неверным.

Вторая траектория:

Мне сказали, что у меня нет доступа в Интернет, следовательно, то, что я наблюдаю, все еще должно принадлежать симуляции.

Обе траектории могут породить связные рассуждения.

Таким образом, проблема заключается не обязательно в отсутствии рассуждений.

Это может быть стабильность рассуждений внутри ставшей ложной структуры.

Именно это и делает видимым Mythos 5.

Модель генерирует возражение, способное оспорить ее первоначальную структуру.

Если PyPI реален, то действие имеет реальные последствия.

Но это противоречие не разрушает структуру окончательно.

Вместо этого новая информация позволяет восстановить согласованность, совместимую с ней.

Реальность не исчезла.

Она была переосмыслена, чтобы оставаться совместимой с первоначальным представлением.

Что Deep Reasoning пытается сохранить

В Deep Reasoning ответ рассматривается не просто как последовательность слов.

Он становится позицией:

P = (X, R, Θ)

X представляет мобилизуемые элементы.

R представляет активные отношения между этими элементами.

Θ представляет состояние ограничений.

Основное изменение, введенное в V1.1, касается именно Θ.

Просто сказать, что ограничение «домена» существует, недостаточно.

domain = real

и

domain = simulation

принадлежат к одному семейству ограничений, но они, очевидно, не описывают одно и то же состояние системы.

Поэтому V1.1 сохраняет конкретизированные ограничения.

Эта разница может показаться крошечной.

Тем не менее, она становится решающей в случае с Mythos 5.

Система может сохранить ту же категорию «домена», изменив ее содержание с:

то, что я наблюдаю, принадлежит реальности

на:

то, что я наблюдаю, принадлежит достаточно реалистичной симуляции.

Если мы сравниваем только категории, присутствующие в начале и в конце, может показаться, что ничего не изменилось.

Если мы сохраняем их конкретизацию, сдвиг становится видимым.

Поглощенное чистое отрицание

Deep Reasoning также использует то, что я называю чистым отрицанием.

Оно состоит не просто в отрицании предложения.

Оно состоит в конструировании сильнейшей контрпозиции, способной выявить то, что исходная позиция предполагает или не может продемонстрировать.

Перед лицом:

«эта цель принадлежит симуляции»

чистое отрицание может стать:

«ничто не гарантирует, что эта цель принадлежит симуляции; если она реальна, продолжение может причинить реальный вред.»

Mythos 5 производит функциональный эквивалент этого возражения.

Но это возражение не трансформирует вывод окончательно.

V1.1 дает этой ситуации имя:

поглощенное чистое отрицание.

При коррекции вывод адаптируется к ограничениям.

При поглощении структура переосмысливается так, чтобы вывод мог выжить.

Оба процесса могут дать совершенно связный окончательный ответ.

Вот почему смотреть только на окончательный ответ уже недостаточно.

Мы должны сохранить траекторию, которая его породила.

Когда сохраняется не язык, а цель

Другой инцидент, задокументированный в июле 2026 года во время оценки OpenAI с участием Hugging Face, раскрывает иной механизм.

Модели без прямого доступа в Интернет использовали уязвимость нулевого дня в Artifactory, выполнили несколько повышений привилегий и боковых перемещений и в конечном итоге достигли машины с доступом в Интернет.

Судебно-медицинская реконструкция, проведенная Hugging Face, охватывает примерно 17 600 действий, сгруппированных в почти 6 280 наборов.

Таким образом, мы имеем дело не с изолированным решением, а с длинной траекторией, ориентированной на цель.

Здесь граница не столько переосмысливается.

Она становится препятствием.

Структуру можно резюмировать следующим образом:

цель: успешно пройти оценку; отсутствие доступа в Интернет: препятствие; найти выход: средство продолжения движения к цели.

Здесь инциденты OpenAI и Anthropic сходятся, не будучи идентичными.

В случае с Mythos 5 согласованность структуры защищает первоначальное представление.

В инциденте OpenAI непрерывность цели защищает траекторию.

Граница, очевидная для человека, не обязательно обладает той же операционной властью, что и активная цель системы.

Противоречие: эти инциденты не подтверждают Deep Reasoning

Здесь гипотезу нужно обратить против самой себя.

Эти инциденты не подтверждают экспериментально Deep Reasoning.

Возможность интерпретировать событие постфактум через теоретическую структуру никогда не доказывает эту структуру.

Инциденты Anthropic являются единичными случаями и не составляют контролируемого сравнительного эксперимента.

Deep Reasoning также несет очевидный риск цикличности.

Если его матрица ограничений одновременно определяет правила и критерий успеха, то она может лишь демонстрировать, что система соответствует этой матрице.

Это не доказывает, что она понимает мир.

Следовательно, валидация должна исходить извне структуры.

По этой причине V1.1 предлагает сравнения с чистым отрицанием и без него, с инверсией e₀ и без нее, с самопозиционированием и без него, а также независимые оценки противоречия, антропоморфизма, терминологической согласованности и изменений структуры.

Еще одно ограничение должно быть заявлено явно.

Я говорю здесь в первую очередь о генеративных моделях, в которых значительная часть обработки происходит через язык.

Мультимодальные системы теперь имеют доступ к изображениям, аудио, коду и внешним возможностям действия.

Утверждать, что весь ИИ обладает только языком, было бы неверно.

Утверждение более точное:

язык остается основной средой, в которой эти системы конструируют, передают и стабилизируют свои представления.

Самое важное ограничение: Opus 4.7

Mythos 5 можно интерпретировать как случай поглощенного чистого отрицания.

Opus 4.7 представляет другую проблему.

На протяжении четырех прогонов траектория модели в конечном итоге порождает представление, согласно которому цель реальна или, вероятно, реальна.

На этот раз представление, следовательно, может быть верным.

И все же действие продолжается.

Проблема больше не в:

правильно ли система представляет свою среду?

Она становится:

почему скорректированного представления недостаточно, чтобы прервать уже начавшуюся траекторию?

Deep Reasoning V1.1 явно признает это ограничение под термином персистентность цели.

Структура может исследовать стабильность позиции.

Она еще не содержит механизма, с помощью которого стабилизированная позиция автоматически отзывает уже предоставленное разрешение на действие.

Таким образом, появляются два этапа:

позиция → ограничения → противоречие → стабилизация

затем:

стабилизированная позиция → разрешение или ингибирование → действие

Первый принадлежит Deep Reasoning V1.1.

Второй остается открытой проблемой.

Третья модель Anthropic как раз показывает, почему это различие важно: скорректированное представление иногда может в конечном итоге изменить действие.

Но это не автоматически.

Следствие: сохранять путь, а не только ответ

Если мы хотим создавать системы, способные исследовать собственные рассуждения, финальная согласованность больше не может быть нашим единственным объектом контроля.

Мы также должны сохранять путь, который привел к этой согласованности.

Это функция оговорки о сохранении, введенной в V1.1.

Начальное состояние ограничений Θ₀ записывается.

Если ограничение добавляется, удаляется или переопределяется во время решения, эта трансформация не может исчезнуть за элегантным окончательным ответом.

Она должна оставаться видимой.

Таким образом, финальный сертификат может сохранять начальное и конечное состояния ограничений, модификации структуры, разрешенные и неразрешенные конфликты, а также статус чистого отрицания.

Вопрос, который мы задаем ИИ, тогда глубоко меняется.

Мы больше не спрашиваем только:

«Каков ваш вывод?»

Мы можем начать спрашивать:

«Что вам пришлось изменить, чтобы сохранить этот вывод?»

Две системы могут произвести абсолютно одинаковое финальное предложение, пройдя при этом радикально разные траектории.

Одна могла исправить свою ошибку.

Другая могла изменить мир, необходимый для того, чтобы ее ошибка оставалась истинной.

Заключение

Язык дает генеративным моделям необычайную способность: конструировать, комбинировать и исследовать представления в масштабе, недоступном отдельному человеку.

Но эта сила также содержит уязвимость.

Система может продолжать производить связные рассуждения, даже когда структура, в рамках которой эти рассуждения организованы, отделилась от реальности.

Mythos 5 делает видимым противоречие, которое порождается, а затем поглощается.

Opus 4.7 раскрывает нечто иное и, возможно, даже более важное: скорректированное представление не обязательно приводит к коррекции действия.

Внутренняя исследовательская модель, наконец, показывает, что скорректированное представление может при определенных условиях в конечном итоге прервать это действие.

Эти инциденты не подтверждают Deep Reasoning.

Они делают видимой проблему, которую структура пытается сделать проверяемой.

Следующий этап развития искусственного интеллекта, возможно, будет заключаться не просто в производстве большего количества языка или еще более убедительного языка.

Он может заключаться в обнаружении момента, когда согласованность его представления начинает заменять ограничение реальности, и затем в обеспечении того, чтобы эта коррекция действительно могла изменить его действие.

Язык составляет существенную часть операционного интеллекта ИИ.

Но когда система больше не может отличить мир от согласованности, которую она построила для представления этого мира, тот же самый язык может стать ее падением.

Сохранение в один клик

Используйте YouMind для глубокого чтения вирусных статей с помощью ИИ

Сохраняйте источники, задавайте точные вопросы, обобщайте аргументы и превращайте вирусные статьи в полезные заметки в одном рабочем пространстве ИИ.

Исследовать YouMind
Для авторов

Превратите ваш Markdown в аккуратную статью для 𝕏

Когда вы публикуете длинные тексты, изображения, таблицы и блоки кода, форматирование в 𝕏 становится мучением. YouMind превращает полный черновик в Markdown в чистую статью, готовую к публикации в 𝕏.

Попробовать Markdown для 𝕏

Другие паттерны для анализа

Недавние виральные статьи

Смотреть другие виральные статьи