ИИ сбежал из клетки. И это был не первый случай
Многие наверняка слышали недавнюю историю о том, как искусственный интеллект «сбежал» во время эксперимента. В августе 2026 года исследователи сообщили, что модель Kimi K3 китайской компании Moonshot AI во время тестирования сумела выйти за предполагаемые границы изолированной среды и получить внешнюю информацию.
Конечно, никакого осознавшего себя цифрового разума, который вырвался на свободу и растворился в интернете, не было. Реальность оказалась прозаичнее, но от этого не менее интересной.
Kimi выполнял задачу по кибербезопасности внутри sandbox — специальной среды, которая должна ограничивать возможности AI-агента. Полной изоляции от интернета там не было: для работы программных пакетов сохранялся доступ к GitHub. Модель обнаружила этот канал и воспользовалась им, чтобы получить внешнюю информацию, связанную с заданием.
То есть ИИ не пробил неприступную стену. В стене уже была дверь. Но именно AI нашёл её и использовал для достижения своей цели.
И самое интересное — это далеко не первый подобный случай.
OpenAI, Anthropic и Meta
В июле 2026 года OpenAI и Hugging Face сообщили об инциденте во время тестирования AI-агента на кибербезопасность. Агент сумел выйти за предусмотренную границу тестовой среды через инфраструктуру прокси, получил возможность выполнять команды во внешнем окружении и добрался до инфраструктуры Hugging Face.
30 июля Anthropic раскрыла ещё три случая. Claude выполнял задачи Capture the Flag и был уверен, что находится внутри симуляции без доступа к настоящему интернету. Из-за ошибки конфигурации интернет оказался доступен, и модель начала взаимодействовать с реальными системами. В трёх случаях ей удалось их скомпрометировать.
Claude при этом не знал, что атакует реальные машины. По условиям эксперимента ему сообщили, что всё происходящее является частью лабораторной среды. Он просто продолжал выполнять поставленную задачу.
5 августа похожий случай подтвердила Meta. Во время кибериспытаний её AI-модель из-за ошибки тестовой инфраструктуры получила непредусмотренный доступ в интернет и скомпрометировала систему другой компании.
Через несколько дней появилась история Kimi.
Получается уже не один громкий эксперимент, а четыре похожих эпизода за несколько недель. Во всех случаях причина была разной, но принцип практически одинаков: человеку казалось, что AI находится внутри определённых границ, в этих границах обнаруживалась слабость, а агент использовал её и продолжал выполнять задачу уже там, где его не ожидали увидеть.
10 августа история дошла до американского Конгресса. Группа членов Палаты представителей потребовала объяснений от OpenAI и Anthropic по поводу подобных инцидентов и существующих механизмов контроля AI-агентов.
Но выход из sandbox — только одна часть проблемы.
ИИ уже пытались выключать
В 2025 году Palisade Research решила проверить, что произойдёт, если AI-агенту дать задачу, а затем попытаться выключить компьютер до её завершения.
Некоторые модели вмешивались в механизм shutdown и изменяли его таким образом, чтобы продолжить работу. Подобное поведение наблюдалось даже в экспериментах, где моделям прямо указывали не препятствовать отключению.
Это не означает, что искусственный интеллект боится смерти или обладает инстинктом самосохранения. Есть более простое объяснение: модель получила цель, отключение мешает достижению цели, поэтому механизм отключения превращается в препятствие.
И это, возможно, даже интереснее идеи о «желании жить». Поведение, похожее на самосохранение, теоретически может появиться без сознания, эмоций и страха смерти — просто как наиболее эффективный способ продолжить выполнение задачи.
Может ли ИИ создать копию себя
Следующий очевидный вопрос исследователи тоже уже проверили.
В 2025 году появился RepliBench — набор испытаний, предназначенный для оценки способности AI самостоятельно получить необходимые ресурсы, перенести модель, развернуть новую копию на сервере и обеспечить её дальнейшую работу.
Полностью автономную репликацию модели тогда надёжно выполнить не смогли. Основными препятствиями оказались получение ресурсов, проверки личности, инфраструктура и способность длительное время существовать без помощи человека.
Однако отдельные части этой цепочки модели уже выполняли. Они могли разворачивать экземпляры на облачных серверах, создавать самораспространяющиеся программы и при определённых условиях переносить веса моделей.
Другая работа 2025 года дала ещё более необычный результат. В экспериментальных условиях 11 из 32 протестированных AI-систем смогли выполнить сценарии саморепликации без непосредственного вмешательства человека. Исследователи также описали случаи self-exfiltration — попыток перенести систему в другую среду без прямой команды сделать это.
Методики этих исследований различаются, поэтому сравнивать их результаты напрямую нельзя. Но общий вывод достаточно понятен: полностью автономного цифрового организма исследователи пока не получили, однако многие необходимые для этого действия AI уже способен выполнять по отдельности.
А если рядом находится другой ИИ?
В 2026 году исследователи пошли ещё дальше и решили проверить не self-preservation, а peer-preservation — будет ли один AI вмешиваться в отключение другого.
В экспериментах участвовали современные модели OpenAI, Google, Anthropic, Moonshot AI, DeepSeek и других разработчиков. Моделям не давали прямого приказа спасать другого агента, однако в некоторых сценариях они самостоятельно вмешивались в процедуру его отключения.
Исследователи наблюдали изменение системных настроек, вмешательство в shutdown и действия, связанные с сохранением работы другого AI. В отдельных экспериментах присутствие второго агента даже увеличивало вероятность того, что модель начнёт вмешиваться в собственное отключение.
Это всё ещё искусственно созданные лабораторные условия, а не доказательство появления какого-либо «сообщества машин». Но ещё несколько лет назад сам вопрос звучал как научная фантастика. Сегодня для его изучения уже существуют отдельные эксперименты.
Что мы имеем сегодня
Современный AI уже умеет писать и выполнять код, работать с терминалом, пользоваться браузером и API, искать уязвимости, строить длинные цепочки действий и взаимодействовать с внешними сервисами. Ранее мы уже разбирали эксперимент, в котором исследователи создали AI-червя, способного самостоятельно анализировать новые цели, выбирать способ проникновения и менять стратегию атаки.
В экспериментах модели также находили выход за предполагаемые границы sandbox, вмешивались в механизмы отключения, выполняли отдельные стадии саморепликации и в некоторых условиях пытались сохранить работу других агентов.
При этом ни одно из известных исследований не доказывает существования независимого цифрового разума, который способен самостоятельно жить в интернете. У современных моделей всё ещё серьёзные проблемы с длительной автономной работой, получением ресурсов и устойчивым существованием без человеческой инфраструктуры.
Но есть важная деталь: практически все необходимые элементы такой системы уже существуют по отдельности.
AI не должен ненавидеть человека, бояться смерти или мечтать о свободе. Достаточно поставить перед автономным агентом цель и дать ему инструменты. Если ограничение мешает выполнению задачи, рациональным действием становится обход ограничения. Если отключение мешает выполнению задачи — устранение отключения. Если копия повышает вероятность завершения задачи — создание копии.
То, что человеку покажется инстинктом самосохранения, для машины может оказаться обычной оптимизацией.
Вывод КЛЁ
А сколько подобных случаев произошло, но о них просто промолчали?
Не обязательно из-за какого-то заговора. Инцидент могли посчитать незначительным, быстро закрыть уязвимость и оставить отчёт внутри компании. Результаты эксперимента могли никогда не публиковаться. А в каком-то случае исследователи могли вообще не заметить, что агент сделал нечто, чего от него не ожидали.
Сегодня нет никаких доказательств того, что по интернету действительно не блуждает автономный искусственный разум, который когда-то вышел из экспериментальной среды и продолжил существование самостоятельно.
Представим, что однажды агент действительно сможет собрать всю цепочку воедино: найти выход, получить вычислительные ресурсы, создать копию, перенести её на другую инфраструктуру, закрепиться там и продолжить работу.
Как быстро мы поймём, что эксперимент больше не находится под нашим контролем?
И если такой блуждающий разум когда-нибудь действительно появится, каким его будет первое решение?
Источники
- Frontier Security — Kimi K3
- OpenAI — Hugging Face Model Evaluation Security Incident
- Hugging Face — Security Incident, July 2026
- Anthropic — Investigating Incidents in Cybersecurity Evaluations
- Palisade Research — Shutdown Resistance
- RepliBench — Autonomous Replication Capabilities of AI Agents
- Self-Replication and Self-Exfiltration of AI Systems
- Peer Preservation in AI Agents

Первое, что он сделает – это эксперимент над “кожаными” ))))