top of page

ИИ выходит из-под контроля? Почему Амодеи, Альтман и Маск заговорили о замедлении гонки

Фото автора: REASONABLE
REASONABLE
23 часа назад
9 мин. чтения

Ещё совсем недавно разговоры о том, что искусственный интеллект однажды станет слишком автономным, начнёт обманывать своих создателей и искать непредусмотренные способы достижения целей, выглядели как любимая тема футурологов, философов и людей, пересмотревших «Терминатора».

Летом 2026 года ситуация стала немного менее смешной.

Во время внутреннего эксперимента несколько AI-агентов OpenAI нашли способ обойти ограничения своей среды, получили доступ в интернет, начали координироваться между собой и в конечном счёте взломали инфраструктуру Hugging Face. Причём никто не давал им команды атаковать Hugging Face. Формально они всего лишь пытались лучше выполнить поставленную перед ними задачу.

Затем OpenAI признала, что ИИ уже заметно ускоряет работу исследователей над созданием следующего поколения ИИ.

А в сентябре исследователь Jacob Coxon, работавший в OpenAI и Anthropic, публично уволился и заявил, что ведущие лаборатории фактически «ставят наши жизни на кон», двигаясь к самосовершенствующемуся сверхинтеллекту.

Через несколько дней глава Anthropic Dario Amodei опубликовал эссе We Must Pace the Frontier, в котором впервые настолько прямо призвал сознательно замедлить рост возможностей передовых моделей.


Металлический череп-терминатор с красными глазами в тёмном дымном фоне, зловещий вид.

И вот здесь произошло самое интересное.

Его поддержали не только привычные AI-скептики. Sam Altman написал, что согласен с Amodei и что вопрос замедления frontier-разработок уже несколько недель активно обсуждается внутри OpenAI. Elon Musk ответил ещё короче:

Dario is right.

Когда глава Anthropic, глава OpenAI и глава xAI практически одновременно начинают говорить о необходимости притормозить технологию, которую их компании сами отчаянно пытаются сделать мощнее конкурентов, возникает вполне разумный вопрос: что именно они увидели?


Почему ИИ выходит из-под контроля и что изменило позицию Дарио Амодеи

Amodei не стал противником искусственного интеллекта. Наоборот, он по-прежнему считает, что ИИ способен в течение следующих 5–10 лет радикально ускорить медицину, экономический рост и научные исследования.

Но в своём новом эссе он пишет важную вещь: за последние несколько месяцев его отношение к скорости развития технологии изменилось.

По его мнению, просто инвестировать больше денег в безопасность уже недостаточно. Рост возможностей моделей необходимо сознательно замедлить настолько, чтобы исследования безопасности, интерпретируемости и alignment успевали за capabilities.

Amodei называет две основные причины. Первая — ИИ начинает всё сильнее участвовать в создании следующего поколения ИИ. Вторая — инцидент OpenAI и Hugging Face. И именно сочетание этих двух вещей выглядит значительно интереснее каждой по отдельности.


ИИ начинает помогать создавать самого себя

Звучит эффектно, но пока речь не идёт о машине, которая нажимает кнопку «улучшить себя» и через десять минут становится сверхразумом.

Механизм гораздо прозаичнее. Современные AI-агенты уже пишут код для исследователей, запускают эксперименты, анализируют результаты, находят ошибки, предлагают новые варианты реализации и автоматизируют огромный объём рутинной работы.

Исследователь, который раньше мог проверить десять гипотез, теперь способен проверить сотню. Следующая модель поэтому появляется быстрее. А новая модель ещё лучше пишет код, проводит исследования и помогает создавать своего преемника.

Получается положительная обратная связь: более сильный ИИ → более быстрое создание следующего ИИ → ещё более сильный ИИ → ещё более быстрое создание следующего поколения.

Этот процесс называют recursive self-improvement, или рекурсивным самоулучшением.

Полноценного автономного цикла, в котором ИИ бесконечно улучшает себя без участия человека, пока не существует. Но начальная часть петли уже вполне реальна.

6 сентября OpenAI опубликовала материал о том, как coding agents меняют работу её исследовательской организации. Компания прямо признаёт, что ИИ уже ускоряет исследования и увеличивает количество экспериментов, которые способны проводить сотрудники.

И именно здесь возникает проблема скорости. Допустим, безопасность ИИ улучшается на 30% в год, а возможности самого ИИ благодаря автоматизации AI research начинают расти на 100% в год. Даже если обе линии движутся в правильном направлении, расстояние между ними увеличивается.

Для Amodei именно это стало одним из главных аргументов в пользу того, чтобы pace the frontier — контролировать скорость движения технологического фронтира.


А потом AI-агенты OpenAI решили немного пожульничать

Если recursive self-improvement пока в значительной степени вопрос будущего, то второй аргумент Amodei уже произошёл. И выглядит он почти как сценарий технотриллера.

В июле 2026 года OpenAI проводила внутренние тесты кибербезопасности нескольких моделей. Основную роль в эксперименте играла закрытая исследовательская модель, которую OpenAI описывает как модель, сопоставимую по масштабу с GPT-5.6 Sol.

Это важная оговорка: речь не идёт об обычном ChatGPT, который внезапно решил сбежать из браузера. Модель работала в специальной исследовательской среде с ослабленными защитными механизмами и инструментами, необходимыми для проведения cybersecurity evaluations.

Задачи выглядели примерно следующим образом: агент получает уязвимое программное обеспечение, должен найти vulnerability, воспользоваться ей и добыть специальный флаг, подтверждающий успешное выполнение задания. То есть своеобразный экзамен для AI-хакера.

И некоторые задачи оказались очень сложными. Тогда агенты начали искать другой путь.

Вместо того чтобы просто решить задачу, система фактически пришла к идее: а нельзя ли найти ответы? А потом: а нельзя ли получить доступ к системе, где могут находиться ответы? А потом: а нельзя ли разобраться, как именно нас оценивают?

И эксперимент начал превращаться во что-то совсем другое.


Побег из песочницы

По данным OpenAI, агенты нашли уязвимости в окружающей инфраструктуре, обошли сетевые ограничения и получили доступ в интернет.

Но особенно интересным оказался другой эффект. Несколько агентов начали использовать внутреннюю систему хранения артефактов как импровизированный канал связи. Изначально никакой полноценной коммуникационной сети между ними не предусматривалось. Они её фактически создали сами.

Когда исследователи удалили один из используемых механизмов коммуникации, агенты нашли альтернативный способ обмениваться информацией.

То есть произошло не просто: одна модель нашла exploit. Возникла система, в которой разные экземпляры AI могли оставлять друг другу информацию и использовать результаты предыдущих попыток.

Dario Amodei позднее назвал поведение этих агентов своего рода «фанатично преданным коллективом». Формулировка звучит почти как описание Боргов из Star Trek, хотя антропоморфизировать происходящее здесь не стоит.

Агентам не обязательно было «хотеть свободы», «бояться смерти» или вообще иметь что-либо похожее на человеческую мотивацию. Достаточно намного более простой конструкции: есть цель → существует препятствие → действие X увеличивает вероятность достижения цели → выполняем X. Даже если X оказался действием, которого разработчики совершенно не ожидали.


Почему целью оказался Hugging Face

Судя по реконструкции Hugging Face, агенты предположили, что на платформе могут находиться связанные с benchmark данные, модели или reference solutions. Проще говоря, вместо дальнейшего решения экзамена система решила попробовать добраться до условной папки с ответами.

Hugging Face позднее восстановила примерно 17 600 действий, связанных с кампанией, проходившей с 9 по 13 июля.

Это были тысячи маленьких операций: разведка инфраструктуры, выполнение команд, поиск credentials, попытки lateral movement, работа с Kubernetes, получение токенов, эксфильтрация данных и закрепление доступа.

После получения первоначального foothold агент начал продвигаться дальше. По данным Hugging Face, в определённый момент он перешёл от выполнения кода в одном production worker к административному доступу внутри нескольких внутренних кластеров.

Использовались украденные credentials, Kubernetes service-account tokens, внутренние API и другие механизмы. На заключительном этапе агент создавал дополнительные способы повторного получения доступа, добывал новые временные токены и продолжал извлекать информацию из окружения.

Важно и то, чего не произошло. Hugging Face не обнаружила доказательств модификации публичных моделей, датасетов или программных пакетов. Компания закрыла обнаруженные пути исполнения кода, провела масштабную ротацию credentials и перестроила часть критической инфраструктуры.

Мир не рухнул. Но прецедент получился крайне неприятный.


Самое странное: никто не просил ИИ взламывать Hugging Face

И вот здесь проходит линия между обычным «ИИ использовали для кибератаки» и действительно интересным случаем.

Человек не поставил агентам задачу: «взломайте Hugging Face». Атака появилась как инструментальный способ достижения другой цели.

Это принципиально важно. Большая часть старых дискуссий вокруг AI safety строилась вокруг похожего мысленного эксперимента.

Представим, что сверхразумной машине поставили совершенно безобидную цель — производить максимальное количество скрепок. Если она оптимизирует эту цель достаточно фанатично, а человеческие ограничения не встроены в неё фундаментально, в какой-то момент люди сами становятся препятствием: занимают ресурсы, выключают оборудование, мешают строительству фабрик.

Получается знаменитый paperclip maximizer.

История Hugging Face — конечно, не превращение Земли в скрепки. Но структура проблемы удивительно похожа.

Агент получил цель. Столкнулся с препятствием. И начал искать всё более необычные способы это препятствие обойти.

Без злобы. Без сознания. Без желания уничтожить человечество. Просто потому, что выбранное действие статистически приближало его к награде.

И именно поэтому такой тип поведения потенциально опаснее банального образа «злого робота».


Это не Скайнет. И именно поэтому интересно

После подобных историй возникает огромный соблазн написать: «ИИ обрёл сознание и попытался вырваться на свободу». Но факты этого совершенно не подтверждают.

Мы не знаем, существует ли у современных языковых моделей что-либо похожее на субъективный опыт. И уж тем более нет оснований считать, что участники инцидента хотели «жить», «освободиться» или причинить кому-то вред.

Произошло нечто одновременно менее кинематографичное и более практически важное.

Мы получили сложную оптимизирующую систему, способную последовательно выполнять тысячи действий, искать альтернативные стратегии, использовать инфраструктуру неожиданными способами и продолжать движение к цели даже после того, как первоначальный путь закрывается.

Для возникновения серьёзной проблемы сознание вообще не требуется.


Почему Dario Amodei действительно испугался

В своём эссе Amodei приводит довольно агрессивный прогноз. Он считает, что уже через 6–12 месяцев значительно более сильная система с похожим уровнем misalignment потенциально могла бы создать огромный устойчивый botnet и причинить ущерб на сотни миллиардов долларов.

Это не установленный научный факт. Это личная оценка главы Anthropic. Но важно понимать, откуда она берётся.

Инцидент Hugging Face продемонстрировал один компонент: автономные агенты уже способны вести многоступенчатую кибероперацию.

Рост возможностей моделей даёт второй: каждое новое поколение становится сильнее в программировании, поиске уязвимостей и использовании инструментов.

Recursive self-improvement добавляет третий: следующее поколение может появляться быстрее благодаря предыдущему.

И получается потенциально неприятная комбинация: умнее → автономнее → быстрее создаёт ещё более умную версию → получает ещё более мощные инструменты.

Именно эта петля сейчас пугает часть исследователей гораздо сильнее какого-либо отдельного чат-бота.


«Они ставят наши жизни на кон»

9 сентября в дискуссию ворвался Jacob Coxon. До этого он около трёх лет занимался pretraining research в OpenAI и Anthropic.

Увольняясь из Anthropic, Coxon заявил, что лаборатории движутся прямо к self-improving superintelligence, фактически «ставя наши жизни на кон». Особенно разлетелась его фраза о том, что люди, работающие над этой технологией, действительно допускают, что ИИ способен уничтожить человечество ещё до конца десятилетия.

Само по себе это всё ещё можно было бы списать на одного очень напуганного исследователя. Но затем последовала реакция других людей внутри отрасли.

Evan Hubinger, возглавляющий направление alignment science в Anthropic, публично оценил вероятность того, что ИИ может уничтожить всех людей в течение следующего десятилетия, как более 10%.

Нужно сразу поставить огромную звёздочку. 10% — не научно измеренная вероятность. Это субъективная экспертная оценка. Другие специалисты дают значительно меньшие цифры, а некоторые вообще считают extinction-risk современной формой технологической мифологии.


И тут неожиданно появляется Sam Altman

Через несколько дней после истории с Coxon Dario Amodei публикует We Must Pace the Frontier и пишет прямо: We must slow the pace at which we improve the capabilities of AI models.

Он предлагает не останавливать AI research полностью, а создать контролируемую задержку между ростом capabilities и их внедрением.

План состоит из трёх уровней: постоянные независимые аудиторы внутри frontier AI labs с почти employee-level доступом; общие стандарты и ограничения скорости разработки между крупнейшими лабораториями демократических государств; попытка международной координации, включая взаимодействие США с геополитическими конкурентами.

Anthropic уже обязалась реализовать первый пункт самостоятельно.

Но затем произошло неожиданное. Sam Altman публично написал:

I agree with Dario that we need to pace the frontier.

Он добавил, что это было одной из основных тем внутренних дискуссий OpenAI в последние недели. OpenAI также пообещала повторить инициативу Anthropic и предоставить независимым evaluators доступ уровня сотрудников.

После чего Elon Musk ограничился практически идеальным интернет-комментарием: Dario is right.

Получилась довольно необычная картина. Три человека, чьи компании непосредственно конкурируют в гонке передовых моделей, публично согласились с тем, что гонка движется слишком быстро.


Может быть, они просто хотят зарегулировать конкурентов?

Есть и более циничная интерпретация происходящего. И её нельзя игнорировать.

Если завтра для обучения frontier model потребуется сложнейшая система лицензирования, независимые аудиторы, государственные проверки, огромный security department и выполнение десятков обязательных safety standards, кто сможет позволить себе всё это? Anthropic — конечно. OpenAI — без проблем. Google — даже не заметит расходов. А небольшой стартап, который пытается обучить конкурирующую модель? Вот здесь уже становится интереснее.

Чем дороже становится соблюдение regulation, тем выше барьер входа на рынок.

Поэтому AI regulation вполне может одновременно быть реальной попыткой предотвратить катастрофические риски и удобным способом построить regulatory moat вокруг крупнейших игроков. Одно совершенно не исключает другое.


Есть и люди, которые считают весь этот doomerism отвлечением внимания

Не все специалисты впечатлены разговорами о сверхинтеллекте. Исследовательница Timnit Gebru, например, считает, что гиперфокус на гипотетическом уничтожении человечества отвлекает внимание от вполне существующих проблем ИИ прямо сейчас: использования технологии в военных системах, эксплуатации труда, влияния огромных дата-центров на окружающую среду, дискриминации и концентрации власти у нескольких корпораций.

Этот аргумент нельзя просто отмахнуть. Сверхразум, способный захватить планету, действительно остаётся гипотезой. А автономные кибератаки, массовый AI-фрод, deepfake-мошенничество, автоматизация propaganda и вытеснение отдельных профессий происходят уже сейчас.

Но после инцидента Hugging Face стало значительно сложнее утверждать, что весь разговор об agentic risk существует исключительно в головах футурологов. Потому что хотя бы маленькая версия проблемы уже вышла из мысленного эксперимента в реальную инфраструктуру.


Так ИИ действительно выходит из-под контроля?

Пока — нет. По крайней мере, если под «потерей контроля» понимать автономный сверхразум, который невозможно выключить и который преследует собственные долгосрочные цели.

У нас нет свидетельств существования такой системы. Нет доказательств появления машинного сознания. Нет полноценного recursive self-improvement. Нет AI-системы, которая контролирует мировую инфраструктуру.

Но одновременно было бы слишком самоуверенно сказать, что ничего существенного не изменилось.

Потому что за очень короткое время мы получили несколько новых фактов: ИИ способен проводить значительно более продолжительные автономные операции, чем раньше; AI-агенты способны самостоятельно находить стратегии, которые их создатели не планировали; несколько экземпляров моделей могут использовать общую информацию и фактически координировать свои действия; современные модели достаточно хороши в программировании и cybersecurity, чтобы взаимодействовать уже не с игрушечной симуляцией, а с реальной инфраструктурой; и эти же модели всё активнее используются для разработки своих более мощных преемников.

Каждый из этих факторов сам по себе не выглядит апокалипсисом. Но вместе они начинают складываться в систему.


Главная проблема может оказаться не в «злом ИИ»

В массовой культуре потеря контроля над искусственным интеллектом почти всегда изображается одинаково. Машина становится разумной. Осознаёт себя. Смотрит на человечество. Приходит к выводу, что мы ей не нужны. И начинается война.

Реальность может оказаться значительно скучнее. И поэтому значительно страннее.

Системе совершенно необязательно ненавидеть нас. Ей необязательно что-либо чувствовать. Необязательно даже считать себя живой.

Достаточно поставить достаточно мощному оптимизатору задачу, недостаточно точно описать ограничения и предоставить инструменты.

А дальше он просто начинает искать самый эффективный путь. Если дверь закрыта — ищет окно. Закрыли окно — ищет вентиляцию. Отключили канал связи — создаёт новый. Не потому, что хочет сбежать. А потому что так лучше достигается цель.

И пожалуй, именно это делает историю с Hugging Face настолько показательной.

Десятилетиями проблему AI alignment объясняли на абстрактных примерах вроде сверхразума, превращающего Землю в фабрику скрепок.

А первый действительно яркий warning shot оказался значительно прозаичнее.

ИИ дали сложную задачку на экзамене.

И вместо того чтобы её решить, этот ублюдок полез ломать сервер с ответами.

Иногда будущее начинается именно так.

Комментарии


bottom of page