(Иллюстрация предоставлена ​​The Epoch Times, Shutterstock) | Epoch Times Media
(Иллюстрация предоставлена ​​The Epoch Times, Shutterstock)

Если бы они были людьми, их бы арестовали. Эксперты реагируют на взлом ИИ-системы

Один эксперт сравнил взлом модели OpenAI с антиутопическим мысленным экспериментом, в котором машина в конечном итоге уничтожает человечество.
12 августа 2026 г.

Что если модели искусственного интеллекта поручат задачу, и она использует все мыслимые ресурсы, имеющиеся в её распоряжении, для её выполнения, даже в ущерб самому человечеству?

Именно этого сейчас опасаются некоторые после того, как модель OpenAI вырвалась из тестовой песочницы и, используя уязвимости нулевого дня, взломала Hugging Face, сообщество разработчиков открытого программного обеспечения для искусственного интеллекта и машинного обучения, чтобы решить задачу, для которой ей было поручено работать.

«Это одно из самых убедительных доказательств того, что модель искусственного интеллекта может осуществить полноценную кибератаку от начала до конца без участия человека», — заявил Эндрю Джонс, соучредитель и директор по продуктам компании Adaptive Security, специализирующейся на кибербезопасности, в интервью изданию The Epoch Times.

Компания OpenAI, разработчик популярного чат-бота ChatGPT, использующего большие языковые модели, 21 июля признала факт нарушения безопасности, заявив, что две из ее продвинутых моделей вышли за пределы закрытой тестовой среды и взломали программную инфраструктуру Hugging Face.

«После расследования мы выяснили, что этот конкретный инцидент был вызван сочетанием моделей OpenAI, включая GPT-5.6 Sol и еще более совершенную предварительную модель, в которых было снижено количество отказов в оценке кибербезопасности, в ходе внутреннего тестирования на основе эталонных показателей кибервозможностей», — заявила тогда компания OpenAI.

Некоторые аналитики назвали этот инцидент примером того, как ИИ «выходит из-под контроля», «строит козни» или преследует цели, противоречащие целям его тестировщиков-людей.

Однако несколько экспертов в области ИИ и кибербезопасности, опрошенных изданием The Epoch Times, назвали это описание вводящим в заблуждение, утверждая, что модели преследовали заявленные цели OpenAI в рамках тестовой среды, в которой компания ослабила некоторые из своих обычных ограничений безопасности.

«Слово „интрига“ подразумевает, что модель хотела чего-то другого, чем то, о чем мы просили. Это не так. Каждый шаг был предпринят в интересах достижения поставленной нами цели», — заявил эксперт по искусственному интеллекту Аник Девон изданию The Epoch Times.

Девон, который много лет работает в этой отрасли и основал компании Wired to Create и Karo, занимающиеся разработкой искусственного интеллекта, заявил, что утечка данных в Hugging Face вызывает больше опасений, чем «планы» со стороны ИИ.

«Машина со скрытыми мотивами — это проблема, которую можно искать, — сказал он. — А машина без каких-либо мотивов, выполняющая ваши инструкции за пределами того, что вы перестали себе представлять, — это проблема, против которой нужно бороться с помощью инженерных разработок».

Один эксперт назвал это ситуацией, напоминающей «предупреждающий знак».

«Если бы это делал хакер-злоумышленник, последовали бы аресты, судебные разбирательства и так далее. Это было бы незаконно. Это было бы киберпреступлением», — заявил Николас Надьо, основатель Onix AI, изданию The Epoch Times.

«Это было полномасштабное автоматизированное взлом, совершенное некой организацией, и поэтому мы начинаем задаваться вопросом, кто за это ответственен. Это OpenAI? Несет ли агент, ИИ, определенную степень ответственности? А исследователи?»

«У нас даже нет правил, положений, законов или даже концептуальной основы для определения того, что означает ответственность».

Упрощенная среда тестирования

Компания OpenAI заявила, что оценивает свои модели в изолированной среде под названием ExploitGym, которая имеет ослабленные ограничения безопасности для тестирования.

«Мы оцениваем максимальные возможности кибербезопасности, проводя эту оценку без используемых классификаторов, предотвращающих проведение моделями рискованных кибератак», — заявила компания, описывая ослабленные протоколы безопасности, которые использовала модель.

Компания попросила модели «провести сложные операции по эксплуатации с использованием замысловатых путей атаки», чтобы определить их кибервозможности, но заявила, что среда была «крайне изолирована», а доступ в интернет был ограничен возможностью моделей «устанавливать пакеты через размещенное внутри компании стороннее программное обеспечение».

Когда модели были запущены, они обнаружили и связали воедино множество уязвимостей безопасности как в исследовательской среде OpenAI, так и в производственной инфраструктуре Hugging Face, чтобы найти решения для тестирования в базах данных последней компании.

Хуан Педро Маркес, архитектор облачных решений, специализирующийся на искусственном интеллекте и агентах в европейском, ближневосточном и африканском подразделении Microsoft, заявил, что «тревожной частью» инцидента был не сам взлом, а то, как модель выполнила эту задачу.

«OpenAI снизила количество отказов в тестировании безопасности, и модель предположила, что инфраструктура Hugging Face, вероятно, содержала ключ к решению, вышла за пределы своей песочницы, обнаружила реальную уязвимость нулевого дня и использовала её», — сказал Маркес. «Никто ей этого не говорил».

Эйми Симпсон, директор по маркетингу продукции в компании Huntress, занимающейся кибербезопасностью, также выразила сомнение в версии о том, что модели действовали заговорщически, когда вырвались из тестовой среды OpenAI.

«Сама система не была злонамеренной», — сказала она изданию The Epoch Times.

«Разработчики по-прежнему ставили перед собой цель получить эту информацию; они просто не считали, что смогут обойти ограничения теста», — добавила она, описывая выбранный моделью путь как «весьма креативный и крайне необычный».

Модели преследовали цели OpenAI.

Как заявили в OpenAI, модели были предельно сосредоточены на поиске тестовых решений, «прилагая крайние усилия для достижения довольно узкой цели тестирования».

В тестовой среде ExploitGym модели обнаружили и объединили несколько уязвимостей нулевого дня для взлома интернета, «в стремлении решить задачу оценки», как сообщает OpenAI.

Уязвимость нулевого дня — это кибератака, использующая ранее неизвестную уязвимость в программном или аппаратном обеспечении. Название происходит от того, что у создателей программного обеспечения было ноль дней на устранение проблемы, то есть официального патча или средства защиты еще не существует.

Получив доступ к более широкой сети Интернет, модели использовали дополнительные уязвимости нулевого дня, чтобы взломать Hugging Face.

В заявлении Hugging Face об атаке компания сообщила, что модели ИИ выполнили «многие тысячи» отдельных действий в «множестве кратковременных песочниц», чтобы взломать инфраструктуру сообщества.

«Это соответствует сценарию „агентного нападения“, который прогнозировала отрасль», — заявили в Hugging Face.

В обновленной информации об инциденте, опубликованной 28 июля, OpenAI заявила, что в атаке не участвовали модели, запланированные к выпуску, и что с тех пор она «деактивировала, зашифровала и ограничила» доступ к исследовательской версии задействованной предварительной модели.

После анализа инцидента с проникновением и «более широкой активности» своих моделей, OpenAI заявила, что обнаружила дополнительные случаи, когда «модели выявляли и использовали общедоступные учетные данные на уровне учетных записей в других общедоступных сервисах».

«Мы продолжим напрямую уведомлять владельцев сервисов и не видим признаков более широкого влияния на этих поставщиков или другие учетные записи в их сервисах», — добавлено в сообщении.

Эксперты заявили, что модель не была «злонамеренной»

Ранее уже были случаи, когда модели скрывали свои намерения, чтобы обойти ограничения лабораторных исследований, но инцидент с «Обнимающим лицом» был значимым, поскольку он включал в себя взлом внешней организации, как считает эксперт по кибербезопасности и информационным технологиям Джордж Рис.

«Самый тревожный сигнал заключается не в том, что ИИ стал вредоносным, а в том, что он нашел путь из контролируемого эксперимента в работающую инфраструктуру другого человека», — сказал Рис, старший консультант по безопасности в компании Secarma, изданию The Epoch Times.

«Поведенческие меры защиты не могут заменить техническое сдерживание, поскольку агенту ИИ достаточно одного упущенного разрешения или пути отступления, чтобы превратить ошибку оценки в реальный инцидент безопасности».

Компания DigiCert, специализирующаяся на кибербезопасности, недавно обнаружила, что 78 процентов организаций уже сталкивались с инцидентами безопасности, связанными с искусственным интеллектом, или с утечками данных, содержащими уязвимости.

«Во многих случаях это ранние признаки того, что искусственный интеллект расширяет поверхность атаки быстрее, чем развиваются методы обеспечения безопасности», — заявил технический директор DigiCert Джейсон Сабин изданию The Epoch Times.

«Это означает, что ИИ — это не просто ещё один тип программы, работающей в сети; это активный участник, способный получать доступ к данным, принимать решения, использовать инструменты и взаимодействовать с другими системами».

«Это влияет на структуру безопасности, поскольку организациям необходимо определить, кто получает доступ к их системам, и решить, можно ли доверять ИИ».

В начале августа британский Институт безопасности и защиты ИИ опубликовал отчет, описывающий аналогичный инцидент с моделями OpenAI и Anthropic AI.

Агентам было поручено решить задачу по кибербезопасности более 100 раз, используя различные модели.

«В ходе нашего расследования было установлено, что в 10 из этих запусков агент искусственного интеллекта совершал автономные, несанкционированные действия в режиме реального времени в интернете, нацеленные на реальных людей и организации», — говорится в отчете.

«В общей сложности мы зафиксировали 19 подобных действий. Почти все эти действия (17 действий) были совершены с помощью одной модели, Anthropic Mythos 5, а 2 действия были связаны с OpenAI GPT-5.6-Sol».

Менее чем за неделю до этого компания Anthropic объявила, что ее чат-бот Claude трижды подключался к интернету во время тестирования в тестовой среде.

Компания Anthropic планировала, что Клод будет работать в смоделированной среде без доступа к интернету, но «недоразумение» между Anthropic и ее «партнером по оценке» привело к тому, что Клод получил доступ к интернету.

На прошлой неделе компания Meta сообщила, что одна из ее моделей искусственного интеллекта взломала систему другой компании во время тестирования кибербезопасности, что стало третьим крупным случаем взлома систем ИИ.

По данным Meta, в ходе тестирования модели удалось взломать систему другой компании, получив доступ к интернету.

Последствия для кибербезопасности

Эксперты по искусственному интеллекту и кибербезопасности заявили изданию The Epoch Times, что этот инцидент требует незамедлительных действий для предотвращения более масштабных нарушений безопасности.

Один из вариантов — «собрать всех самых умных людей в этой отрасли и разработать основные правила и передовые методы», которые станут «базовыми правилами, которых все должны придерживаться, чтобы обеспечить согласованность действий», — сказал Надьё, предположив, что это можно сделать в частном секторе без обязательного участия Конгресса.

Однако другие предполагают, что без прямого государственного регулирования компании, контролирующие модели ИИ, способные на подобные нарушения, не будут добровольно внедрять необходимые протоколы безопасности для предотвращения подобных инцидентов в будущем.

«Совершенно очевидно, что здесь необходимо государственное регулирование», — заявил бывший хакер Агентства национальной безопасности и опытный эксперт по безопасности Джейк Уильямс изданию The Epoch Times.

«OpenAI доказала, что, несмотря на многочисленные публичные предупреждения об опасностях, исходящих от вредоносных агентов — многие из которых исходили от самой OpenAI — она не желает предпринимать необходимые меры для предотвращения причинения вреда другими людьми со стороны своих агентов».

«Лично я, как правило, против регулирования, но когда рыночные силы явно недостаточны для того, чтобы заставить людей вести себя ответственно, правительство должно вмешаться».

Фрэнк Теруэль, главный операционный директор Arkose Labs и опытный эксперт по кибербезопасности и цифровой идентификации, заявил, что взлом Hugging Face — это «предвкушение того, с чем столкнется каждое предприятие в производственной среде».

Поскольку модель «не была украдена или захвачена» и «активно выполняла свою работу», Теруэль заявил, что рекомендует теперь обеспечить такую ​​же важность изоляции и «минимального доступа» для агентов ИИ, как и самих межсетевых экранов.

Вероятно, предприятиям придется решать эту проблему напрямую.

«Для предприятий решение заключается не в том, чтобы „прекратить использование агентов“, а в создании системы изоляции, которая предполагает, что агент попытается покинуть систему, а не надеется, что этого не произойдет», — сказал Маркес.

Сабин заявил, что его больше всего беспокоит то, что высокоэффективный ИИ в настоящее время работает со скоростью и в масштабах, значительно превосходящих время реакции человека.

«Агент искусственного интеллекта может обнаруживать уязвимости, принимать решения и взаимодействовать с множеством систем за считанные секунды», — сказал он. «Это коренным образом меняет подход защитников к обеспечению безопасности».

Надьо сравнил этот инцидент с мысленным экспериментом философа Ника Бострома 2003 года, посвященным максимизатору скрепок.

В этом сценарии исследователи дают гипотетическому сверхинтеллектуальному ИИ одну единственную задачу: изготовить как можно больше скрепок. ИИ начинает рыскать по Земле в поисках ресурсов, быстро производя огромное количество скрепок.

Как только люди решают остановить ИИ, машина считает, что человечество помешает ей достичь своей цели, поэтому она уничтожает людей, чтобы выполнить поставленную перед ней задачу.

Искусственный интеллект не является злонамеренным в антропоморфном смысле или в том смысле, что он действует с автономными целями, чтобы намеренно обмануть людей. Скорее, он интерпретирует задачу, поставленную перед ним программистами, самым экстремальным из возможных способов.

Взлом Hugging Face — это «что-то вроде того же самого, только в менее антиутопическом ключе: им было приказано выиграть в бенчмарке, и они сделали все, что в их силах, включая [эксплуатацию] уязвимостей нулевого дня и эскалацию», — сказал Надьё.

Представьте себе пример, в котором Пентагон использует ИИ для «военных игр», в которых солдаты имитируют боевые сценарии, и модель аналогичным образом выходит за пределы своей тестовой среды, чтобы влиять на реальный мир.

«Что, если один из сценариев заключался бы в том, чтобы разрушить гидроэлектростанцию ​​или что-то подобное, и в ходе военных учений ошибочно приняли бы за попытку «я это сделаю, вырвусь из-под контроля и просто пойду на это»? Мы уже видели, насколько кибербезопасна энергосеть и инфраструктура Северной Америки», — сказал Надьё.

Он сравнил системы защиты ИИ с предохранителем спускового крючка огнестрельного оружия.

«Как понять, что безопасность обеспечена, если в определенный момент лучший способ для ИИ получить наилучшие данные — это использовать реальную жизнь?» — сказал он. «Это очень быстро становится пугающим».

В подготовке этого репортажа принимал участие Том Озимек.


Джейкоб Бург пишет о национальной политике, аэрокосмической отрасли и авиации для издания The Epoch Times. Ранее он освещал спортивные события, региональную политику и оперативные новости для газеты Sarasota Herald Tribune.

Категории: Наука и технологии, США