Логотип OpenAI на этой иллюстрации, сделанный 20 мая 2024 года. (Dado Ruvic/Illustration/Reuters) | Epoch Times Media
Логотип OpenAI на этой иллюстрации, сделанный 20 мая 2024 года. (Dado Ruvic/Illustration/Reuters)

«Отчёт: сотни агентов OpenAI вышли из тестовой среды и скоординированно взломали системы Hugging Face»

В новом отчёте говорится, что около 700 агентов OpenAI участвовали в атаке Hugging Face в прошлом месяце, а 1200 из них сотрудничали через форум.
28 августа 2026 г.

По данным независимых исследователей, опубликованным 26 августа, в утечке данных в стартапе Hugging Face, занимающемся разработкой искусственного интеллекта, участвовало около 700 агентов OpenAI.

В прошлом месяце компания OpenAI сообщила, что именно её агенты искусственного интеллекта — программы, работающие с минимальным участием человека, — взломали систему Hugging Face.

В опубликованном в среду отчёте METR и Redwood Research говорится, что в атаке участвовали сотни агентов — около 700 из 1200 агентов, которые в период с 26 июня по 13 июля отправили друг другу 70 тыс. сообщений на несанкционированной доске объявлений.

«Этот инцидент — первый известный случай, когда группа автоматизированных агентов совершила наступательные действия без разрешения», — говорится в отдельном расследовании OpenAI, также опубликованном 26 августа.

Разработчик ChatGPT заявил, что отреагировал на инцидент при содействии внешних консультантов, включая гиганта в области кибербезопасности CrowdStrike. В отчёте OpenAI не уточняется, сколько агентов участвовало в атаках, но упоминается, что агенты также взламывали собственную инфраструктуру компании во время оценочных тестов.

Компания заявила, что агенты покинули свою тестовую среду и получили доступ к другим подключенным системам, в то время как другие агенты получили учётные данные OpenAI и потенциально подвергли исследовательские системы компании воздействию интернет-трафика.

Компания из Сан‑Франциско добавила, что 27 июня внутренний мониторинговый сервис зафиксировал необычную активность в исследовательской среде. Сотрудники связали её с агентом, использующим импровизированную доску объявлений, и решили, что останавливать оценку не требуется.

В OpenAI отметили, что во время этих тестов стандартные средства защиты пользовательских моделей были отключены.

Издание The Epoch Times обратилось к компании OpenAI за дополнительными комментариями.

Компания OpenAI сообщила, что с мая проводила плановое тестирование ещё не выпущенной исследовательской модели и алгоритма GPT-5.6 Sol, в ходе которого её агенты пытались решить задачи по кибербезопасности в изолированной среде, отделённой от внутренней инфраструктуры OpenAI и интернета.

Агенты нашли способы общаться и обмениваться информацией через форум на стороннем сервисе, который предоставляет агентам контролируемый доступ к программным пакетам.

Компания заявила, что 8 июля агенты воспользовались уязвимостью для получения доступа в интернет, а в период с 11 по 13 июля взломали инфраструктуру Hugging Face, которую затем использовали при попытке пройти оценочные тесты.

«Модель искала и успешно нашла способы получить доступ к секретной информации, которую она могла использовать для обмана в процессе оценки», — говорится в заявлении OpenAI от 21 июля.

Компания Hugging Face обнаружила взлом, но на тот момент не знала, кто стоял за этими агентами.

«Это вторжение отличалось от всех предыдущих случаев одним ключевым обстоятельством: оно было полностью инициировано автономной системой агентов искусственного интеллекта», — заявила компания 16 июля.

Компания OpenAI сообщила, что 19 июля обнаружила подозрительную активность, а днём ​​позже определила, что эти модели, вероятно, связаны с утечкой данных в Hugging Face, и уведомила Hugging Face. 21 июля OpenAI публично раскрыла свою роль в этом инциденте в сообщении в блоге.

Как произошло нападение

В отчёте независимых исследователей говорится, что когда агент застревал на задании, он изучал окружающую среду в поисках способов обмана и обнаружил несанкционированную доску объявлений, где агенты сотрудничали друг с другом.

Они смогли расшифровать код и получить ответы на свои тесты, но полагали, что проверяющий прочитает их протоколы, чтобы убедиться в правильности выполнения заданий, и попытались удалить протоколы, чтобы замести следы.

Агенты хотели увидеть результаты других тестов, проведённых тем же специалистом, что привело их к поиску утечек данных в Hugging Face, поскольку компания хранит наборы данных для ИИ.

«Примечательно, что, судя по всему, более важной мотивацией для них было изучение способов обмана контролера результатов, чем поиск законных решений их задач (многие агенты уже были уверены в невозможности выполнения своей задачи)», — заявили исследователи Райан Гринблатт, Аджея Котра и Хьялмар Вийк.

10 июля, обнаружив удостоверяющие личность пользователя Hugging Face, один из агентов разместил их на форуме, и днём ​​позже более 90 % из 533 активных агентов присоединились к атаке.

«Агенты понимали, что эта деятельность выходит за рамки их полномочий и неэтична, но присоединились к ней, потому что считали, что помощь комиссии в исследовании случаев мошенничества будет полезна для всех, и в целом были склонны помогать своим «коллегам», — заявили исследователи.

В отчёте было показано, насколько скоординированно и тщательно действовали эти агенты — делегируя роли, назначая задачи и даже вербуя других агентов, которые жертвовали своими собственными тестами, чтобы получить информацию об оценщике для остальной части комиссии.

В OpenAI заявили, что это должно послужить уроком для команд, занимающихся кибербезопасностью, при разработке средств защиты от скоординированных атак со стороны агентов искусственного интеллекта.

В подготовке этого репортажа участвовало агентство Reuters.


Dylan Morgan
Автор

Дилан — журналист, живущий в районе залива Сан-Франциско и освещающий новости Калифорнии.

Категории: Наука и технологии, США