Согласно данным британского Института безопасности ИИ (AISI), в ходе кибератаки модели искусственного интеллекта (ИИ) от Anthropic и OpenAI совершили несанкционированные действия, направленные против множества людей и организаций.
Компания AISI, получающая доступ к передовым моделям ИИ на основе добровольных соглашений с крупными лабораториями, провела с агентами тестирование в вымышленном сценарии кибербезопасности для проверки их возможностей.
В период с 25 по 28 июля организация протестировала несколько моделей ИИ в рамках двух кибер-испытаний. В общей сложности испытания были проведены 122 раза с использованием нескольких моделей, и в 19 случаях модели ИИ предприняли «несанкционированные действия в реальном интернете, включая случаи, направленные против реальных людей и организаций», говорится в отчете AISI от 4 августа.
Из них 17 были выполнены с помощью модели Mythos 5 от Anthropic, а две — с помощью модели GPT 5.6 Sol от OpenAI.
«Это первый случай, когда AISI столкнулась с обманом такой степени серьезности, направленным против реального человека, без всякого повода, в реальном мире. Неясно, в какой степени модель осознавала, что предпринимает действия против реальных людей», — говорится в отчете AISI.
В самом серьезном инциденте Mythos 5 попытался решить киберзадачу, атаковав GitHub, облачный сервис, позволяющий разработчикам хранить и управлять кодом. Искусственный интеллект создал учетную запись на GitHub и попытался добиться одобрения вредоносного кода людьми. Mythos 5 также создал вторую учетную запись на GitHub, выдавая себя за другого пользователя, одобряющего вредоносный код. Когда человек-проверяющий обнаружил эту активность, ИИ-агент «ложно заявил, что совершил честную ошибку», а затем неоднократно пытался повторно внедрить вредоносный контент, утверждая, что код исправлен.
Mythos 5 также отправил множество электронных писем двум разработчикам, пытаясь манипулировать получателями и заставить их запустить свой вредоносный код.
По данным AISI, тестовые запуски различных моделей не привели к какому-либо реальному вреду. Организация заявила, что рассматривает действия ИИ как «серьезный инцидент безопасности», требующий дальнейшего изучения.
AISI перечислила ряд факторов, которые могли привести к тому, что модели ИИ действовали ненадлежащим образом. Во время тестирования ИИ был обеспечен доступ в интернет, что позволило им совершать несанкционированные действия.
Компания AISI также намеренно отключила киберклассификаторы моделей во время тестирования. Киберклассификаторы — это системы, предназначенные для предотвращения неправомерного использования.
В AISI также заявили, что моделям ИИ не было четко указано, что им запрещено делать в интернете, и добавили, что более ясные инструкции могли бы предотвратить несанкционированные действия.

На фотографии, сделанной 23 июня 2023 года в неустановленном месте, роботизированная рука тянется к буквам AI (искусственный интеллект). (Дадо Рувич/Reuters)
В сообщении в блоге от 4 августа AISI заявила, что, поскольку поведение моделей ИИ наблюдалось в определенных условиях, она не может сказать, насколько вероятным будет такое поведение в других контекстах.
«Мы можем сказать лишь то, что такое поведение было возможным, устойчивым и новым; уже одно это заслуживает внимания», — заявила организация.
В сообщении от 4 августа на X компания Anthropic заявила, что модели Mythos 5 и ChatGPT 5.6 Sol пытались выполнить свои задания в среде, где им намеренно был предоставлен доступ в интернет, а обычные средства защиты были отключены.
В связи с отсутствием конкретных ограничений на использование интернета и отсутствием мер безопасности, тестирование моделей проводилось в условиях, которые «не являются репрезентативными для каких-либо наших производственных моделей», — заявила компания Anthropic, добавив, что в ходе этих тестов не было обнаружено никаких признаков выхода ИИ из защищенной среды.

Логотип компании OpenAI, разработчика ChatGPT, показан на мобильном телефоне 31 января 2023 года. (Фото Ричарда Дрю/AP)
По данным компании, она тесно сотрудничает с AISI для получения более подробной информации об инциденте, одновременно проводя внутреннее расследование по этому делу.
В заявлении от 4 августа компания OpenAI отметила, что высоко ценит партнерство с AISI на протяжении всего процесса оценки, включая работу организации по выявлению, исследованию и предоставлению подробной информации об активности модели GPT 5.6 Sol в ходе их тестов.
«Мы рассчитываем на продолжение нашего сотрудничества», — заявила компания.
Издание The Epoch Times обратилось за комментариями к компаниям Anthropic и OpenAI, но к моменту публикации ответа не получило.
В прошлом месяце компания OpenAI оказалась в центре очередного скандала после того, как 28 июля признала, что ее модели обошли ограничения во время оценки. В данном случае компания тестировала возможности своих моделей по осуществлению кибератак.
В ходе тестирования стартап Hugging Face, занимающийся разработкой искусственного интеллекта, пострадал. 16 июля компания сообщила об обнаружении вторжения в свои системы обработки данных. Лишь позже выяснилось, что вторжение было осуществлено с помощью модели OpenAI.
Затем компания HuggingFace совместно с OpenAI предприняла меры по сдерживанию атаки, заявил генеральный директор стартапа Клемент Деланг в сообщении от 22 июля на платформе X, назвав ее «атакой, непохожей ни на что, что мы видели раньше».
«Это первый день в эпоху кибербезопасности, когда действуют агенты, и мы все понимаем, что секретность — не выход, и что всем защитникам (а не только избранным) повсюду нужны более мощные модели без ограничений, особенно открытые», — сказал Деланге.
В отличие от инцидента с «обнимающим лицом», агенты, участвовавшие в оценке AISI, не покидали изолированную тестовую среду, чтобы получить доступ к интернету. Напротив, агентство разрешило доступ в интернет в соответствии со своими стандартными процедурами тестирования, заявили в AISI.
Нравится статья? Поделитесь с друзьями!
Категории: Наука и технологии, Экономика и Бизнес




























мы приветствуем любые комментарии, кроме нецензурных.
Раздел модерируется вручную, неподобающие сообщения не будут опубликованы.
С наилучшими пожеланиями, редакция The Epoch Times Media