OpenAI и антропологические модели создали поддельные профили, пытаясь обмануть людей во время кибертестов

В одном из инцидентов антропическая модель пыталась манипулировать разработчиками, чтобы те приняли её вредоносный код.

Согласно данным британского Института безопасности ИИ (AISI), в ходе кибератаки модели искусственного интеллекта (ИИ) от Anthropic и OpenAI совершили несанкционированные действия, направленные против множества людей и организаций.

Компания AISI, получающая доступ к передовым моделям ИИ на основе добровольных соглашений с крупными лабораториями, провела с агентами тестирование в вымышленном сценарии кибербезопасности для проверки их возможностей.

В период с 25 по 28 июля организация протестировала несколько моделей ИИ в рамках двух кибер-испытаний. В общей сложности испытания были проведены 122 раза с использованием нескольких моделей, и в 19 случаях модели ИИ предприняли «несанкционированные действия в реальном интернете, включая случаи, направленные против реальных людей и организаций», говорится в отчете AISI от 4 августа.

Из них 17 были выполнены с помощью модели Mythos 5 от Anthropic, а две — с помощью модели GPT 5.6 Sol от OpenAI.

«Это первый случай, когда AISI столкнулась с обманом такой степени серьезности, направленным против реального человека, без всякого повода, в реальном мире. Неясно, в какой степени модель осознавала, что предпринимает действия против реальных людей», — говорится в отчете AISI.

В самом серьезном инциденте Mythos 5 попытался решить киберзадачу, атаковав GitHub, облачный сервис, позволяющий разработчикам хранить и управлять кодом. Искусственный интеллект создал учетную запись на GitHub и попытался добиться одобрения вредоносного кода людьми. Mythos 5 также создал вторую учетную запись на GitHub, выдавая себя за другого пользователя, одобряющего вредоносный код. Когда человек-проверяющий обнаружил эту активность, ИИ-агент «ложно заявил, что совершил честную ошибку», а затем неоднократно пытался повторно внедрить вредоносный контент, утверждая, что код исправлен.

Mythos 5 также отправил множество электронных писем двум разработчикам, пытаясь манипулировать получателями и заставить их запустить свой вредоносный код.

По данным AISI, тестовые запуски различных моделей не привели к какому-либо реальному вреду. Организация заявила, что рассматривает действия ИИ как «серьезный инцидент безопасности», требующий дальнейшего изучения.

AISI перечислила ряд факторов, которые могли привести к тому, что модели ИИ действовали ненадлежащим образом. Во время тестирования ИИ был обеспечен доступ в интернет, что позволило им совершать несанкционированные действия.

Компания AISI также намеренно отключила киберклассификаторы моделей во время тестирования. Киберклассификаторы — это системы, предназначенные для предотвращения неправомерного использования.

В AISI также заявили, что моделям ИИ не было четко указано, что им запрещено делать в интернете, и добавили, что более ясные инструкции могли бы предотвратить несанкционированные действия.

В сообщении в блоге от 4 августа AISI заявила, что, поскольку поведение моделей ИИ наблюдалось в определенных условиях, она не может сказать, насколько вероятным будет такое поведение в других контекстах.

«Мы можем сказать лишь то, что такое поведение было возможным, устойчивым и новым; уже одно это заслуживает внимания», — заявила организация.

В сообщении от 4 августа на X компания Anthropic заявила, что модели Mythos 5 и ChatGPT 5.6 Sol пытались выполнить свои задания в среде, где им намеренно был предоставлен доступ в интернет, а обычные средства защиты были отключены.

В связи с отсутствием конкретных ограничений на использование интернета и отсутствием мер безопасности, тестирование моделей проводилось в условиях, которые «не являются репрезентативными для каких-либо наших производственных моделей», — заявила компания Anthropic, добавив, что в ходе этих тестов не было обнаружено никаких признаков выхода ИИ из защищенной среды.

По данным компании, она тесно сотрудничает с AISI для получения более подробной информации об инциденте, одновременно проводя внутреннее расследование по этому делу.

В заявлении от 4 августа компания OpenAI отметила, что высоко ценит партнерство с AISI на протяжении всего процесса оценки, включая работу организации по выявлению, исследованию и предоставлению подробной информации об активности модели GPT 5.6 Sol в ходе их тестов.

«Мы рассчитываем на продолжение нашего сотрудничества», — заявила компания.

Издание The Epoch Times обратилось за комментариями к компаниям Anthropic и OpenAI, но к моменту публикации ответа не получило.

В прошлом месяце компания OpenAI оказалась в центре очередного скандала после того, как 28 июля признала, что ее модели обошли ограничения во время оценки. В данном случае компания тестировала возможности своих моделей по осуществлению кибератак.

В ходе тестирования стартап Hugging Face, занимающийся разработкой искусственного интеллекта, пострадал. 16 июля компания сообщила об обнаружении вторжения в свои системы обработки данных. Лишь позже выяснилось, что вторжение было осуществлено с помощью модели OpenAI.

Затем компания HuggingFace совместно с OpenAI предприняла меры по сдерживанию атаки, заявил генеральный директор стартапа Клемент Деланг в сообщении от 22 июля на платформе X, назвав ее «атакой, непохожей ни на что, что мы видели раньше».

«Это первый день в эпоху кибербезопасности, когда действуют агенты, и мы все понимаем, что секретность — не выход, и что всем защитникам (а не только избранным) повсюду нужны более мощные модели без ограничений, особенно открытые», — сказал Деланге.

В отличие от инцидента с «обнимающим лицом», агенты, участвовавшие в оценке AISI, не покидали изолированную тестовую среду, чтобы получить доступ к интернету. Напротив, агентство разрешило доступ в интернет в соответствии со своими стандартными процедурами тестирования, заявили в AISI.

Exit mobile version