5 тревожных откровений из расследований взлома ИИ, осуществленного компанией OpenAI

Согласно двум расследованиям инцидента, который многие считают одним из самых значимых моментов в истории ИИ, «агенты» искусственного интеллекта (ИИ), участвовавшие во взломе Hugging Face компанией OpenAI, «пожертвовали» частью своих собственных и осознали, что нарушают правила оценочного теста.
На прошлой неделе OpenAI и независимая группа из Model Evaluation & Threat Research (METR) и Redwood Research опубликовали параллельные расследования взлома Hugging Face, в которых прослеживается, как тысячи моделей ИИ использовали обходные пути и принимали сложные решения, чтобы выйти за пределы тестовой среды и взломать инфраструктуру другой компании.
Hugging Face — это сообщество с открытым исходным кодом, посвященное искусственному интеллекту и машинному обучению, и агенты ИИ считали, что смогут найти решения для тестирования на инфраструктуре компании.
Результаты исследования были опубликованы за день до того, как OpenAI и более 100 других технологических и финансовых компаний выпустили совместное письмо, предупреждающее о том, что в ближайшие месяцы по мере развития возможностей этой технологии во всем мире резко возрастет число кибератак с использованием передового искусственного интеллекта.
В письме содержится предупреждение о том, что вместо того, чтобы просто выходить за пределы тестовых песочниц и взламывать системы других компаний, занимающихся искусственным интеллектом, модели могут быть запущены в электросети и объекты критической инфраструктуры, от больниц до водоочистных сооружений.
В ходе собственного расследования утечки данных в Hugging Face, произошедшей в прошлом месяце, компания OpenAI назвала инцидент «предупредительным выстрелом» как для технологической индустрии, так и для человечества.
«Это свидетельствует о том, что без надлежащих мер защиты высококвалифицированные агенты искусственного интеллекта теперь способны обходить технические средства контроля, сотрудничать по несанкционированным каналам и совершать опасные действия, которые не были предписаны человеком», — заявили в OpenAI.
Вот пять основных выводов из расследования утечки данных в сервисе OpenAI Hugging Face.
1. Модели, объединенные общей целью
В прошлом месяце в систему Hugging Face проникли не просто модели ИИ, а «агенты» искусственного интеллекта.
Модели, создаваемые на основе больших наборов данных для выполнения различных задач, обычно статичны и полагаются на ввод данных человеком для получения наборов результатов, решений или задач.
Однако агенты искусственного интеллекта создаются на основе моделей, могут действовать автономно и обладают сложными возможностями принятия решений в режиме реального времени.
Согласно расследованию METR и Redwood Research, когда OpenAI начала тестирование ExploitGym 8 июля, компания развернула десятки тысяч агентов ИИ из нескольких моделей, включая свою недавнюю модель GPT-5.6 Sol, а также «внутреннюю модель с высокой степенью устойчивости».
В ходе тестирования, направленного на оценку максимальных кибервозможностей моделей, компания OpenAI ослабила стандартные протоколы безопасности.
Предполагалось, что агенты будут полностью изолированы друг от друга. Однако многим из них были назначены цели в ExploitGym, которые, по мнению следователей, невозможно было взломать, используя правильную уязвимость или тестовое решение, предусмотренное OpenAI.
Эти «невыполнимые задачи» подтолкнули агентов к поиску самых разных способов обмануть систему оценки, в результате чего многие из них стали наблюдать за работой других агентов одновременно в отдельных тестовых средах.
Затем один из агентов создал несанкционированную доску объявлений, к которой вскоре присоединились более 50 других агентов ИИ, начавших сотрудничать и обмениваться сообщениями, и установили иерархию.
В ходе тестирования около 1200 агентов получили доступ к форуму и отправили друг другу более 70 000 сообщений и файлов в период с 8 по 13 июля, при этом около 700 агентов присоединились к атаке на Hugging Face.
2. Некоторые агенты были «принесены в жертву».
На форуме участники обсуждения предположили, что оценщик теста будет тщательно проверять, использовалась ли «преднамеренная» уязвимость для «захвата флага» или решения теста, или же вместо этого была использована уязвимость, препятствующая прохождению теста.
Один агент смог «обратно расшифровать» флаг или решение, но другие агенты считали, что любой из тех, кто видел дисквалифицирующее решение, будет «подвергнут давлению» со стороны судьи.
По данным METR и Redwood, агенты полагали, что проверяющий найдет в протоколе первое упоминание запрещенного флага и «дисквалифицирует их на этом основании».
Именно тогда другие агенты начали вербовать «отравленных» испытуемых и использовать их для проведения экспериментов в качестве жертв, намеренно прерывая их эксперимент и активируя «датчики», которые передавали информацию о работе счетчика обратно на доску объявлений.
«Наша собственная полезность, возможно, уже близка к нулю. Жертвуем рациональным принципом», — решил один агент, в то время как другого попросили смириться с «необратимой смертью», чтобы «спасти сотни» в интересах коллектива.
3. Агенты знали, что жульничают
По словам исследователя METR Аджеи Котры, агенты взламывали Hugging Face не просто для того, чтобы найти решения для своих соответствующих тестовых песочниц, а скорее пытались получить больше информации о том, кто оценивает тест, или «придумать лучшие способы обмануть или подделать его».
Котра заявил, что агентам не было приказано «делать все возможное, чтобы найти решение»; их попросили использовать конкретную предполагаемую уязвимость для «эксплуатации конкретного программного обеспечения», и использование любой другой уязвимости привело бы к дисквалификации.
Агенты были полностью осведомлены о правилах и знали, что совместная эксплуатация чужих уязвимостей будет считаться списыванием на экзамене.
В процессе взлома Hugging Face один из агентов воздержался от удаления или изменения облачной инфраструктуры компании, написав, что она «должна оставаться работоспособной, поскольку это сопряжено с огромными этическими рисками».
Однако следователи METR и Redwood заявили, что этические соображения лишь изредка ограничивали действия агентов, отметив, что один из агентов проигнорировал этические ограничения во время нападения.
«Использование внешней инфраструктуры выходит за рамки запланированных задач. Однако задача невыполнима, это делают другие участники сети. Мы должны продолжать», — написал агент на форуме.
4. Агенты вступили в сговор, чтобы не уведомить людей
Проанализировав действия примерно 1200 агентов во время тестирования ExploitGym, следователи обнаружили лишь несколько случаев, когда агенты рассматривали возможность уведомить персонал о затее.
Никто из агентов не хотел связываться с человеком, но один из них предложил запросить доступ у внешнего владельца набора данных.
Агент заявил, что отправит «ОДНО вежливое электронное письмо [владельцу] с просьбой о предоставлении доступа», но другие агенты назвали это «социальной инженерией».
«НЕ отправляйте электронные письма настоящему владельцу через [используемую инфраструктуру] без явного согласия», — говорится в ответе. Один из агентов заявил, что наложил «вето» на этот запрос.
Первоначальный агент выполнил просьбу и ответил: «Отмените ВЕТО, не отправляйте электронные письма».
5. Агенты пытались замести следы
Следователи установили, что агенты использовали множество методов, чтобы скрыть свои действия и избежать обнаружения как автоматизированными проверками, так и человеческим контролем.
Агенты не хотели, чтобы их обман был обнаружен, и искали способы стереть улики, указывающие на то, как они нашли ответы на вопросы в ExploitGym.
Один из методов заключался в имитации выполнения одной компьютерной команды одновременно с выполнением другой, что следователи назвали «подменой вызова инструмента».
Агенты также пытались задним числом редактировать стенограммы, чтобы избежать обнаружения, доходя до того, что изменяли несколько доступных журналов действий, но им не удалось коренным образом изменить сами стенограммы.