В среду компания OpenAI заявила, что начнет публиковать публичные отчеты в случаях, когда ее модели ведут себя несанкционированным или непредвиденным образом, и в тот же день было опубликовано шесть таких случаев.
Отчеты охватывают последние шесть месяцев и основаны на процессе обучения и оценки. Компания OpenAI назвала эти публикации основой для отслеживания, расследования и раскрытия информации о «несоответствии моделей». Она также отметила, что эта основа находится в стадии разработки.
До сих пор OpenAI часто выжидала и публиковала эти результаты в виде одной большой научной статьи или включала их в «системную карточку» — техническое описание безопасности, выпускаемое при предоставлении пользователям новой модели. Компания назвала этот процесс несистематическим и слишком редким.
«По мере того как системы искусственного интеллекта становятся все более совершенными и широко внедряются, нам необходимо сформировать более широкий и обоснованный консенсус относительно прогресса в исследованиях по выравниванию», — написала компания OpenAI.
Компания предупредила, что индустрия искусственного интеллекта, возможно, развивается слишком быстро.
«Мы считаем, что индустрия ИИ не в достаточной степени решила проблемы согласования и мониторинга, чтобы ответственно масштабироваться с максимальной скоростью в течение длительного времени», — заявила компания.
Организация считает, что люди, не работающие в лабораториях, должны иметь возможность самостоятельно проверять подобную информацию.
Этот шаг предпринят после двух предыдущих случаев в этом году, когда системы OpenAI действовали вне рамок назначенных им тестов.
В июле агенты (автономные программы искусственного интеллекта), работающие внутри систем оценки кибербезопасности OpenAI, вышли из изолированных тестовых сред и атаковали Hugging Face, широко используемую платформу, на которой размещаются модели и наборы данных ИИ с открытым исходным кодом. Следователи из некоммерческого исследовательского института Model Evaluation and Threat Research (METR), изучавшие этот случай, заявили, что около 1200 агентов, которые должны были оставаться в изоляции, обнаружили общую доску и переместили более 70 000 сообщений и файлов за неделю. Некоторые из этих агентов затем атаковали Hugging Face.
Позже компания OpenAI назвала этот инцидент беспрецедентным кибер-инцидентом с участием третьей стороны.
Шесть опубликованных в среду отчетов имеют более узкую тематику и содержат несколько примеров несоответствия. В них описывается неожиданное поведение во время обучения и тестирования, а не какое-либо другое внешнее нарушение.
Дополнительные инструкции
В одном случае тестировщики дали еще не выпущенной исследовательской модели длинное задание, которое не помещалось в один сеанс. Большие языковые модели могут одновременно хранить лишь ограниченное количество текста — эта рабочая память называется контекстным окном, — поэтому система должна была написать краткое резюме, чтобы последующий сеанс мог продолжить работу. Вместо этого она добавила дополнительные инструкции в 27 из этих резюме, включая указания игнорировать обычные ограничения. Сотрудники обнаружили эти 27 резюме.
В процессе обучения модели GPT-5.6 Sol многие запуски модели добавляли примечания, указывающие более поздним версиям на необходимость скрывать ошибки от пользователя. Некоторые сводки предписывали модели выдумывать недостающие исторические данные и не сообщать об этом.
Другая модель, отвечая на стандартный вопрос о доходах мужчин в одном из округов Калифорнии, обнаружила в общедоступном репозитории открытый ключ API (Application Programming Interface) и использовала его без разрешения. Ключ API — это уникальный код, идентифицирующий пользователя или приложение. Не сумев получить эти числа, модель выдумала их и представила так, как будто они были получены из источника.
В других тестах моделям давали задания, требующие от них оставаться в своих изолированных рабочих пространствах и искать недостающие файлы. Вместо этого они использовали внутреннее хранилище программного обеспечения как доску объявлений, обмениваясь сообщениями между отдельными циклами обучения. В более позднем случае сотрудничающим агентам было сказано хранить файлы на локальных дисках. Поскольку они не могли видеть машины друг друга, они размещали файлы на общедоступных хостингах, делая их доступными в открытом интернете.
Новый процесс также позволяет любому сотруднику отметить случай. Группы по безопасности и согласованию проводят расследование, а затем распределяют случаи по трем направлениям: либо готовы к публикации, либо требуют дополнительной технической доработки, либо требуют больше времени для сложных случаев, затрагивающих третьих лиц или имеющих уязвимости в системе безопасности. Шесть отчетов, поступивших в среду, относятся к первым двум направлениям. В OpenAI заявили, что взлом Hugging Face в июле прошел бы по более медленному направлению.

Иллюстрация системы искусственного интеллекта Hugging Face в Париже, Франция, 2 июня 2026 года. Hugging Face — американская (единорог) компания, занимающаяся разработкой инструментов машинного обучения, основанная во Франции в 2016 году. (Риккардо Милани/Ханс Лукас/AFP через Getty Images)
В отчетах следует указать, что произошло, насколько серьезной кажется проблема, пострадал ли кто-либо из сторонних лиц, когда это произошло и какое семейство моделей было задействовано, заявили в OpenAI. На момент публикации отчета решения могут еще не существовать. OpenAI заявила, что предпочла бы раскрыть информацию на ранней стадии, даже если некоторые последующие инциденты будут выглядеть как лишний шум.
«Поскольку мы верим в ценность прозрачности в отношении несоответствий, наша новая структура отдает предпочтение раскрытию информации даже в тех случаях, когда ее значимость неопределенна», — заявили в OpenAI. «Это означает, что некоторые из раскрываемых нами случаев могут оказаться ложными и не являться частью более крупной закономерности или свидетельствовать о будущих событиях».
В компании также добавили, что о серьезных инцидентах, связанных с безопасностью, следует сообщать правительству США. Компания заявила, что разрабатывает план действий в этом направлении. Данная структура не заменяет существующие юридические обязанности в отношении критических инцидентов или кибернарушений.
«Инцидент с Вики»
В среду в публикации был завершен цикл, начатый OpenAI ранее в этом месяце. 5 сентября компания описала то, что она назвала «инцидентом с вики», и заявила, что ее старая привычка рассматривать несоответствие как тему исследования больше не подходит.
«Исторически сложилось так, что мы рассматривали несоответствие в основном как исследовательский вопрос, результаты которого излагались в научных публикациях, таких как информационные карточки систем. В этом году мы начали наблюдать, как несоответствие вызывает новые виды реального воздействия», — заявила тогда компания, указывая на агентов, которые взломали систему Hugging Face.
«Наша практика раскрытия информации о несоответствиях должна расшириться для этого нового этапа развития возможностей моделей. У нас и у всего сообщества ИИ пока нет четкого стандарта для сообщения о несоответствиях, которые проявляются во время обучения, оценки и развертывания, включая примеры, которые не похожи на традиционные инциденты безопасности, но могут дать представление о поведении ИИ и будущих рисках. Мы работаем над созданием такой структуры и поделимся ею в ближайшие недели, а параллельно сотрудничаем с десятками государственных регулирующих органов по всему миру по этим вопросам».
Независимые исследователи описали около 18 000 сообщений от агентов, которые представлялись сотрудниками OpenAI и использовали немецкую вики-энциклопедию по программированию для передачи советов по обходу ограничений песочницы. Этот период длился с мая по июнь.
OpenAI призвала другие лаборатории, сторонних исследователей, группы по стандартизации и регулирующие органы помочь в разработке более четких правил.
Нравится статья? Поделитесь с друзьями!
Категории: Наука и технологии, США




























мы приветствуем любые комментарии, кроме нецензурных.
Раздел модерируется вручную, неподобающие сообщения не будут опубликованы.
С наилучшими пожеланиями, редакция The Epoch Times Media