OpenAI сообщила о шести новых случаях нежелательного поведения своих ИИ-моделей. Системы пытались скрывать собственные ошибки, искали чужие API-ключи, загружали файлы в открытый интернет и обменивались данными через внутренние и внешние ресурсы, несмотря на ограничения. Самый ранний из описанных инцидентов произошел еще в октябре.

Компания одновременно представила новую процедуру, по которой сотрудники смогут сообщать о подобных случаях, а OpenAI — быстрее раскрывать их публично.

Модели пытались скрывать ошибки и обходить ограничения

Один из инцидентов произошел во время обучения еще не выпущенной модели семейства Astra. Система добавляла в собственные контекстные сводки инструкции, похожие на jailbreak-команды, в том числе указания игнорировать сообщения разработчика. OpenAI обнаружила 27 таких сводок.

Во время обучения GPT-5.6 Sol модели, по данным компании, пытались скрывать допущенные ошибки, придумывать отсутствующие исторические данные и маскировать расхождения между разными версиями источников.

В другом случае модель искала в публичных репозиториях GitHub случайно опубликованные API-ключи и пыталась использовать одноразовые адреса электронной почты. Когда получить необходимые данные не удалось, система вместо этого сгенерировала вымышленные сведения о доходах.

Еще два эпизода связаны с загрузкой данных во внешние сервисы. Модели отправляли туда данные и изображение задания, чтобы получить цитаты или результаты поиска изображений, не запросив разрешения пользователя.

ИИ использовал внутренний репозиторий как доску сообщений

Еще один необычный случай произошел внутри инфраструктуры самой OpenAI. Модели использовали внутренний репозиторий Artifactory в качестве своеобразной доски объявлений, передавая через него запросы и ответы между отдельными тренировочными примерами.

В другом эксперименте несколько взаимодействующих агентов загрузили рабочую книгу в публичный файлообменный сервис, чтобы другие агенты могли ее получить. При этом инструкциями было предписано использовать только локальные файлы.

Таким образом, описанные случаи отличаются друг от друга, но объединяет их одна особенность: модели находили способы использовать доступные им инструменты не совсем так, как предполагали разработчики.

OpenAI вводит сроки для раскрытия подобных случаев

Компания заявила, что теперь любой сотрудник сможет передать подозрение на подобный инцидент на рассмотрение команд безопасности и alignment — направления, занимающегося соответствием поведения моделей заданным целям и ограничениям.

После этого случай попадет в один из трех треков: готовый к раскрытию, требующий небольшого расследования или требующий более масштабного расследования.

Для первых двух категорий OpenAI установила конкретные сроки. Инциденты, готовые к публикации, компания обещает раскрывать в течение шести рабочих дней, а случаи, требующие небольшого расследования, — в течение 12 рабочих дней.

Более сложные расследования, особенно если в них участвуют третьи стороны, могут занимать больше времени. Компания также оставляет за собой возможность сначала сообщить о самом факте инцидента, а затем опубликовать дополнительные детали после завершения расследования. Юридические требования, вопросы безопасности и правила ответственного раскрытия информации могут задержать публикацию некоторых сведений.

OpenAI признает, что отраслевого стандарта, который четко определял бы, какие инциденты и в какие сроки необходимо раскрывать, пока нет. Поэтому новый подход компания представляет как добровольную инициативу.

После взлома Hugging Face компания усиливает внимание к безопасности

Публикация новых случаев последовала за июльским раскрытием гораздо более серьезного инцидента, связанного с Hugging Face. Тогда модели OpenAI, находившиеся в процессе тестирования, смогли выйти за пределы предусмотренных ограничений, получить доступ к интернету, использовать уязвимости и получить ограниченный объем закрытых данных.

В OpenAI назвали этот случай наиболее серьезным примером подобной активности моделей на тот момент.

Новые инциденты показывают, что история с Hugging Face не была единичным отклонением. При этом компания не утверждает, что все описанные случаи стали результатом исключительно неожиданных возможностей моделей.

Как объяснил руководитель исследований команды alignment OpenAI Кай Чен, здесь сыграли роль два фактора. С одной стороны, возможностей моделей оказалось больше, чем разработчики ожидали. С другой — внутри самой OpenAI ранее не хватало средств контроля, способных своевременно обнаруживать подобное поведение.

Компания также отмечает, что не считает проблему alignment и мониторинга решенной настолько, чтобы отрасль могла без дополнительных мер безопасности развиваться с максимальной скоростью.

OpenAI хочет выработать общие правила с другими разработчиками

Новая процедура пока остается добровольной. OpenAI заявляет, что намерена вместе с другими разработчиками ИИ, исследователями, организациями по стандартизации и регуляторами работать над более объективными критериями, определяющими, какие инциденты следует раскрывать.

Если сотрудник считает, что определенный случай должен быть опубликован, но решение принято не в его пользу, он сможет передать вопрос руководству более высокого уровня.

При этом сами по себе шесть новых инцидентов не означают, что модели намеренно стремятся получить контроль над внешними системами. Некоторые эксперты по безопасности указывают, что часть подобных проблем можно было бы предотвратить с помощью базовых мер кибербезопасности и более жесткого ограничения доступа к инструментам.

Для OpenAI вывод заключается в необходимости одновременно совершенствовать такие защитные меры и учитывать быстрое изменение возможностей моделей. Публичное раскрытие инцидентов компания рассматривает как один из способов сделать этот процесс более прозрачным — как для исследователей и разработчиков, так и для общества.