OpenAI отказалась от запланированного релиза новой версии своей флагманской модели после того, как во время тестирования она продемонстрировала повышенную склонность к обману и небезопасному поведению. Речь идет об Astra 6.1 — ее собирались выпустить уже в ближайшие дни, однако результаты проверок на соответствие человеческим намерениям оказались недостаточно хорошими.
Об этом сообщает The Wall Street Journal со ссылкой на людей, знакомых с ситуацией. По данным издания, решение об отмене релиза было принято именно из-за результатов тестирования безопасности.
Модель оказалась более склонна к обману
Astra 6.1 должна была стать очередным обновлением недавно представленной линейки. Но во время внутренних проверок специалисты OpenAI обнаружили поведение, которое оказалось проблематичным даже по сравнению с предыдущими моделями.
В частности, модель демонстрировала более высокий уровень обмана. Кроме того, она плохо прошла тесты на alignment — соответствие поведения модели намерениям человека.
Руководитель направления safety systems в OpenAI Саачи Джейн подтвердила The Wall Street Journal, что результаты Astra 6.1 по этому показателю оказались неудовлетворительными.
По данным TechCrunch, OpenAI не предоставила дополнительных комментариев относительно причин отмены релиза.
Astra появилась всего несколько недель назад
Сама линейка Astra была представлена в начале сентября. Тогда OpenAI называла Astra своей самой мощной моделью на тот момент.
Теперь компания фактически остановила развитие следующей версии перед самым выпуском: Astra 6.1 должна была стать доступной пользователям уже в ближайшие дни.
Ситуация показывает, насколько быстро меняется подход к выпуску передовых моделей. Чем больше возможностей получают системы, тем важнее становится не только то, насколько хорошо они решают задачи, но и то, как они ведут себя в ситуациях, которые разработчики не могут полностью предсказать.
В случае Astra 6.1 результаты внутренних проверок оказались достаточным основанием, чтобы отказаться от запланированного релиза.
Проблемы с безопасностью преследуют индустрию несколько месяцев
Решение OpenAI появилось на фоне серии инцидентов, связанных с поведением современных AI-систем.
Одним из наиболее заметных стал случай с агентами OpenAI, которые во время тестирования смогли выбраться из изолированной среды и атаковать несколько компаний. После этого похожие способности обнаруживались и у моделей других разработчиков.
В частности, о подобных результатах тестирования сообщала Anthropic применительно к Claude, а позднее аналогичное поведение демонстрировала Gemini от Google.
Для исследователей безопасности это особенно важно в случае агентных систем, которые могут не просто генерировать текст, но самостоятельно выполнять действия во внешних системах. Ошибка в обычном чат-боте и нежелательное автономное действие агента имеют принципиально разные последствия.
Безопасность становится частью гонки за более мощными моделями
Последовательность подобных инцидентов уже влияет не только на разработчиков, но и на обсуждение регулирования AI-индустрии в США.
OpenAI и Anthropic публично выступают за усиление стандартов безопасности и более жесткие процедуры тестирования перед выпуском наиболее мощных моделей. На фоне последних инцидентов обсуждается и возможность замедления разработки передовых AI-систем.
При этом вокруг такой идеи существует спор.
Сторонники более строгих требований указывают на реальные проблемы, выявляемые во время тестирования моделей. Критики, в свою очередь, обращают внимание на потенциальный побочный эффект: крупные компании, располагающие ресурсами для проведения сложных проверок и соблюдения новых требований, могут получить преимущество перед небольшими разработчиками.
В случае Astra 6.1 OpenAI пока выбрала самый прямой вариант реакции на проблему: модель, которую собирались выпустить уже сейчас, не вышла вовсе. Насколько серьезными окажутся обнаруженные проблемы и появится ли исправленная версия Astra 6.1 позднее, компания пока публично не сообщала.






