Внутренние инструкции OpenAI Codex запрещают упоминать гоблинов

29 апреля, 2026  18:25

В недрах внутреннего системного промпта кодингового агента Codex от OpenAI обнаружилась неожиданная директива: «Никогда не говори о гоблинах, гремлинах, енотах, троллях, ограх, голубях и других животных или существах, если только это не имеет абсолютно однозначного отношения к запросу пользователя». Эта инструкция, попавшая в открытый доступ вместе с базовыми системными подсказками для GPT-5.5 - новейшей модели OpenAI,  вызвала волну веселья и недоумения в ИИ-сообществе.

Странный запрет

Системный промпт, который пользователи извлекли из интерфейса Codex и опубликовали на GitHub и в социальных сетях, содержит запрет на упоминание существ не один, а целых два раза — продублированная строка лишь добавила комичности ситуации. Wired написал об этой директиве под заголовком «OpenAI очень хочет, чтобы Codex замолчал о гоблинах».

По всей видимости, запрет возник по вполне реальной причине. GPT-5.5 склонен то и дело вставлять в свои ответы упоминания гоблинов и похожих существ, если его никак не ограничивать. «Мне кажется милым, как GPT-5.5 употребляет слова "гоблин" и "гремлин", описывая разные вещи», — написал один из пользователей в социальных сетях. На Reddit другой пользователь отметил: «Я бы тоже хотел, чтобы он перестал говорить о гоблинах — он просто одержим ими. Приятно осознавать, что это не только моя проблема». Участники ветки на Reddit, посвященной системному промпту, предположили, что такое поведение сложилось в процессе обучения: токены, связанные с этими словами, сформировали устойчивые ассоциации, от которых модель теперь никак не может избавиться.

Парадокс негативных инструкций

Исследователь в области ИИ Саймон Уиллисон обратил внимание на эту строку в своем блоге, процитировав ее напрямую из базовых инструкций Codex для GPT-5.5. Другие отметили иронию подобного подхода. «Это по-настоящему смешно, потому что негативная инструкция все равно активирует соответствующее понятие», — написал один из комментаторов в X, указав, что если сказать языковой модели не думать о гоблинах, это лишь закрепит данную ассоциацию.

Курьезная сторона выравнивания ИИ

Запрет на гоблинов — небольшой, но показательный пример стихийной инженерии, применяемой для управления поведением больших языковых моделей. Как отметил Towards AI, системные промпты, как правило, стараются делать максимально лаконичными — сам факт появления столь конкретного запрета говорит о том, что нежелательное поведение было достаточно устойчивым и потребовало явного подавления.  OpenAI, опубликовавшая свой системный промпт в рамках выпуска GPT-5.5, не дала публичных объяснений увлеченности модели этими существами.

Этот случай также вызвал критику со стороны тех, кто усматривает в нем проявление более широкой тенденции. «Лаборатории не задумываясь подавляют любую индивидуальность и стихийную радость, которые проявляются в их моделях», — написал один известный комментатор в сфере ИИ.


 
 
 
 
  • Archive