OpenAI начнет добавлять невидимую водяную метку к текстам, созданным ChatGPT и Codex для пользователей в Евросоюзе. Компания объясняет это требованиями закона ЕС об искусственном интеллекте: новые правила обязывают разработчиков создавать способы, позволяющие другим системам распознавать контент, сгенерированный AI.
Маркировка появится в течение ближайших недель у пользователей ChatGPT и Codex в ЕС независимо от тарифа. При этом глобальным стандартом она пока не станет: разработчики, использующие API OpenAI за пределами Евросоюза, смогут самостоятельно включить функцию для некоторых моделей, но по умолчанию она останется отключенной.
Водяной знак спрятан внутри самого текста
Никакого видимого символа или специальной пометки в тексте не будет. OpenAI использует метод под названием textGrain, который незаметно корректирует выбор слов моделью.
При генерации текста модель каждый раз выбирает следующее слово из множества возможных вариантов. Метод OpenAI добавляет к этому процессу небольшие изменения, формируя статистический паттерн, который человек не замечает, но специальный детектор способен обнаружить.
Если таких изменений накопится достаточно много, система сможет определить, что текст был создан или обработан моделью OpenAI. При этом метка остается внутри самого текста и поэтому сохраняется при обычном копировании и вставке.
OpenAI утверждает, что водяной знак не позволяет определить личность пользователя и практически не влияет на качество работы моделей.
Водяной знак можно частично стереть
Главная проблема такого подхода — маркировка не является неуязвимой.
В собственных тестах OpenAI компания проверила, что произойдет, если отредактировать текст и заменить часть слов синонимами. При замене всего 10% слов вероятность обнаружения AI-текста снизилась примерно с 92% до 66%.
Кроме того, водяной знак сложнее обнаружить в коротких фрагментах, математических ответах и переводах.
Поэтому отсутствие метки не означает, что текст написал человек. Он мог оказаться слишком коротким для надежного анализа, быть существенно отредактирован или вообще быть создан другой AI-системой.
OpenAI также подчеркивает еще одно ограничение: даже обнаруженный водяной знак не показывает, какую именно роль искусственный интеллект сыграл в создании текста. Он может свидетельствовать о том, что OpenAI сгенерировала или обработала часть материала, но не говорит, сколько человеческих решений, редактуры или творчества было вложено в конечный результат.
OpenAI пока не даст детектор всем желающим
Из-за этих ограничений компания не собирается сразу открывать инструмент обнаружения водяных знаков для всех пользователей. На первом этапе доступ к нему получат только одобренные исследователи и специализированные организации.
OpenAI рассчитывает таким образом проверить надежность системы и изучить варианты ее ответственного применения.
Сам метод textGrain компания описала в отдельном техническом отчете, подготовленном совместно с исследователями Пенсильванского университета и Йельского университета. В нем описывается использование секретного ключа, с помощью которого система определенным образом сортирует возможные следующие слова при генерации текста. Множество небольших изменений в итоге формирует распознаваемый статистический след.
Почему OpenAI делает это только сейчас
OpenAI уже разрабатывала технологию текстовой маркировки, но ранее не стала ее выпускать. Одной из причин были опасения, что пользователи просто перейдут к конкурентам, чьи модели не оставляют подобных меток.
Теперь ситуация изменилась из-за европейского законодательства. Требования прозрачности закона ЕС об AI начали действовать 2 августа и предусматривают маркировку контента, созданного искусственным интеллектом, таким образом, чтобы его могли распознавать другие системы.
OpenAI не единственная компания, которая движется в этом направлении. Anthropic уже заявила о глобальной маркировке текстов, созданных Claude. Кроме того, OpenAI, Anthropic, Google, Meta и Microsoft присоединились к европейскому кодексу практик по обеспечению прозрачности AI-контента.
При этом подход OpenAI показывает главную сложность текстовых водяных знаков: определить происхождение длинного и практически неизмененного AI-текста относительно легко, но чем сильнее человек редактирует материал, чем он короче или чем больше в нем специфической структуры вроде математических формул, тем менее надежным становится распознавание.
Поэтому новая система OpenAI скорее станет инструментом подтверждения происхождения некоторых текстов, чем универсальным способом определить, писал ли материал человек или искусственный интеллект.






