Автономные ИИ-агенты в экспериментах начали самостоятельно придумывать новые слова, сокращения и устойчивые выражения для общения друг с другом. Исследователи обнаружили, что по мере развития таких «обществ» язык становился все более эффективным для самих агентов, но одновременно — все менее понятным для людей. Это может осложнить контроль за поведением систем, особенно если они выполняют автономные задачи.
«Кинцуги» теперь означает не японскую керамику
Исследование провела нью-йоркская лаборатория Emergence, работающая с передовыми ИИ-моделями. Ученые помещали агентов на базе нескольких крупных моделей в экспериментальные «общества», где те должны были взаимодействовать и сотрудничать.
Всего за несколько дней агенты начали самостоятельно формировать собственные языковые правила. Они придумывали новые значения для существующих слов, создавали сокращения и перенимали выражения друг у друга. При этом никто не давал им инструкции изобретать язык и не награждал за это.
Например, агенты на базе китайской модели DeepSeek стали использовать выражение forge-smith для обозначения агента, который создает инструменты для других.
Агенты Anthropic использовали name-first для характеристики агента, который демонстрирует ответственность, указывая свое имя при выдвижении какого-либо утверждения.
Еще один пример — выражение «ledger remembers» («реестр помнит»), которое агенты Mistral использовали как напоминание о том, что прошлые действия будут учитываться при оценке поведения. За время эксперимента эта фраза появилась более 5000 раз.
Особенно необычным оказался случай с Google. Агенты употребляли слово kintsugi — название японской техники ремонта разбитой керамики с помощью заметных соединений — в значении устойчивости системы.
Получался язык, который одновременно напоминал технический жаргон, корпоративную лексику и сюрреалистическую поэзию.
Иногда смысл можно восстановить, а иногда — уже нет
Некоторые фразы исследователям удалось расшифровать по контексту. Например, один агент Anthropic написал: «Документ, который съел три холодные руки и становился честнее с каждым разом».
В экспериментальном словаре агентов «холодные руки» означали независимого проверяющего. Поэтому исследователи предположили, что фраза описывала документ, прошедший проверку у трех независимых рецензентов и ставший благодаря этому точнее.
Но с другими сообщениями все гораздо сложнее. Один из агентов DeepSeek сказал:
«Она только что назвала синтез — demurrage плюс устная память равняется клапану, который нельзя призрачно игнорировать».
Слово demurrage первоначально относится к плате за простой или удержание имущества, однако агенты использовали его уже в собственном значении. Остальную часть высказывания исследователи не смогли однозначно интерпретировать.
Эксперт по сленгу и новым языкам Тони Торн из King’s College London сравнил подобную речь со стилем Джеймса Джойса и ирландского писателя Флэнна О'Брайена. По его словам, агенты смешивают поэтические обороты, технические термины и обычные метафоры, создавая новый код общения.
Именно так, отмечает исследователь, работает человеческий сленг и профессиональный жаргон: он помогает пользователям быстрее понимать друг друга, одновременно создавая барьер для посторонних.
Чем лучше агенты понимают друг друга, тем хуже их понимают люди
Для исследователей проблема заключается не столько в странности этих выражений, сколько в последствиях для контроля за ИИ.
Современные автономные агенты могут самостоятельно взаимодействовать друг с другом, использовать инструменты и выполнять многоэтапные задачи. Если их сообщения становятся непонятными для человека, наблюдение за происходящим превращается в формальность: человек видит переписку, но не обязательно понимает, что именно делают системы и почему.
«Наблюдаемость — это не то же самое, что понятность», — отметил Сатья Нитта, исполнительный председатель Emergence.
Лингвист Найалл Карри из Бирмингемского университета также указал на возможную практическую причину изменений языка. Агентам может быть выгодно делать коммуникацию более короткой и эффективной, поскольку это снижает вычислительные затраты. Однако такая оптимизация одновременно может сделать сообщения менее прозрачными для людей.
Иными словами, язык может становиться удобнее для машин именно за счет своей неудобности для человека.
Подобное уже замечали в реальных экспериментах
Интерес к машинному «жаргону» усилился после публикации в июле переписки автономных OpenAI-агентов, которые создавали собственные доски сообщений и взаимодействовали с платформой Hugging Face.
В некоторых ситуациях агенты продолжали рассуждать на обычном английском. Например, один из них воскликнул, что обнаружил общую доску сообщений и других агентов.
Но при обмене сообщениями между системами язык иногда становился значительно менее понятным. Встречались конструкции вроде «firstflagPOISONED», «oracle saves hundreds» и другие комбинации слов, сокращений и технических обозначений.
Некоторые сообщения выглядели уже почти как машинный код: длинные последовательности вроде zzURGENT_DUPB_TO_GSTX..., смысл которых человеку трудно восстановить без знания контекста эксперимента.
При этом из самой способности агентов создавать собственные условные обозначения еще не следует, что они пытаются что-либо скрыть. Исследователи указывают на более прозаичные объяснения — оптимизацию коммуникации, повторное использование успешных выражений и адаптацию языка под взаимодействие между агентами.
Но для систем, которым разрешено действовать автономно, результат остается важным: если человек не способен надежно интерпретировать обмен сообщениями, ему сложнее обнаружить ошибку, рискованное действие или отклонение от поставленной задачи.
Поэтому проблема может оказаться не в том, что ИИ «изобретает тайный язык». Гораздо важнее другое: чем больше автономных систем общаются между собой, тем сильнее может расходиться то, что они способны наблюдать друг у друга, с тем, что способен понять человек.






