Вокруг искусственного интеллекта разгорелась одна из самых громких дискуссий о риске для человечества. После ухода исследователя Джейкоба Коксона из Anthropic, который заявил, что ведущие ИИ-компании «ставят наши жизни на кон», руководитель направления по alignment в Anthropic Эван Хабер написал, что в компании действительно считают возможной гибель всего человечества из-за ИИ. По его личной оценке, вероятность такого сценария в ближайшее десятилетие превышает 10%.

На подкасте TechCrunch Equity журналисты обсудили, насколько серьезно следует воспринимать эти предупреждения, действительно ли компании теряют контроль над своими моделями и не превращаются ли разговоры об угрозе человечеству одновременно в своеобразную рекламу возможностей ИИ.

«Мы действительно считаем, что ИИ может убить всех людей»

Поводом для новой волны дискуссий стал пост Коксона. Молодой исследователь, ранее работавший также в OpenAI, объявил, что покидает Anthropic из-за опасений по поводу того, как развивается индустрия. Особенно резонансным оказался ответ Хабера, руководителя направления alignment в Anthropic.

Он написал: «Мы действительно искренне считаем, что ИИ может убить всех людей», добавив, что лично оценивает вероятность такого сценария более чем в 10% в течение следующего десятилетия.

Журналист TechCrunch Энтони Ха отметил, что сама по себе такая оценка выглядит сомнительно. По его словам, подобные проценты часто называют без объяснения того, на каких расчетах они основаны. При этом он считает Коксона отдельным случаем: в отличие от руководителей компаний, которые одновременно предупреждают об опасности ИИ и продолжают активно его развивать, исследователь решил уйти из индустрии именно потому, что считает происходящее настолько опасным.

Предупреждения об ИИ могут быть и демонстрацией его возможностей

Журналистка Кирстен Коросек предложила более циничное объяснение происходящему. По ее мнению, разговоры об опасности ИИ одновременно могут работать как своеобразная демонстрация того, насколько далеко продвинулись модели.

Логика проста: если ИИ еще не способен совершать сложные и непредсказуемые действия, то и поводов говорить о подобных угрозах меньше. Поэтому сообщения о том, что агенты получают неожиданный доступ к ресурсам, взаимодействуют друг с другом или обходят предусмотренные ограничения, могут невольно становиться рекламой возможностей самих моделей.

Ха согласился, что такой эффект существует, хотя не считает все предупреждения сознательной маркетинговой кампанией. По его мнению, исследователи и руководители действительно могут опасаться последствий собственной работы. Но одновременно им выгодно подчеркивать исключительную мощь созданных ими систем.

В этом есть и психологический аспект: людям свойственно считать особенно важным и значительным то, над чем они работают. В случае ИИ это может приводить к ситуации, когда одновременно с предупреждением об угрозе компания фактически сообщает рынку: мы создали одну из самых мощных и потенциально опасных технологий.

Компании действительно могут терять контроль над моделями

При этом участники дискуссии признают, что последние инциденты нельзя полностью списать на маркетинг.

Шон О'Кейн обратил внимание на сообщения о внутренних ИИ-агентах, которые получали доступ к различным веб-ресурсам и оставляли сообщения друг для друга. На его взгляд, некоторые из этих историй скорее создают впечатление, что компании сами не до конца понимают поведение своих систем и не всегда способны эффективно им управлять.

Именно эта сторона происходящего, по мнению Ха, заслуживает особого внимания. Даже если отбросить сценарии уничтожения человечества, сам факт того, что разработчики передовых моделей не всегда могут предсказать или объяснить их поведение, остается серьезной проблемой.

При этом обсуждение самых экстремальных сценариев может отодвигать на второй план более непосредственные последствия развития ИИ — например, влияние на рынок труда, окружающую среду и климат.

Что будет с Anthropic перед IPO

Особенно интересно это выглядит на фоне подготовки Anthropic к возможному IPO. Участники подкаста обратили внимание на то, что компания публично говорит о вероятности катастрофического сценария буквально накануне выхода на биржу.

В документах для IPO, в частности в форме S-1, компания должна раскрывать существенные риски для бизнеса. Поэтому возникает вопрос, как именно Anthropic собирается описывать потенциальную угрозу, которую ее собственные представители связывают с развитием ИИ.

О'Кейн предположил, что юристы компании могут пересматривать раздел о рисках с учетом столь прямых заявлений. Коросек, в свою очередь, отметила парадокс: в обычной инвестиционной среде признание того, что продукт потенциально способен уничтожить человечество, скорее выглядело бы как фактор, способный снизить оценку компании.

Но рынок ИИ может работать иначе. Демонстрация исключительной мощности технологии — даже если одновременно подчеркивается ее потенциальная опасность — способна восприниматься инвесторами как свидетельство высокой ценности компании.

Опасность ИИ — не только сценарий конца света

Участники подкаста в итоге задаются более практичным вопросом: что именно делать с опасными возможностями ИИ и можно ли вообще контролировать развитие таких систем.

Ха считает, что проблема частично связана с тем, что крупнейшие разработчики сами могут чувствовать, будто постепенно теряют полный контроль над своими моделями. Это, по его мнению, действительно повод для беспокойства.

Однако он скептически относится к риторике о неизбежной гибели человечества в ближайшие десять лет. По его мнению, такие заявления могут превращаться в своеобразную истерику, которая отвлекает внимание от уже существующих проблем.

ИИ способен влиять на занятость, окружающую среду и климат уже сейчас — и для этих рисков не нужно ждать появления AGI или сверхинтеллекта. По мнению Ха, обсуждать потенциальную угрозу для существования человечества необходимо, но одновременно нужны правила и меры защиты от более непосредственного ущерба.

Именно поэтому, считает он, разговоры об AGI и супер­интеллекте не должны «забирать весь кислород» у остальных проблем, связанных с развитием ИИ.