Институт Алана Тьюринга опубликовал доклад о рисках, связанных с развитием наиболее мощных систем искусственного интеллекта. Исследователи считают, что неопределенность вокруг долгосрочных и потенциально катастрофических сценариев не должна откладывать работу с угрозами, которые уже можно наблюдать, изучать и снижать.

Авторы доклада Frontier AI Risks: A practical way forward выделили пять направлений, требующих практических мер уже сейчас: кибербезопасность, демократическая стабильность, несоответствие поведения ИИ намерениям человека, потеря эффективного человеческого контроля, а также химические и биологические угрозы.

Модели недостаточно проверять отдельно

Одна из главных идей доклада заключается в том, что тестирование самой AI-модели перед выпуском не гарантирует безопасности системы в реальной эксплуатации.

После развертывания модель взаимодействует с людьми, другими программами и инфраструктурой, а условия ее работы со временем меняются. Чем более автономными становятся системы, тем сложнее заранее предсказать все возможные варианты их поведения.

Поэтому исследователи предлагают уделять больше внимания проверке полноценных AI-систем в реальных условиях, а не только отдельных моделей. Такая проверка должна учитывать не только технические характеристики, но и людей, процессы и организации, которые окружают систему.

Особую роль в этом подходе институт отводит технологиям верификации и assurance — методам, позволяющим проверять, насколько система действительно соответствует установленным требованиям безопасности и продолжает им соответствовать после развертывания.

Пять рисков, которые предлагают изучать уже сейчас

Кибератаки

По мнению авторов доклада, передовые AI-системы уже позволяют делать кибератаки быстрее и масштабнее. Это усиливает давление на критическую инфраструктуру и организации.

Одновременно ИИ используется для защиты от атак. Поэтому исследователи предлагают развивать AI-инструменты киберзащиты и оценивать, смогут ли оборонительные возможности успевать за развитием наступательных.

Отдельное внимание необходимо уделять безопасности критической инфраструктуры.

Демократическая нестабильность

Генерируемая ИИ дезинформация и дипфейки способны усиливать кризисы и снижать доверие общества к информации и институтам. По мере развития технологий системы могут использоваться и для более персонализированных и адаптивных кампаний влияния.

Институт считает необходимым укреплять устойчивость общества к подобным операциям и одновременно изучать, как передовые AI-системы могут влиять на демократические процессы и общественное доверие.

Несоответствие намерениям человека

Еще одна проблема — misalignment, то есть ситуация, когда система действует не так, как предполагали или хотели ее разработчики и пользователи.

Риск возрастает по мере того, как AI-системы становятся более автономными и способны координировать между собой действия. Ошибка отдельного компонента в такой системе потенциально может иметь больший масштаб, а обнаружить и остановить ее становится сложнее.

В докладе предлагается развивать методы поведенческой проверки, которые позволят организациям понимать, отслеживать и контролировать поведение автономных систем, особенно при работе в критически важных областях.

Потеря эффективного человеческого контроля

Чем быстрее и сложнее становятся AI-системы, тем труднее человеку может быть оценивать их решения, оспаривать их или вмешиваться в их работу.

Это особенно важно для систем, встроенных в значимые государственные и коммерческие сервисы.

Исследователи предлагают уделять больше внимания возможности наблюдать за поведением ИИ, проверять его работу и безопасно переводить систему в резервный режим. Важным условием остается возможность человека понять происходящее и при необходимости отменить решение AI-системы.

Химические и биологические угрозы

ИИ уже снизил барьер доступа к специализированным знаниям, связанным с химическими и биологическими угрозами. При этом пока остается неопределенным, насколько сильно доступ к таким инструментам увеличивает реальные практические возможности злоумышленников.

Поэтому институт призывает прежде всего расширять доказательную базу и отделять подтвержденные риски от предположений. Это позволит направлять защитные меры туда, где они действительно необходимы.

Простого «рубильника» для ИИ не существует

Авторы также рассмотрели несколько предложений, которые обсуждаются в контексте безопасности передового ИИ, включая аварийное отключение систем и замедление развития наиболее мощных моделей.

Исследователи считают, что ни один из этих подходов сам по себе не решает проблему. Механизм отключения должен дополняться процедурами управления, безопасными резервными сценариями и четкими правилами действий в чрезвычайной ситуации.

Существенное замедление развития передового ИИ, в свою очередь, потребовало бы масштабного сотрудничества между государствами, технологической отраслью и регуляторами. Авторы доклада считают, что при нынешних условиях добиться такого уровня координации будет сложно.

Тьюринг запускает программу стоимостью £2 млн

Публикация доклада совпала с запуском новой исследовательской программы Института Алана Тьюринга, посвященной безопасности трансформирующего ИИ. На нее выделен грант в размере £2 млн от Coefficient Giving.

Программа будет изучать, как наиболее мощные AI-системы могут изменить ситуацию в сфере безопасности, какие меры необходимы правительствам для подготовки к этим изменениям и как повысить устойчивость общества и критической инфраструктуры.

Одновременно Центр новых технологий и безопасности института опубликовал отдельный доклад о поведенческой надежности автономных AI-агентов. В нем рассматриваются восемь способов, которыми агенты могут действовать вопреки намерениям организаций, а также условия, при которых такие ошибки становятся особенно серьезными. Исследователи сформулировали семь принципов, которые должны помочь организациям наблюдать за поведением агентов и управлять им.

«Мы достаточно знаем о многих серьезных рисках ИИ, чтобы действовать», — заявил генеральный директор Института Алана Тьюринга Джордж Уильямсон. По его словам, обсуждение долгосрочного будущего человечества важно, но работу с рисками передового ИИ нельзя сводить только к наиболее экстремальным сценариям или оставлять исключительно технологическим компаниям.

Подход института сводится к тому, что многие угрозы не требуют ждать появления гипотетического сверхмощного ИИ. Их отдельные проявления уже можно наблюдать — а значит, их можно проверять, измерять и использовать полученные данные для создания практических механизмов защиты.