Институт Алана Тьюринга опубликовал доклад о рисках, связанных с развитием наиболее мощных систем искусственного интеллекта. Исследователи считают, что неопределенность вокруг долгосрочных и потенциально катастрофических сценариев не должна откладывать работу с угрозами, которые уже можно наблюдать, изучать и снижать.
Авторы доклада Frontier AI Risks: A practical way forward выделили пять направлений, требующих практических мер уже сейчас: кибербезопасность, демократическая стабильность, несоответствие поведения ИИ намерениям человека, потеря эффективного человеческого контроля, а также химические и биологические угрозы.
Модели недостаточно проверять отдельно
Одна из главных идей доклада заключается в том, что тестирование самой AI-модели перед выпуском не гарантирует безопасности системы в реальной эксплуатации.
После развертывания модель взаимодействует с людьми, другими программами и инфраструктурой, а условия ее работы со временем меняются. Чем более автономными становятся системы, тем сложнее заранее предсказать все возможные варианты их поведения.
Поэтому исследователи предлагают уделять больше внимания проверке полноценных AI-систем в реальных условиях, а не только отдельных моделей. Такая проверка должна учитывать не только технические характеристики, но и людей, процессы и организации, которые окружают систему.
Особую роль в этом подходе институт отводит технологиям верификации и assurance — методам, позволяющим проверять, насколько система действительно соответствует установленным требованиям безопасности и продолжает им соответствовать после развертывания.
Пять рисков, которые предлагают изучать уже сейчас
Кибератаки
По мнению авторов доклада, передовые AI-системы уже позволяют делать кибератаки быстрее и масштабнее. Это усиливает давление на критическую инфраструктуру и организации.
Одновременно ИИ используется для защиты от атак. Поэтому исследователи предлагают развивать AI-инструменты киберзащиты и оценивать, смогут ли оборонительные возможности успевать за развитием наступательных.
Отдельное внимание необходимо уделять безопасности критической инфраструктуры.
Демократическая нестабильность
Генерируемая ИИ дезинформация и дипфейки способны усиливать кризисы и снижать доверие общества к информации и институтам. По мере развития технологий системы могут использоваться и для более персонализированных и адаптивных кампаний влияния.
Институт считает необходимым укреплять устойчивость общества к подобным операциям и одновременно изучать, как передовые AI-системы могут влиять на демократические процессы и общественное доверие.
Несоответствие намерениям человека
Еще одна проблема — misalignment, то есть ситуация, когда система действует не так, как предполагали или хотели ее разработчики и пользователи.
Риск возрастает по мере того, как AI-системы становятся более автономными и способны координировать между собой действия. Ошибка отдельного компонента в такой системе потенциально может иметь больший масштаб, а обнаружить и остановить ее становится сложнее.
В докладе предлагается развивать методы поведенческой проверки, которые позволят организациям понимать, отслеживать и контролировать поведение автономных систем, особенно при работе в критически важных областях.
Потеря эффективного человеческого контроля
Чем быстрее и сложнее становятся AI-системы, тем труднее человеку может быть оценивать их решения, оспаривать их или вмешиваться в их работу.
Это особенно важно для систем, встроенных в значимые государственные и коммерческие сервисы.
Исследователи предлагают уделять больше внимания возможности наблюдать за поведением ИИ, проверять его работу и безопасно переводить систему в резервный режим. Важным условием остается возможность человека понять происходящее и при необходимости отменить решение AI-системы.
Химические и биологические угрозы
ИИ уже снизил барьер доступа к специализированным знаниям, связанным с химическими и биологическими угрозами. При этом пока остается неопределенным, насколько сильно доступ к таким инструментам увеличивает реальные практические возможности злоумышленников.
Поэтому институт призывает прежде всего расширять доказательную базу и отделять подтвержденные риски от предположений. Это позволит направлять защитные меры туда, где они действительно необходимы.
Простого «рубильника» для ИИ не существует
Авторы также рассмотрели несколько предложений, которые обсуждаются в контексте безопасности передового ИИ, включая аварийное отключение систем и замедление развития наиболее мощных моделей.
Исследователи считают, что ни один из этих подходов сам по себе не решает проблему. Механизм отключения должен дополняться процедурами управления, безопасными резервными сценариями и четкими правилами действий в чрезвычайной ситуации.
Существенное замедление развития передового ИИ, в свою очередь, потребовало бы масштабного сотрудничества между государствами, технологической отраслью и регуляторами. Авторы доклада считают, что при нынешних условиях добиться такого уровня координации будет сложно.
Тьюринг запускает программу стоимостью £2 млн
Публикация доклада совпала с запуском новой исследовательской программы Института Алана Тьюринга, посвященной безопасности трансформирующего ИИ. На нее выделен грант в размере £2 млн от Coefficient Giving.
Программа будет изучать, как наиболее мощные AI-системы могут изменить ситуацию в сфере безопасности, какие меры необходимы правительствам для подготовки к этим изменениям и как повысить устойчивость общества и критической инфраструктуры.
Одновременно Центр новых технологий и безопасности института опубликовал отдельный доклад о поведенческой надежности автономных AI-агентов. В нем рассматриваются восемь способов, которыми агенты могут действовать вопреки намерениям организаций, а также условия, при которых такие ошибки становятся особенно серьезными. Исследователи сформулировали семь принципов, которые должны помочь организациям наблюдать за поведением агентов и управлять им.
«Мы достаточно знаем о многих серьезных рисках ИИ, чтобы действовать», — заявил генеральный директор Института Алана Тьюринга Джордж Уильямсон. По его словам, обсуждение долгосрочного будущего человечества важно, но работу с рисками передового ИИ нельзя сводить только к наиболее экстремальным сценариям или оставлять исключительно технологическим компаниям.
Подход института сводится к тому, что многие угрозы не требуют ждать появления гипотетического сверхмощного ИИ. Их отдельные проявления уже можно наблюдать — а значит, их можно проверять, измерять и использовать полученные данные для создания практических механизмов защиты.






