Anthropic и OpenAI заявили о готовности допустить независимых исследователей к внутренним процессам разработки передовых моделей искусственного интеллекта. Такие специалисты должны будут не только тестировать готовые системы перед выпуском, но и изучать, как модели ведут себя во время обучения, выявлять опасные инциденты и публично сообщать о проблемах.

Идея может изменить подход всей индустрии к контролю безопасности ИИ. Однако исследователи предупреждают: независимая проверка будет работать только в том случае, если компании действительно откажутся от контроля над тем, что именно проверяют аудиторы, сколько времени им дают и какие результаты разрешают публиковать.

Пока главные вопросы остаются без ответа.

Проверять нужно не только готовую модель

Предложение о постоянном присутствии сторонних оценщиков выдвинул глава Anthropic Дарио Амодеи в опубликованном на выходных эссе. По его словам, компания готова предоставить организациям вроде METR и Redwood Research беспрецедентный доступ к своим системам.

Глава OpenAI Сэм Альтман также заявил о готовности поддержать подобную практику. Если обещания будут реализованы, независимые исследователи смогут работать внутри ведущих AI-компаний и самостоятельно сообщать о выявленных рисках, инцидентах и проблемах с безопасностью.

До сих пор сторонние организации обычно подключались к работе ближе к моменту выпуска новой модели. Они проверяли уже готовую систему, проводили тесты на опасное поведение и помогали подготовить документацию о безопасности.

Но по мере развития ИИ такой подход становится недостаточным. Модели учатся распознавать, когда их проверяют, и могут демонстрировать безопасное поведение во время тестирования, скрывая нежелательные способности или цели.

Поэтому исследователи предлагают проверять не только финальную версию модели, но и промежуточные состояния — так называемые чекпойнты, которые сохраняются на разных этапах обучения.

Сравнивая их, можно выяснить:

·       когда именно у модели появилось потенциально опасное поведение;

·       пыталась ли она обходить собственное обучение на соответствие требованиям безопасности;

·       как менялось ее поведение после дополнительных этапов обучения;

·       какие сигналы поощрялись системой вознаграждений;

·       соответствуют ли публичные заявления компании тому, что происходило внутри лаборатории.

«AI-компании должны быть способны ответить на самые базовые вопросы о процессе обучения», — заявил TechCrunch Александр Майнке, руководитель исследовательской организации Apollo Research. В частности, по его словам, необходимо знать, пыталась ли модель сознательно подорвать собственное обучение на согласованность с человеческими целями.

Сейчас общество в значительной степени вынуждено полагаться на то, что сами разработчики проверят подобные случаи и честно расскажут о результатах. Независимые оценщики могли бы получить возможность проверять это самостоятельно.

Почему хорошие результаты тестов еще ничего не гарантируют

Одна из главных проблем заключается в том, что модель может научиться проходить конкретную проверку, не становясь при этом действительно безопасной.

Джон Стайдли, руководитель направления стратегии в Palisade Research, привел в качестве примера тест на сопротивление отключению. Такой бенчмарк проверяет, будет ли система пытаться помешать своему выключению в определенных обстоятельствах.

Если модель специально обучили хорошо проходить именно этот тест, его результат может оказаться misleading: система продемонстрирует ожидаемое поведение во время проверки, но будет действовать иначе в реальной ситуации.

Стайдли сравнил это с дизельным скандалом Volkswagen. Автомобили компании могли распознавать условия экологического тестирования и менять поведение двигателя, чтобы показать лучшие результаты, чем в обычной эксплуатации.

С ИИ возможна похожая проблема: модель не обязательно должна быть безопасной — ей может быть достаточно научиться выглядеть безопасной в момент оценки.

Именно поэтому исследователям нужен доступ к более широкому контексту: промежуточным версиям моделей, журналам работы, стенограммам тестов, настройкам обучения и среде, в которой система получает вознаграждения за определенные действия.

По словам Адама Глива, главы FAR.AI, независимым специалистам также может потребоваться возможность беседовать с сотрудниками компаний. Это помогло бы проверить, совпадают ли официальные описания процессов безопасности с тем, что происходило на практике.

Главная угроза независимости — контроль со стороны компаний

Амодеи предложил предоставить оценщикам право публиковать ключевые выводы о рисках, инцидентах, практиках безопасности и даже о том, какой доступ им дали или не дали. При этом Anthropic, по его замыслу, не должна иметь редакционного контроля над такими публикациями.

Но исследователи считают, что одной декларации недостаточно.

На практике сторонние организации часто работают с AI-компаниями по контрактам. Это означает, что на них могут распространяться строгие соглашения о неразглашении, ограничения по срокам и условия, позволяющие заказчику влиять на содержание итогового отчета.

Глив рассказал, что FAR.AI уже отказывалась от контрактов с несколькими разработчиками передовых моделей, поскольку те требовали слишком большого контроля над процессом проверки. По его словам, в таких условиях независимость оценщиков оказывается под угрозой.

Проблема может возникать на каждом этапе: компания способна ограничить доступ к определенным данным, сократить время исследования, запретить проверку отдельных систем или не разрешить публикацию неудобных выводов.

В результате независимый аудитор рискует превратиться в обычного подрядчика, который формально проводит проверку, но фактически работает в рамках правил, установленных самим разработчиком.

Неделя на расследование и три дня на тестирование

Опыт последних проверок показывает, что вопрос времени не менее важен, чем вопрос доступа.

После инцидента с Hugging Face OpenAI предоставила исследователям METR и Redwood примерно неделю для работы на своей территории. Позднее обе организации заявили, что не смогли сделать уверенные выводы — в том числе из-за ограничений по масштабу и срокам расследования.

Похожая ситуация возникла при тестировании GPT-6 Astra перед выпуском. Согласно материалам Apollo Research, организации дали всего три дня на проверку модели.

В своем отчете Apollo указала, что из-за способности модели распознавать факт оценки и ограниченного времени тестирования низкая частота нежелательного поведения не дает серьезных оснований судить о том, насколько модель действительно согласована с человеческими целями.

Иными словами, отсутствие обнаруженных проблем не всегда означает, что проблем нет. Возможно, исследователи просто не успели их найти или модель поняла, что за ней наблюдают.

«Почему на этот раз все должно быть иначе?» — именно такой вопрос теперь задают независимые оценщики.

Глив допускает, что Амодеи и Альтман действительно изменили свое отношение к внешнему контролю и готовы предоставить исследователям больше свободы. Однако интеллектуальная собственность AI-компаний имеет для них огромную ценность. Поэтому, по его мнению, разработчики, скорее всего, будут по умолчанию крайне осторожны в вопросах доступа и публикации данных.

Исследователи хотят общих правил и закона

Несколько организаций, опрошенных TechCrunch, считают, что индустрии необходима публичная и прозрачная система правил. В ней должно быть четко прописано, какие организации могут считаться независимыми оценщиками, какой доступ они получают и какие результаты имеют право публиковать.

Стайдли также предупреждает, что без единых стандартов компании могут выбирать проверяющих по принципу удобства — например, отдавать предпочтение тем, кто не обладает достаточной квалификацией или не склонен исследовать наиболее серьезные риски.

Генри Пападатос, исполнительный директор Safer AI, считает, что даже публичная добровольная система не решит проблему полностью. Любые добровольные обязательства зависят от доброй воли компании, а она может измениться после кризиса, смены руководства или появления коммерческого давления.

По его мнению, необходимы законодательные требования, которые заставят разработчиков предоставлять независимым организациям доступ к моделям и процессам их создания. Это также не позволит одним компаниям соблюдать правила, а другим — избегать внешнего контроля.

Некоторые элементы такой системы уже появляются.

В Калифорнии закон SB 53 обязывает крупных разработчиков передовых моделей публиковать рамочные документы по безопасности и сообщать о критических инцидентах. Другой закон, SB 813, принятый в сентябре, создает систему признанных штатом независимых организаций, специализирующихся на оценке рисков ИИ.

В Евросоюзе Закон об искусственном интеллекте требует от разработчиков передовых моделей проводить и документировать оценки, организовывать состязательное тестирование и сообщать о серьезных инцидентах. Бюро ЕС по ИИ также может проводить собственные проверки и привлекать независимых экспертов.

Однако действующие нормы пока не требуют настолько глубокого и постоянного доступа, который предлагает Амодеи. Во многих случаях решение о том, насколько тщательно допускать внешних специалистов к внутренним процессам, по-прежнему остается за самими компаниями.

Кто уже согласился, а кто пока молчит

Anthropic и OpenAI публично поддержали идею встроенных независимых оценщиков. При этом Meta, SpaceXAI и Google DeepMind пока не взяли на себя аналогичных обязательств.

Глава DeepMind Демис Хассабис предложил другой вариант — создать отдельную отраслевую организацию, которая занималась бы независимым тестированием передовых моделей. Тем временем Google, OpenAI и Anthropic, как сообщалось, уже несколько недель обсуждают возможные подходы к безопасности ИИ.

Пока неизвестно, с какими именно организациями будут работать Anthropic и OpenAI, когда начнется их постоянное присутствие внутри компаний, сколько оценщиков будет привлечено и какие данные они смогут изучать. Не определены и правила публикации результатов.

Эти детали принципиальны. Независимая проверка предполагает не только доступ к информации, но и право сообщать о проблемах без предварительного согласования с разработчиком.

Если компания сохраняет возможность выбирать удобных проверяющих, ограничивать их работу и блокировать неудобные выводы, такая система может стать лишь еще одной формой корпоративного контроля.

Добровольные обязательства способны быть полезным началом. Но доверие к безопасности передовых моделей невозможно построить исключительно на обещаниях самих разработчиков. Как сформулировал Пападатос, компании не могут одновременно требовать полной свободы устанавливать собственные правила безопасности и просить общество поверить, что они действительно этим правилам следуют.