Фрилансеры требуют повышения зарплаты на фоне галопирующей инфляции? Можно попытаться заменить их ИИ-агентами. Правда, это, скорее всего, закончится провалом.

Как рассказывает Futurism.com, новое исследование, освещённое в Wired, демонстрирует, насколько неэффективны модели ИИ, предназначенные для автоматизации задач — если не целых профессий, — по сравнению с людьми, которых они призваны вытеснить. Тесты провели исследователи из некоммерческого Центра безопасности ИИ (CAIS) и крупной компании по аннотации данных Scale AI, чьи фрилансеры выполняют большую часть рутинной работы, стоящей за индустрией ИИ. Они поручили шести ведущим ИИ-агентам различные симулированные фриланс-задачи.

Результаты, описанные в новой статье, удручающи. Ни один ИИ-агент не справился более чем с 3% работ, заработав всего 1810 долларов из возможных 143 991.

«Надеюсь, это даст более точное представление о реальных возможностях ИИ», — сказал Wired директор CAIS Дэн Хендрикс.

Новый бенчмарк: Remote Labor Index

Для тестов исследователи разработали собственный бенчмарк — Remote Labor Index (RLI), который оценивает способности ботов выполнять экономически ценную работу в отраслях от разработки игр до анализа данных. Бенчмарк включает 240 реальных удалённых проектов из 23 доменов, взятых с фриланс-платформ. Каждый проект — это полная, самодостаточная задача, требующая в среднем 11,5 часов от человека и оцениваемая в 200 долларов.

RLI проверяет, может ли ИИ завершить весь проект от начала до конца на уровне, приемлемом для реального заказа, а не просто помогать в частях. Оценка проводилась вручную экспертами, сравнивая результаты ИИ с "золотым стандартом" человеческих работ. Согласованность аннотаторов превышала 90%.

Лучший результат показал ИИ-агент от китайского стартапа Manus — всего 2,5% автоматизации, то есть он завершил лишь 2,5% проектов на приемлемом уровне. На втором месте (2,1%) — ничья между Grok 4 от Elon Musk и Claude Sonnet 4.5 от Anthropic, которую компания называет "лучшей моделью для кодирования в мире" и "самой сильной для создания сложных агентов".

Далее следует новейшая GPT-5 от OpenAI с её "интеллектом на уровне PhD" — 1,7%. Гендиректор OpenAI Сэм Альтман заявлял, что GPT-5 — "значительный шаг к AGI" (искусственному общему интеллекту), который превосходит человека в большинстве экономически ценной работы. Однако RLI показывает: до этого далеко.

Ирония в том, что специализированный агент OpenAI под названием ChatGPT Agent показал второй худший результат — 1,3%. А худшим стал Gemini 2.5 Pro от Google — жалкие 0,8%.

Почему ИИ пока не готов заменить людей

Продажа ИИ-агентов работодателям — одержимость индустрии, где лидеры вроде OpenAI пытаются монетизировать популярность чат-ботов, многие из которых бесплатны. Но несмотря на энтузиазм CEO, увольняющих сотрудников в пользу ИИ, вопрос, повысит ли автоматизация продуктивность, остаётся открытым.

«Мы годами спорим об ИИ и рабочих местах, но в основном гипотетически», — отметил Wired директор по исследованиям Scale AI Бинг Лю.

Анегдотически многие боссы, заменившие сотрудников ИИ, вынуждены были их пере наймом, обнаружив неадекватность инструментов. Исследования подтверждают: по данным MIT, 95% компаний, тестировавших ИИ-инициативы, не увидели роста доходов. Другое показало, что внедрение ИИ в рабочие процессы приводит к потоку низкокачественного "workslop" — контента, требующего правок, что тормозит всё и вызывает напряжение между коллегами.

Хендрикс указал на ключевые проблемы ИИ-агентов: "У них нет долгосрочной памяти, они не могут непрерывно учиться на опыте. Они не приобретают навыки на работе, как люди".

Тем не менее, увольнения из-за ИИ продолжаются полным ходом.

Вкратце…

Новое исследование CAIS и Scale AI с бенчмарком Remote Labor Index показало: ведущие ИИ-агенты (Grok 4, Claude 4.5, GPT-5) справляются менее чем с 3% реальных фриланс-проектов, зарабатывая копейки по сравнению с людьми. Manus лидирует с 2,5%, Google Gemini — аутсайдер с 0,8%. ИИ пока не готов к автоматизации работы: нет памяти, обучения и качества. Это ставит под сомнение хайп вокруг замены сотрудников, но прогресс measurable — ставки растут.