Какая главная слабость свойственна современным ИИ-моделям?

15 июня, 2026  15:01

Международная группа исследователей провела эксперимент, который выявил серьёзную и ранее малоизученную проблему ведущих языковых моделей. Оказывается, при увеличении длины задачи, требующей устойчивого внимания, точность ИИ резко падает — вплоть до практически полного отказа от выполнения инструкции.

Результаты исследования опубликованы в журнале PNAS Nexus.

Классический тест в новых условиях

Для проверки учёные использовали знаменитый тест Струпа — психологический эксперимент, разработанный ещё в 1935 году. Испытуемому показывают слова, обозначающие цвета («красный», «синий», «зелёный»), но написанные цветом, не совпадающим со смыслом слова. Задача — назвать цвет чернил, игнорируя само слово.

Люди справляются с этим относительно стабильно даже на длинных списках, хотя и испытывают когнитивный конфликт. Мозг успешно подавляет автоматическую реакцию чтения.

Исследователи под руководством Сукету Пателя адаптировали тест для ИИ и проверили на нём несколько ведущих моделей:

GPT-4o Claude 3.5 Sonnet GPT-5 Claude Opus 4.1 Gemini 2.5

Шокирующие результаты

При коротких списках (5 слов) все модели показывали высокую точность. Однако с ростом длины задания результаты ухудшались драматически:

GPT-4o: при 5 словах — 91% правильных ответов, при 10 словах — 57%, при 40 словах — всего 15%. Claude 3.5 Sonnet: уверенно работал до 20 слов, после чего точность рухнула до 24%.

Модели постепенно «забывали» исходную инструкцию и начинали просто читать написанное слово, то есть возвращались к самому сильному паттерну, на котором были обучены.

Принципиальное отличие от человека

В отличие от людей, которые способны долгое время поддерживать произвольное внимание и подавлять автоматические реакции, современные ИИ демонстрируют крайне низкую устойчивость к длительным когнитивным нагрузкам. По сути, чем длиннее задача, тем сильнее проявляется этот фундаментальный недостаток.

Вкратце

Учёные обнаружили серьёзную слабость современных языковых моделей: при увеличении длины задачи, требующей концентрации внимания, их точность резко падает. Тест Струпа показал, что GPT-4o и Claude 3.5 Sonnet уже при умеренной длине списка практически перестают следовать инструкции. Это принципиальное отличие ИИ от человеческого мышления подчёркивает необходимость дальнейших исследований в области устойчивого внимания искусственного интеллекта.

Следите за NEWS.am Tech на Facebook и Twitter