Международная группа исследователей провела эксперимент, который выявил серьёзную и ранее малоизученную проблему ведущих языковых моделей. Оказывается, при увеличении длины задачи, требующей устойчивого внимания, точность ИИ резко падает — вплоть до практически полного отказа от выполнения инструкции.
Результаты исследования опубликованы в журнале PNAS Nexus.
Классический тест в новых условиях
Для проверки учёные использовали знаменитый тест Струпа — психологический эксперимент, разработанный ещё в 1935 году. Испытуемому показывают слова, обозначающие цвета («красный», «синий», «зелёный»), но написанные цветом, не совпадающим со смыслом слова. Задача — назвать цвет чернил, игнорируя само слово.
Люди справляются с этим относительно стабильно даже на длинных списках, хотя и испытывают когнитивный конфликт. Мозг успешно подавляет автоматическую реакцию чтения.
Исследователи под руководством Сукету Пателя адаптировали тест для ИИ и проверили на нём несколько ведущих моделей:
GPT-4o Claude 3.5 Sonnet GPT-5 Claude Opus 4.1 Gemini 2.5Шокирующие результаты
При коротких списках (5 слов) все модели показывали высокую точность. Однако с ростом длины задания результаты ухудшались драматически:
GPT-4o: при 5 словах — 91% правильных ответов, при 10 словах — 57%, при 40 словах — всего 15%. Claude 3.5 Sonnet: уверенно работал до 20 слов, после чего точность рухнула до 24%.Модели постепенно «забывали» исходную инструкцию и начинали просто читать написанное слово, то есть возвращались к самому сильному паттерну, на котором были обучены.
Принципиальное отличие от человека
В отличие от людей, которые способны долгое время поддерживать произвольное внимание и подавлять автоматические реакции, современные ИИ демонстрируют крайне низкую устойчивость к длительным когнитивным нагрузкам. По сути, чем длиннее задача, тем сильнее проявляется этот фундаментальный недостаток.
Вкратце
Учёные обнаружили серьёзную слабость современных языковых моделей: при увеличении длины задачи, требующей концентрации внимания, их точность резко падает. Тест Струпа показал, что GPT-4o и Claude 3.5 Sonnet уже при умеренной длине списка практически перестают следовать инструкции. Это принципиальное отличие ИИ от человеческого мышления подчёркивает необходимость дальнейших исследований в области устойчивого внимания искусственного интеллекта.
Следите за NEWS.am Tech на Facebook и Twitter