17:02 22 мая, 2025Нейросети уже генерируют видео, озвучивают лекции и рисуют карты Вселенной, но… не умеют правильно читать аналоговые часы. Согласно исследованию Эдинбургского университета (ICLR 2025), даже самые продвинутые модели, включая GPT-4.1 и визуально-языковые VLM, верно интерпретируют циферблат только в 38,7% случаев. Если перед ними — календарь, ситуация ещё хуже: 26,3%, пишет Livescience.
Казалось бы, что может быть проще — повернуть голову, посмотреть на часы, понять, сколько времени. Но для ИИ это пространственная задача, требующая базового уровня ориентации и ментального моделирования — а именно этого у моделей и нет. ИИ ошибаются в определении углов, путают стрелки и даже при повторных инструкциях не могут корректно интерпретировать изображение. Особенно сильно сбиваются с толку, если видят часы с римскими цифрами или нестандартным дизайном. Исследователи отмечают, что ИИ просто «угадывают» по визуальному совпадению, не понимая, что вообще означает «время» как абстракция.
Причина таких сбоев — в фундаментальной «бестелесности» искусственного интеллекта. У него нет телесного опыта, нет зрительно-моторной координации, нет осознания положения объектов в пространстве. Пространственные навыки формируются у человека с раннего возраста через движение, осязание, зрение, повороты головы и тела. А ИИ учится по миллионам 2D-картинок, не зная, где «лево», «право» или «за».
Системы не могут мысленно «согнуть» коробку, не понимают, где находится Эдинбург по отношению к Лондону, если ты стоишь лицом на запад, и путаются в самых простых геометрических трансформациях. Их «пространственное мышление» — это статистика на плоской поверхности, а не внутреннее ощущение мира.
Парадоксально, но эти же модели легко сдают SAT и пишут программный код. Это рождает ложное ощущение универсальности: если нейросеть может объяснить квантовую механику и сгенерировать роман, почему бы не доверить ей навигацию по городу или диагноз в клинике? Ответ прост: потому что она не понимает. Она предсказывает, а не осмысляет.
Такое неравномерное развитие — не баг, а отражение самого способа обучения ИИ. Он учится на текстах, изображениях, репликах, а не на опыте. Отсюда и результат: гениальный собеседник, который теряется при виде часов и не знает, где запад.