OpenAI сделала значительный шаг в развитии искусственного интеллекта: их экспериментальная языковая модель достигла уровня золотой медали на Международной математической олимпиаде (IMO) 2025 года. Об этом сообщил исследователь компании Александр Вэй, работающий над языковыми моделями и логическим выводом. Модель решила пять из шести сложнейших задач, набрав 35 из 42 возможных баллов, что соответствует результатам лучших участников одного из самых престижных математических соревнований в мире. Это достижение подчеркивает прогресс в создании ИИ с общими рассуждающими способностями, способными конкурировать с человеческим интеллектом.
Международная математическая олимпиада (IMO), начавшаяся в 1959 году в Румынии, считается самым сложным и престижным соревнованием для старшеклассников. Ежегодно более 100 стран отправляют команды до шести участников, чтобы решить шесть задач за два дня — по три задачи за 4,5 часа в каждом сеансе. Задания охватывают алгебру, геометрию, комбинаторику и теорию чисел, требуя не только знаний, но и глубокого нестандартного мышления. В 2025 году, проходившем на Солнечном побережье Австралии, золотую медаль получили лишь 67 из 630 участников — около 10%.
Традиционно ИИ справляется с задачами, требующими обработки больших данных или выполнения рутинных вычислений, но олимпиадные задачи IMO представляют уникальный вызов. Они требуют многостраничных доказательств, креативности и способности удерживать логическую цепочку на протяжении долгого времени — около 100 минут на задачу для лучших участников. До сих пор даже передовые модели, такие как Gemini 2.5 Pro или Grok-4, не могли достичь даже бронзового уровня (19 баллов), набирая не более 13 баллов в тестах MathArena.ai.
Экспериментальная модель OpenAI, о которой сообщил Александр Вэй, смогла преодолеть эти барьеры. Она решала задачи IMO 2025 года под теми же условиями, что и люди: без доступа к интернету, внешним инструментам или программам, полагаясь только на чтение официальных условий и создание доказательств на естественном языке. Модель успешно решила задачи P1–P5, набрав 35 из 42 баллов, что соответствует порогу для золотой медали. Оценку проводили три бывших медалиста IMO, единогласно подтвердивших качество многостраничных доказательств модели.
В отличие от специализированных систем, таких как AlphaGeometry 2 от Google DeepMind, которая в 2024 году достигла уровня золотой медали в геометрии, модель OpenAI — это универсальная языковая модель (LLM), использующая новые подходы к обучению с подкреплением и масштабированию вычислений во время тестирования. По словам Вэя, успех был достигнут не за счет узкоспециализированных методов, а благодаря прорыву в общем рассуждении, что делает достижение шагом к созданию искусственного общего интеллекта (AGI).
Генеральный директор OpenAI Сэм Альтман подчеркнул: «Это не специализированная математическая система, а языковая модель, решающая задачи на уровне лучших математиков. Это важный маркер прогресса ИИ за последние годы». Вэй также отметил, что модель превзошла ожидания: в 2021 году он прогнозировал лишь 30% успеха на менее сложном тесте MATH к июлю 2025 года, но ИИ достиг уровня IMO.
Достижение OpenAI вызвало как восторг, так и скептицизм. Некоторые эксперты, включая профессора Нью-Йоркского университета Гэри Маркуса, указали, что результаты пока не подтверждены независимо официальными организаторами IMO. Кроме того, исследователь Google DeepMind Танг Луонг раскритиковал OpenAI за преждевременное объявление результатов до завершения церемонии награждения, что нарушило рекомендации IMO, направленные на сохранение внимания к достижениям участников-людей. Луонг также предположил, что модель могла набрать баллы, соответствующие серебряной медали, а не золотой, из-за неудачи с шестой задачей, хотя это утверждение остается неподтвержденным.
Еще одна точка споров — методология. Некоторые критики указывают на возможное «переобучение» модели или использование данных, близких к олимпиадным задачам, хотя OpenAI утверждает, что модель работала с новыми задачами без предварительной подготовки на них. Также есть опасения, что процесс «best-of-n» выбора ответов может быть формой «подгонки под судей», а не демонстрацией истинного математического мышления.
Тем не менее, даже скептики признают значимость результата. Мадхаван Мукунд из Ченнайского математического института отметил, что способность модели создавать сложные доказательства — это неожиданный прогресс, учитывая, что языковые модели часто «спотыкаются» на простых логических задачах, таких как сравнение чисел 9.11 и 9.9.
Успех OpenAI имеет далеко идущие последствия. Во-первых, он демонстрирует, что ИИ может достигать человеческого уровня в задачах, требующих глубокого творческого мышления, что ранее считалось недостижимым. Это открывает путь к применению ИИ в таких областях, как криптография, физика или космические исследования, где необходимы сложные многошаговые вычисления. Во-вторых, достижение подчеркивает прогресс в создании универсальных моделей, способных решать задачи не только в математике, но и в других дисциплинах.
Однако модель пока не готова к публичному выпуску. Вэй и Альтман уточнили, что она является экспериментальной и не будет доступна в ближайшие месяцы, даже в составе грядущей GPT-5. Это связано с необходимостью дальнейшего тестирования и обеспечения надежности, чтобы избежать ошибок или неправильного использования. Интересно, что в то же время другая модель OpenAI уступила человеку в соревновании по программированию AtCoder, показав, что ИИ пока не превосходит людей во всех областях.
Есть и слухи, что Google DeepMind также достиг уровня золотой медали на IMO 2025 с помощью своей модели, но официального подтверждения от компании пока нет. Это указывает на нарастающую конкуренцию между ведущими лабораториями ИИ в достижении универсального интеллекта.
Достижение OpenAI на IMO 2025 — это веха в развитии искусственного интеллекта, демонстрирующая, что языковые модели могут не только обрабатывать данные, но и рассуждать на уровне лучших умов человечества. Решение пяти из шести задач олимпиады подтверждает прогресс в создании ИИ с общими рассуждающими способностями, приближая нас к искусственному общему интеллекту. Однако споры вокруг результатов и их неподтвержденный статус напоминают о необходимости тщательной проверки и прозрачности. В будущем такие модели могут стать ценными помощниками в научных исследованиях, но пока они остаются экспериментальными, оставляя место для совершенствования и дискуссий.
month
week
day