Исследователи: результаты бенчмарков reasoning-моделей зависят от условий оценки
Исследование arXiv:2506.04734 выявило, что результаты бенчмарков reasoning-моделей сильно зависят от условий оценки. Это касается серии Deepseek-R1-Distill, моделей на её основе и QwQ-32B.
- Небольшие различия в условиях оценки приводят к существенным колебаниям результатов бенчмарков reasoning-моделей.
- Эффект затрагивает серию Deepseek-R1-Distill, модели, дообученные на её основе, и QwQ-32B.
- Авторы предлагают более строгий подход к оценке производительности моделей.

Серия reasoning-моделей Deepseek-R1-Distill широко используется в open-source-сообществе благодаря сильным результатам в математике, науке и программировании. Однако новое исследование, опубликованное на arXiv под номером 2506.04734, показывает: результаты их оценки на бенчмарках сильно колеблются в зависимости от условий тестирования.
Авторы работы — Yongfu Zhu, Lin Sun, Jinzhu Wu, Weihong Lin, Xiaoqi Jian, Guangxiang Zhao, Change Jia, Linglin Zhang, Sai-er Hu, Yuhan Wu и Xiangzheng Zhang — обнаружили, что даже незначительные различия в процедуре оценки приводят к заметным изменениям итоговых цифр. Это затрудняет воспроизводимость заявленных улучшений производительности.
Какие модели затронуты
Помимо самой серии Deepseek-R1-Distill, аналогичные эффекты наблюдаются у других открытых inference-моделей, дообученных на её основе, а также у модели QwQ-32B. Из-за этого сравнивать модели между собой и проверять заявленный рост качества становится сложнее.
Исследователи призывают к созданию более строгой парадигмы оценки производительности моделей. В работе они приводят собственные эмпирические замеры для серии Deepseek-R1-Distill.
Почему это важно
Бенчмарки остаются основным способом сравнивать модели между собой, и от их стабильности зависит доверие к заявленным результатам. Если итоговые цифры меняются от тонких различий в условиях оценки, то выводы о превосходстве одной модели над другой могут оказаться невоспроизводимыми. Это касается как самой серии Deepseek-R1-Distill, так и моделей, дообученных на её основе, и QwQ-32B.
Авторы не ограничиваются описанием проблемы: они предлагают пересмотреть подход к оценке и сделать его более строгим. В статье также приведены их собственные эмпирические оценки моделей серии Deepseek-R1-Distill, которые должны помочь сообществу точнее интерпретировать результаты бенчмарков.
Для профиТехнические детали: архитектура, цифры, ссылки
Статья доступна на arXiv: 2506.04734 (cs.AI; также cs.CL, cs.LG). DOI: 10.48550/arXiv.2506.04734. Текущая версия — v3 от 25 сентября 2026 года; первая версия опубликована 5 июня 2025 года, вторая — 10 июня 2025 года.
Авторы: Yongfu Zhu, Lin Sun, Jinzhu Wu, Weihong Lin, Xiaoqi Jian, Guangxiang Zhao, Change Jia, Linglin Zhang, Sai-er Hu, Yuhan Wu, Xiangzheng Zhang.
В работе представлены эмпирические оценки серии Deepseek-R1-Distill. Конкретные бенчмарки, метрики и величины отклонений в аннотации не раскрываются.
Вопросы и ответы
- Что именно обнаружили исследователи?
- Что результаты бенчмарков reasoning-моделей сильно колеблются из-за различий в условиях оценки, и заявленные улучшения трудно воспроизвести.
- Какие модели затронуты?
- Серия Deepseek-R1-Distill, другие открытые inference-модели, дообученные на её основе, а также QwQ-32B.
- Что предлагают авторы?
- Установить более строгую парадигму оценки производительности моделей.

