Исследователи: результаты бенчмарков reasoning-моделей зависят от условий оценки

Исследование arXiv:2506.04734 выявило, что результаты бенчмарков reasoning-моделей сильно зависят от условий оценки. Это касается серии Deepseek-R1-Distill, моделей на её основе и QwQ-32B.

Главное
  • Небольшие различия в условиях оценки приводят к существенным колебаниям результатов бенчмарков reasoning-моделей.
  • Эффект затрагивает серию Deepseek-R1-Distill, модели, дообученные на её основе, и QwQ-32B.
  • Авторы предлагают более строгий подход к оценке производительности моделей.
Иллюстрация к новости о нестабильности бенчмарков reasoning-моделей Deepseek-R1-Distill и QwQ-32B
Фото: arXiv cs.LG

Серия reasoning-моделей Deepseek-R1-Distill широко используется в open-source-сообществе благодаря сильным результатам в математике, науке и программировании. Однако новое исследование, опубликованное на arXiv под номером 2506.04734, показывает: результаты их оценки на бенчмарках сильно колеблются в зависимости от условий тестирования.

Авторы работы — Yongfu Zhu, Lin Sun, Jinzhu Wu, Weihong Lin, Xiaoqi Jian, Guangxiang Zhao, Change Jia, Linglin Zhang, Sai-er Hu, Yuhan Wu и Xiangzheng Zhang — обнаружили, что даже незначительные различия в процедуре оценки приводят к заметным изменениям итоговых цифр. Это затрудняет воспроизводимость заявленных улучшений производительности.

Какие модели затронуты

Помимо самой серии Deepseek-R1-Distill, аналогичные эффекты наблюдаются у других открытых inference-моделей, дообученных на её основе, а также у модели QwQ-32B. Из-за этого сравнивать модели между собой и проверять заявленный рост качества становится сложнее.

Исследователи призывают к созданию более строгой парадигмы оценки производительности моделей. В работе они приводят собственные эмпирические замеры для серии Deepseek-R1-Distill.

Почему это важно

Бенчмарки остаются основным способом сравнивать модели между собой, и от их стабильности зависит доверие к заявленным результатам. Если итоговые цифры меняются от тонких различий в условиях оценки, то выводы о превосходстве одной модели над другой могут оказаться невоспроизводимыми. Это касается как самой серии Deepseek-R1-Distill, так и моделей, дообученных на её основе, и QwQ-32B.

Авторы не ограничиваются описанием проблемы: они предлагают пересмотреть подход к оценке и сделать его более строгим. В статье также приведены их собственные эмпирические оценки моделей серии Deepseek-R1-Distill, которые должны помочь сообществу точнее интерпретировать результаты бенчмарков.

Для профиТехнические детали: архитектура, цифры, ссылки

Статья доступна на arXiv: 2506.04734 (cs.AI; также cs.CL, cs.LG). DOI: 10.48550/arXiv.2506.04734. Текущая версия — v3 от 25 сентября 2026 года; первая версия опубликована 5 июня 2025 года, вторая — 10 июня 2025 года.

Авторы: Yongfu Zhu, Lin Sun, Jinzhu Wu, Weihong Lin, Xiaoqi Jian, Guangxiang Zhao, Change Jia, Linglin Zhang, Sai-er Hu, Yuhan Wu, Xiangzheng Zhang.

В работе представлены эмпирические оценки серии Deepseek-R1-Distill. Конкретные бенчмарки, метрики и величины отклонений в аннотации не раскрываются.

Вопросы и ответы

Что именно обнаружили исследователи?
Что результаты бенчмарков reasoning-моделей сильно колеблются из-за различий в условиях оценки, и заявленные улучшения трудно воспроизвести.
Какие модели затронуты?
Серия Deepseek-R1-Distill, другие открытые inference-модели, дообученные на её основе, а также QwQ-32B.
Что предлагают авторы?
Установить более строгую парадигму оценки производительности моделей.