BridgeMind запустили NerfBench для отслеживания деградации моделей после релиза
BridgeMind выпустили NerfBench — бенчмарк для отслеживания «нёрфа» моделей: ухудшения качества, роста расхода токенов или стоимости задачи после релиза. Результат в день выхода модели принимается за 100%, а последующие замеры показывают отклонения.
- NerfBench сравнивает качество, расход токенов и стоимость задачи с результатом в день релиза модели
- Отклонение в диапазоне 90–110% считается нормальным статистическим разбросом, ниже 90% — подозрительным
- BridgeMind выделили $10 000 на будущие перепроверки и планируют более частые замеры новых моделей
BridgeMind представили NerfBench — бенчмарк, который измеряет, не ухудшают ли лаборатории свои модели после релиза. Поводом стали постоянные жалобы пользователей чат-ботов и агентов на то, что модели «глупеют» после выхода или перед анонсом следующей версии. Этот процесс называют «нёрф».
Как работает NerfBench
В день релиза модель прогоняют по тестам, и этот результат принимают за 100%. Затем её периодически проверяют заново, измеряя качество, расход токенов и стоимость выполнения задачи. Диапазон 90–110% считается нормальным статистическим разбросом. Всё, что ниже 90%, помечается как подозрительное. Если модели требуется больше токенов или денег на ту же работу, это тоже считается потерей мощности.
Пример с Opus 5.5
Многие пользователи жалуются, что Opus 5.5 стал заметно проседать. После очередного замера его скор оказался в районе 94% от результата на старте. Формально это всё ещё в пределах нормального диапазона, но никакие другие модели так не ослабли. В X уже говорят о возможном скором выходе Fable 5.5.
Следить за обновлениями бенчмарка можно на сайте bridgebench.ai/nerf-bench. BridgeMind также пообещали выделить $10 000 на финансирование будущих перепроверок: планируются новые модели и более частые замеры.
Для профиТехнические детали: архитектура, цифры, ссылки
NerfBench от BridgeMind измеряет три метрики: качество ответов, расход токенов и стоимость задачи. Базовая точка — результат в день релиза модели, принимаемый за 100%. Нормальным считается отклонение в пределах 90–110%. Всё, что ниже 90%, помечается как подозрительное. Рост расхода токенов или стоимости при том же качестве также фиксируется как потеря мощности.
Текущий пример: Opus 5.5 после очередного замера показывает около 94% от стартового результата. BridgeMind выделили $10 000 на будущие перепроверки и анонсировали более частые замеры новых моделей. Результаты публикуются на bridgebench.ai/nerf-bench.
Вопросы и ответы
- Что такое NerfBench?
- Бенчмарк от BridgeMind, который измеряет, не ухудшаются ли модели после релиза. Сравнивает качество, расход токенов и стоимость задачи с результатом в день выхода.
- Какой диапазон считается нормальным?
- Отклонение в пределах 90–110% от стартового результата считается нормальным статистическим разбросом. Всё, что ниже 90%, помечается как подозрительное.
- Какие модели уже проверены?
- В источнике упоминается Opus 5.5, чей скор после очередного замера составил около 94% от запуска.



