Epoch AI: стоимость фиксированного результата на ИИ-бенчмарках падает на 47% за квартал
Стоимость достижения фиксированного уровня на ИИ-бенчмарках падает примерно на 47% за квартал, или в 13 раз в год, подсчитала Epoch AI. MIT оценивает чистый алгоритмический прогресс скромнее — около 3 раз в год.
- Epoch AI: цена достижения фиксированного результата на пяти бенчмарках падает на 47% за квартал, или примерно в 13 раз в год.
- MIT: с поправкой на железо и конкуренцию алгоритмическая эффективность растёт примерно в 3 раза в год.
- Пример Epoch AI: результат o3 на GPQA Diamond в начале 2025 года стоил 30 центов за вопрос, а позже модель семейства GPT-5.6 показала тот же результат за четыре сотых цента.

Стоимость достижения фиксированного уровня производительности на отдельных ИИ-бенчмарках резко упала с 2023 года. Исследовательская организация Epoch AI, отслеживающая тренды в ИИ, оценивает снижение примерно в 47% за квартал — около 13 раз в год. По данным группы, ни одна другая трансформирующая технология не дешевела так быстро.
Речь идёт о рыночных ценах за фиксированный балл на бенчмарке, а не о чистом алгоритмическом или архитектурном прогрессе и не о реальной стоимости продуктивности. Исследователи MIT на сопоставимых данных видят снижение в 5–10 раз в год, но после вычета более дешёвого железа и ценового давления конкуренции оценивают собственно алгоритмический выигрыш примерно в 3 раза в год.
Насколько дешевле стало повторять результат o3
Epoch AI приводит пример с моделью o3 от OpenAI. В начале 2025 года o3 набрала 75% на GPQA Diamond — тесте уровня PhD по науке — при оценочной стоимости 30 центов за вопрос. Позже модель семейства GPT-5.6 достигла того же результата за четыре сотых цента. По оценке Epoch AI, это 1/725 от исходной цены.
Анализ Epoch AI опирается на пять бенчмарков, охватывающих математику, науку и логические задачи. Из-за узкой выборки организация называет свои выводы «разумными, но приблизительными измерениями на основе лучших доступных данных».
Что именно объясняет падение
Ханс Гундлах и его коллеги из MIT используют данные платформы сравнения Artificial Analysis за период с апреля 2024 по ноябрь 2025 года и оценивают гораздо больше моделей на тест, чем предыдущие исследования. Их цифры ниже, чем у Epoch AI, отчасти потому, что новые reasoning-модели могут тратить дополнительный test-time compute на сложные задачи, повышая стоимость правильного ответа даже при падении цены за токен.
Когда MIT разбирает, что толкает цены вниз, часть приходится на более дешёвое железо, часть — на конкуренцию. Чтобы исключить эффект конкуренции, исследователи отдельно смотрят на открытые модели. Остаётся чистый алгоритмический выигрыш — около 3 раз в год. Показатель Epoch AI в 13 раз выше, потому что не вычитает эффекты железа и конкуренции.
MIT также обнаружил, что часть прироста производительности объясняется просто большими затратами вычислений. Новая модель, обходящая предшественницу на GPQA Diamond, выглядит как прогресс со стороны, но авторы оценивают, что значительная доля улучшения связана с использованием большего объёма вычислений на вопрос. Она набирает больше баллов и стоит дороже в запуске. На бенчмарках по коду и математике наблюдается меньшая версия той же закономерности.
Есть и проблема «benchmaxxing»: ИИ-компании могут оптимизировать модели под известные тесты, завышая баллы без реальной отдачи. Epoch AI пытается этому противостоять, включая тест «Mystery Game Puzzles», основанный на державшейся в секрете игре. На этом тесте цены падают медленнее всего, что согласуется с теорией benchmaxxing, но может объясняться и форматом задачи, и шумом в данных.
Средние цены плохо помогают при выборе модели под конкретную задачу. Платформы вроде Artificial Analysis ранжируют модели по качеству, цене, задержке, размеру контекстного окна и скорости вывода, и самый дешёвый вариант редко выигрывает по всем параметрам.
Для профиТехнические детали: архитектура, цифры, ссылки
Epoch AI оценивает снижение стоимости фиксированного результата в 47% за квартал (около 13x в год) на основе пяти бенчмарков по математике, науке и логике. Пример: o3 — 75% на GPQA Diamond за 30 центов за вопрос в начале 2025 года; модель семейства GPT-5.6 — тот же результат за четыре сотых цента, то есть 1/725 цены.
MIT (Гундлах и коллеги) используют данные Artificial Analysis за апрель 2024 — ноябрь 2025 года. Их оценка: 5–10x в год по цене, из которых чистый алгоритмический выигрыш — около 3x в год после вычета эффектов железа и конкуренции. Конкуренцию контролируют, отдельно анализируя открытые модели.
MIT также отмечает, что часть прироста на GPQA Diamond связана с ростом test-time compute на вопрос: модель набирает больше баллов и стоит дороже в запуске. На бенчмарках по коду и математике — та же закономерность в меньшем масштабе. Epoch AI для защиты от benchmaxxing включает тест «Mystery Game Puzzles» на основе секретной игры; на нём цены падают медленнее всего.
Вопросы и ответы
- Насколько упала стоимость достижения фиксированного результата на ИИ-бенчмарках?
- Epoch AI оценивает снижение примерно в 47% за квартал, или около 13 раз в год.
- Сколько составляет чистый алгоритмический прогресс по оценке MIT?
- Около 3 раз в год — после вычета эффектов более дешёвого железа и конкуренции.
- Почему новые модели могут стоить дороже в запуске?
- Reasoning-модели тратят больше вычислений на сложные задачи, что повышает стоимость правильного ответа даже при падении цены за токен.


