Mercury 2.5 выдаёт 770 токенов в секунду в тесте Artificial Analysis

LLM Mercury 2.5 показала скорость генерации 770 токенов в секунду в замерах Artificial Analysis. Модель оценивается по Intelligence Index v4.3.2, который включает 10 бенчмарков.

Главное
  • Mercury 2.5 достигает 770 токенов в секунду при генерации ответа
  • Модель оценивается в Artificial Analysis Intelligence Index v4.3.2
  • Индекс включает 10 бенчмарков, среди них Terminal-Bench 4.0 и Humanity's Last Exam
Скриншот страницы Mercury 2.5 на платформе Artificial Analysis с графиками скорости и интеллекта модели
Фото: Hacker News: AI

Модель Mercury 2.5 показала скорость генерации 770 токенов в секунду — это следует из данных платформы Artificial Analysis, которая публикует независимые замеры LLM. Скорость измеряется как число токенов, получаемых в секунду во время генерации ответа после первого чанка от API.

Mercury 2.5 оценивается в рамках Artificial Analysis Intelligence Index версии 4.3.2. Этот индекс объединяет 10 бенчмарков: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience и AA-LCR v1.1.

Что измеряет индекс

Набор тестов покрывает разные типы задач: агентную работу со знаниями, реальные рабочие задачи, SaaS-сценарии, программирование и работу в терминале, анализ документов, физику, научные исследования, медицинский контекст.

Отдельно Artificial Analysis считает AA-Omniscience — метрику надёжности знаний и галлюцинаций. Она начисляет баллы за правильные ответы, штрафует за ошибки и не штрафует за отказ отвечать; диапазон — от −100 до 100.

Платформа также публикует стоимость прогона задач индекса, число выходных токенов на задачу, размер контекстного окна и цены за миллион токенов, включая цену кэш-хита. Эти данные позволяют сравнивать модели по соотношению интеллекта и цены.

Для профиТехнические детали: архитектура, цифры, ссылки

Artificial Analysis Intelligence Index v4.3.2 включает 10 оценок: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1.

  • Скорость: 770 выходных токенов в секунду (замер после первого чанка, для моделей со стримингом).
  • AA-Briefcase Elo: комбинированная метрика — rubric pass rate, analytical quality Elo и presentation Elo; rubric-результат переводится в Elo через синтетические парные матчи.
  • AA-Omniscience Index: от −100 до 100; 0 — равное число верных и неверных ответов, отрицательные значения — больше ошибок, чем правильных ответов.
  • Стоимость: платформа считает взвешенную цену за задачу индекса по ценам input, cache hit, cache write, reasoning и answer-токенов, а также общую стоимость прогона всех оценок.

Данные о контекстном окне, ценах за миллион токенов и числе выходных токенов на задачу опубликованы на странице модели.

Вопросы и ответы

Какую скорость показала Mercury 2.5?
770 выходных токенов в секунду по замерам Artificial Analysis.
По каким бенчмаркам оценивают Mercury 2.5?
По Artificial Analysis Intelligence Index v4.3.2, который включает 10 оценок, в том числе Terminal-Bench 4.0, SciCode и Humanity's Last Exam.
Что измеряет AA-Omniscience?
Надёжность знаний и галлюцинации: баллы за правильные ответы, штраф за ошибки, без штрафа за отказ отвечать; диапазон от −100 до 100.