Grok 4.7 против GPT-6 Astra и Claude: разрыв в бенчмарках достигает 1,5 раза

xAI выпустила Grok 4.7 — модель с контекстом 500 тыс. токенов и ценой $2/$6 за миллион. На Terminal-Bench она набирает 38% в своей обвязке Grok Build, но лишь 26% на независимом прогоне Artificial Analysis.

Главное
  • Grok 4.7 вышла 21 сентября, контекст 500 тыс. токенов, цена $2/$6 за миллион
  • На Terminal-Bench Grok 4.7 даёт 38% в обвязке xAI против 26% у Artificial Analysis
  • GPT-6 Astra вышла 3 сентября с контекстом 1,05 млн токенов и ценой $10/$50
Сравнение индексов и бенчмарков моделей Grok 4.7, GPT-6 Astra и Claude Fable 5.1
Фото: Хабр: Машинное обучение

xAI выложила Grok 4.7 — новую базовую модель поверх Grok 4.6. Её дольше обучали с подкреплением: модель должна сама планировать, вызывать инструменты и проверять результат на задачах, которые длятся часами. Контекст — 500 тыс. токенов, на входе текст и картинки, на выходе только текст. Уровни рассуждения: low, medium, high, xhigh.

Модель уже доступна в API xAI, в Cursor на всех тарифах, в Grok Build как модель по умолчанию, а также в надстройках Word, PowerPoint и Excel. Через OpenRouter, Vercel и Cloudflare — тоже. В обычный чат Grok и в X её обещают позже.

Конкуренты вышли раньше

GPT-6 Astra от OpenAI вышла 3 сентября. Контекст — 1,05 млн токенов, ответ до 128 тыс., знания обрезаны 30 апреля 2026 года. OpenAI первой из своих моделей отнесла её к уровню Critical по кибервозможностям и усилила проверки на действия без явного разрешения.

Claude Opus 5 вышел 24 июля: миллион токенов контекста, цена $5/$25. Claude Fable 5.1 — 1 сентября, тот же размер окна, цена $10/$50. По данным Anthropic, для большинства задач включать надо Opus, а Fable доставать, когда Opus уже не тянет.

Китайские модели в той же таблице

Qwen3.8 Max от Alibaba стоит те же $2 и $6 за миллион токенов, что и Grok, и на общем индексе отстаёт на один балл. Kimi K3 от Moonshot сидит в том же коридоре на суточных инженерных задачах. GLM-5.3 от Z.ai сильнее всего на длинной инженерии. DeepSeek V4 Flash: 284 млрд параметров, 13 млрд активных, лицензия MIT, контекст 1 млн токенов, цена $0,44/$1,32 в пик.

Бенчмарки расходятся

Artificial Analysis собирает индекс из десяти оценок: офисные дела, профессиональные задачи, автоматизация интерфейсов, терминал, научный код, длинный контекст и другие тесты. Все модели гоняют в одной обвязке, лаборатории не выбирают себе удобный режим.

На Terminal-Bench 4.0 — 66 тяжёлых сценариев в настоящем терминале с бюджетом до восьми часов — цифры расходятся почти в полтора раза. xAI в своей карточке указывает 38% для Grok 4.7 в режиме xhigh в обвязке Grok Build. Artificial Analysis на тех же весах получает 26%. У Grok 4.6 в той же карточке было 20,3%.

Claude Fable 5.1 в карточке xAI набирает 57,9%, у Artificial Analysis — около 55%. GPT-6 Astra в таблице xAI отсутствует, у Artificial Analysis — около 60%. DeepSeek V4 Flash на графике AA оказывается на процент выше Grok 4.7.

Ничья Astra и Fable

На отметке 53 в индексе Artificial Analysis Astra и Fable делят место, но это ничья из разных сил. Astra впереди на терминале и автоматизации интерфейсов. Fable — на офисных делах AA-Briefcase, профессиональных задачах GDPval, научном коде SciCode и Humanity’s Last Exam.

У Grok 4.7 режимы high и xhigh на этом индексе совпали: оба по 46. Доплачивать за максимальное усилие имеет смысл только там, где собственный тест это видит.

Для профиТехнические детали: архитектура, цифры, ссылки

Цены API за миллион токенов

  • Grok 4.7: $2 / $6
  • GPT-6 Astra: $10 / $50, выше 272 тыс. токенов вход — $20, выход — $75
  • Claude Opus 5: $5 / $25
  • Claude Fable 5.1: $10 / $50
  • Qwen3.8 Max: $2 / $6
  • DeepSeek V4 Flash: $0,44 / $1,32 в пик, вне пика $0,22 / $0,66
  • DeepSeek V4 Pro: $1,32 / $3,96 в пик, вне пика вдвое дешевле
  • GLM-5.3: $1,40 / $4,40, кэш входа $0,26

Контекст и обрезка знаний

  • Grok 4.7: 500 тыс. токенов, претрейн до июня 2026, дополнительные данные до августа
  • GPT-6 Astra: 1,05 млн, ответ до 128 тыс., знания до 30 апреля 2026
  • Claude Opus 5: 1 млн, ответ до 128 тыс., знания до мая 2026
  • Claude Fable 5.1: 1 млн, знания до июня 2026
  • DeepSeek V4 Flash: 1 млн, выход до 384 тыс., лицензия MIT

У DeepSeek пик — будни, два окна по UTC, ночью и в выходные дешевле вдвое. Тариф Kimi K3 публично не в долларах за токен по сетке OpenAI — точную строку лучше брать в консоли Moonshot в день интеграции.

Terminal-Bench 4.0

  • Claude Fable 5.1: 57,9% (карточка xAI) / около 55% (AA)
  • GPT-6 Astra: около 60% (AA), в таблице xAI нет
  • Grok 4.7: 38% xhigh (карточка xAI) / 26% (AA)
  • GPT-5.6 Sol: 37,3% (карточка xAI)
  • DeepSeek V4 Flash: 27% (AA)
  • Grok 4.6: 20,3% (карточка xAI)

7 сентября Artificial Analysis публиковала Astra 59,1% и Fable 52,0%. 21 сентября разбор свежего графика округляет их примерно до 60% и 55%.

Вопросы и ответы

Сколько стоит Grok 4.7?
$2 за миллион входных токенов и $6 за миллион выходных.
Какой контекст у Grok 4.7?
500 тыс. токенов — короче, чем у GPT-6 Astra и Claude.
Почему результаты бенчмарков различаются?
xAI измеряет в своей обвязке Grok Build, Artificial Analysis — в единой для всех моделей. На Terminal-Bench это даёт 38% против 26%.