Grok 4.7 против GPT-6 Astra и Claude: разрыв в бенчмарках достигает 1,5 раза
xAI выпустила Grok 4.7 — модель с контекстом 500 тыс. токенов и ценой $2/$6 за миллион. На Terminal-Bench она набирает 38% в своей обвязке Grok Build, но лишь 26% на независимом прогоне Artificial Analysis.
- Grok 4.7 вышла 21 сентября, контекст 500 тыс. токенов, цена $2/$6 за миллион
- На Terminal-Bench Grok 4.7 даёт 38% в обвязке xAI против 26% у Artificial Analysis
- GPT-6 Astra вышла 3 сентября с контекстом 1,05 млн токенов и ценой $10/$50

xAI выложила Grok 4.7 — новую базовую модель поверх Grok 4.6. Её дольше обучали с подкреплением: модель должна сама планировать, вызывать инструменты и проверять результат на задачах, которые длятся часами. Контекст — 500 тыс. токенов, на входе текст и картинки, на выходе только текст. Уровни рассуждения: low, medium, high, xhigh.
Модель уже доступна в API xAI, в Cursor на всех тарифах, в Grok Build как модель по умолчанию, а также в надстройках Word, PowerPoint и Excel. Через OpenRouter, Vercel и Cloudflare — тоже. В обычный чат Grok и в X её обещают позже.
Конкуренты вышли раньше
GPT-6 Astra от OpenAI вышла 3 сентября. Контекст — 1,05 млн токенов, ответ до 128 тыс., знания обрезаны 30 апреля 2026 года. OpenAI первой из своих моделей отнесла её к уровню Critical по кибервозможностям и усилила проверки на действия без явного разрешения.
Claude Opus 5 вышел 24 июля: миллион токенов контекста, цена $5/$25. Claude Fable 5.1 — 1 сентября, тот же размер окна, цена $10/$50. По данным Anthropic, для большинства задач включать надо Opus, а Fable доставать, когда Opus уже не тянет.
Китайские модели в той же таблице
Qwen3.8 Max от Alibaba стоит те же $2 и $6 за миллион токенов, что и Grok, и на общем индексе отстаёт на один балл. Kimi K3 от Moonshot сидит в том же коридоре на суточных инженерных задачах. GLM-5.3 от Z.ai сильнее всего на длинной инженерии. DeepSeek V4 Flash: 284 млрд параметров, 13 млрд активных, лицензия MIT, контекст 1 млн токенов, цена $0,44/$1,32 в пик.
Бенчмарки расходятся
Artificial Analysis собирает индекс из десяти оценок: офисные дела, профессиональные задачи, автоматизация интерфейсов, терминал, научный код, длинный контекст и другие тесты. Все модели гоняют в одной обвязке, лаборатории не выбирают себе удобный режим.
На Terminal-Bench 4.0 — 66 тяжёлых сценариев в настоящем терминале с бюджетом до восьми часов — цифры расходятся почти в полтора раза. xAI в своей карточке указывает 38% для Grok 4.7 в режиме xhigh в обвязке Grok Build. Artificial Analysis на тех же весах получает 26%. У Grok 4.6 в той же карточке было 20,3%.
Claude Fable 5.1 в карточке xAI набирает 57,9%, у Artificial Analysis — около 55%. GPT-6 Astra в таблице xAI отсутствует, у Artificial Analysis — около 60%. DeepSeek V4 Flash на графике AA оказывается на процент выше Grok 4.7.
Ничья Astra и Fable
На отметке 53 в индексе Artificial Analysis Astra и Fable делят место, но это ничья из разных сил. Astra впереди на терминале и автоматизации интерфейсов. Fable — на офисных делах AA-Briefcase, профессиональных задачах GDPval, научном коде SciCode и Humanity’s Last Exam.
У Grok 4.7 режимы high и xhigh на этом индексе совпали: оба по 46. Доплачивать за максимальное усилие имеет смысл только там, где собственный тест это видит.
Для профиТехнические детали: архитектура, цифры, ссылки
Цены API за миллион токенов
- Grok 4.7: $2 / $6
- GPT-6 Astra: $10 / $50, выше 272 тыс. токенов вход — $20, выход — $75
- Claude Opus 5: $5 / $25
- Claude Fable 5.1: $10 / $50
- Qwen3.8 Max: $2 / $6
- DeepSeek V4 Flash: $0,44 / $1,32 в пик, вне пика $0,22 / $0,66
- DeepSeek V4 Pro: $1,32 / $3,96 в пик, вне пика вдвое дешевле
- GLM-5.3: $1,40 / $4,40, кэш входа $0,26
Контекст и обрезка знаний
- Grok 4.7: 500 тыс. токенов, претрейн до июня 2026, дополнительные данные до августа
- GPT-6 Astra: 1,05 млн, ответ до 128 тыс., знания до 30 апреля 2026
- Claude Opus 5: 1 млн, ответ до 128 тыс., знания до мая 2026
- Claude Fable 5.1: 1 млн, знания до июня 2026
- DeepSeek V4 Flash: 1 млн, выход до 384 тыс., лицензия MIT
У DeepSeek пик — будни, два окна по UTC, ночью и в выходные дешевле вдвое. Тариф Kimi K3 публично не в долларах за токен по сетке OpenAI — точную строку лучше брать в консоли Moonshot в день интеграции.
Terminal-Bench 4.0
- Claude Fable 5.1: 57,9% (карточка xAI) / около 55% (AA)
- GPT-6 Astra: около 60% (AA), в таблице xAI нет
- Grok 4.7: 38% xhigh (карточка xAI) / 26% (AA)
- GPT-5.6 Sol: 37,3% (карточка xAI)
- DeepSeek V4 Flash: 27% (AA)
- Grok 4.6: 20,3% (карточка xAI)
7 сентября Artificial Analysis публиковала Astra 59,1% и Fable 52,0%. 21 сентября разбор свежего графика округляет их примерно до 60% и 55%.
Вопросы и ответы
- Сколько стоит Grok 4.7?
- $2 за миллион входных токенов и $6 за миллион выходных.
- Какой контекст у Grok 4.7?
- 500 тыс. токенов — короче, чем у GPT-6 Astra и Claude.
- Почему результаты бенчмарков различаются?
- xAI измеряет в своей обвязке Grok Build, Artificial Analysis — в единой для всех моделей. На Terminal-Bench это даёт 38% против 26%.


