Open-weight LLM догнали закрытые? Разбор для продакшена

Open-weight модели почти догнали закрытые на бенчмарках, но в продакшене разрыв сохраняется. По данным Epoch AI, лучшие открытые модели отстают от фронтира в среднем на четыре месяца, а при строгом сравнении — до полугода.

Главное
  • С апреля по август 2026 года вышли DeepSeek V4, Kimi K3, GLM-5.3 и Muse Glimmer от Meta.
  • По индексу ECI лучшие открытые модели отстают от закрытого фронтира в среднем на четыре месяца.
  • Натана Ламберт оценил разрыв после Kimi K3 в 3–5 месяцев, но это экспертная оценка, а не измерение.
Сравнение открытых и закрытых языковых моделей в контексте продакшена
Фото: Хабр: ИИ

С апреля по август 2026 года вышли несколько крупных open-weight моделей: DeepSeek V4, Kimi K3, GLM-5.3, а Meta вернулась к открытым весам с Muse Glimmer. На этом фоне всё чаще звучит тезис, что открытые модели догнали закрытые. Техлид и преподаватель ОТУС Сергей Прощаев проверил его по четырём направлениям: независимые измерения, деньги, лицензии и железо.

Что говорят измерения

Аналитики Epoch AI считают сводный индекс возможностей ECI по множеству бенчмарков. По данным с 1 января по 28 мая 2026 года лучшие открытые модели отстают от закрытого фронтира в среднем на четыре месяца. В пунктах индекса это около 8 — примерно как разница между GPT-5 и GPT-5.5. При этом разрыв не сократился, а слегка вырос: с 2023 по октябрь 2025 года он был около трёх месяцев.

Сами авторы предупреждают, что четыре месяца могут занижать реальный разрыв. Открытые модели активно подтягиваются под публичные бенчмарки, а закрытые лаборатории держат лучшие системы при себе. При более строгом критерии сравнения разрыв доходит примерно до полугода. Обновлённого пересчёта с учётом летних релизов у Epoch нет, но эксперт Натан Ламберт после выхода Kimi K3 предположил, что разрыв сократился до 3–5 месяцев. Это интерпретация, а не независимое измерение.

Паритет на бенчмарке не равен паритету в продакшене

Средний разрыв мало говорит о конкретной рабочей нагрузке. Модель может быть неотличима от фронтира на извлечении полей из документа и заметно проигрывать на длинных агентных цепочках. Автор приводит пример: при классификации обращений по спорным платежам открытая модель показала разницу с дорогой закрытой в пределах разброса между повторными прогонами. Но при генерации объяснений для антифрод-аналитиков та же модель уверенно ссылалась на внутренние правила, которых не было в контексте.

Из этого следует, что честный вывод можно сделать только о паре «модель плюс задача». Автор советует на демонстрациях новых моделей спрашивать не «какой у неё балл», а «на каких наших примерах её гоняли».

Шпаргалка по задачам

На основе опыта и публичных данных автор составил таблицу применимости open-weight моделей:

  • Классификация и маршрутизация обращений — уже сейчас, смотреть на точность на своём размеченном наборе.
  • Извлечение полей из документов — уже сейчас, смотреть на формат ответа и долю невалидного JSON.
  • RAG по внутренней базе знаний — уже сейчас, смотреть на повторное использование префиксов и выбор движка инференса.
  • Генерация текстов со ссылками на регламенты — с осторожностью, проверять ссылки на правила, которых нет в контексте.
  • Длинные агентные цепочки с инструментами — пока с резервом на фронтир, смотреть на долю успешно завершённых сценариев.

Автор подчёркивает: это не результат бенчмарка, а сводка опыта и публичных данных.

Для профиТехнические детали: архитектура, цифры, ссылки

В статье приведены конкретные релизы open-weight моделей:

  • 24 апреля DeepSeek выложил превью V4 с весами под MIT: версия Pro на 1,6 трлн параметров (49 млрд активных) и Flash на 284 млрд (13 млрд активных), обе с контекстом в 1 млн токенов. 13 августа Pro вышла из превью.
  • 16 июля Moonshot AI представила Kimi K3: 2,8 трлн параметров, 104 млрд активных, контекст 1 млн токенов. Веса выложили 27 июля.
  • 10 августа Meta выпустила Muse Glimmer на 30 млрд параметров под Apache 2.0, запускается на одной потребительской видеокарте.
  • 14 августа Zhipu выпустила GLM-5.3 через API, веса опубликовала 28 августа после двухнедельной проверки на кибербезопасность.

По анализу данных OpenRouter, к маю на китайские open-weight модели приходилось около 61% потреблённых там токенов. Это статистика одного маршрутизатора, а не всего рынка.

Цены и лицензии проверены 16 сентября 2026 года. Индекс ECI от Epoch AI показывает разрыв в 8 пунктов между лучшими открытыми и закрытыми моделями.

Вопросы и ответы

Насколько открытые модели отстают от закрытых?
По индексу ECI от Epoch AI — в среднем на четыре месяца, при строгом сравнении до полугода.
Можно ли уже использовать open-weight модели в продакшене?
Для классификации, извлечения полей и RAG — да, для длинных агентных цепочек пока рекомендуется резерв на закрытые модели.
Какие open-weight модели вышли в 2026 году?
DeepSeek V4, Kimi K3, GLM-5.3 и Muse Glimmer от Meta.