Open-weight LLM догнали закрытые? Разбор для продакшена
Open-weight модели почти догнали закрытые на бенчмарках, но в продакшене разрыв сохраняется. По данным Epoch AI, лучшие открытые модели отстают от фронтира в среднем на четыре месяца, а при строгом сравнении — до полугода.
- С апреля по август 2026 года вышли DeepSeek V4, Kimi K3, GLM-5.3 и Muse Glimmer от Meta.
- По индексу ECI лучшие открытые модели отстают от закрытого фронтира в среднем на четыре месяца.
- Натана Ламберт оценил разрыв после Kimi K3 в 3–5 месяцев, но это экспертная оценка, а не измерение.

С апреля по август 2026 года вышли несколько крупных open-weight моделей: DeepSeek V4, Kimi K3, GLM-5.3, а Meta вернулась к открытым весам с Muse Glimmer. На этом фоне всё чаще звучит тезис, что открытые модели догнали закрытые. Техлид и преподаватель ОТУС Сергей Прощаев проверил его по четырём направлениям: независимые измерения, деньги, лицензии и железо.
Что говорят измерения
Аналитики Epoch AI считают сводный индекс возможностей ECI по множеству бенчмарков. По данным с 1 января по 28 мая 2026 года лучшие открытые модели отстают от закрытого фронтира в среднем на четыре месяца. В пунктах индекса это около 8 — примерно как разница между GPT-5 и GPT-5.5. При этом разрыв не сократился, а слегка вырос: с 2023 по октябрь 2025 года он был около трёх месяцев.
Сами авторы предупреждают, что четыре месяца могут занижать реальный разрыв. Открытые модели активно подтягиваются под публичные бенчмарки, а закрытые лаборатории держат лучшие системы при себе. При более строгом критерии сравнения разрыв доходит примерно до полугода. Обновлённого пересчёта с учётом летних релизов у Epoch нет, но эксперт Натан Ламберт после выхода Kimi K3 предположил, что разрыв сократился до 3–5 месяцев. Это интерпретация, а не независимое измерение.
Паритет на бенчмарке не равен паритету в продакшене
Средний разрыв мало говорит о конкретной рабочей нагрузке. Модель может быть неотличима от фронтира на извлечении полей из документа и заметно проигрывать на длинных агентных цепочках. Автор приводит пример: при классификации обращений по спорным платежам открытая модель показала разницу с дорогой закрытой в пределах разброса между повторными прогонами. Но при генерации объяснений для антифрод-аналитиков та же модель уверенно ссылалась на внутренние правила, которых не было в контексте.
Из этого следует, что честный вывод можно сделать только о паре «модель плюс задача». Автор советует на демонстрациях новых моделей спрашивать не «какой у неё балл», а «на каких наших примерах её гоняли».
Шпаргалка по задачам
На основе опыта и публичных данных автор составил таблицу применимости open-weight моделей:
- Классификация и маршрутизация обращений — уже сейчас, смотреть на точность на своём размеченном наборе.
- Извлечение полей из документов — уже сейчас, смотреть на формат ответа и долю невалидного JSON.
- RAG по внутренней базе знаний — уже сейчас, смотреть на повторное использование префиксов и выбор движка инференса.
- Генерация текстов со ссылками на регламенты — с осторожностью, проверять ссылки на правила, которых нет в контексте.
- Длинные агентные цепочки с инструментами — пока с резервом на фронтир, смотреть на долю успешно завершённых сценариев.
Автор подчёркивает: это не результат бенчмарка, а сводка опыта и публичных данных.
Для профиТехнические детали: архитектура, цифры, ссылки
В статье приведены конкретные релизы open-weight моделей:
- 24 апреля DeepSeek выложил превью V4 с весами под MIT: версия Pro на 1,6 трлн параметров (49 млрд активных) и Flash на 284 млрд (13 млрд активных), обе с контекстом в 1 млн токенов. 13 августа Pro вышла из превью.
- 16 июля Moonshot AI представила Kimi K3: 2,8 трлн параметров, 104 млрд активных, контекст 1 млн токенов. Веса выложили 27 июля.
- 10 августа Meta выпустила Muse Glimmer на 30 млрд параметров под Apache 2.0, запускается на одной потребительской видеокарте.
- 14 августа Zhipu выпустила GLM-5.3 через API, веса опубликовала 28 августа после двухнедельной проверки на кибербезопасность.
По анализу данных OpenRouter, к маю на китайские open-weight модели приходилось около 61% потреблённых там токенов. Это статистика одного маршрутизатора, а не всего рынка.
Цены и лицензии проверены 16 сентября 2026 года. Индекс ECI от Epoch AI показывает разрыв в 8 пунктов между лучшими открытыми и закрытыми моделями.
Вопросы и ответы
- Насколько открытые модели отстают от закрытых?
- По индексу ECI от Epoch AI — в среднем на четыре месяца, при строгом сравнении до полугода.
- Можно ли уже использовать open-weight модели в продакшене?
- Для классификации, извлечения полей и RAG — да, для длинных агентных цепочек пока рекомендуется резерв на закрытые модели.
- Какие open-weight модели вышли в 2026 году?
- DeepSeek V4, Kimi K3, GLM-5.3 и Muse Glimmer от Meta.


