Малые языковые модели: где они работают, а где уступают LLM
Малые языковые модели (SLM) всё чаще рассматривают как дешёвую альтернативу LLM. Разбираем, где они действительно полезны, а где пока уступают крупным моделям.
- SLM насчитывают от нескольких миллионов до 10 млрд параметров, к ним относят Qwen3.5–0.8B, Gemma 2–9B и Gemini Nano-1 и Nano-2
- По данным летнего отчёта Hugging Face, на модели с менее чем 1 млрд параметров приходится около 83% всех загрузок
- В NVIDIA дообучили Llama 3 8B Instruct через LoRA для код-ревью — точность оценки критичности замечаний выросла более чем на 18%

Малые языковые модели (SLM) всё чаще оказываются в центре внимания: они почти не уступают LLM в узких задачах, но тратят намного меньше ресурсов. Разбираемся, где они действительно полезны, а где пока буксуют.
Что такое SLM
Малая языковая модель может насчитывать от нескольких миллионов до 10 млрд параметров. К таким моделям относят Qwen3.5–0.8B от Alibaba и часть семейства Gemma от Google DeepMind с 2–9 млрд параметров. Gemini предлагает лёгкие варианты Nano-1 и Nano-2 с 1,8 млрд и 3,25 млрд параметров — они заточены под работу на смартфонах и планшетах.
В NVIDIA предлагают относить к SLM всё, что можно запустить на потребительских устройствах: ПК или ноутбуках. Такой подход размывает границы между малыми и крупными моделями. Например, Microsoft называет Phi-4 14B малой языковой моделью, потому что её квантованная версия запускается на одной потребительской видеокарте.
Популярность таких решений растёт. По данным летнего отчёта Hugging Face, на модели с более чем 100 млрд параметров приходится лишь 1% всех загрузок, а на модели с менее чем 1 млрд — около 83%. К ним обращаются энтузиасты, исследователи и образовательные организации.
Где пригодятся SLM
Малые модели эффективны в узкоспециализированных сценариях, где важна скорость: классификация звонков, фильтрация спама. Наиболее вероятный сценарий — использование в агентских системах, где есть мозг-оркестратор, который распределяет задачи между узкими моделями.
Наиболее вероятный сценарий для малых языковых моделей — это их использование в агентских системах, где есть некий мозг-оркестратор, которому выдается задача. И он, зная описание узкоспециализированных моделей, уже определяет, какую задачу какой из них выдать.— Максим Шкут, Data Scientist, ВТБ
Можно взять одну базовую архитектуру и дообучить её, получив семейство узких моделей. Полное обучение дороже, чем LoRA-адаптеры, но даёт более качественный результат. На практике стоит использовать комбинированный подход.
Код-ревью и унификация кода
Данные для дообучения под рефакторинг можно взять в корпоративном репозитории: коммиты показывают состояние кода «до» и «после». В NVIDIA дообучили Llama 3 8B Instruct с помощью LoRA для внутреннего код-ревью, обучающие примеры создавала GPT-4 по схеме дистилляции знаний. Точность оценки критичности замечаний выросла более чем на 18%, результат оказался лучше, чем у Llama 3 70B и Nemotron 4 340B Instruct, при меньшей стоимости и задержке.
Исследования показывают, что SLM с открытыми весами справляются с унификацией кода и без тонкой настройки. Учёные из Университета имени Лоранда Этвеша протестировали двенадцать моделей от 0,5 до 8 млрд параметров на трёх тысячах Python-программ из бенчмарка APPS. После правок число нарушений PEP-8 сокращалось на 65–86%.
Работа с базами данных
Малые модели могут проявить себя и здесь, но с ограничениями. Схема реального хранилища слишком велика, чтобы целиком поместить её в промпт, поэтому нужен способ отсечь лишние таблицы и столбцы. Это отдельная инженерная задача, которую приходится решать при развёртывании SLM.
Для профиТехнические детали: архитектура, цифры, ссылки
Дообучение через LoRA: метод позволяет адаптировать нейросеть к стилю, формату ответов или предметной области с помощью дополнительного набора параметров. Требует значительно меньше ресурсов, чем полное дообучение, и в некоторых случаях обходится всего в восемь долларов.
Бенчмарки: исследователи из Университета Конкордия и Политехнической школы Монреаля в 2024 году сравнили две открытые модели с 7 млрд параметров с результатами ChatGPT 3.5 на двух тысячах задач по доработке программ. Лучше всего SLM справлялись с локальными изменениями: переименованием сущностей и оформлением кода по соглашениям проекта.
Пример развёртывания: в Колледже Джона Эббота в Монреале развернули связку из трёх моделей на 3–7 млрд параметров (Llama3.2–3B, Qwen2.5–7B и Neural-Chat 7B) на сервере с macOS без топовых GPU. Система помогает преподавателям физики проверять лабораторные работы.
Вопросы и ответы
- Что такое малая языковая модель?
- Модель с числом параметров от нескольких миллионов до 10 млрд. В NVIDIA к SLM относят всё, что запускается на потребительских устройствах.
- Где SLM применяются лучше всего?
- В узких задачах: классификация звонков, фильтрация спама, код-ревью, работа с базами данных и агентские системы с оркестратором.
- Сколько стоит дообучение SLM?
- С помощью метода LoRA дообучение в некоторых случаях обходится всего в восемь долларов.

