Малые языковые модели: где они работают, а где уступают LLM

Малые языковые модели (SLM) всё чаще рассматривают как дешёвую альтернативу LLM. Разбираем, где они действительно полезны, а где пока уступают крупным моделям.

Главное
  • SLM насчитывают от нескольких миллионов до 10 млрд параметров, к ним относят Qwen3.5–0.8B, Gemma 2–9B и Gemini Nano-1 и Nano-2
  • По данным летнего отчёта Hugging Face, на модели с менее чем 1 млрд параметров приходится около 83% всех загрузок
  • В NVIDIA дообучили Llama 3 8B Instruct через LoRA для код-ревью — точность оценки критичности замечаний выросла более чем на 18%
Иллюстрация к статье о малых языковых моделях и их применении
Фото: Хабр: Машинное обучение

Малые языковые модели (SLM) всё чаще оказываются в центре внимания: они почти не уступают LLM в узких задачах, но тратят намного меньше ресурсов. Разбираемся, где они действительно полезны, а где пока буксуют.

Что такое SLM

Малая языковая модель может насчитывать от нескольких миллионов до 10 млрд параметров. К таким моделям относят Qwen3.5–0.8B от Alibaba и часть семейства Gemma от Google DeepMind с 2–9 млрд параметров. Gemini предлагает лёгкие варианты Nano-1 и Nano-2 с 1,8 млрд и 3,25 млрд параметров — они заточены под работу на смартфонах и планшетах.

В NVIDIA предлагают относить к SLM всё, что можно запустить на потребительских устройствах: ПК или ноутбуках. Такой подход размывает границы между малыми и крупными моделями. Например, Microsoft называет Phi-4 14B малой языковой моделью, потому что её квантованная версия запускается на одной потребительской видеокарте.

Популярность таких решений растёт. По данным летнего отчёта Hugging Face, на модели с более чем 100 млрд параметров приходится лишь 1% всех загрузок, а на модели с менее чем 1 млрд — около 83%. К ним обращаются энтузиасты, исследователи и образовательные организации.

Где пригодятся SLM

Малые модели эффективны в узкоспециализированных сценариях, где важна скорость: классификация звонков, фильтрация спама. Наиболее вероятный сценарий — использование в агентских системах, где есть мозг-оркестратор, который распределяет задачи между узкими моделями.

Наиболее вероятный сценарий для малых языковых моделей — это их использование в агентских системах, где есть некий мозг-оркестратор, которому выдается задача. И он, зная описание узкоспециализированных моделей, уже определяет, какую задачу какой из них выдать.— Максим Шкут, Data Scientist, ВТБ

Можно взять одну базовую архитектуру и дообучить её, получив семейство узких моделей. Полное обучение дороже, чем LoRA-адаптеры, но даёт более качественный результат. На практике стоит использовать комбинированный подход.

Код-ревью и унификация кода

Данные для дообучения под рефакторинг можно взять в корпоративном репозитории: коммиты показывают состояние кода «до» и «после». В NVIDIA дообучили Llama 3 8B Instruct с помощью LoRA для внутреннего код-ревью, обучающие примеры создавала GPT-4 по схеме дистилляции знаний. Точность оценки критичности замечаний выросла более чем на 18%, результат оказался лучше, чем у Llama 3 70B и Nemotron 4 340B Instruct, при меньшей стоимости и задержке.

Исследования показывают, что SLM с открытыми весами справляются с унификацией кода и без тонкой настройки. Учёные из Университета имени Лоранда Этвеша протестировали двенадцать моделей от 0,5 до 8 млрд параметров на трёх тысячах Python-программ из бенчмарка APPS. После правок число нарушений PEP-8 сокращалось на 65–86%.

Работа с базами данных

Малые модели могут проявить себя и здесь, но с ограничениями. Схема реального хранилища слишком велика, чтобы целиком поместить её в промпт, поэтому нужен способ отсечь лишние таблицы и столбцы. Это отдельная инженерная задача, которую приходится решать при развёртывании SLM.

Для профиТехнические детали: архитектура, цифры, ссылки

Дообучение через LoRA: метод позволяет адаптировать нейросеть к стилю, формату ответов или предметной области с помощью дополнительного набора параметров. Требует значительно меньше ресурсов, чем полное дообучение, и в некоторых случаях обходится всего в восемь долларов.

Бенчмарки: исследователи из Университета Конкордия и Политехнической школы Монреаля в 2024 году сравнили две открытые модели с 7 млрд параметров с результатами ChatGPT 3.5 на двух тысячах задач по доработке программ. Лучше всего SLM справлялись с локальными изменениями: переименованием сущностей и оформлением кода по соглашениям проекта.

Пример развёртывания: в Колледже Джона Эббота в Монреале развернули связку из трёх моделей на 3–7 млрд параметров (Llama3.2–3B, Qwen2.5–7B и Neural-Chat 7B) на сервере с macOS без топовых GPU. Система помогает преподавателям физики проверять лабораторные работы.

Вопросы и ответы

Что такое малая языковая модель?
Модель с числом параметров от нескольких миллионов до 10 млрд. В NVIDIA к SLM относят всё, что запускается на потребительских устройствах.
Где SLM применяются лучше всего?
В узких задачах: классификация звонков, фильтрация спама, код-ревью, работа с базами данных и агентские системы с оркестратором.
Сколько стоит дообучение SLM?
С помощью метода LoRA дообучение в некоторых случаях обходится всего в восемь долларов.