Альфа-Банк протестировал LLM как энкодер для классификации на 300+ классов
Альфа-Банк рассказал, как использует LLM не как генератор, а как энкодер для классификации текстов. На четырёх внутренних доменах банка сравнили LLM-бэкбоны с классическими BERT-моделями.
- Промптинг LLM не масштабируется на 300+ классов: контекст раздувается, модель галлюцинирует, инференс занимает десятки секунд
- Вместо генерации ответа берут скрытое состояние последнего слоя LLM и обучают классификационную голову сверху
- Тесты провели на четырёх доменах: от коротких сообщений на 20 токенов до транскриптов звонков на 3000+ токенов

Альфа-Банк опубликовал разбор подхода к классификации текстов, в котором LLM используется не как генератор, а как энкодер. Вместо промптинга с описанием классов модель извлекает скрытое состояние последнего слоя, поверх которого обучается обычная классификационная голова.
Почему промптинг не подходит
При 100+ классах промпт с описаниями занимает десятки тысяч токенов. Модель начинает придумывать несуществующие классы, путать похожие категории и тратить секунды на авторегрессионную генерацию. Для чат-бота с высоким потоком запросов это критично, а инференс на CPU практически невозможен.
BERT-подобные архитектуры остаются рабочим бэкбоном в задачах банка: классификация чатов и звонков контакт-центра, модерация отзывов в Альфа-Инвестиции, внутреннее устройство чат-бота. Они быстрые, дешёвые в обучении и не требуют GPU в проде.
Что известно об LLM как энкодере
Подход опирается на статьи LLM2Vec (arXiv:2404.05961), E5-Mistral (arXiv:2312.15166) и GritLM (arXiv:2402.09906). В LLM2Vec декодерную модель адаптируют в три шага: включают двунаправленное внимание, дообучают на маскированном предсказании токенов и применяют контрастивное обучение с InfoNCE loss.
Среди русскоязычных эмбеддинг-моделей на базе LLM авторы выделяют Qwen3-Embedding и Giga-Embedding. В статье также упоминаются русскоязычные энкодеры RuModernBERT и USER-bge-m3 от VK, FRIDA от Сбера и её дистиллят BERTA.
Четыре домена для сравнения
Чтобы не делать выводов по одной задаче, в банке отобрали четыре домена с разными сценариями: от коротких сообщений на 20 токенов до длинных транскриптов звонков на 3000+ токенов, от бинарной классификации до мультикласса на 300+ классов. Один из доменов — QMS.
Авторы дообучали как весь бэкбон целиком, так и LoRA-адаптер вместе с головой. Главный вопрос, на который они хотели ответить: в каких условиях LLM-классификатор реально обходит BERT, а когда лучше оставить классические модели.
Для профиТехнические детали: архитектура, цифры, ссылки
Подход: LLM используется как энкодер, скрытое состояние последнего слоя подаётся на классификационную голову. Дообучение — полный бэкбон или LoRA-адаптер с головой.
Сравнение проводилось на четырёх внутренних доменах Альфа-Банка: QMS, классификация чатов и звонков контакт-центра, модерация отзывов в Альфа-Инвестиции. Диапазон задач — от 20 до 3000+ токенов, от бинарной до 300+ классов.
Референсные работы: LLM2Vec (arXiv:2404.05961), E5-Mistral (arXiv:2312.15166), GritLM (arXiv:2402.09906). Русскоязычные модели: RuModernBERT, USER-bge-m3 (VK), FRIDA, BERTA (Сбер), Qwen3-Embedding, Giga-Embedding.
Что это значит для России
Материал описывает внутренние задачи Альфа-Банка, поэтому практическая применимость подхода ограничена инфраструктурой банка. Из русскоязычных инструментов в статье упоминаются открытые модели: RuModernBERT и USER-bge-m3 от VK, FRIDA и BERTA от Сбера, а также Qwen3-Embedding и Giga-Embedding.
Вопросы и ответы
- Почему нельзя просто использовать промптинг LLM для классификации?
- При 100+ классах промпт занимает десятки тысяч токенов, модель галлюцинирует и путает похожие классы, а авторегрессионная генерация на каждый запрос занимает секунды.
- Как Альфа-Банк использует LLM для классификации?
- Модель работает как энкодер: берётся скрытое состояние последнего слоя, поверх которого обучается классификационная голова. Дообучать можно весь бэкбон или LoRA-адаптер.


