Альфа-Банк протестировал LLM как энкодер для классификации на 300+ классов

Альфа-Банк рассказал, как использует LLM не как генератор, а как энкодер для классификации текстов. На четырёх внутренних доменах банка сравнили LLM-бэкбоны с классическими BERT-моделями.

Главное
  • Промптинг LLM не масштабируется на 300+ классов: контекст раздувается, модель галлюцинирует, инференс занимает десятки секунд
  • Вместо генерации ответа берут скрытое состояние последнего слоя LLM и обучают классификационную голову сверху
  • Тесты провели на четырёх доменах: от коротких сообщений на 20 токенов до транскриптов звонков на 3000+ токенов
Схема использования LLM как энкодера для классификации текстов с классификационной головой
Фото: Хабр: Машинное обучение

Альфа-Банк опубликовал разбор подхода к классификации текстов, в котором LLM используется не как генератор, а как энкодер. Вместо промптинга с описанием классов модель извлекает скрытое состояние последнего слоя, поверх которого обучается обычная классификационная голова.

Почему промптинг не подходит

При 100+ классах промпт с описаниями занимает десятки тысяч токенов. Модель начинает придумывать несуществующие классы, путать похожие категории и тратить секунды на авторегрессионную генерацию. Для чат-бота с высоким потоком запросов это критично, а инференс на CPU практически невозможен.

BERT-подобные архитектуры остаются рабочим бэкбоном в задачах банка: классификация чатов и звонков контакт-центра, модерация отзывов в Альфа-Инвестиции, внутреннее устройство чат-бота. Они быстрые, дешёвые в обучении и не требуют GPU в проде.

Что известно об LLM как энкодере

Подход опирается на статьи LLM2Vec (arXiv:2404.05961), E5-Mistral (arXiv:2312.15166) и GritLM (arXiv:2402.09906). В LLM2Vec декодерную модель адаптируют в три шага: включают двунаправленное внимание, дообучают на маскированном предсказании токенов и применяют контрастивное обучение с InfoNCE loss.

Среди русскоязычных эмбеддинг-моделей на базе LLM авторы выделяют Qwen3-Embedding и Giga-Embedding. В статье также упоминаются русскоязычные энкодеры RuModernBERT и USER-bge-m3 от VK, FRIDA от Сбера и её дистиллят BERTA.

Четыре домена для сравнения

Чтобы не делать выводов по одной задаче, в банке отобрали четыре домена с разными сценариями: от коротких сообщений на 20 токенов до длинных транскриптов звонков на 3000+ токенов, от бинарной классификации до мультикласса на 300+ классов. Один из доменов — QMS.

Авторы дообучали как весь бэкбон целиком, так и LoRA-адаптер вместе с головой. Главный вопрос, на который они хотели ответить: в каких условиях LLM-классификатор реально обходит BERT, а когда лучше оставить классические модели.

Для профиТехнические детали: архитектура, цифры, ссылки

Подход: LLM используется как энкодер, скрытое состояние последнего слоя подаётся на классификационную голову. Дообучение — полный бэкбон или LoRA-адаптер с головой.

Сравнение проводилось на четырёх внутренних доменах Альфа-Банка: QMS, классификация чатов и звонков контакт-центра, модерация отзывов в Альфа-Инвестиции. Диапазон задач — от 20 до 3000+ токенов, от бинарной до 300+ классов.

Референсные работы: LLM2Vec (arXiv:2404.05961), E5-Mistral (arXiv:2312.15166), GritLM (arXiv:2402.09906). Русскоязычные модели: RuModernBERT, USER-bge-m3 (VK), FRIDA, BERTA (Сбер), Qwen3-Embedding, Giga-Embedding.

Что это значит для России

Материал описывает внутренние задачи Альфа-Банка, поэтому практическая применимость подхода ограничена инфраструктурой банка. Из русскоязычных инструментов в статье упоминаются открытые модели: RuModernBERT и USER-bge-m3 от VK, FRIDA и BERTA от Сбера, а также Qwen3-Embedding и Giga-Embedding.

Вопросы и ответы

Почему нельзя просто использовать промптинг LLM для классификации?
При 100+ классах промпт занимает десятки тысяч токенов, модель галлюцинирует и путает похожие классы, а авторегрессионная генерация на каждый запрос занимает секунды.
Как Альфа-Банк использует LLM для классификации?
Модель работает как энкодер: берётся скрытое состояние последнего слоя, поверх которого обучается классификационная голова. Дообучать можно весь бэкбон или LoRA-адаптер.