Yandex Research предложила управлять поведением LLM через KV-кеш
Yandex Research исследует, как сделать LLM-агента интерактивным без переобучения модели — за счёт манипуляций с KV-кешем. Подход описан в работах Hogwild Inference и AsyncReasoning.
- Yandex Research предлагает рассматривать KV-кеш не как оптимизацию, а как активное состояние выполнения модели
- Подход позволяет агентам получать новые данные прямо во время генерации, не дожидаясь завершения рассуждения
- В Hogwild Inference несколько экземпляров одной модели работают параллельно и пишут токены в общую память

Исследователи Yandex Research предложили подход, который позволяет сделать LLM-агента интерактивным без изменения весов уже обученной модели. Об этом рассказал исследователь Yandex Research и выпускник ШАД Георгий Якушев. Идея в том, чтобы перестать воспринимать KV-кеш только как способ ускорить генерацию и начать рассматривать его как активное состояние агента.
Почему обычный цикл не подходит для интерактивных задач
Современные агенты обычно работают по схеме «прочитать — подумать — ответить»: модель получает фиксированный контекст, генерирует рассуждение, вызывает инструмент, ждёт результат и продолжает. Для чат-бота такая задержка может быть приемлемой, но для голосового ассистента, робота, игрового агента или системы, следящей за видеопотоком, это становится фундаментальным ограничением.
Пока модель рассуждает, новая информация остаётся за пределами процесса. Пользователь может уточнить вопрос, камера — передать следующий кадр, инструмент — вернуть результат, но модель не увидит ничего из этого, пока не закончит начатое. Если пользователь уточнит запрос на середине рассуждения, уже выполненные вычисления часто приходится отбрасывать.
KV-кеш как активное состояние
При авторегрессионной генерации ключи и значения в аттеншене для предыдущих токенов не меняются, и модель сохраняет их в KV-кеше, чтобы не вычислять префикс заново. Обычно кеш считают пассивной оптимизацией, но исследователи предлагают другой взгляд: это активное состояние выполнения модели. Он определяет, какие результаты предыдущих вычислений увидит новый запрос, в каком причинном порядке они расположены и какие промежуточные состояния повлияют на следующий токен.
Вместо одного длинного контекста можно хранить набор дополняемых блоков. Отдельные блоки соответствуют входящим сообщениям пользователя, внутреннему рассуждению, ответу агента, результатам вызова инструментов, визуальным наблюдениям или работе других субагентов. Разным процессам при этом доступны разные логические представления одних и тех же физических блоков.
Для моделей с RoPE это можно сделать без повторного кодирования и копирования всего кеша: блок достаточно один раз сохранить в локальных координатах, а во время запроса attention kernel применяет к текущему query поворот, зависящий от конкретного блока. Один и тот же физический блок в разных потоках оказывается на разных логических позициях.
Hogwild Inference и AsyncReasoning
В работе Hogwild Inference несколько экземпляров одной предобученной модели работают одновременно и записывают свои токены в общую память. Каждый воркер видит незавершённые генерации остальных сразу, не дожидаясь, пока те сформулируют полное сообщение или закончат цепочку рассуждений. По ходу генерации модели могут разделить задачу, проверить чужое решение, попробовать другой подход, заметить дублирование или продолжить перспективную мысль другого воркера.
Для этого каждому участнику нужен свой логический порядок блоков. Истории воркеров сохраняются как переиспользуемые блоки, а нужное представление задаётся отдельными поворотами query внутри attention kernel. В результате агенты координируются через общее состояние, хотя специально мультиагентному взаимодействию их не обучали. По словам авторов, модель не приобретает новых знаний, но такое взаимодействие позволяет решать сложные задачи быстрее за счёт большей коллаборативности агентов.
AsyncReasoning применяет тот же принцип к другой проблеме: обычный reasoning-пайплайн устроен как строгий цикл, где рассуждение блокирует ответ.
Для профиТехнические детали: архитектура, цифры, ссылки
Подход опирается на математику поворотов RoPE: блок кеша сохраняется в локальных координатах, а attention kernel применяет к текущему query поворот, зависящий от блока. Это превращает плоский append-only-тензор в переиспользуемую память с несколькими представлениями.
Работы, в которых описан подход: Hogwild Inference и AsyncReasoning. Автор статьи — Георгий Якушев, исследователь Yandex Research, преподаватель и выпускник ШАД.
Что это значит для России
Исследование выполнено в Yandex Research, материал опубликован на Хабре. Подход не требует переобучения модели и работает на уровне инференса, что упрощает его применение к уже развёрнутым моделям.
Вопросы и ответы
- Нужно ли переобучать модель для такого подхода?
- Нет, подход реализуется на уровне инференса, без изменения весов уже обученной модели.
- Для каких задач это нужно?
- Для голосовых ассистентов, роботов, игровых агентов и систем, следящих за непрерывным видеопотоком.

