Память агента против окна в миллион токенов: тесты Радианта в Битрикс24
Инженер Битрикс24 Глеб Смольяков сравнил долговременную память агента Радиант с загрузкой истории в контекстное окно на миллион токенов. Радиант нашёл 15 из 15 старых сообщений, но на длинном контексте модель путает похожие факты.
- Память Радианта в тесте заняла 6,8 млн токенов — в 6,5 раза больше окна на миллион токенов.
- Радиант нашёл 15 из 15 сообщений возрастом от месяца до пяти лет, включая записи пятилетней давности.
- На контексте 700 тыс. токенов модель ответила неверным портом стенда, спутав его с соседней записью.

Инженер-программист DevRel-отдела Битрикс24 Глеб Смольяков проверил, справляется ли долговременная память агента с задачей, которую не решает даже контекстное окно на миллион токенов. В агенте Битрикс24 Коворк/Код за долговременную память отвечает слой Радиант: он собирает данные из переписки, задач, статей базы знаний, карточек людей, чатов и событий и хранит их в локальном хранилище.
Проблема длинного контекста
Контекстное окно работает внутри одного сеанса и вмещает только последние четыре месяца переписки. Память Радианта в эксперименте весила 6,8 млн токенов — в 6,5 раза больше окна на миллион токенов. Чем длиннее контекст, тем чаще модель теряет нужный факт и путает его с похожим.
Автор проверил это на синтетическом журнале команды с вымышленными именами и задачами. Модель bitrixgpt-5.6-agent через AI Router искала факт в контексте разного объёма. После 400 тыс. токенов точность быстро снижалась: на 700 тыс. токенов модель уверенно называла порт соседнего стенда вместо нужного и ни разу не ответила «не знаю».
Как устроена память Радианта
Основной объём памяти занимают карточки людей, чатов, статей и событий — около 3,9 млн токенов. Журнал переписки — примерно 2,6 млн токенов, задачи — 0,16 млн, темы и справочные страницы — 0,1 млн. Данные лежат в Markdown и JSON, поиск идёт по словам запроса без векторного индекса.
Глубина памяти зависит от тарифа: 30, 90 или 180 дней либо без ограничения. После обновления Радиант догрузил старую историю: журнал переписки вырос с 2432 до 17 085 сообщений, в памяти оказались сообщения пятилетней давности.
Результаты экспериментов
В тесте на 15 сообщениях возрастом от месяца до пяти лет Радиант нашёл все 15, правильно называя чат и дату. Без Радианта в контекстное окно попали бы только четыре сообщения не старше трёх месяцев. Верный ответ приходил в медиане через 101 секунду.
На 12 одинаковых вопросах Коворк с Радиантом дал 11 верных ответов, а выгрузка памяти до 380 тыс. токенов в контекст — 8 из 12. Выгрузка отвечала быстрее, в среднем за 10 секунд против 87, и лучше обобщала темы работы за месяц.
Для профиТехнические детали: архитектура, цифры, ссылки
Тесты проводились на модели bitrixgpt-5.6-agent через AI Router — OpenAI-совместимый API Битрикс24. Каждый объём контекста прогонялся 3–5 раз. Для сравнения тот же тест провели на bitrixgpt-5.5: на 200 тыс. токенов она ответила «8138» вместо верного «8443».
- Память Радианта: карточки — ~3,9 млн токенов, переписка — ~2,6 млн, задачи — ~0,16 млн, темы и справочные страницы — ~0,1 млн, всего ~6,8 млн без служебного слоя.
- Поиск двухэтапный: сначала находятся все записи с хотя бы одним словом из запроса (медиана 3294 записи), модели уходит не больше 100 верхних.
- В выгрузку для второго варианта поместились 107 карточек сотрудников из 230, база знаний не влезла.
- У Радианта был один неверный ответ: агент придумал идентификатор на месте значения, затёртого фильтром персональных данных.
Что это значит для России
Радиант — часть агента Коворк/Код от Битрикс24, российского разработчика корпоративных решений. Память хранится локально на компьютере пользователя, а поиск работает без векторного индекса. Глубина хранения зависит от тарифа: 30, 90 или 180 дней либо без ограничения.
Вопросы и ответы
- Что такое Радиант?
- Слой долговременной памяти агента Битрикс24 Коворк/Код, который собирает данные из переписки, задач, статей базы знаний и карточек и хранит их локально.
- Сколько данных вмещает память Радианта?
- В эксперименте память заняла 6,8 млн токенов без служебного слоя. Глубина хранения зависит от тарифа: 30, 90, 180 дней или без ограничения.
- Почему одного контекстного окна недостаточно?
- Окно на миллион токенов вмещает переписку только за последние четыре месяца, а на длинном контексте модель чаще теряет нужный факт и путает его с похожим.



