Учёные из Китая научили ИИ общаться без текста — модели обмениваются памятью
Исследователи из Университета Цинхуа представили метод Cache-to-Cache (C2C), который позволяет моделям ИИ обмениваться данными напрямую через кеш, без генерации текста. Исходный код уже открыт, а скорость совместной работы растёт на 100–150 %.
- Метод C2C исключает текстовый обмен между моделями: одна модель передаёт содержимое своего кеша в память другой.
- Скорость совместной работы моделей увеличивается на 100–150 %, точность растёт на 14,2 %.
- Пока метод применим только к моделям с открытыми весами, исходный код доступен разработчикам.

Учёные из Университета Цинхуа в Китае представили метод Cache-to-Cache (C2C), который позволяет разным моделям ИИ общаться напрямую, не преобразуя свои «мысли» в текст. Исходный код решения уже доступен разработчикам.
Обычно, когда несколько языковых моделей работают в одном конвейере, одной приходится превращать результаты своих вычислений в текстовые предложения, чтобы другая могла их прочитать. На это уходят вычислительные ресурсы, а часть мелких деталей теряется. Модель хранит сведения об обработанных данных в оперативной памяти — кеше. C2C предлагает передавать содержимое этого кеша напрямую из одной модели в другую.
За передачу отвечает вспомогательная программа Fuser. Она преобразует и адаптирует данные так, чтобы принимающая модель могла ими пользоваться. Разные модели используют несовместимые внутренние форматы, объёмы и структуры хранения, поэтому прямая передача «сырой» информации могла бы привести к сбоям или потере связности ответов. Чтобы этого избежать, C2C применяет интеллектуальный фильтр: одни внутренние слои принимают новые данные сразу, другие продолжают вычисления автономно.
По данным исследователей, при совместном выполнении задач скорость работы моделей увеличивается на 100–150 %. Точность по сравнению с автономной работой возрастает на 14,2 %, а по сравнению с текстовым обменом — на 3,1–5,4 %.
Пока метод работает только с моделями, у которых открыты веса: нужен прямой доступ к кешу и структуре слоёв. Исследователи отмечают, что генерация текста при совместной работе моделей всегда замедляла вычисления, поскольку вынуждала ИИ «мыслить» подобно людям.
Для профиТехнические детали: архитектура, цифры, ссылки
Метод Cache-to-Cache (C2C) разработан в Университете Цинхуа. Ключевой компонент — программа Fuser, которая преобразует и адаптирует содержимое кеша одной модели для другой. Внутренние слои принимающей модели работают по фильтру: часть данных усваивается немедленно, остальные вычисления продолжаются автономно.
Заявленные показатели: ускорение совместной работы на 100–150 %, рост точности на 14,2 % относительно автономного режима и на 3,1–5,4 % относительно текстового обмена. Ограничение — метод применим только к моделям с открытыми весами, поскольку требуется прямой доступ к кешу и структуре слоёв. Исходный код открыт.
Вопросы и ответы
- Что такое Cache-to-Cache?
- Метод обмена данными между моделями ИИ напрямую через кеш, без генерации текста.
- Насколько быстрее работают модели с C2C?
- Скорость совместной работы увеличивается на 100–150 %, точность — на 14,2 %.
- Доступен ли метод для закрытых моделей?
- Нет, пока только для моделей с открытыми весами, так как нужен доступ к кешу и структуре слоёв.

