Создатель Redis выпустил ds4 для локального запуска LLM
Создатель Redis Сальваторе Санфилиппо (antirez) представил ds4 — движок на C для локального запуска открытых LLM на Mac, CUDA и ROCm. Поддерживаются DeepSeek V4 и V4.1 Flash, GLM 5.x и Qwen3.8 Flash Next.
- ds4 написан на C и поддерживает бэкенды Metal, CUDA и ROCm для машин с большим объёмом памяти.
- Движок использует асимметричное 2-битное квантование и imatrix для сжатия routed-экспертов MoE-моделей.
- На M5 Max с 128 ГБ при контексте 2 048 токенов prefill достигает 790,2 т/с, генерация — 39,4 т/с.

Создатель Redis Сальваторе Санфилиппо, известный как antirez, выпустил ds4 — движок для локального запуска открытых LLM. Проект написан на C и работает на Mac с Metal, а также на машинах с CUDA и ROCm. Код доступен под лицензией MIT.
ds4 поддерживает DeepSeek V4 и V4.1 Flash, GLM 5.x и Qwen3.8 Flash Next. Это текстовые и vision-модели, которые запускаются локально через CLI, HTTP API или встроенного агента.
Как это работает
Движок не претендует на роль универсального раннера GGUF. Он поддерживает узкий набор семейств моделей и проверяет каждый формат end to end. Для сжатия routed-экспертов MoE-моделей применяется асимметричное 2-битное квантование с imatrix, при этом критически важные общие пути сохраняются точными.
KV-кэш сохраняется на SSD и восстанавливается по хешу промпта, поэтому перезапуск не требует полного повторного prefill. Движок поддерживает тензорный параллелизм, батчинг сессий и спекулятивное декодирование.
Интерфейсы и запуск
Проект предоставляет три интерфейса: ./ds4 для чата, ./ds4-server для локальных API и ./ds4-agent для постоянных сессий кодинга. Сервер совместим с OpenAI и Anthropic API, поэтому к нему можно подключить Codex, Claude Code и OpenCode.
Для запуска нужно скачать проектный GGUF, собрать под свой бэкенд и запустить CLI или сервер. Обычные GGUF-файлы не поддерживаются.
Требования и производительность
V4 Flash Q2 — базовая конфигурация. На 128 ГБ также помещаются GLM 5.3 Q2 и Qwen Q4, а V4.1 Q2 стримится с SSD. На M5 Max с 128 ГБ при контексте 2 048 токенов prefill составляет 790,2 т/с, генерация — 39,4 т/с. При контексте 65 536 токенов эти показатели падают до 398,5 и 27,6 т/с соответственно. На DGX Spark с 128 ГБ prefill держится около 823–825 т/с, а генерация снижается с 18,1 до 13,8 т/с при росте контекста.
Для профиТехнические детали: архитектура, цифры, ссылки
Архитектура: движок на C, бэкенды Metal, CUDA, ROCm. Поддержка тензорного параллелизма, батчинга сессий, спекулятивного декодирования (DSpark + MTP) и vision-входа.
Квантование: асимметричное 2-битное для routed-экспертов, imatrix, сохранение точности критических путей.
KV-кэш: выгрузка на SSD, возобновление по хешу промпта.
API: OpenAI и Anthropic-совместимые эндпоинты через ./ds4-server.
Лицензия: MIT.
Бенчмарки: M5 Max 128 ГБ, q2, 2 048 токенов — prefill 790,2 т/с, генерация 39,4 т/с; 65 536 токенов — 398,5 и 27,6 т/с. DGX Spark 128 ГБ, q2, 2 048 токенов — 825,8 и 18,1 т/с; 65 536 токенов — 823,0 и 13,8 т/с.
Репозиторий: github.com/antirez/ds4
Вопросы и ответы
- Какие модели поддерживает ds4?
- DeepSeek V4 и V4.1 Flash, GLM 5.x и Qwen3.8 Flash Next, включая текстовые и vision-модели.
- Под какой лицензией выходит ds4?
- Проект распространяется под лицензией MIT.
- Какие бэкенды поддерживаются?
- Metal, CUDA и ROCm.



