Создатель Redis выпустил ds4 для локального запуска LLM

Создатель Redis Сальваторе Санфилиппо (antirez) представил ds4 — движок на C для локального запуска открытых LLM на Mac, CUDA и ROCm. Поддерживаются DeepSeek V4 и V4.1 Flash, GLM 5.x и Qwen3.8 Flash Next.

Главное
  • ds4 написан на C и поддерживает бэкенды Metal, CUDA и ROCm для машин с большим объёмом памяти.
  • Движок использует асимметричное 2-битное квантование и imatrix для сжатия routed-экспертов MoE-моделей.
  • На M5 Max с 128 ГБ при контексте 2 048 токенов prefill достигает 790,2 т/с, генерация — 39,4 т/с.
Логотип проекта ds4 и схема архитектуры локального движка для запуска LLM
Фото: Hacker News: AI

Создатель Redis Сальваторе Санфилиппо, известный как antirez, выпустил ds4 — движок для локального запуска открытых LLM. Проект написан на C и работает на Mac с Metal, а также на машинах с CUDA и ROCm. Код доступен под лицензией MIT.

ds4 поддерживает DeepSeek V4 и V4.1 Flash, GLM 5.x и Qwen3.8 Flash Next. Это текстовые и vision-модели, которые запускаются локально через CLI, HTTP API или встроенного агента.

Как это работает

Движок не претендует на роль универсального раннера GGUF. Он поддерживает узкий набор семейств моделей и проверяет каждый формат end to end. Для сжатия routed-экспертов MoE-моделей применяется асимметричное 2-битное квантование с imatrix, при этом критически важные общие пути сохраняются точными.

KV-кэш сохраняется на SSD и восстанавливается по хешу промпта, поэтому перезапуск не требует полного повторного prefill. Движок поддерживает тензорный параллелизм, батчинг сессий и спекулятивное декодирование.

Интерфейсы и запуск

Проект предоставляет три интерфейса: ./ds4 для чата, ./ds4-server для локальных API и ./ds4-agent для постоянных сессий кодинга. Сервер совместим с OpenAI и Anthropic API, поэтому к нему можно подключить Codex, Claude Code и OpenCode.

Для запуска нужно скачать проектный GGUF, собрать под свой бэкенд и запустить CLI или сервер. Обычные GGUF-файлы не поддерживаются.

Требования и производительность

V4 Flash Q2 — базовая конфигурация. На 128 ГБ также помещаются GLM 5.3 Q2 и Qwen Q4, а V4.1 Q2 стримится с SSD. На M5 Max с 128 ГБ при контексте 2 048 токенов prefill составляет 790,2 т/с, генерация — 39,4 т/с. При контексте 65 536 токенов эти показатели падают до 398,5 и 27,6 т/с соответственно. На DGX Spark с 128 ГБ prefill держится около 823–825 т/с, а генерация снижается с 18,1 до 13,8 т/с при росте контекста.

Для профиТехнические детали: архитектура, цифры, ссылки

Архитектура: движок на C, бэкенды Metal, CUDA, ROCm. Поддержка тензорного параллелизма, батчинга сессий, спекулятивного декодирования (DSpark + MTP) и vision-входа.

Квантование: асимметричное 2-битное для routed-экспертов, imatrix, сохранение точности критических путей.

KV-кэш: выгрузка на SSD, возобновление по хешу промпта.

API: OpenAI и Anthropic-совместимые эндпоинты через ./ds4-server.

Лицензия: MIT.

Бенчмарки: M5 Max 128 ГБ, q2, 2 048 токенов — prefill 790,2 т/с, генерация 39,4 т/с; 65 536 токенов — 398,5 и 27,6 т/с. DGX Spark 128 ГБ, q2, 2 048 токенов — 825,8 и 18,1 т/с; 65 536 токенов — 823,0 и 13,8 т/с.

Репозиторий: github.com/antirez/ds4

Вопросы и ответы

Какие модели поддерживает ds4?
DeepSeek V4 и V4.1 Flash, GLM 5.x и Qwen3.8 Flash Next, включая текстовые и vision-модели.
Под какой лицензией выходит ds4?
Проект распространяется под лицензией MIT.
Какие бэкенды поддерживаются?
Metal, CUDA и ROCm.