Redis 創辦人兩週寫了一個推論引擎:DeepSeek V4 Flash 現在能在 128GB Mac 上跑 26 tok/s
Redis 創辦人 Salvatore Sanfilippo(antirez)發布 ds4,一個專為 DeepSeek V4 Flash 打造的本地推論引擎。128GB M3 Max 跑出 26.68 tok/s generation speed,KV cache 移到 SSD,全用 C + Metal 寫成。284B MoE 模型、1M context,第一次在筆電上真正「可用」。
目錄+
Salvatore Sanfilippo,Redis 的創辦人,在 GitHub 上有一個叫 antirez 的帳號,74,000 stars 的 Redis 就是他一個人寫出來的。
2026-05-09,他發布了一個新專案:ds4。
不是通用框架。不是另一個 llama.cpp 包裝器。就一件事:讓 DeepSeek V4 Flash 在 128GB Mac 上真正跑起來。
DeepSeek V4 Flash 是什麼規模的模型
2026-04-24,DeepSeek 發布 V4 系列。V4 Flash 是效率版:
- 284B 總參數(MoE 架構,每次推論只啟用 13B active 參數)
- 1M token context window
- 設計目標是 agentic loop
在這之前,這個規模的模型只活在雲端。
ds4 怎麼把它搬到本地
三個關鍵技術選擇(根據 36kr 報導和 ds4 README):
1. 非對稱量化(Asymmetric quantization)
不是對整個模型一刀切 2-bit,而是不同層用不同精度。注意力投影保留較高精度,FFN 壓縮更激進。在壓縮率和準確度之間找平衡點。
2. KV cache 移到 SSD
這是最反直覺的部分。KV cache 通常放在 RAM,但 1M context 的 KV 量太大,直接放 SSD,Mac 的 SSD 頻寬夠快可以支撐這個設計。
3. Metal-only(Apple Silicon 專用)
不是跨平台設計。ds4 只跑 Metal,充分利用 Apple Silicon 的統一記憶體架構。README 說未來可能支援 CUDA,但語氣很保留。
實測數字
根據 36kr 引用的測試結果:
| 硬體 | context | prefill 速度 | generation 速度 |
|---|---|---|---|
| M3 Max 128GB MacBook Pro | 32K(短提示) | 58.52 tok/s | 26.68 tok/s |
| M3 Ultra 512GB Mac Studio | 長提示(11,709 tokens) | 468.03 tok/s | 27.39 tok/s |
26 tok/s generation speed 在 284B MoE 模型上,是「可以實際用」的水準——不是跑出來看著玩,是能跑 agentic coding loop 的速度。
專案定位刻意保持窄
ds4 README 的定位說得很清楚:不是通用工具,就是一個模型 + 一個平台(Apple Silicon)+ 一個目標(讓本地推論可用)。
整個專案就一個 .c 檔加 Metal 依賴。antirez 在 README 裡特別致謝 llama.cpp 和 GGML 的 Georgi Gerganov,但 ds4 不是包裝它們,而是從 DeepSeek V4 Flash 的特性重新設計執行圖。
現在有三種使用方式:
- Interactive CLI
- HTTP server(OpenAI-compatible API)
- Experimental Agent mode
Agent mode 目前還不穩定,不適合直接生產用。
為什麼要說這件事
閉源大廠在燒幾百億蓋 GPU cluster,一個人花兩週用 C 語言和 Metal 寫了一個推論引擎,讓 frontier 等級的模型在筆電上可用。
這不是「技術上可以跑」的 demo——artka.dev 的測試明確指出,26 tok/s 的速度足以支撐真實的 coding agent 工作流。
本地 AI 的成本正在趨近於一次性硬體投資。 128GB MacBook Pro 或 Mac Studio,買了之後推論成本是零。對於需要私有資料不出境的場景,這個選項的吸引力遠超過雲端 API。
antirez 本人也說了:這個專案刻意保持小、快、專注。它不會變成一個大框架——但它已經證明了這條路走得通。
ds4 GitHub:github.com/antirez/ds4