跳到主要內容
$599 Mac Mini 取代 $200/月 Claude 訂閱:這個方法真的可行嗎?
/閱讀約 7 分鐘/

$599 Mac Mini 取代 $200/月 Claude 訂閱:這個方法真的可行嗎?

有人每月花 $200 訂 Claude Max,3 小時就燒完。他買了 $599 Mac Mini M4,裝上本地模型,讓 AI 在他睡覺時繼續工作。這個設定可行嗎?哪些情況適合,哪些不適合?

目錄+

凌晨 4 點,Claude 跳出請求上限。

Chesny 沒有驚慌。他早就預料到了。這個月這是第三次——他每個月付 $200 訂 Claude Max,但只要進入密集工作節奏,3 小時就能把當日額度燒光。這不是濫用,是他的正常工作量。

這次他沒有等到早上補額度,也沒有考慮升方案。他做了一件更根本的事:花 $599 買了一台 Mac Mini M4,裝上 5 個本地模型,讓系統繼續跑。

早上起床看 logs,一切正常。

鄰居以為他在挖礦。


先把帳算清楚

這個故事的核心不是技術,是數學。

費用
Claude Max 訂閱$200 / 月
一年下來$2,400
Mac Mini M4 基本款$599(一次性)
Ollama + 本地模型免費

買了 Mac Mini,3 個月就回本。之後每個月省下 200。第一年等於用200。第一年等於用 599 換到 $1,801 的淨節省。

當然,這個算法有一個前提:你的工作流可以讓本地模型取代雲端訂閱。這個前提不是對所有人都成立——後面會說清楚。


Mac Mini M4 跑本地 AI 的真實狀況

Mac Mini M4 基本款,$599,16GB unified memory。蘋果的 M 系列晶片有一個其他電腦沒有的優勢:CPU 和 GPU 共用同一塊記憶體,沒有傳統顯卡需要透過 PCIe 傳輸資料的瓶頸。這讓 16GB 在本地跑 AI 模型時表現比聽起來好得多。

7B 到 8B 的量化模型:跑起來非常順,速度很快,適合大多數日常任務。

35B 的大型模型:這裡要說實話。

Chesny 提到他用了一個叫 OLLAMA_FLASH_ATTENTION=1 的 flag,讓 35B 模型可以在 16GB 上跑起來。這個 flag 的作用是改善記憶體使用效率,技術上確實讓原本裝不進去的模型變成裝得進去。

但「跑起來」不等於「跑得快」。

16GB 裝 35B 模型,必須把一部分資料存到 SSD(這就是 mmap,memory-mapped file 的縮寫——簡單說就是把 SSD 當成記憶體的延伸來用)。速度會比純記憶體跑明顯慢,context window 也會受限。

Chesny 說「大家都說不可能,一個 flag 讓他們都錯了」。更精確的說法是:一個 flag 讓它從不可能變成有條件可行——而他的工作流恰好符合那些條件。


什麼工作流適合這個設定

Chesny 的工作流設計有一個關鍵:他把任務分層。

不需要即時回應、可以排隊跑的工作——分類、壓縮 context、批次處理——交給本地模型在後台慢慢跑。需要高品質推理的部分,再呼叫雲端 API。凌晨 4 點雲端斷線後,本地模型接手繼續跑。他睡覺,系統工作。

這套設計對以下情境特別有效:

  • 批次處理任務:整理文件、分類資料、壓縮 context
  • 非即時工作:可以排隊、不需要幾秒內回應
  • 有雲端 + 本地混搭需求的工作流:Claude 達到上限時有備援

什麼情況不適合

這個設定不是萬能的,以下情況用這套方案會踩坑:

需要長 context 的任務:16GB 跑 35B 模型,context window 能開多大是有限制的,處理超長文件或對話不是它的強項。

需要高吞吐量的場景:如果你要在短時間內大量平行處理請求,本地機器的速度瓶頸會很明顯。

需要最新知識截止日期:本地模型的訓練資料有截止日期,如果工作需要最新資訊,還是需要雲端。

需要多模態能力:目前本地模型在圖片理解等多模態任務上,和頂級雲端模型仍有差距。

廣告

Sponsored · 蝦皮 · 迷你主機

ROG GR70 R9 + RTX 5070 · 衛生紙盒大小的 AI 工作機

ROG 電競迷你主機,搭載 RTX 5070,桌面只佔一個衛生紙盒大小——AI 開發本地跑 ComfyUI、影片剪輯、3A 遊戲全包。

廣告 · 透過連結購買本站可獲得分潤,不影響你的售價立即查看 · 原廠保固

帳算到最後,他省了什麼

Chesny 在推文裡提了一個對比數字:同樣的工作量,一個團隊需要 3 個工程師加每月 15,000API費用。他只付了15,000 的 API 費用。他只付了 599 一次。

這個數字顯然是在強調極端情況,但底下的邏輯是真的:工作流設計的能力,比工具預算更能決定你的 AI 使用效率。

他不是靠「用最貴的工具」贏的。他靠的是知道哪些任務可以非同步跑、哪些需要即時高品質回應,然後把工具分配到對的位置。


這個方案適合什麼樣的人

適合

  • 每個月 Claude 或 OpenAI 訂閱費超過 $100 的重度使用者
  • 工作流裡有大量批次處理、非即時任務的開發者或創作者
  • 已經在用 Ollama 或對本地模型有基本了解的人
  • 願意花時間設計工作流、而不只是「打開工具直接用」的人

不適合

  • 主要需求是即時高品質對話的一般用戶
  • 需要最新知識或多模態能力的場景
  • 不想花時間設定、維護本地環境的人
  • 工作流需要超長 context 或高吞吐量的場景

訂閱費不是 AI 的門票,工作流設計才是。


有興趣嘗試類似路線但預算更高、效能要求更強的,也可以考慮搭載獨立 GPU 的迷你主機方案,本地跑 ComfyUI、大型模型效能更直接:

ROG GR70 R9 + RTX 5070 迷你主機 · 蝦皮


利益揭露:本文部分連結為聯盟連結,點擊購買我會獲得回饋,不影響你的價格。