跳到主要內容
2026 微調入門:CJ Zafir 的工作流可信 70%,剩下的 30% 我補給你
/閱讀約 10 分鐘/

2026 微調入門:CJ Zafir 的工作流可信 70%,剩下的 30% 我補給你

CJ Zafir 在 X 上丟了一份微調開源模型的入門清單,從 1B 起手、用 Unsloth、Codex 配 DeepSeek v4 Pro 生資料。清單裡多數是 2026 業界共識,但 A100 $0.60/hr 的算術不完整、ELM 不是公認術語,而且最關鍵的瓶頸根本不在工具——他沒講夠。這篇拆給你聽。

目錄+

CJ Zafir 在 X 上發了一串入門清單:從 1B 模型開始、用 Unsloth、Codex 規劃資料、DeepSeek v4 Pro 生資料、Colab 跑 A100。

讀完第一遍覺得「這就是 2026 微調的標準起手式」——大致沒錯。但讀第二遍會發現有兩個數字要打折,還有一個關鍵環節他完全沒提。

這篇不是翻譯。是把這份清單拆給已經知道 LLM 是什麼、但還沒微調過第一個模型的人聽。

CJ Zafir 原清單的九個建議(濃縮版)

  1. 從 1B、2B、4B、8B 起手,不要一開始碰 27B 以上
  2. 用 WebGPU 雲端供應商;9B 以下用 Google Colab Pro
  3. 微調超過 7-10 個模型再考慮買 GPU
  4. 用 Codex 5.5 規劃資料集 + DeepSeek v4 Pro 生資料列
  5. 從 Hugging Face 拿 Unsloth 的 instruct 版本當 base
  6. 把 Unsloth 的官方筆記本丟給 Codex 改成你的 config
  7. 花一天搞懂:SFT、GRPO/DPO/PPO、LoRA/QLoRA、量化、llama.cpp、KV cache
  8. 直接動手,Claude/Codex/ChatGPT 會幫你排計畫
  9. 未來會往 5-15B 的 ELM(Expert Language Models)走,不是 1T 通用大模型

接下來分三層拆:可信的、要打折的、他沒講的。

可信的部分:這六點是 2026 共識

從 1-8B 起手。 社群裡的壓倒性共識。原因不是 8B 比 70B 好,是迭代速度。在 8B 上你可以一天跑 5 個實驗,70B 一天跑一個還可能 OOM。學習階段你需要的是 feedback loop 的頻率,不是模型有多大。

Unsloth 是 2026 單卡微調的事實標準。 數字很硬:相較標準 HuggingFace Transformers 約 2-5 倍速、VRAM 砍約 70%(effloow.com 2026 指南、Red Hat 2026-04-01 公告)。具體門檻:7B 模型用 QLoRA 可以塞進 8GB VRAM、70B 模型在 A100 上用 QLoRA 約 46GB。2026 年 2 月 Unsloth 還更新了 MoE 訓練 12 倍加速、embedding 模型支援、超長上下文 RL,GitHub stars 已過 50K。

QLoRA > LoRA > 全參數微調,對絕大多數人。 LoRA 訓練的參數只佔總模型的 0.1%-1%,但效果可以拿回完整微調的 90-95%;QLoRA 再用 4-bit 量化,效果保住 80-90%。除非你是研究員在跑 ablation,否則就用 QLoRA。

Codex 規劃 + DeepSeek 生資料是合理的分工。 Codex 適合做結構(schema、prompt template、邊界 case 設計),DeepSeek v4 Pro 適合大量便宜地生成內容。這個搭配在 2026 的社群裡反覆出現,不是 CJ 發明的,但他講的沒錯。

先別買 GPU。 這個建議超省錢。買一張 RTX 5090 你可能要等三個月才能拆封,那三個月的學費可以跑掉幾十個 Colab 實驗。

一天搞懂那份名詞清單。 SFT、GRPO/DPO/PPO、LoRA/QLoRA、量化、llama.cpp、KV cache——這份清單剛好覆蓋 99% 入門會撞到的詞。學一天就夠,不要陷進去。

要打折扣的部分:兩個數字別照抄

「A100 80GB $0.60/hr」需要解釋。

CJ 講的是 Google Colab Pro,但這不是 cash price。Colab Pro 是 9.99/月訂閱,靠computeunits(CU)消耗算力。A10080GB在Colab大約是∗∗15CU/小時∗∗,9.99/月訂閱,靠 compute units(CU)消耗算力。A100 80GB 在 Colab 大約是 **15 CU/小時**,9.99 大概買 100 CU——換算下來如果你只跑 A100,**9.99大概能用7小時A100∗∗,攤下來確實接近9.99 大概能用 7 小時 A100**,攤下來確實接近 1.4/hr,算上沒用滿的 CU 折抵,「有效 $0.60/hr」勉強說得通。

但你不能直接用「A100 $0.60/hr」去比價:

  • 真實 cash price:Thunder Compute 約 0.78/hr、Spheron約0.78/hr、Spheron 約 1.07/hr
  • 主流雲:Lambda Labs 2.49/hr、AWSp4d換算約2.49/hr、AWS p4d 換算約 4.84/hr

也就是說,Colab Pro 是極省的選項,前提是你的 workload 真的能塞進 Colab 的 session timeout 和 CU 配額。如果你的微調要跑 4 小時且不能中斷,Colab 不一定撐得住——這時 Thunder Compute 或 Vast.ai 才是真正的 $0.60-1/hr 解。

「ELM」不是業界公認術語。

CJ 用「Expert Language Models」描述 5-15B 的領域專家模型,方向沒錯,但這個縮寫主要是他在用。社群普遍的詞是 SLM(Small Language Models),Microsoft、Cogitx、Hugging Face 都用這個。看到別人講 SLM,講的就是 CJ 講的 ELM,同一件事,別搞混。

至於「企業付 50k微調」這個數字,是CJ個人的觀察,不是公開市場價。台灣的fine−tuningconsulting報價更可能落在NT50k 微調」這個數字,是 CJ 個人的觀察,不是公開市場價。台灣的 fine-tuning consulting 報價更可能落在 NT30 萬到 NT$200 萬區間,視資料規模與評估閉環的複雜度而定。可以拿來鼓勵自己,但別當 RFQ 的底價。

他沒講夠的部分:真正的瓶頸是資料 + 評估

這是整篇清單最大的缺口。

2026 年微調的瓶頸不在算力、不在框架、不在模型選擇——是你有沒有 200 筆高品質訓練資料、和一套會自動跑的評估腳本。

工具鏈在 2024 還是門檻,2026 已經是 commodity。Unsloth + QLoRA + 一張 8GB VRAM 的卡,技術上你已經能跑。真正會卡你 80% 時間的是兩件事:

1. 資料品質決定一切。 LoRA 訓練 200 筆乾淨資料,效果通常贏 2000 筆雜訊資料。CJ 的清單只說「用 DeepSeek 生」——但他沒講 deduplication、沒講 quality filter、沒講 instruction-output 對齊度檢查、沒講要不要混入 negative samples。這些才是業界顧問拿錢的部分。

2. 沒有 eval,微調等於亂寫。 微調後你怎麼知道模型變好還是變壞?不能只看 train loss 下降——那只說明 model overfit 了。你需要:

  • 保留集(held-out test set):訓練前先切 10-20% 出來,訓練時絕不碰
  • 任務專屬 metric:分類任務看 F1,生成任務看 ROUGE / BLEU 或 LLM-as-judge
  • 行為迴歸測試:列 30-50 個你不想被破壞的 baseline 行為(例如「不要拒答合理問題」「英文輸入仍然回英文」)

CJ 的清單完全沒有 eval 這一段。所有走過微調的人都知道:真正讓你晚上睡不著的,是 fine-tune 完跑進實際對話,發現「怎麼比 base model 還笨」的那個時刻。

增強版清單:12 個真正可執行的步驟

把 CJ 的 9 點加上他缺的 3 點,按執行順序排:

  1. 從 1B-4B 模型起手(不是 8B;8B 會多浪費你一週時間)
  2. 用 Unsloth 的官方 Colab notebook,先把範例跑通一次再開始改
  3. 定義你的任務:分類?JSON 抽取?特定風格生成?寫成一句話
  4. 準備 200 筆高品質訓練資料(人工檢過、去重、輸入輸出對齊)
  5. 切出 30 筆 held-out test set,整個訓練過程都不碰
  6. 寫一個 eval 腳本:跑完模型、自動算分、印出 baseline 對比
  7. 用 QLoRA + Unsloth 的 default 參數(r=16, α=16-32, all-linear targets, DoRA on)
  8. 第一次只訓練 1-3 個 epoch,跑完馬上跑 eval
  9. 看 eval 分數判斷:變好就微調超參、變壞就回去檢查資料
  10. 用 llama.cpp 轉 GGUF,本地推論驗證 latency 與 memory
  11. 連跑 5-7 個任務後,你才開始有經驗判斷該不該升級到 70B
  12. 微調超過 10 個模型後,再認真考慮買卡

如果你真的微調超過 10 個模型,租 Colab 的成本會開始超過買卡的攤提,這時候才值得考慮自己組機器。本地單卡能吃 70B QLoRA 的目前最划算門檻是 48GB 顯存,這也是為什麼 麗臺 RTX PRO 5000 Blackwell 48GB 在台灣的微調圈被討論——同樣 48GB 的方案少,這張是少數「單卡跑 70B QLoRA 不會 OOM」的選項。但這是第 10 個模型之後的事,不是第一天的事。

最後說一句

CJ Zafir 的清單方向對、執行可行,缺的是「訓練完之後怎麼知道你做對了」這一段。

2026 年微調已經不是技術問題,是流程紀律問題:你有沒有 eval、你的 200 筆資料乾不乾淨、你會不會在發現變差時誠實地丟掉這次訓練重來。工具會繼續變便宜,框架會繼續變快,但這三件事仍然只有你自己會做。

把 CJ 的 9 點當入場券,把上面 12 點當實際的執行 checklist。第一個模型訓完那一刻,你會發現入門的真正障礙根本不是 LoRA 怎麼設 rank——是你願不願意花一週整理那 200 筆資料。


延伸閱讀:2026 年微調開源模型入門指南:從 1B 開始、用 Unsloth、在 Google Colab 跑完第一個模型