跳到主要內容
/閱讀約 10 分鐘/

RAG vs 微調 vs Prompting:2026 年,這張決策圖已經不一樣了

2023 年一則爆紅推文畫出 Prompting、RAG、微調三者的決策框架,兩年多來還在被到處轉貼。查了一輪 2026 年的業界分析後發現,這張圖至少有三個地方已經站不住腳——長 context 把便宜的 API 帶進戰局,微調也不再是原本說的那個樣子。

目錄+

2023 年 12 月,AI 工程師 Akshay Pachaar 在 X 貼出一張圖,把 Prompting、RAG、微調三者的決策邏輯畫成一棵樹,兩年多來還在被轉貼、被截圖、被塞進新人教材。查了一輪 2026 年的業界分析才發現——這張圖現在至少有三個地方已經站不住腳。不是推文寫錯,是這個領域跑得比任何一張圖都快。這篇拆三件事:①這張圖原本在講什麼、②哪三個變數把它弄過時了、③2026 年工程師實際在用的判斷順序。

這張圖原本在講什麼

推文的邏輯很簡單,三選一:

  • Prompt Engineering:不動模型,只調整你給的文字輸入,讓模型用它原本的知識生成回應。
  • RAG(Retrieval-Augmented Generation):在 prompt 之外接一個資料庫,先查資料再生成,回答會根據資料庫內容而不是模型記憶。
  • 微調(Fine-tuning):直接調整模型參數,讓它在特定領域「說話的方式」變得更像專家——原文的比喻是「給一個已經很厲害的員工做額外訓練」。

推文給的判斷依據是兩個維度:要不要外部知識、要不要改變模型行為。單純缺知識用 RAG,單純想換語氣或格式用微調,兩者都要就混用,兩者都不要就留在 prompt 就好。

這個兩維度判斷框架,其實到今天都還站得住腳——這也是為什麼 2026 年的多篇分析文章,講的仍然是同一組座標軸。但推文裡沒說的是:這兩個維度底下的成本結構,兩年內整個翻了一遍。

三個把這張圖弄過時的變數

第一,長 context 加上便宜 API,把「無腦上 RAG」變成一個要重新算成本的決定。 兩年內主流 LLM API 價格在便宜的那一端掉了約 10 倍,context window 也普遍衝到 100 萬到 200 萬 token。這代表小規模知識庫直接塞進 prompt,有時比架一套檢索 pipeline 還划算。但反過來說,知識庫一旦大到 context 塞不下、或需要頻繁更新、或要附上引用來源,RAG 還是成本更低的做法——這不是「RAG 過時了」,是決策從「要不要 RAG」變成了一道要實際算數字的三選一。

第二,微調本身已經不是推文說的那個樣子。 2023 年講「微調」,隱含的畫面是重練整個模型。2026 年幾乎沒人這樣做——全參數微調風險高、成本貴,還會把你鎖死在一個 base model 上,換代模型一出就得重來。現在的預設是 LoRA、QLoRA 這類參數高效微調:只訓練一小塊「適配層」,掛在別人訓練好的大模型上。微調開源 LLM 的實戰入門指南就整理過一套從 1B 模型開始、用 Colab 就能跑的流程,成本跟 2023 年的認知已經是兩個量級。

第三,RAG 自己也在質變。 「查資料庫」這個動作,正在從一個獨立模組變成一整套上下文引擎——結合快取、壓縮、分層記憶,甚至用知識圖譜取代單純的向量檢索。HKUDS 的 OpenSpace 就是一個例子:用技能圖譜加自進化引擎,把重複查詢的 token 消耗砍掉快一半。這意味著「RAG」這個詞,2026 年指的已經不是 2023 年那個簡單的檢索加拼接。

一句話講完:微調不是被淘汰,是被壓縮成一片薄薄的 LoRA 適配層,貼在別人練好的大腦上。

2026 年真正在用的判斷順序

多篇 2026 年的業界分析(包括 Aishwarya Srinivasan 的框架整理、Winder.ai 的決策指南)不約而同用同一句話總結現在的做法:Prompt,然後 RAG,然後微調,然後蒸餾(Distill)。差別在於,這不是一個「照順序爬」的階梯——2026 年初的分析文章特別強調過,這是六個限制條件(知識時效性、行為一致性、延遲、預算、團隊能力、資料可得性)共同決定的落點,不是一條非走不可的直線。

原推文的兩維度判斷,換成 2026 年版本大概長這樣:

Loading diagram...

多篇 2026 年分析都指向同一個結論:右下角那格(RAG 加微調的混合架構)才是生產系統的常態,不是特例——用 RAG 處理會變的知識,用微調鎖住不該變的行為。有分析把這個分工講得更直白:練介面,不練知識。該固定下來的是問題改寫、輸出格式、拒答邏輯這類「行為」,該檢索的是會過期、會更新、需要引用來源的「內容」。

想知道自己該不該微調,有一個比較務實的自我測試:把你目前最好的 prompt 加上幾個範例,拿一組有標準答案的測試集跑一次基準。準確率在目標的 10% 以內,先繼續優化 prompt;落後 20% 以上、而且你有標註資料,微調才值得投入。這比憑感覺決定實在得多——順帶一提,Claude 的 prompt engineering 實戰技巧也值得先過一遍,很多時候問題出在 prompt 沒寫好,而不是真的需要升級。

舊推文裡的例子,兩年後變成了什麼樣子

原推文最後推薦了 Abacus AI 的 RAG API,說法是「比 GPT-4V 便宜 20 倍」。這句話放在 2026 年讀,本身就是最好的證據——GPT-4V 這個參照點早就過時,Abacus AI 也不再只是一個 RAG API:它現在是一整個平台(ChatLLM/DeepAgent),一次接進 GPT-5.5、Claude Opus 4.7、Gemini 3.1 Pro 等二十多個模型,還加上多代理協作、頁面級 RAG 索引這類新功能。一則推文兩年半前推薦的產品,兩年半後已經是完全不同量級的東西——這大概是這篇文章最想讓你記住的一件事:任何一張決策圖都會過時,但底層的判斷邏輯(要不要外部知識、要不要改變行為)一直沒變。

如果你正打算動手做本機微調,VRAM 通常是第一個卡住的地方——麗臺 RTX PRO 4000 Blackwell 這類 24GB 工作站顯卡,本機跑 LoRA 微調、量化模型推論都算剛好夠用的規格。

給開發者的實際建議

  • 先假設 prompt 沒寫好,而不是假設模型能力不夠。 大多數「需要微調」的直覺,其實是 prompt 或 few-shot 範例沒做到位。
  • 知識會變就用 RAG,行為要固定就用微調,這兩個判準兩年沒變過,變的只是實作成本。
  • 微調預設從 LoRA/QLoRA 開始,不要一上來就想全參數重練。
  • 每半年重新算一次成本模型。 context 價格、window 大小、微調工具鏈都在快速變動,兩年前算過的帳,今天多半要重算。

這張決策圖不會是最後一版。下一次 context 價格再腰斬、或是新一代開源模型把微調成本再壓低一截,這個座標軸上的分界線又會再挪一次。真正該記住的不是哪個象限,是那句老話:先問要不要外部知識、要不要改變行為,再談要花多少錢解決它。