跳到主要內容

slime 是什麼?GLM 全系列都靠這套開源 RL 框架練出來的

GLM-5.2 的完整後訓練只花了兩天,背後是一套叫 slime 的開源強化學習框架——而且從 GLM-4.5 到 5.1 全系列都靠它練出來。這篇拆開它「只固定一顆學習核心,其餘都當成資料生成」的設計,順便講清楚 Megatron 跟 SGLang 到底在做什麼。

目錄+

GLM-5.2 的完整後訓練,只花了兩天。

不是預訓練,是把一個已經很強的底座模型,透過強化學習調教成能寫程式、能用工具、能跑長任務的最終版本——這個過程通常要燒好幾週。Z.ai 自己的技術部落格證實了這件事:他們用一套叫 slime 的框架跑完整個流程,兩天。而且這套框架不是關起門來的內部工具,是完全開源、任何人都能拉下來用的東西。

更狠的是,slime 不是只練了 GLM-5.2 一次。從 GLM-4.5 到 GLM-5.1,整個 GLM 系列的強化學習後訓練都靠它。這篇拆三件事:這套框架的核心設計哲學是什麼、Megatron 跟 SGLang 這兩個聽起來很硬的名字到底在幹嘛、還有它跟其他 RL 框架比起來算不算真的不一樣。

slime 是什麼?一句話講完

slime 是清華大學 KEG 實驗室(也就是 THUDM,Zhipu AI/Z.ai 的前身團隊)開源的一套 LLM 強化學習後訓練框架,GitHub 上目前累積約 7.4k 星、超過 1000 次 fork,用 Apache-2.0 授權,任何人都能拿去用、拿去改。它的官方文件寫得很直白:這是「經過前沿模型訓練實戰驗證」的框架——不是論文裡的玩具實作,是真的拿去練出過旗艦模型的那種驗證。

THUDM 這個名字你可能沒聽過,但它做出來的東西你大概見過:ChatGLM、GLM-130B 都是這個實驗室的作品,後來團隊獨立出來變成 Zhipu AI,也就是現在的 Z.ai。slime 最早其實是跟 SGLang 背後的 LMSYS Org(做出 Chatbot Arena 的那群人)一起發布的,算是兩個團隊的合作成果。

為什麼可信:不是只有這則推文這樣說

一個框架被吹得多神,通常要打個折扣看。但這次的說法有好幾個獨立來源互相對得上:

slime 官方文件白紙黑字寫著它是「GLM-5.2、GLM-5.1、GLM-5、GLM-4.7、GLM-4.6、GLM-4.5 背後的 RL 框架」。Z.ai 自己的 GLM-5.2 發表部落格也提到,post-training 用 slime 做平行 OPD 訓練,把十幾個專家模型合併進最終版本,「整個 OPD 訓練過程大約花了兩天」——這句話跟原推文講的「兩天」對上了,是兩個獨立來源互相印證,不是同一個說法繞了一圈。另外 GLM-5 的技術報告(掛在 arXiv 上)也提到他們的非同步 RL 基礎設施是建立在 slime 之上,進一步把生成跟訓練解耦。

三個來源、三個不同的發布管道,講的是同一件事。這篇不需要「根據原文」這種提醒,你自己就能查到。

核心設計:一顆固定的學習核心,其餘都是「怎麼生資料」

slime 的哲學可以濃縮成一句話:RL 訓練分成兩半,一半負責學習,一半負責生成資料,slime 把學習那一半焊死,把所有花樣都塞進生成資料那一半。

拆開講。每一輪強化學習訓練其實有兩個階段:一個是「產生經驗」——模型自己寫出答案,然後有東西幫它打分;另一個是「從經驗裡學習」——把打分結果拿去算 loss、更新權重。學習這一半其實很機械:讀樣本、算損失、跑一次優化器,不管模型是在解數學題還是在操作瀏覽器,這個動作長得一模一樣。

真正會變的是「怎麼生成資料」這一半。一道數學題可能一輪就打完分;一個 agent 任務可能要反覆呼叫工具、讀回傳結果,跑好幾輪才拿得到最終獎勵。slime 就是把界線畫在這裡:學習核心永遠不變,會變的東西一律變成「新的資料生成方式」,而不是去改動核心迴圈本身。

這句話值得記住:學習核心夠小才值得信任,資料生成才是該長花樣的地方。

技術實作上,slime 把 Megatron 用來訓練、SGLang 用來生成(術語叫 rollout),中間架一個叫 Data Buffer 的資料緩衝層,負責存放 prompt、自訂資料、以及生成結果。多輪工具呼叫、沙盒互動、環境回饋、驗證器打分,這些全部都是透過同一個資料生成介面進來,而不是分岔出另一條訓練迴圈。下面這張圖畫出這個結構:

Loading diagram...

Megatron 跟 SGLang 到底在幹嘛

這兩個名字聽起來像黑話,其實各自負責一件很具體的事。

Megatron-LM 是 NVIDIA 做的訓練框架,負責把一個大到單張顯卡塞不下的模型,拆成好幾份分散到成百上千張 GPU 上,然後算梯度、更新權重。你可以把它想成「模型的自習室」——這裡在做的事是讀題目、對答案、修正自己的理解,很機械,但要處理的量非常大。

SGLang 是 LMSYS Org 做的推論引擎,專門負責讓模型快速、大量地生成文字。你可以把它想成「模擬考考場」——模型在這裡快速做完一整批練習題,等著被拿去打分。

一般的 RL 訓練要嘛把這兩件事焊在同一批 GPU 上輪流做(像 veRL 的做法),要嘛用複雜的排程器東拼西湊。slime 選擇的做法是:兩邊各自用業界最強的工具,中間補一個乾淨的資料緩衝層當「郵箱」,讓自習室跟考場能各自升級,又不會互相卡住彼此的腳步。

這個設計到底新不新:跟 veRL、OpenRLHF、TRL 比

老實講,把「訓練」跟「生成」分開處理,不是 slime 發明的概念——veRL(ByteDance 出品)、OpenRLHF、TRL 這幾套主流 RL 框架也都有類似的角色劃分。真正讓 slime 不一樣的,不是「分開」這個決定,是它刻意拒絕相容多種後端。

veRL 用一種叫 HybridEngine 的設計,讓訓練跟推論共用同一批 GPU、原地切換,適合大規模量產但兩邊耦合較緊。OpenRLHF 用 Ray 把每個角色(actor、critic、reward model)拆成獨立的進程池,彈性很高、支援異質叢集,但官方自己也承認對 agentic、多環境的支援還沒有專門介面。TRL 是 HuggingFace 生態最好上手的選擇,但撐到 30B 左右規模就開始吃力。

slime 的官方文件講得很直接:它只認 Megatron 訓練、SGLang 推論這一組,不試著把多個推論引擎抽象成一套「最大公約數」介面。這是反直覺的設計——大部分框架想的是「支援愈多後端愈好」,slime 想的是「我就用這兩個業界最強的,直接透傳參數,上游一有新優化我馬上吃得到」。代價是你沒得選,要嘛用這一組,要嘛自己想辦法。這個取捨到底值不值,得看你是不是真的在乎「上游更新要等多久才用得到」。

已經有一票專案掛在它上面

slime 拒絕在核心迴圈裡加抽象層,但沒有拒絕別人在它外面蓋房子。已經確認存在、而且沒有動到核心迴圈的衍生專案至少有幾個:Miles(一個面向企業場景的 RL 框架,官方說明寫著「從 slime fork 出來、跟它共同演進」,GitHub 上也有將近 1700 星)、Relax(一套全模態 agentic RL 框架,一樣建立在 Megatron + SGLang 這套 slime 的基礎設施之上)、還有 P1(一系列完全靠強化學習練出來的物理推理模型,官方描述直接寫「以 slime 作為 RL 後訓練框架」)。

這幾個專案的共通點:它們都需要不同的訓練策略、不同的獎勵機制,但沒有一個去改動 slime 的學習核心。這正好印證了前面那句話——核心夠小、夠可信,變化才有地方去。

你用得到嗎:本地小規模 RL 實驗

先說實話:普通開發者不可能複製 GLM-5.2 那種 750 億參數以上、動用兩百多張 H100 的訓練規模。但 slime 的文件裡也放了小得多的範例——例如 Qwen3-4B 配 8 張 H100 就能跑,這是拿來理解 RL 訓練資料流、練手感的合理入口,不是拿來複刻旗艦模型。

如果你想在本地做這類小規模 RL 或微調實驗,第一個卡關的地方通常是顯存不夠、模型跑一半就 OOM。48GB VRAM 等級的工作站顯卡,例如麗臺 RTX PRO 5000 Blackwell,規格上能直接吃下 Llama 3 70B 的全精度版本,本地做多 GPU 訓練或微調實驗不用一直看顯存夠不夠的臉色。想更進一步理解微調跟 RL 這條路怎麼選,可以參考本地 RL 訓練與 agentic 視覺的實作筆記,或者從開源模型微調入門指南開始墊底;如果連強化學習的基礎概念都還沒補過,免費 RL 學習資源清單是個不花錢的起點。

常見問題

slime 只能拿來訓練 GLM 嗎? 不是。官方驗證案例除了 GLM 全系列,還包含 Qwen3、DeepSeek V3、Llama 3,是一套通用的 RL 後訓練框架。

普通開發者用得到 RL 訓練框架嗎? 用得到,但別想著複製 GLM 那種規模。文件裡有 Qwen3-4B 配 8 張 H100 的範例,適合拿來練手、理解資料流。

slime 跟 veRL、OpenRLHF、TRL 比,優勢是什麼? 不是功能更多,是刻意做得更少——只認 Megatron + SGLang 這一組,直接吃上游優化,代價是沒得選後端。

Megatron 跟 SGLang 是同一家公司做的嗎? 不是,Megatron-LM 是 NVIDIA 的訓練框架,SGLang 是 LMSYS Org 的推論引擎,slime 把兩者接在一起。

這套框架商用有限制嗎? slime 本身 Apache-2.0 授權可商用;但用它訓練出來的模型授權是另一回事,例如 GLM-5.2 開放權重是用 MIT 授權,兩者要分開看。

利益揭露:本文部分連結為聯盟連結,點擊購買我會獲得回饋,不影響你的價格。硬體推薦僅就公開規格與適用情境描述,未代表本人長期實測。

RL 訓練這個領域最近很吵,一堆框架都在比誰的功能列表更長。slime 走了反方向:把能刪的都刪掉,只留一顆小到你能親自讀懂的核心。這種「做得更少」的自信,本身就是一種技術主張。