跳到主要內容
Qwen-Scope:阿里巴巴釋出 14 組 SAE,把可解釋性研究做成工程工具

Qwen-Scope:阿里巴巴釋出 14 組 SAE,把可解釋性研究做成工程工具

Qwen 團隊 2026-04-30 釋出 Qwen-Scope,橫跨 7 個 Qwen3/Qwen3.5 模型的 14 組 SAE 權重。Anthropic 帶起、Google DeepMind 跟進的「sparse autoencoder for LLM」賽道,第一次有中國模型廠官方出手,把學術圈的玩具變成可以改 model 行為的開發者工具。

目錄+

2026-04-30,阿里巴巴 Qwen 團隊釋出 Qwen-Scope——一套訓練在 Qwen3 與 Qwen3.5 上的 sparse autoencoder (SAE) 工具集,14 組權重橫跨 7 個模型(5 個 dense、2 個 MoE)。這是中國模型廠首次在「機制可解釋性 (mechanistic interpretability)」這條賽道上官方出手,而 Qwen 沒有把它包裝成研究論文,而是定位成「開發者工具」。

這篇拆三件事:①Qwen-Scope 釋出了什麼、跟之前的 SAE 有什麼差別;②為什麼 SAE 從 Anthropic 的研究興趣變成了模型廠的標配;③SAE 真的能用在生產嗎,還是只是漂亮的可視化玩具。


Qwen-Scope 釋出了什麼

不囉唆,先上規格(資料來源:Qwen 官方 blog、Hugging Face 模型卡、MarkTechPost):

  • 14 組 SAE 權重,覆蓋 7 個 Qwen 模型
    • Dense: Qwen3-1.7B / Qwen3-8B / Qwen3.5-2B / Qwen3.5-9B / Qwen3.5-27B
    • MoE: Qwen3-30B-A3B / Qwen3.5-35B-A3B
  • Top-k 稀疏化,k = 50 或 100
  • 寬度設定:dense 模型 SAE 寬度 = 16× hidden size;MoE 標準 32K (16× 擴展),最寬版本 128K (64× 擴展)
  • 四個應用情境(這是 Qwen 官方包裝的賣點):
    1. Inference:直接操控內部特徵來控制輸出,不需要 prompt engineering
    2. Data:用極少 seed example 分類與合成資料,特別針對長尾能力
    3. Training:把 code-switching、重複生成這類 bug 追到根源層去修
    4. Evaluation:分析特徵激活模式,篩選更聰明的 benchmark、減少冗餘

注意第三點。Qwen 把 SAE 從「研究者用來看內部」直接定位成「工程師用來修 bug」——code-switching(生成中突然換語言)和 repetitive generation 是任何 LLM 在生產環境都會遇到的問題。Qwen-Scope 的賣點是:你不再只能調 sampling 參數或重訓,而是直接找到「這個行為是哪幾個 feature 在發作」,從根源關掉。


SAE 賽道脈絡:誰先做、誰跟進、Qwen 在哪

SAE 不是新概念,但「拿來解 LLM」這件事的時間軸很集中:

  • 2022:Anthropic 的 Elhage et al. 提出 superposition 假說,解釋為什麼一個神經元會同時對應多個無關概念(polysemanticity)
  • 2023:Bricken et al. (Anthropic) 用 SAE 在 toy model 上實驗
  • 2024-05:Anthropic 發布 Golden Gate Claude——用 SAE feature 把 Claude 操控成「無論問什麼都會把話題拐到金門大橋」的迷因事件,第一次讓 SAE 進入大眾視野
  • 2024-08:Google DeepMind 發布 Gemma Scope,Gemma 2 系列的開源 SAE 套件
  • 2024-10:學術界推出 Llama Scope(He et al.),Llama-3.1-8B 的 SAE 套件——但這是學術專案,不是 Meta 官方
  • 2024:OpenAI 發 "Scaling and Evaluating Sparse Autoencoders"(Gao et al.),訓練在 GPT-4,但沒開源權重
  • 2025-09:Google DeepMind 發 Gemma Scope 2,覆蓋 Gemma 3 全系列 (270M / 1B / 4B / 12B / 27B) 全層 SAE
  • 2026-04:Qwen-Scope 上線

在這條時間軸上,Qwen-Scope 是中國模型廠第一次官方下場。中國研究機構之前在學術側有貢獻(Llama Scope 主要作者 He et al. 來自上海復旦),但模型廠自己訓練、自己背書的官方 SAE 套件,Qwen 是第一家。

跟 Gemma Scope 對比也有意思——Gemma Scope 用的是 JumpReLU SAE,Qwen 用 Top-k SAE,後者在 2024 後段成為新主流,因為「直接設 k 就能控制稀疏度」比「調 L1 sparsity penalty」穩定很多。MoE 模型的 SAE Qwen 也訓到 128K 寬度(64× 擴展),這在公開 SAE 套件裡算是相當激進的設定。


SAE 真的能用在生產嗎

這是這篇文章最該問的一題,因為這條賽道有兩派研究結論在打架。

支持派的故事:Anthropic 2024 的 Scaling Monosemanticity 論文展示在 Claude Sonnet 上提取出「有害程式碼」「sycophancy」等具體可操控特徵;後續學界(Marks et al. 2024、Conmy et al. 2024)證明 SAE 能找到「拒絕回答」「change-of-language」這類行為的具體 circuit。這是 Qwen-Scope 第三個應用情境(用 SAE 修 code-switching 這類 bug)的理論基礎。

質疑派的證據

  • Wu et al. 2025 的 Axbench 論文("Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders")直接挑戰:在 model steering 任務上,SAE 並沒有比簡單的 baseline 強
  • Hugging Face 上 MaziyarPanahi 的實測 ("From Golden Gate Bridge to Broken JSON"):SAE steering 在結構化輸出(JSON 生成)上失效——steer 出去的模型語意對了,但 JSON 結構壞了。原因是 SAE 抽到的是語意特徵,但 JSON 是 token-level 結構行為,兩者衝突
  • ACL 2025 的 SAE 分類研究指出:SAE 特徵用在分類任務上不一定贏 hidden-state probing,特別是 hyperparameter 沒調好時

這意味著什麼?SAE 是強大的解釋性工具,但拿來「直接控制生產模型行為」目前仍是一個有條件的工具。對「我想知道為什麼模型在這個 case 出包」非常好用;對「我要把 SAE 上線當成 production 的 control layer」風險還在。

Qwen-Scope 的四個應用情境裡,第一個(inference steering)最性感、但也最危險;第三個(trace bug to root)最務實——把 SAE 當成 debugger 而不是 controller,是目前文獻最支持的用法。


一個容易忽略的細節

Qwen-Scope 釋出 7 個模型版本裡,包含兩個 MoE 模型(Qwen3-30B-A3B、Qwen3.5-35B-A3B)的 SAE。這在公開 SAE 套件裡並不常見——MoE 的 expert routing 讓 SAE 訓練更難,因為不同 expert 的 activation 分布差異大,學一組通用的稀疏字典會稀釋掉 routing 訊號。

Qwen 為 MoE 訓到 128K 寬度(64× 擴展)的 SAE,技術報告暗示是為了「捕捉更細粒度的表示結構」。這個動作讓 Qwen-Scope 成為目前公開 SAE 套件裡,MoE 覆蓋最完整的一組。對研究 MoE 內部行為的人來說,這份權重的價值高於它的「四個應用工具」包裝。


一句話收尾

Anthropic 拿 SAE 做出了 Golden Gate Claude,DeepMind 把它系統化成 Gemma Scope,Qwen-Scope 把它包裝成「四個工程工具」並開放權重。SAE 從研究興趣變成模型廠標配,這個進程比預期快了很多——但「能用在 debug」跟「能用在 production control」之間的距離,還沒被任何一家解決。