跳到主要內容
Lighthouse Attention:Nous Research 的 17 倍訓練加速,但只在訓練時

Lighthouse Attention:Nous Research 的 17 倍訓練加速,但只在訓練時

Nous Research 發布 Lighthouse Attention,在 512K 上下文預訓練裡比標準 attention 快 17.3 倍,1M token 也跑得動。但這套技巧只活在訓練端——快結束前會被卸掉,部署的模型還是用 vanilla attention。這篇拆它為什麼這樣設計、跟 MoBA/NSA 差在哪、誰會真的用。

目錄+

2026 年 5 月 15 日,Nous Research 公佈了 Lighthouse Attention:一個專門用來加速長上下文預訓練的注意力機制。在 512K 上下文、單張 B200 上,它的 forward + backward 比標準 attention 快 17.3 倍。

但這篇論文最有意思的地方,不是這個數字。

是它用完就丟。訓練快結束前,Lighthouse 會被卸掉,再用普通 SDPA 訓練一小段「恢復期」,最後出來的模型在推論時跑的是完全一般的 dense attention——沒有自訂稀疏 kernel、沒有架構耦合、沒有 quality tax。

說白了,這不是新模型架構,是訓練端的省錢戰術。這篇拆三件事:① 它為什麼能既快又「不留痕跡」、② 跟同期那些稀疏 attention(MoBA、NSA、Mamba)差在哪、③ 誰會真的用它、誰不會。


它解決的問題:訓 100 萬 token 的學費

訓練 causal transformer 的瓶頸從來不是 FLOPs,是 attention 的 N² 記憶體與時間成本。FlashAttention 把這個常數因子壓低了一個量級,但漸進複雜度沒變——上下文從 8K 拉到 128K,attention 的成本就是 256 倍,拉到 1M token 就更難看。

過去業界的解法分兩派:

第一派:永久換掉 attention 架構——Mamba、Native Sparse Attention(NSA)、MoBA 這類,把稀疏邏輯做進 kernel,模型推論時也跑這套。好處是訓練推論一致;代價是要寫客製化 kernel、debug 自己的 backward pass、而且部署生態(vLLM、SGLang、TensorRT-LLM)全都得適配你的新東西。

第二派:只動推論——TOVA、H2O 這類 token eviction、page retrieval 方法,訓練時用 dense attention,推論時偷工減料。好處是訓練不變;代價是預訓練的長上下文學費照付。

Lighthouse Attention 是第三條路:訓練時偷工,推論時不偷。


它怎麼做到「用完就丟」

技術上 Lighthouse 是一個包在 SDPA 外面的四步驟流水線:

  1. 金字塔池化:把每一層的 queries、keys、values 同時做多解析度平均池化(每 2 個、4 個、8 個 token 為一組)。Q、K、V 對稱壓縮是關鍵——這保住了 left-to-right 因果性,也讓並行性大幅提高。
  2. 無參數打分:用 ℓ² norm 對金字塔各層的條目排名,找出「重要」的位置。這個打分函數沒有可訓練參數。
  3. Top-K 採樣 + Gather:選出最重要的條目,打包成一個連續的稠密子序列。
  4. 跑標準 FlashAttention:注意——子序列是稠密的,所以這一步用的就是現成的 FlashAttention,不用客製 kernel。算完再 scatter 回原位置。

關鍵的工程取巧在於:top-K 是不可微的、無梯度的。梯度只透過被選中的 value 流回 W_Q / W_K / W_V,不用直通估計器(straight-through estimator),不用輔助 loss。論文裡用 530M 參數的 Llama-3 模型驗證——在 16,000 步預算內,前 10k-12k 步用 Lighthouse 訓練,剩下 4-6k 步切回 dense SDPA 做 recovery。

最後得到的訓練 loss 是 0.6980-0.7102,比 dense-from-scratch baseline 的 0.7237 還低。換句話說——既訓得快,最終品質還更好一點。

長上下文 retrieval 評測也維持住了,沒有 quality tax。


為什麼這比「另一個稀疏 attention」更值得看

Lighthouse 不是第一個壓縮注意力的方法,但它是第一個刻意把自己限縮在訓練時的方法。這個自我限制很重要:

它讓「便宜訓練」跟「乾淨部署」變成可以分開的兩件事。

過去的稀疏 attention 方法都有一個結構性問題:你訓出來的模型,是「在稀疏 attention 環境下表現好的權重」。當你拿這個模型去推論,要嘛繼續用稀疏 kernel(生態適配費),要嘛切回 dense(模型沒在這環境訓過、可能表現差)。

Lighthouse 用 recovery 階段直接驗證了:只要最後讓模型在 dense attention 環境多訓一下,它就會「忘掉」Lighthouse 的稀疏結構,變回一個正常的 dense 模型。

這個觀察的價值是:你不必為了訓得快而綁住自己未來的部署選擇。

數字上的對照:

上下文長度Lighthouse vs SDPA(forward+backward)
98K1.4 - 1.7 倍速
512K17.3 倍速
1M跑得動(32 張 B200,context parallelism)

512K 場景下,SDPA 跑 122K context 的時間,Lighthouse 已經跑完整個 512K。


它的限制:不是給推論用的

論文裡很坦白:Q、K、V 對稱池化的設計假設 queries 在訓練時就已知。autoregressive decoding 時你是一個一個 token 生的,這個假設不成立。所以 Lighthouse 沒辦法當推論加速器用——它就是訓練專用。

另外幾件事要注意:

  • 複雜度仍是 sub-quadratic,不是線性——別跟 Mamba 那種 O(N) 比,Lighthouse 比的是 dense O(N²)
  • 驗證規模目前是 530M 參數 + 50B token——對於要訓 100B+ 模型的人來說,這還是「初步實驗」等級的證據
  • 多節點 context parallelism 有 10% 左右的 ring-rotation overhead——大規模時這個損耗會被放大

Nous 自己也在 2026-05-13 同步發了另一個訓練加速方法 Token Superposition Training(TST),在 10B-A1B MoE 上把 B200-GPU-hours 從 12,311 壓到 4,768,約 2.5 倍加速。這兩個東西方向不同——TST 動 tokenizer 跟 data pipeline,Lighthouse 動 attention——但合在一起看:Nous 最近的策略很清楚,他們在做訓練端效率的開源戰場,不跟前緣實驗室拼模型大小。


誰會用、誰不會

實話說,這套東西的目標讀者是有 B200 叢集、自己要訓長上下文預訓練模型的團隊——主要就是各家前緣實驗室跟少數有錢的研究機構。如果你只是 fine-tune 一個 7B 模型來做客服、跑 RAG、做 agent,這篇論文跟你完全無關。

但如果你是:

  • 想訓一個自家 base model 的團隊,正在規劃 long context 預算
  • 在做 attention 機制研究,想知道「訓推分離」這條路怎麼走
  • 用 32 張以上 B200,做超長上下文研究

那這篇值得認真讀。code 在論文 PDF裡有 repo 連結。

順帶一提,想自己玩 B200 等級的東西沒那麼容易,但 Blackwell 架構的工作站卡已經能買到——例如 麗臺 RTX PRO 5000 Blackwell(48GB)在本地跑 70B 模型不用看 OOM 臉色,研究端做 attention 小規模實驗夠用了。


收尾:訓練端的省錢戰術才剛開始

Lighthouse Attention 真正的意義不是「快 17 倍」這個 headline 數字。是它示範了一件事:你不必為了訓得快,賭上你的部署選擇。

過去三年大家在 attention 這條線上的主要敘事是「換架構」——Mamba、RWKV、各種 linear attention。Lighthouse 走的是相反方向:保留標準 dense attention 作為終局,只在訓練中段插一個「省錢期」。

這條路如果走得通——而且在 530M 規模驗證過 recovery 之後,看起來真的能走——對前緣實驗室的訓練成本曲線會有實質影響。對其他人來說,這只是再次說明一件事:注意力機制的故事還沒完,只是戰場從「推論架構」搬到「訓練 pipeline」了。