跳到主要內容
/閱讀約 2 分鐘/

Google 推出 TabFM:表格資料的零-shot 基礎模型

TabFM 讓模型在單次前向傳遞中,對沒看過的表格進行分類與回歸預測,省去傳統訓練流程。

目錄+

Google Research 發布了 TabFM,一個專門處理表格資料的 foundation model。

為什麼這件事重要

表格資料一直是企業最主要的資料型態,但傳統做法(XGBoost、隨機森林)在每次遇到新資料集時,都需要大量的人工特徵工程和超參數調整。

TabFM 的目標是把這個流程變成 zero-shot。

模型可以直接把整個表格(包含歷史資料和要預測的資料)當成單一輸入,在一次前向傳遞中輸出預測結果,不需要重新訓練。

技術上的處理方式

表格資料和文字不同,它是二維且沒有固定順序的。TabFM 結合了 TabPFN 和 TabICL 的想法,使用交替的 row/column attention,然後把每列壓縮成向量,再用 Transformer 做 in-context learning。

這樣做可以大幅降低計算成本,同時保留表格特有的結構資訊。

實際意義

如果這個模型真的能在真實企業表格上達到可用水準,會對很多非 ML 團隊產生影響。

尤其是如果 Google 把這個能力整合進 BigQuery,讓分析師可以直接用 SQL 呼叫預測,門檻會再降低。

目前模型已經開放在 Hugging Face 和 GitHub 上。


這是 Google 把 zero-shot 概念從時間序列(TimesFM)延伸到表格資料的最新嘗試。值得持續觀察實際 benchmark 表現。