跳到主要內容
/閱讀約 11 分鐘/

SensorFM是什麼?Google穿戴數據健康基礎模型解析

Google Research 發表 SensorFM,用超過 1 兆分鐘穿戴裝置感測數據、來自 500 萬名同意受試者訓練出的健康基礎模型,在 35 項心血管、代謝、睡眠、心理健康任務中打贏 34 項專用模型。這篇拆解它怎麼訓練、怎麼評測,以及為什麼現在還只是一篇論文,不是你手錶裡的下一個功能。

目錄+

Google Research 在 2026 年 7 月 9 日丟出一個數字:1 兆分鐘。這是他們新模型 SensorFM 吃下去的穿戴裝置感測資料量,來源是 500 萬名同意參與研究的人、超過 20 款 Fitbit 和 Pixel Watch。更狠的是,這個模型沒有針對任何單一疾病訓練,卻在 35 種健康預測任務裡贏過 34 個各自打造的專用模型。這篇拆三件事:它怎麼練出來的、贏面從哪來、以及為什麼現在還輪不到你的手錶。

SensorFM 是什麼:一個不挑任務的健康模型

過去做穿戴裝置健康預測,通常一個任務配一個模型:睡眠品質一個、心律不整風險又一個。問題是每個人的生理基線差很多,同一個訊號在你身上是警訊,在別人身上可能只是日常波動,能拿來訓練的標籤(確診紀錄、抽血報告、量表分數)又貴又慢。

SensorFM 換了個做法。它是一個「感測器基礎模型」,先不管任何具體任務,直接從海量、沒有標籤的穿戴資料裡學一個通用的生理表徵,之後轉接到心血管、代謝、睡眠、心理健康、生活習慣、人口統計六大類任務——一個底層模型服務所有下游用途,不用每個任務重新練一次。

資料從哪來:20 款裝置、500 萬人、1 兆分鐘

這批資料有多大?500 萬人同意把自己手錶的資料拿去做這個研究,時間橫跨 2024 年 9 月到 2025 年 9 月,涵蓋 100 多個國家、美國全部 50 州,裝置超過 20 款 Fitbit 和 Pixel Watch。加起來超過 20 億小時——換算成分鐘,是 1 兆多分鐘。

模型看的是手錶上五種感測器的資料:量心率血氧的、記錄動作的、測皮膚導電反應的、量體溫的、量高度的。翻成白話就是:心跳穩不穩、血氧夠不夠、睡得好不好、走了幾步、會不會緊張出汗、體溫正不正常——而且是連續 24 小時全都記錄。

Google 自己說,這是目前訓練單一模型用過規模最大、種類最多的一批穿戴資料。

訓練方式:資料缺塊,不補也不丟

穿戴裝置的資料天生破碎:手錶會沒電、會被拿下充電、會進省電模式。傳統自監督學習遇到缺口通常兩條路——硬補上去(帶入偏差)或整段丟掉(浪費資料)。SensorFM 用 LSM-2 延伸出的 AIM 框架(Adaptive and Inherited Masking),把「真的缺資料」跟「刻意蓋住做重建練習」的位置一視同仁,讓模型學著在不完整輸入下工作。缺塊不是雜訊,是訓練訊號的一部分。

養大模型真的有差:35 選 34 的贏面

Google 做了一組橫跨四個數量級的擴展實驗,資料量從約 200 萬小時加到 20 億小時,模型參數從 10 萬撐到 1 億,共四種尺寸。結果很乾脆:資料和模型一起放大,重建損失持續下降,這個進步還會傳到下游任務,沒看到飽和跡象。

最大模型 SensorFM-B 相對最小版本的效能提升(Google Research 官方數據,單位:%)

最大版本 SensorFM-B 用滿 500 萬人語料,重建損失比最小版本降了 31%,下游分類任務平均 AUC 提升 9%,迴歸任務的 Pearson 係數平均提升 21%。評測用三個獨立、經 IRB 審核的前瞻性研究,共 13,985 名受試者、35 個任務。做法是凍結 SensorFM 的編碼器,只在上面接一層很輕的線性分類頭,跟工程特徵訓練出的監督式基準比——結果 35 項裡贏了 34 項。連憂鬱、焦慮這種因人而異、訊號很淡的心理健康指標,規模放大後表現也在變好。

讓 LLM agent 自己找演算法

光有通用表徵還不夠,每加一個新任務就得手動做特徵工程、選架構、調參數,很耗工。Google 的解法是搭一個「agent 教室」:讓一群互相合作又競爭的 LLM agent,自動生成、測試、修改程式碼去接 SensorFM 的 embedding 做預測頭。整個過程跑了超過 3 萬組候選方案,agent 設計出的預測頭在 20 個分類任務裡贏過線性探針 16 個、15 個迴歸任務裡贏 12 個。這種讓多個 agent 分工榨出模型更多用途的思路,跟 MiroFish 那種平行世界引擎的技術賭注有點像——賭的都是「與其手動堆架構,不如讓 agent 自己迭代出解法」。

500 萬人同意的背後:隱私怎麼講

官方部落格對隱私的說法很簡短:這是「來自 500 萬名同意將資料用於健康與保健研究之受試者的去識別化資料」,沒有再往下講資料治理細節。要理解 Google 平常怎麼要求第三方用這類資料,可以參照 Google Fit 的健康研究政策——研究計畫得經獨立審查委員會核准、資料只能用於原始研究目的、不得挪去做廣告用途。這是 Google 對外部研究者的一般規範,不是這篇論文專屬的揭露,但至少說明了這類穿戴資料在 Google 內部不是隨便拿來用的。

這離你的手錶還有多遠

先講白:這是一篇研究論文,發在 arXiv,作者是 Google Research 和 Google DeepMind 的人。部落格裡唯一提到的實際應用,是拿 SensorFM 的預測結果去餵一個實驗性的 Personal Health Agent,讓臨床醫師盲測評分——加了 SensorFM 預測的健康摘要,評分顯著贏過只有基本穿戴指標的版本,甚至跟真實檢驗數據餵進去的效果沒有統計上的差異。這證明模型的推論品質夠高,但離變成 Fitbit app 裡的功能還有一段距離,官方沒給任何時程。

值得對照的是,Apple Watch、Oura、WHOOP 這些消費端產品,多半還是針對單一指標各自訓練的專用演算法——睡眠分數、恢復分數各是各的模型。SensorFM 賭的是另一條路:先練一個通用表徵,再讓它同時支援多種任務,這跟 GeoGPT 那種領域專屬模型的崛起剛好是反方向的思路——一邊收斂到單一領域做深,一邊在單一模態內部做通用化。哪條路線最後贏還說不準,但這種「先做通用表徵、再長出應用」的打法,跟 垂直 AI 的商業機會地圖裡討論的邏輯是同一套——基礎模型的錢景往往不在模型本身,在誰先把它接進真實工作流。

一個沒被訓練去認識任何一種病的模型,反而在 34 種健康任務上贏過專門訓練的對手——這就是 SensorFM 最反直覺的地方。

如果你對「先做通用嵌入、再接輕量預測頭」這套訓練路數有興趣,想拿自己的資料做類似的小規模微調實驗,本地端至少要一張撐得住 embedding 訓練跟批次推論的顯卡。24GB VRAM 等級的麗臺 RTX PRO 4000 Blackwell,跑這種規模的下游微調任務綽綽有餘,不用出動雲端 GPU 計費。

常見問題

SensorFM 會出現在 Fitbit app 或 Google Fit 嗎? 目前沒有官方時程。Google Research 部落格把它定位成研究論文,文中唯一提到的應用場景是實驗性接進一個 Personal Health Agent,並不是已公開的產品或 API。

SensorFM 訓練用的是哪些穿戴裝置資料? 來自超過 20 款 Fitbit 和 Pixel Watch 機型,涵蓋心率(PPG)、加速度、皮膚電活動、體溫、高度計五種感測模態,取樣時間是 2024 年 9 月到 2025 年 9 月。

想動手整理自己的量化自我資料、搭一套本地分析工作站,開發者桌面選物這種基本盤先備好,鍵盤、Hub、站立書架都是常見的起手式。

利益揭露:本文部分連結為聯盟連結,點擊購買我會獲得回饋,不影響你的價格。文中蝦皮商品為規格與情境推薦,並非本人長期實測結果。

SensorFM 目前只是一篇論文,但它把「穿戴裝置健康 AI」的賭注講得很清楚:與其每個病症各練一個模型,不如先練一個懂身體的通用表徵。至於這個表徵什麼時候會變成你手腕上真的能用的東西,就看 Google 願不願意把研究論文的贏面,搬進 Fitbit app 的下一次更新。