跳到主要內容
/閱讀約 11 分鐘/

LiteRT.js、Muse Spark 1.1、MOSS 開源:一個週末的五件 AI 大事

7 月 8 號到 9 號 48 小時內,Google、Meta、一個中國開源團隊、three.js 社群、Anthropic 同時放出五件不相干的消息。拆開看很平常,湊在一起卻是同一件事:AI 產業正同時在五條戰線上出手。

目錄+

7 月 8 號到 9 號,48 小時內,五件互不相干的 AI 消息同時擠上時間軸——Google 升級瀏覽器端推論引擎、Meta 幫自家旗艦模型開了付費 API、一個中國團隊直接開源能聽 90 分鐘會議的語音模型、three.js 社群把一場足球賽踢成 3D 地形圖炸遍全網,Anthropic 反過來勸你少用點 Claude。

單看每一則都只是常規更新,湊在一起卻說明同一件事:AI 產業同時在五條戰線上出手——瀏覽器跑更快、雲端模型更貴更封閉、開源生態補位、創意應用出圈、連「勸你少用一點」都能做成功能。這篇拆開講,也告訴你哪個是真升級、哪個只是換包裝。


LiteRT.js:Google 幫瀏覽器裝了一個更快的 AI 引擎

LiteRT.js 是 Google 新的「Edge AI runtime for the web」,把 PyTorch 模型轉成 LiteRT 格式後,靠 WebGPU、WebAssembly、WebNN 在瀏覽器裡跑推論——官方的說法很直接:「該從 TensorFlow.js 升級了」。

這不是全新技術。LiteRT 本身是 2024 年 9 月從 TensorFlow Lite 改名而來的,這次是補上瀏覽器這塊。根據 Google 自家文件,LiteRT.js 特意設計成能直接插進既有的 TensorFlow.js pipeline:前後處理都不用動,只要換掉載入模型和跑推論那兩行程式碼。

問題是,LiteRT.js 真的跟 ONNX Runtime Web 差在哪?ONNX Runtime Web 早就支援 WebGPU、WebNN、WASM 三種執行路徑,還是 Transformers.js 瀏覽器端推論的底層引擎,PyTorch 匯出的模型直接能吃。說白了,LiteRT.js 的賣點不是「發明了瀏覽器 GPU 推論」,是「如果你本來就是 TensorFlow 陣營,這是條摩擦最小的下車路線」。早就在用 ONNX 或 Transformers.js 的人,沒有非換不可的理由。

想搞清楚本地跑模型和雲端服務的算盤該怎麼打,2026 年的兩條路:垂直 AI 與本地 AI 的商業機會地圖 這篇拆得比較細。


Muse Spark 1.1:Meta 把免費模型的生意經換了

7 月 9 號,@AIatMeta 宣布 Muse Spark 1.1,說是今年稍早發布的第一代 Muse Spark 的「重大升級」。同一波公告裡還有一件更關鍵的事:Meta 開放了新的 Meta Model API 公開預覽,讓開發者能直接呼叫 Muse Spark 1.1,模型也已經在 Meta AI app 和 meta.ai 上以「Thinking」模式上線。

查了一下來歷,這個版本號背後其實是個更大的轉向。Muse Spark 是 Meta Superintelligence Labs(由 Alexandr Wang 領軍)成立以來的第一款模型,4 月發布時就被定位成 Meta 正面對打 GPT、Gemini、Claude 的第一步——跟開源的 Llama 不同,Muse Spark 是閉源的,Meta 明確說要走付費 API。

那 1.1 是真升級,還是版本號灌水?Muse Spark 剛發布時,媒體引用 Meta 自己的說法,承認「長流程 agent 任務」和「進階程式能力」還有明顯落差。這次 1.1 沒提到補上這些缺口,力氣反而放在更實際的事——把 API 開放給開發者。免費模型的生意經,換成了收費 API。這次升級對 Meta 的意義,商業模式的進展可能比模型能力本身更大。

如果你對「架構軍備賽」背後到底在比什麼還有疑問,2026 年 4 月:五個 LLM 同月發布,但架構戰場已經不在 transformer block 這篇會讓你重新想一次「模型變強」到底是什麼意思。


MOSS-Transcribe-Diarize-0.9B:0.9B 就能聽 90 分鐘會議、還分得出誰在講話

OpenMOSS 團隊 7 月 9 號在 Hugging Face 開源了 MOSS-Transcribe-Diarize-0.9B,一個端到端「音訊直接轉結構化逐字稿」的 ASR 模型。規格是:0.9B 參數、Apache 2.0 授權、128k 長文本轉錄、單次最長能吃約 90 分鐘音訊、一次生成就同時給說話者標籤、時間戳記、多人分離(處理打斷和重疊講話),還支援針對人名、術語、專業詞彙的 hotword biasing,在 NVIDIA RTX 4090 上跑出約 100 token/s,RTF 約 0.017。

OpenMOSS 不是憑空冒出來的團隊——他們是復旦大學 NLP Lab、上海創新研究院、MOSI.AI 合作的研究組,往前追就是 2023 年「中國版 ChatGPT」MOSS 的原班人馬,之後也陸續放出 MOSS-TTS-Nano、多模態 MOSS-VL,算是有底子,不是一次性刷存在感。

老實講,token/s 和 RTF 這兩個數字目前只有這一個來源,我沒找到第三方重跑過的結果,別直接當定論。倒是有個側面訊號:推文點名感謝了 sglang、vllm、mlx-audio 團隊做「day-0 支援」,這幾個推論框架通常不會急著為跑不動的模型背書。

同類型的開源模型能不能打,可以參考 Kimi K2.5 完整評測:比 Claude 便宜 25 倍的開源 LLM,值得用嗎?。如果打算把轉錄任務長期搬到自己桌面上跑、不想每次都掏錢租雲端,蝦皮上的開發者桌面四件套是個把工作站整理起來的便宜起點——0.9B 模型對硬體要求本來就不高,先把桌面環境弄順比先買貴顯卡更實際。


一支沒有文字的推文:three.js 把世界盃踢成了 3D 地形圖

這則推文沒有任何文字,只有一支約 45 秒的靜音影片——455.5 萬次觀看,證明一支空白推文本身就是最好的宣傳。影片是一張即時比賽的等距 3D 地形圖,場地被切成藍紅兩色區塊,我截圖時畫面停在阿根廷對埃及、上半場第 1 分鐘、比分 0 比 0。畫面角落標註了創作者:Alexander Bogachev(個人網站 wc26.bogachev.fr),資料來源是 FotMob、WhoScored 經 Opta 整理,用 three.js 搭 WebGPU 渲染。

根據 Bogachev 本人在 LinkedIn 和 Reddit 上的說明,這是把 2026 世界盃全部 96 場比賽重建成 3D 地形的專案——刻意強調沒有追蹤球或球員實際位置,是從每場約 1,500 筆逐項事件加上逐分鐘的比賽動能資料,用自訂 GLSL 做地形位移和渲染。

這類作品容易被過度神化成「AI 生成」,其實剛好相反:不是生成式模型吐出來的畫面,是純粹用真實事件資料驅動的程式化渲染,每一道稜線都對應一筆真實發生的球場事件。真正值得學的不是技術本身,是它把「數據」和「感覺」的距離壓縮到一支 45 秒無字影片就能讓人看懂比賽張力——這比大多數塞滿標籤的儀表板更有效。


Claude Reflect:Anthropic 出了一個勸你少用 AI 的功能

7 月 9 號,@claudeai 宣布新功能「Reflect」:月度使用回顧,顯示你什麼時候最常用 Claude、把時間花在哪些主題上,還能設定安靜時段、收到休息提醒,位置在 Settings 底下的 Reflect。

功能已經進入 beta,Free、Pro、Max 方案的網頁版和桌面版都能用,前提是記憶功能要開著——無痕對話和健康整合內容不算進統計。可以回顧 1、3、6、12 個月的使用狀況,中間還會丟出反思性問題,例如「有哪件事你想自己做、就算 Claude 做得更快」。The Verge 直接把它叫做「Claude Wrapped」——概念上跟 Spotify Wrapped 一樣,只是主題換成「你花了多少時間叫 AI 幫你做事」。

一家靠訂閱賺錢的公司,推出功能勸你少用自家產品,聽起來矛盾,但這可能才是精明的地方:如果 Anthropic 賭的是長期信任、不是短期用量,先擺出「我們在乎你有沒有過度依賴」的姿態,反而比放任你無止盡刷對話框更留得住人。這跟 Muse Spark 1.1 的付費 API 是兩種商業邏輯——一個想讓你更黏,一個想讓你覺得被在乎。

Anthropic 這陣子在功能上動作不少,AI 幫你審程式碼、記住習慣、自動分工——Anthropic 這次升了四個功能 可以一起看。


利益揭露:本文部分連結為聯盟連結,點擊購買我會獲得回饋,不影響你的價格。

這 48 小時湊在一起看,畫出的不是一條技術趨勢線,是五種生存策略:Google 靠瀏覽器基礎設施卡位,Meta 想把模型變成生意,OpenMOSS 用開源換口碑,一位獨立創作者靠沒有文字的影片證明創意比預算重要,Anthropic 反而賭「節制」能換來信任。沒有一件事能單獨說明 AI 產業在往哪走,但放在一起看,大家已經不在比誰的模型更強——在比誰能先把使用者綁得更牢。你更買單哪一種?