Mira Murati 的 Thinking Machines 推出互動模型:AI 第一次能同時聽、說、看、思考
Thinking Machines Lab(Mira Murati 創辦)發布 Interaction Models,一個 276B MoE 模型(12B active),用 200ms micro-turns 實現全雙工音訊/視訊/文字互動。不再是輪流發言,而是 AI 和人同時在聆聽、說話、觀看。限量研究預覽已開放,wider release 規劃在 2026 下半年。
目錄+
現在的 AI 對話是這樣的:你說,它回;它說,你聽。輪流發言,一次一個。
這個設計不是因為最好,是因為技術限制。
2026-05-11,Thinking Machines Lab 展示了一個不同的方向。
什麼是 Interaction Models
Thinking Machines Lab 的 technical blog 用一句話說清楚了核心概念:
「人類同時說話、聆聽、觀看、思考、協作。我們設計了一個 AI,以同樣的方式與人合作。」
技術上,這叫 full-duplex multimodal system(全雙工多模態系統)。具體是:
- 200ms micro-turns:每 200ms 一個處理單元,而不是等你講完才開始思考
- 連續音訊 + 視訊流:可以同時處理語音輸入和視覺輸入,不是輪流
- 可以打斷、被打斷:像真實對話一樣,AI 可以在你還在說話時反應
根據 marktechpost.com 的報導,模型規格是:
TML-Interaction-Small:276B 參數 MoE,12B active 參數
和現有模型的差距
在幾個新 benchmark 的結果(根據 Thinking Machines 官方 blog 和 marktechpost.com 報導):
- TimeSpeak:64.7(TML-Interaction-Small)vs. 其他受測模型接近 0
- CueSpeak:81.7 vs. 接近 0
- RepCount-A:35.4 vs. 接近 0
- Charades mIoU:32.4 vs. 接近 0
對比基準包括 GPT-realtime-2.0。這些 benchmark 專門測「時間感知」和「線索感知」——就是那種需要在對話進行中實時反應的能力,不是等回答完才評分。
Harmbench refusal rate:99.0%(官方公布)
現在能用嗎
目前是限量研究預覽,wider release 規劃在 2026 下半年。
有興趣的可以發信到 [email protected] 表達興趣。官方在 blog 裡說他們在積極收集回饋。
幾個已知限制:
- 連續的音訊和視訊 context 累積很快,超長 session 需要管理 context
- 串流需要穩定網路(200ms chunk 設計,差的網路會明顯影響體驗)
- 現有的大模型目前推論太慢,不能 real-time 部署——更大版本在規劃中
Thinking Machines 的背景值得了解一下
VentureBeat 的報導補了一個背景:Thinking Machines Lab 由前 OpenAI CTO Mira Murati 創辦。
2026 年 4 月,Business Insider 報導 Meta 挖走了 Thinking Machines 的七名創始成員(包括 Mark Jen 和 Yinghai Lu),以及多名研究員轉往 Meta Superintelligence Labs。
但同時,Thinking Machines 也雇到了 PyTorch 創辦人 Soumith Chintala 擔任 CTO,以及前 Meta 八年的多模態感知系統工程師 Weiyao Wang。
人才流向是雙向的。Interaction Models 的發布,是 Thinking Machines 在這個紛擾背景下給出的第一個實質技術答案。
為什麼 200ms 是關鍵
現在的 AI 語音對話有一個明顯的「感覺不對」:你說完,等一下,它回;它回的時候你不能插話,等它說完再換你。
這個 turn-taking 設計讓對話變得機械。現實中的對話,人類一直在同時接收和發送資訊——你在聽別人說話的時候,臉部表情、點頭、小聲的「嗯嗯」都在給對方回饋。
200ms micro-turns 讓 AI 能在每 200ms 更新一次對對話的理解,而不是等到你說完才開始處理。這個差距感覺起來,就是「像在和人說話」和「像在填問卷」的差距。
AI 協作的瓶頸不再是算力或智力,而是互動頻寬。 Thinking Machines 的賭注是:解決這個,模型會在更大規模的訓練中同時變得更智能也更好協作。