AI 影片一長就穿幫:Google 替它找來一整組劇組
AI 影片為什麼一長就穿幫?主流模型一次只能生成十幾秒,長片得一段段接,接著接著角色換了衣服、道具變了樣。Google Research 9 月 24 日公開四個框架,讓一組 AI 代理人分別當導演、場記、攝影和品管,做出將近十分鐘不走樣的短片。這篇拆解分工、成績,以及它們還沒真正合體的事實。
目錄+
一支將近十分鐘的 AI 短片,男女主角從密室開會、參加晚宴、破牆偷東西,一路演到坐上私人飛機,從頭到尾看得出是同一對人,同一場戲裡的衣服也沒有走樣。Google Research 在 9 月 24 日公開這支《The Great Museum Heist》,背後是四個分工合作的 AI 系統。
聽起來理所當然,但對現在的 AI 影片來說,這正是最難的一件事。
這篇拆三件事:AI 影片為什麼一長就穿幫、Google 怎麼替它找來一整組劇組、還有這組劇組其實還沒一起開工過。
AI 影片為什麼一長就穿幫?
想像你在拍一部電影。演員上午拍完走進門的鏡頭,下午補拍門後的鏡頭,袖子捲的高度不一樣,觀眾一眼就看出來。這叫穿幫。片場有個人專門盯這件事,叫場記,他會記下每個鏡頭裡誰穿什麼、杯子放在哪。
AI 影片沒有場記。現在的影片模型一次能生成的長度有限,invideo 在 8 月整理的數字是主流模型單次大約 8 到 30 秒。要做幾分鐘的片,只能一段一段生成再接起來,而每一段都是重新畫的,不記得上一段的角色有沒有戴帽子。
Google 在文章裡放了一組對照。同一段博物館竊案的分鏡,交給另一套多代理人框架 AutoStudio,一個角色的帽子在下一個鏡頭突然不見;直接用 Gemini-3.1-Pro 生成,被偷的展品在不同鏡頭長得不一樣,展廳格局也跑掉了。
Google 把這類問題分成兩種。一種是慢慢走樣,衣服和場景每接一段就偏一點。另一種是連鎖失誤,上游一張參考圖有瑕疵,後面的影片全部跟著壞,事後還很難查出是哪一步出的錯。
AI video co-director 是什麼?
AI video co-director 是 Google Research 做的一組 AI 代理人,疊在 Gemini 和 Veo 上面,把一支長片的工作拆成導演、場記、攝影、品管四種角色,各由一個框架負責。它是一層指揮系統,管的是怎麼使喚底下的模型。
導演:Co-Director 決定怎麼拍
它的核心是一個叫「多臂老虎機」的方法。名字來自賭場:你面前有好幾台吃角子老虎機,每台的中獎率不一樣,你要一邊試試沒玩過的,一邊多拉手氣好的那台。
Co-Director 的老虎機是拍法。每一輪它挑一種組合,決定用什麼創意策略、什麼敘事方式、什麼美學風格,交給底下的前製、製作、剪輯代理人去拍,再請一個看得懂影片的模型當評審打分數。分數回傳,下一輪換個拍法再試。
成績要看清楚比的是誰。在 Google 自己做的廣告測試集 GenAD-Bench 上(400 個虛構產品的廣告情境),Co-Director 拿 81.4 分,比只跑一輪、不做優化的自家版本 68.5 分高 18.8%。外部模型在同一份測試裡的分數,專案頁也列了:直接用 Veo 3.1 生成是 63.6,Kling 3.0 Omni 是 58.4。
GenAD-Bench 自動評分(滿分 100,數字來自 Co-Director 專案頁)
真人評分也是同一個方向。每支影片由 5 個人打 1 到 5 分,Co-Director 平均 3.96,Veo 3.1 是 3.71。
場記:CANVAS 記住每個角色穿什麼
CANVAS 就是那個場記。它替故事裡的每個角色、每個地點、每個道具建一份檔案,場景再出現時先翻檔案,照原本的樣子畫。
在 Google 的測試裡,它比表現最好的對手在背景連續性上提升 21.6%,角色一致性提升 9.6%,道具一致性提升 7.6%。回到那段竊案分鏡,CANVAS 版本的展品從頭到尾同一個樣子,展廳的格局也對得上。
攝影:A²RD 一段一段接著拍
A²RD 負責把畫面真正拍成長片。它像一個寫連載小說的作者,每寫新的一章之前,先翻一遍前面的角色設定和劇情。
具體做法是一段一段生成,旁邊擺一份影片記憶,記著每一段出現過什麼。每一段開拍前,它先判斷這段要做什麼:劇情要往前走,就往前延伸出新畫面;舊角色或舊場景要回來,就對齊記憶裡原本的樣子。
那支 9 分 37 秒的竊案短片就是 A²RD 的示範。論文在 1 到 10 分鐘的測試裡,一致性比最好的同類方法高最多 30%,敘事連貫高最多 20%。
品管:VQQA 自己出考題
VQQA 是品管。影片生成完,它針對這段要求出一組考題,例如「拉小提琴的還是同一個人嗎」「這顆方形氣球看起來像氣球嗎」,再讓一個看得懂影片的模型作答。
答錯的地方會變成一段文字回饋,拿去改寫提示詞,重新生成。它不動畫面上的任何一個像素,只改寫給影片模型的那段文字。最後它回頭比較每一輪的版本,挑最貼近原始要求的那支,免得越改越偏。
Google 的例子很好懂。原本的生成裡,鋼琴家和小提琴手切鏡頭之後互換了樂器;VQQA 修過之後,兩個人一直守著自己的樂器。論文的成績是 T2V-CompBench 絕對分數提升 11.57%,VBench2 提升 8.43%。
但這組劇組還沒一起開工過
四個角色分工,聽起來像一條完整的產線。仔細看成績表會發現,四個框架是分開測的。官方表格是一個框架對一組測試,沒有任何一個實驗把四個串在一起跑。
幾個細節要一起記住。那支十分鐘的片只用了 A²RD。CANVAS 的成績是分鏡的連續性,它產出的是一格一格的靜態畫面,還不是影片。Co-Director 的測試題目是廣告。CANVAS 自己做的 HardContinuityBench,論文也承認規模不大。
另外,這些都還是論文,Google 沒有說什麼時候變成產品。它的做法本質上是多拍幾次、多檢查幾輪再挑最好的,每一支片要花的運算只會比直接生成多。
十秒的片比畫質,十分鐘的片比記性。
Google 押的方向很清楚,下一輪比的不是單一模型能畫出多漂亮的十秒,而是整套系統記不記得住自己拍過什麼。
現在做 AI 影片可以先學什麼?
這套系統還拿不到,但它的思路今天就能用。
- 寫一份場記表:開拍前把每個角色的長相、衣服、配件,每個場景的格局逐條寫下來。
- 固定參考圖:每一段都用同一張角色參考圖,不要每次重新描述。
- 每段出考題:生成完問自己幾個具體問題,例如主角還戴著帽子嗎、道具位置對不對,答不對就改提示詞重來。
這跟 OpenMontage 把 AI 助手變成一間影片公司 是同一條路:模型負責拍,外面那一層負責記住和檢查。如果你想知道多個 AI 代理人之間怎麼排班、誰該等誰,可以接著看 Graph Engineering 是什麼。
利益揭露:以下是聯盟連結。
手上的工具方面,Kling 可以從一張圖加一句話生成影片,拿來練習「固定參考圖、每段檢查」這套流程剛好;站上之前也寫過 Kling AI 的完整介紹。
常見問題
AI 影片為什麼會角色不一致?
因為長影片是一段一段分開生成再接起來的,每一段都不知道上一段長什麼樣。invideo 在 2026 年 8 月整理,主流模型單次生成大約 8 到 30 秒,片子一長,衣服、道具、房間格局就容易對不上。
Google 的 AI video co-director 現在能用嗎?
還不能。它是 Google Research 發表的研究,四個框架都還是論文,官方沒有公布產品時程。它疊在 Gemini 和 Veo 上面,產出的畫面會帶 SynthID 浮水印。
Google 那支十分鐘的 AI 短片是怎麼做的?
那支《The Great Museum Heist》片長 9 分 37 秒,是四個框架裡的 A²RD 做的示範。它一段一段生成,每段先查影片記憶,要推進劇情就往前延伸,舊角色回來就對齊原本的樣子。
現在想做角色一致的 AI 影片,有什麼可以先學的?
先借它的思路。開拍前列一張角色與場景清單,每段都用同一張角色參考圖,生成完問自己幾個具體問題,例如主角還戴著帽子嗎,答不對就改提示詞重來。
AI 影片下一個門檻,是記住自己拍過什麼。Google 已經把導演、場記、攝影、品管各做出一個,還差把它們排進同一張班表。
如果你手上有一組記得住每個角色的 AI 劇組,第一支想拍的會是什麼?