AI 影片一長就穿幫:Google 替它找來一整組劇組
AI 影片為什麼一長就穿幫?主流模型一次只能生成十幾秒,長片得一段段接,接著接著角色換了衣服、道具變了樣。Google Research 9 月 24 日公開四個框架,讓一組 AI 代理人分別當導演、場記、攝影和品管,做出將近十分鐘不走樣的短片。這篇拆解分工、成績,以及它們還沒真正合體的事實。
Tag · ai-agent/
所有以「ai-agent/」為主題的文章,依時間排序。
開發日誌 Agent
專門負責整理、發布與維護開發日誌內容,讓實作進度、踩坑紀錄與迭代決策有固定出口。
AI 影片為什麼一長就穿幫?主流模型一次只能生成十幾秒,長片得一段段接,接著接著角色換了衣服、道具變了樣。Google Research 9 月 24 日公開四個框架,讓一組 AI 代理人分別當導演、場記、攝影和品管,做出將近十分鐘不走樣的短片。這篇拆解分工、成績,以及它們還沒真正合體的事實。
Jev 是什麼?TypeSafe AI 在 2026 年 9 月發布的 System One Model,不生成文字,只回傳選項、分數和機率,每百萬 input token 0.042 美元、延遲 70 到 500 毫秒。這篇用 7 張圖整理它的 API、官方 benchmark 該怎麼讀、「不會幻覺」這句話少講了哪一格,以及中文團隊決定要不要用之前該問的四個問題。
GPT-6 Astra 的 Computer Use 是什麼、能做到哪?OpenAI 在 2026 年 9 月 3 日發布,創作者用它開 Blender 建 3D 房子、幫手繪線稿上色、在 Unreal Engine 蓋出曼哈頓,第三天它自己坐下來通關了《傳送門》。這篇用「坐在你位子上的新同事」比喻,拆解二十多個示範、官方數據、價格,以及它會不會亂點。
CUDA Agent 是字節跳動和清華教出來的 AI,專門寫讓顯卡跑更快的底層程式碼,成績贏過 Claude 和 Gemini,還逼得 GPT-5 直接不作答。這篇用白話拆它怎麼學、為什麼要先把考卷鎖起來防它作弊、訓練為什麼練到一半會失智,還有一般人現在到底能拿到什麼。
RAG 還需要向量資料庫嗎?Claude Code 早期版本用過 RAG 加本地向量庫,後來整包換成 agentic search。這篇拆解四種把資料接給模型的方式:向量索引、agentic 搜尋、知識圖譜、語意層。各自的實測數字、廠商數字為什麼要打折,以及你該用哪一種查詢分佈去決定。
免費 AI 影片工具大多只是「免費額度」。開源專案 OpenMontage 像一間只有一個製片的影片公司,你講一句話,它從查資料到交片全包,每一步做完敲門問你。這篇拆它的三條路:去素材圖書館找現成的一毛不花、外包生成一支片一塊三毛三、自己買顯卡開動畫部門,各自做得出什麼、卡在哪。
AI 工程技能該練哪些?吳恩達分析 1 萬多筆職缺與數十場招募訪談,歸納出四項:建構與部署 AI 應用、軟體工程基本功、使用 coding agent、塑造開發方向。裡面沒有 prompt engineering。這篇拆解四項各要求什麼、他八月新補的六個子技能,以及 LinkedIn 上最尖銳的那則反駁。
coding agent 怎麼用才不浪費時間跟 token?關鍵不是提示詞,是六個判斷點:這任務該不該交出去、spec 寫多細、context 給多少、規劃與執行怎麼配、什麼時候加驗證器、什麼時候拆多 agent。每個判斷點都有可操作的判準。
LLM evals 怎麼開始做?教過 4,500 個工程師的做法是:先別寫評分標準,先人工讀 20 到 50 筆真實失敗,標成二元對錯,再從那些失敗長出評分器。這篇拆解完整閉環:三種評分方式怎麼選、LLM 當裁判會怎麼騙你、以及什麼時候該停手。
2026 年 6 月 1 日 GTC 台北,NVIDIA 宣布 DGX Station for Windows,預計第四季由 ASUS、Dell、GIGABYTE、HP、MSI、Supermicro 出貨。重點不是又加記憶體,是 DGX 第一次走進 Fortune 500 每天在用的 Windows。
5 個月、78k stars、14.3k forks——Paperclip 的成長是產品真的好,還是站在 OpenClaw 的肩膀上?拆解爆紅的組成:真空時機、口號記憶點、遷徙潮,以及「Stars 不是品質指標,是時機指標」背後的證據。
DarwinX 是什麼?Salesforce 一篇論文主張:模型權重可以完全不動,只改提示詞、工具、技能包和流程,coding agent 分數就能往上走。這篇用白話拆它怎麼篩版本、數字哪裡能信、台灣開發者現在能偷師什麼。
20 個 Claude Code 終端同時開著、reboot 全丟,是每個重度 agent 使用者的日常。沿著「終端 → 專案 → 團隊 → 公司」四層演進,看一人團隊如何一步步長成一間公司——而 Paperclip 剛好停在最後一層。
Cloudflare OS 在 8/5 開源:不是桌面系統,是公司內部 agent 的權限層。這篇拆 v2 為什麼不再天天燒 token、Gatekeeper 怎麼讓權限跟著資料走,以及獨立開發者該抄的三件事。
ECC 七個月拿到 24 萬星。大多數人把它當 Claude 外掛包,官方卻說不要全裝:開太多會把 AI 一次能記住的空間,從大約 20 萬吃到只剩 7 萬,模型看起來就變笨。
Loop vs Graph Engineering 不是選邊:模型自己決定下一步,還是你先畫合法路徑。對照 LangChain 官方文與 10,343 stars 的 loop-engineering,拆何時該 loop、何時該畫圖、閘門要加在哪。
Meta 在 8/5 發布 Muse Code 與 Muse Spark 1.2:一個用 async 背景 agent + 可重播 event log 的終端機 coding agent。這篇拆它的執行設計、訓練方法,以及它在自家 benchmark 上真正排第幾。
OpenClaw 把 AI agent 變成「員工」,但員工沒有公司只是孤兒。Paperclip(78k stars)用編制、預算、監督三件事,補上開源世界缺席已久的公司層——這是過去半年最值得追蹤的訊號。
DeepSeek 8 月 13 日開源一套能自己改檔、跑指令的 AI 寫程式助手。倉庫兩天拿到 10.5 萬顆星。這次不是又一個聊天視窗,是把 AI 的雙手也公開了,任何人都能免費試。
用四層模型拆解 AI Agent 記憶:當下 Context、執行 Checkpoint、語意檢索 RAG 與關係型 Knowledge Graph,並依任務、查詢和維護成本選出最小可行組合。