
世界模型是 AI 的下一個風口,但多數人把三件事當成了一件
世界模型被稱為 AI 的下一個風口,但渲染器、模擬器、規劃器三種其實是不同的東西。用一只杯子帶你看懂三種世界模型的差別,以及李飛飛為何看好最不起眼的那一種。
你最近大概也躲不掉「世界模型」這四個字。它被講成 AI 的下一個風口、語言模型之後的主戰場,每隔幾天就有新公司宣布自己在做。但你有沒有一種怪怪的感覺:每篇文章好像都在講世界模型,可是它們講的東西,兜不太起來。
我會想把這件事弄清楚,老實說是被煩出來的。同一個詞看到第十遍,還是一篇一個說法,我受不了這種「好像懂了、又好像沒懂」的狀態。
於是認真去看,才發現怪在哪。OpenAI 那種生成影片的模型叫世界模型;自駕車公司拿來練車的虛擬路況叫世界模型;實驗室裡學著抓杯子的機械手臂,背後跑的還是叫世界模型。同一個詞,被扣在三件看起來八竿子打不著的東西上。
這不是錯覺。連史丹佛的李飛飛都有點受不了,今年六月特地寫了篇文章想把話講清楚。她講得很坦白:世界模型大概是現在 AI 圈最重要、同時也最常被拿來亂套的詞之一,不同領域口中的它,根本不是同一回事。
同一個詞,怎麼會是三件事
遇到這種情況,大多數人的反應是去問:那到底哪一個才是「真正的」世界模型?
我一開始也想這樣問。但李飛飛的文章點醒我一件事——這個問法本身就錯了。世界模型不是一個被三家公司搶著定義的東西,它本來就有三種,各管一段不同的事。你會覺得混亂,不是因為有人在亂用,是因為大家把三種不同的東西,塞進了同一個名字裡。
所以與其追問哪個是正版,不如先學會把這三種分開。一旦分得開,那些看起來互相矛盾的報導,瞬間就各歸各位了。
先用一只杯子,把三種分開
我用桌上一只玻璃杯帶你走一遍,三種世界模型各自會怎麼對付這只杯子,你就懂了。
第一種,姑且叫它「畫家」(技術圈的正式名稱是 Renderer,渲染器)。它只在乎一件事:畫出來像不像。給它「午後陽光斜照進來,桌上一只玻璃杯」,它能生出一張逼真到能當桌布的圖,甚至一段你彷彿能走進去的場景。Google 的 Genie、World Labs 的即時生成系統都是這路數。但這位畫家有個罩門——它畫得出杯子晶瑩剔透的樣子,卻未必知道你手指一推,它到底會不會倒。它學的是「看起來對」,不是「物理上對」。
第二種,是「物理老師」(正式名稱 Simulator,模擬器)。它輸出的不是好看的畫面,而是這只杯子的底細:多重、什麼材質、被碰會滑開還是會碎、滑到桌緣會不會墜地。蓋房子的、做遊戲的、開發自駕車和機器人的,要的都是這種真懂物理的模型,不然算出來的東西沒人敢用。李飛飛把自家 World Labs 的 Marble 放在這一類,NVIDIA 那套 Omniverse 也在這附近。
第三種,叫它「行動派」(正式名稱 Planner,規劃器)。前兩種都還停在「理解」,這種要的是「動手」。給它一個畫面加一個目標——看到杯子、任務是拿起來——它得自己盤算手臂怎麼伸、從哪個角度抓才不會打翻。現在很熱的那些機器人決策模型,把「看到的、聽到的、要做的」串成一氣的系統,全是這一類。
一句話記住:畫家負責「會看到什麼」,物理老師負責「世界實際怎麼運作」,行動派負責「下一步該怎麼辦」。三種都叫世界模型,但從現在起,你聽到這個詞,第一個念頭該是「是哪一種?」
順帶一提,這套分法聽起來很潮,骨子裡卻老得很——它的根,是強化學習教科書幾十年前那張「角色對環境做動作、環境回饋、再決定下一步」的循環圖。新風口拆開來,不過是把老圖上的不同零件各自做大。記住這點,你就不太會被「劃時代突破」這種詞唬住。
但李飛飛看好的,是最不起眼的那一個
到這裡,混亂其實已經解決了。但真正有意思的事,才剛開始。
把三種分清楚之後,你會以為鎂光燈該打在最炫的畫家(畫面誰都看得懂)和最性感的行動派(機器人最被看好)身上。李飛飛偏不。她在三種裡,獨獨看好夾在中間、最少人談的「物理老師」。
她的理由是這樣:一個真把物理搞懂的模型,往一邊走能變成好看的畫面、往另一邊走能變成正確的動作;反過來,只會畫畫或只會做決定的模型,都補不回中間那塊對世界的真實理解。物理老師是橋。沒這座橋,畫面再漂亮、決策再聰明,兩端永遠接不起來。
這個判斷我自己越想越認同。我們現在被一堆「會生成超逼真影片」的 demo 餵得很飽,但那比較像一個越來越會畫畫的畫家,離真懂這個世界,其實還很遠。
只是這座橋最難蓋,難在沒料。網路上的影片要多少有多少,畫家靠它就能練得有聲有色;但「這只杯子重幾克、玻璃摩擦力多少、撞到會怎麼裂」這種標好物理性質的 3D 資料,得有人一筆一筆做出來,稀缺到跟影片差了好幾個數量級。更燒錢的是,光讓人戴著裝置一格一格示範給機器人看,業界估算單這樣採集,一小時就能燒掉好幾千美元。誰先把這關過了,誰大概就先摸到下一張門票。
所以下次有人說「我在做世界模型」
繞了一圈,這篇想留給你的,不是又一個要背的新名詞,而是一個能直接用的問題。
下次再看到哪家公司開記者會、慷慨激昂地宣布「我們正在打造世界模型」,你先別急著熱血、也別急著翻白眼,淡淡問一句:你做的,是會畫畫的、會算物理的、還是會做決定的那一種?光這一問,你看這件事的清楚程度,已經贏過新聞稿裡那一整排形容詞。
而且這招不只對世界模型管用。AI 這幾年每隔一陣子就丟出一個被講到爛、卻沒人說得清的詞——Agent、多模態、推理模型,下一個還不知道是什麼。每次新詞來襲,與其急著問「它是不是下一個風口」,不如先冷靜拆一句:這個詞底下,是不是其實塞了好幾件不一樣的事?能這樣問的人,永遠比追著熱詞跑的人,看得清楚一點。