宅中地 - 每日更新
宅中地 - 每日更新

贊助商廣告

X

李飛飛掀桌!全球首個多模態世界模型發布,幾張照片省掉幾百個機位

2026年09月02日 首頁 » 熱門科技

前腳友商還在為你追我趕生成幾秒鐘的「電子榨菜」影片卷到頭禿;後腳李飛飛創辦的 World Labs 微微一笑,把桌子掀了——

就在剛剛,全球首個多模態世界模型Atlas 正式登場!

官方部落格🔗 https://www.worldlabs.ai/blog/atlas

按照官方定義,Atlas 是一款面向空間智能的 omni world model,從零開始完成預訓練,可以原生處理文本、圖像、影片、相機位姿與 3D 深度資訊,並在同一套模型中完成世界生成、空間重建和時空模擬。

李飛飛掀桌!全球首個多模態世界模型發布,幾張照片省掉幾百個機位

先來看最直觀的炸場操作:

Camera Controlled Generation(相機控制生成)。

以前大家玩影片生成模型,多少有點玄學抽獎。我們在 Prompt 框裡卑微敲下:「鏡頭緩慢向左拉升、繞著人物微仰角旋轉」,回車之後全憑老天保佑。

李飛飛掀桌!全球首個多模態世界模型發布,幾張照片省掉幾百個機位

對比之下,Atlas 的做法是:直接把「相機位姿參數」當作底層原生輸入。

你要什麼角度、什麼軌跡、走多快?

直接給坐標!

只要丟進去 1 到 6 張普通照片,定好運鏡軌跡,Atlas 就能生成最長達 1 分鐘、1440p 解析度 的大片。

畫面不崩,空間幾何絲滑一致,堪稱外掛級運鏡。

李飛飛掀桌!全球首個多模態世界模型發布,幾張照片省掉幾百個機位

更誇張的是它的空間「腦補力」。

輸入一張只拍到機器人正面的照片?Atlas 能把人家背影完完整整腦補出來;

李飛飛掀桌!全球首個多模態世界模型發布,幾張照片省掉幾百個機位

給一張泳池邊角照?它靠著腦子裡的「世界常識」,默默幫你把隔壁沒拍到的草坪和遠山給修好了。

李飛飛掀桌!全球首個多模態世界模型發布,幾張照片省掉幾百個機位

從官方放出的 Demo 來看,Atlas 在鏡頭運動和空間一致性上確實比普通影片生成模型更進一大步。

不過,鏡頭一旦進入原圖沒有拍到的區域,Atlas 實際上仍然需要依賴模型先驗去猜,視角跨度越大、生成路徑越長,局部幾何漂移、物體形狀變化和紋理閃爍也越容易暴露出來。

換句話說,它生成的更像是一個視覺上合理的三維世界,未必就是原來那個世界的精確數字復刻。

而種種操作的背後,也繞不開一個名為 Spatial Context(空間上下文)的行業術語。

大語言模型看上文接下文,Atlas 則是給每張圖片綁死三維坐標和深度,在腦子裡搭出一個帶軸網的房間。

說得更直白一點,Atlas 很多能力的底層,其實都繞不開多視角合成

李飛飛掀桌!全球首個多模態世界模型發布,幾張照片省掉幾百個機位

它會把來自不同角度、不同機位的圖片和影片,一起塞進同一個三維空間裡,先判斷它們彼此之間的相對位置,再補足沒拍到的區域,繼續生成新的視角。

單張圖輸入時,它更多依賴模型先驗去「腦補」世界;輸入視角一旦變多,它就更像是在做一次帶空間約束的多視角融合,把零散畫面慢慢拼成一個連續、可漫遊的三維場景。

甚至你隨便抓兩張八竿子打不著的照片往空間裡一扔,Atlas 都能強行給你腦補出走廊、大門和房間,把倆場景無縫焊在一起。

導演系同學看到這裡,戰術沉默,緩緩打出一個問號:合著以後運鏡不用實拍,直接在電腦里「雲開機」就完事了?

除此之外,Atlas 還有第二張王牌:Spatial Reconstruction(空間重建)。

傳統的 3D 高斯潑濺(3D GS)或者點雲掃描,得扛著專業設備圍著目標轉幾十圈,拍幾百上千張照片,費錢又費腿。

李飛飛掀桌!全球首個多模態世界模型發布,幾張照片省掉幾百個機位

但 Atlas 再次露出神秘的微笑:一邊去,哪來這麼多的規矩。

官方直接甩出了一個斯坦福大學 Main Quad 案例,只需把 2 到 25 張遊客視角的地面平拍照片塞進去,就能輕鬆還原草坪、拱廊以及紀念教堂外牆的全部細節。

李飛飛掀桌!全球首個多模態世界模型發布,幾張照片省掉幾百個機位

鏡頭隨後直接拔地而起,來了一段上帝視角航拍的漫遊。

在 DTU、ETH3D、ScanNet 等一堆公開數據集上,專門測稀疏視角重建誤差(AbsRel ×10⁻³):Atlas 拿下了 25.3 的分數(分數越低越好)。

對比之下,Pi3X 是 28.7,Depth Anything 3 飆到 39.3,MapAnything 更是高達 47.7。

李飛飛掀桌!全球首個多模態世界模型發布,幾張照片省掉幾百個機位

而且輸出直接對接點雲和 3D Gaussian Splatting,能無縫接進 World Labs 自家的 Marble 平台,高幀率即時渲染。

更絕的還有「子彈時間」式的 Reframing Video。

不用好萊塢幾百台相機的環形陣列,研究員拿三五個普通手機、運動相機隨手一架,塞進背包帶走;

李飛飛掀桌!全球首個多模態世界模型發布,幾張照片省掉幾百個機位

拍一段日常打鬧,Atlas 就能在虛擬空間裡隨意切換視角,原地復刻《駭客任務》。

李飛飛掀桌!全球首個多模態世界模型發布,幾張照片省掉幾百個機位

當然,李飛飛和她旗下的公司 World Labs 折騰這一大出,終極目標肯定不是為了跟好萊塢搶特效飯碗。她的星辰大海,是這代 AI 最大的痛點:

具身智能與機器人。

現在搞機器人訓練的朋友都知道,具身智能的最大痛點其實就是「虛擬訓練場不夠用」。

讓機器人真的去工廠、倉庫和家庭里反覆試錯,數據採集速度慢,成本也高;換到仿真環境裡訓練,又得先花大量人力搭建 3D 場景、材質、光照和物體。

業內甚至有一種估算,如果完全依靠傳統方式收集足夠規模的機器人訓練數據,最終成本可能達到 100 萬億美元的量級。

Atlas 給出的 Real to Sim 路線,相當於直接省掉了中間大量人工搭建仿真世界的工作。

拿手機拍兩段 24 幀的工廠或房間影片,餵給模型;Atlas 原地吐出一個高精度的 3D 物理空間,機器人就可以鑽進這個孿生空間裡瘋狂「跑圖」試錯。

李飛飛掀桌!全球首個多模態世界模型發布,幾張照片省掉幾百個機位

甚至機器人走到哪,Atlas 就當場渲染出機載攝影機應該看到的 RGB 圖和深度圖。

機械臂碰一下剛性箱子、拉一下鉸鏈櫃門、捏一下軟體海綿,Atlas 統統能模擬出受力反饋。

李飛飛掀桌!全球首個多模態世界模型發布,幾張照片省掉幾百個機位

只要錄一段真實現場,就能衍生出千萬種光照、擺放和障礙物條件。

技術底座上,World Labs 這次掏出了一套極其硬核的組合拳:

Multimodal Autoregressive Diffusion Transformer,多模態自回歸擴散 Transformer

李飛飛掀桌!全球首個多模態世界模型發布,幾張照片省掉幾百個機位

拆開來看,它兼采了當前兩大主流範式的長處:

  • Multimodal:原生融通文本、二維圖像、相機位姿與 3D 深度;
  • Autoregressive(自回歸):像語言模型預測下一個詞一樣,在時空序列中逐級預測新的空間狀態;
  • Diffusion(擴散機制):基於 Rectified Flow 逐步去噪,確保連續高維信號的畫質與幾何精度;
  • Transformer:以最成熟的矩陣乘法結構為底座,無縫適配現有大規模算力集群。
  • 這套架構讓 Atlas 能夠同時享受到 LLM 領域的 KV Cache、分布式推理優化,以及擴散模型的採樣蒸餾與先驗引導。
  • 在針對鏡頭運動控制的真人 Blind Test(盲測)里,戰況簡直是一場單方面的騎臉輸出:

面對 MiniMax H3,Atlas 勝率 75%;面對 Gemini Omni Flash,勝率 81%;面對 FLUX 3,勝率直接衝上 93%;面對 Seedance 2.5,勝率達到兇殘的 94%!

李飛飛掀桌!全球首個多模態世界模型發布,幾張照片省掉幾百個機位

除了世界生成和空間重建,Atlas 還順帶具備了不錯的圖像生成能力。雖然這不是它的主攻方向,但複雜 Prompt、文字渲染,以及寫實、電影感、油畫、漫畫等多種風格,它都能處理。

李飛飛掀桌!全球首個多模態世界模型發布,幾張照片省掉幾百個機位

更有意思的是,Atlas 還能直接根據文字或圖片生成 360° 全景圖。相比普通文生圖只要保證一個固定畫面成立,360° 場景還要處理前後左右的空間連續性,對模型的空間理解要求更高。

值得一提的是,除了性能,World Labs 在 Atlas 身上強調的另一個關鍵詞是 Scaling。

官方部落格提到,隨著參數量和計算力成倍上翻,模型展現出了類似大語言模型那種「突然開竅」的湧現能力。

暴力 Scaling 依然是版本答案。

目前 Atlas 已經向部分合作夥伴開放 Early Access,並將在未來成為 Marble 和 World Labs 其他產品的底層模型。

李飛飛掀桌!全球首個多模態世界模型發布,幾張照片省掉幾百個機位

回過頭看,從二十年前奠基電腦視覺的 ImageNet,到斯坦福實驗室十年來深耕「視覺+機器人學習」,再到創辦 World Labs,李飛飛本質上是死磕同一條軌道。

ImageNet 解決的是「讓機器在像素中識別世界」,而她越來越關心的,是一個更難的問題:機器看見一張圖之後,究竟有沒有理解背後的三維空間,以及下一秒會發生什麼?

李飛飛曾把今天的大語言模型形容為「黑暗裡的文字高手」,能談論現實,卻缺少真正生活在現實中的經驗。

一個模型可以解釋杯子為什麼會從桌上掉下來,但機器人真要伸手拿杯子,還得知道杯子離桌邊多遠、手從哪個方向過去,以及碰到它以後整個場景會發生什麼變化。

Atlas 所代表的空間智能,某種程度上就是給已經十分發達的語言智能繼續加上一層關於幾何、物理、時間和行動的世界經驗。

LLM 把網際網路裡的知識交給了機器,世界模型接下來爭奪的,則可能是機器從數字世界走向現實世界的那張最真實的入場券。

宅中地 - Facebook 分享 宅中地 - Twitter 分享 宅中地 - Whatsapp 分享 宅中地 - Line 分享
相關內容
Copyright ©2026 | 服務條款 | DMCA | 聯絡我們
宅中地 - 每日更新