前腳友商還在為你追我趕生成幾秒鐘的「電子榨菜」影片卷到頭禿;後腳李飛飛創辦的 World Labs 微微一笑,把桌子掀了——
就在剛剛,全球首個多模態世界模型Atlas 正式登場!
Introducing Atlas: The world's first multimodal world model that generates image and video frames with pixel-perfect camera control and reconstructs them in 3D. Model the world, move the camera, and simulate space & time. https://twitter.com/theworldlabs/status/2094839756329041984
按照官方定義,Atlas 是一款面向空間智能的 omni world model,從零開始完成預訓練,可以原生處理文本、圖像、影片、相機位姿與 3D 深度資訊,並在同一套模型中完成世界生成、空間重建和時空模擬。

先來看最直觀的炸場操作:
Camera Controlled Generation(相機控制生成)。
以前大家玩影片生成模型,多少有點玄學抽獎。我們在 Prompt 框裡卑微敲下:「鏡頭緩慢向左拉升、繞著人物微仰角旋轉」,回車之後全憑老天保佑。

對比之下,Atlas 的做法是:直接把「相機位姿參數」當作底層原生輸入。
你要什麼角度、什麼軌跡、走多快?
直接給坐標!
只要丟進去 1 到 6 張普通照片,定好運鏡軌跡,Atlas 就能生成最長達 1 分鐘、1440p 解析度 的大片。
畫面不崩,空間幾何絲滑一致,堪稱外掛級運鏡。

更誇張的是它的空間「腦補力」。
輸入一張只拍到機器人正面的照片?Atlas 能把人家背影完完整整腦補出來;

給一張泳池邊角照?它靠著腦子裡的「世界常識」,默默幫你把隔壁沒拍到的草坪和遠山給修好了。

從官方放出的 Demo 來看,Atlas 在鏡頭運動和空間一致性上確實比普通影片生成模型更進一大步。
不過,鏡頭一旦進入原圖沒有拍到的區域,Atlas 實際上仍然需要依賴模型先驗去猜,視角跨度越大、生成路徑越長,局部幾何漂移、物體形狀變化和紋理閃爍也越容易暴露出來。
換句話說,它生成的更像是一個視覺上合理的三維世界,未必就是原來那個世界的精確數字復刻。
而種種操作的背後,也繞不開一個名為 Spatial Context(空間上下文)的行業術語。
大語言模型看上文接下文,Atlas 則是給每張圖片綁死三維坐標和深度,在腦子裡搭出一個帶軸網的房間。
說得更直白一點,Atlas 很多能力的底層,其實都繞不開多視角合成。

它會把來自不同角度、不同機位的圖片和影片,一起塞進同一個三維空間裡,先判斷它們彼此之間的相對位置,再補足沒拍到的區域,繼續生成新的視角。
單張圖輸入時,它更多依賴模型先驗去「腦補」世界;輸入視角一旦變多,它就更像是在做一次帶空間約束的多視角融合,把零散畫面慢慢拼成一個連續、可漫遊的三維場景。
甚至你隨便抓兩張八竿子打不著的照片往空間裡一扔,Atlas 都能強行給你腦補出走廊、大門和房間,把倆場景無縫焊在一起。
導演系同學看到這裡,戰術沉默,緩緩打出一個問號:合著以後運鏡不用實拍,直接在電腦里「雲開機」就完事了?
除此之外,Atlas 還有第二張王牌:Spatial Reconstruction(空間重建)。
傳統的 3D 高斯潑濺(3D GS)或者點雲掃描,得扛著專業設備圍著目標轉幾十圈,拍幾百上千張照片,費錢又費腿。

但 Atlas 再次露出神秘的微笑:一邊去,哪來這麼多的規矩。
官方直接甩出了一個斯坦福大學 Main Quad 案例,只需把 2 到 25 張遊客視角的地面平拍照片塞進去,就能輕鬆還原草坪、拱廊以及紀念教堂外牆的全部細節。

鏡頭隨後直接拔地而起,來了一段上帝視角航拍的漫遊。
在 DTU、ETH3D、ScanNet 等一堆公開數據集上,專門測稀疏視角重建誤差(AbsRel ×10⁻³):Atlas 拿下了 25.3 的分數(分數越低越好)。
對比之下,Pi3X 是 28.7,Depth Anything 3 飆到 39.3,MapAnything 更是高達 47.7。

而且輸出直接對接點雲和 3D Gaussian Splatting,能無縫接進 World Labs 自家的 Marble 平台,高幀率即時渲染。
更絕的還有「子彈時間」式的 Reframing Video。
不用好萊塢幾百台相機的環形陣列,研究員拿三五個普通手機、運動相機隨手一架,塞進背包帶走;

拍一段日常打鬧,Atlas 就能在虛擬空間裡隨意切換視角,原地復刻《駭客任務》。

當然,李飛飛和她旗下的公司 World Labs 折騰這一大出,終極目標肯定不是為了跟好萊塢搶特效飯碗。她的星辰大海,是這代 AI 最大的痛點:
具身智能與機器人。
現在搞機器人訓練的朋友都知道,具身智能的最大痛點其實就是「虛擬訓練場不夠用」。
讓機器人真的去工廠、倉庫和家庭里反覆試錯,數據採集速度慢,成本也高;換到仿真環境裡訓練,又得先花大量人力搭建 3D 場景、材質、光照和物體。
業內甚至有一種估算,如果完全依靠傳統方式收集足夠規模的機器人訓練數據,最終成本可能達到 100 萬億美元的量級。
Atlas 給出的 Real to Sim 路線,相當於直接省掉了中間大量人工搭建仿真世界的工作。
拿手機拍兩段 24 幀的工廠或房間影片,餵給模型;Atlas 原地吐出一個高精度的 3D 物理空間,機器人就可以鑽進這個孿生空間裡瘋狂「跑圖」試錯。

甚至機器人走到哪,Atlas 就當場渲染出機載攝影機應該看到的 RGB 圖和深度圖。
機械臂碰一下剛性箱子、拉一下鉸鏈櫃門、捏一下軟體海綿,Atlas 統統能模擬出受力反饋。

只要錄一段真實現場,就能衍生出千萬種光照、擺放和障礙物條件。
技術底座上,World Labs 這次掏出了一套極其硬核的組合拳:
Multimodal Autoregressive Diffusion Transformer,多模態自回歸擴散 Transformer。

拆開來看,它兼采了當前兩大主流範式的長處:
- Multimodal:原生融通文本、二維圖像、相機位姿與 3D 深度;
- Autoregressive(自回歸):像語言模型預測下一個詞一樣,在時空序列中逐級預測新的空間狀態;
- Diffusion(擴散機制):基於 Rectified Flow 逐步去噪,確保連續高維信號的畫質與幾何精度;
- Transformer:以最成熟的矩陣乘法結構為底座,無縫適配現有大規模算力集群。
- 這套架構讓 Atlas 能夠同時享受到 LLM 領域的 KV Cache、分布式推理優化,以及擴散模型的採樣蒸餾與先驗引導。
- 在針對鏡頭運動控制的真人 Blind Test(盲測)里,戰況簡直是一場單方面的騎臉輸出:
面對 MiniMax H3,Atlas 勝率 75%;面對 Gemini Omni Flash,勝率 81%;面對 FLUX 3,勝率直接衝上 93%;面對 Seedance 2.5,勝率達到兇殘的 94%!

除了世界生成和空間重建,Atlas 還順帶具備了不錯的圖像生成能力。雖然這不是它的主攻方向,但複雜 Prompt、文字渲染,以及寫實、電影感、油畫、漫畫等多種風格,它都能處理。

更有意思的是,Atlas 還能直接根據文字或圖片生成 360° 全景圖。相比普通文生圖只要保證一個固定畫面成立,360° 場景還要處理前後左右的空間連續性,對模型的空間理解要求更高。
值得一提的是,除了性能,World Labs 在 Atlas 身上強調的另一個關鍵詞是 Scaling。
官方部落格提到,隨著參數量和計算力成倍上翻,模型展現出了類似大語言模型那種「突然開竅」的湧現能力。
暴力 Scaling 依然是版本答案。
目前 Atlas 已經向部分合作夥伴開放 Early Access,並將在未來成為 Marble 和 World Labs 其他產品的底層模型。

回過頭看,從二十年前奠基電腦視覺的 ImageNet,到斯坦福實驗室十年來深耕「視覺+機器人學習」,再到創辦 World Labs,李飛飛本質上是死磕同一條軌道。
ImageNet 解決的是「讓機器在像素中識別世界」,而她越來越關心的,是一個更難的問題:機器看見一張圖之後,究竟有沒有理解背後的三維空間,以及下一秒會發生什麼?
李飛飛曾把今天的大語言模型形容為「黑暗裡的文字高手」,能談論現實,卻缺少真正生活在現實中的經驗。
I'm so excited that our @theworldlabs team has achieved a major milestone today! Introducing Atlas - a first of its kind multimodal world model trained from scratch! 🚀 Atlas is capable of generating frames with pixel-perfect camera control, reconstructing large scenes from as few as one single input image, simulating space-time by reframing videos, natively outputting 3D spaces from one or more input images, composing multiple posed images into a consistent 3d world, and more! This is the best camera conditioned world model ever, opening doors to many possible use cases from VFX to robotics. I'm so so so proud of our team!♥️ https://twitter.com/drfeifei/status/2094840371675283673
一個模型可以解釋杯子為什麼會從桌上掉下來,但機器人真要伸手拿杯子,還得知道杯子離桌邊多遠、手從哪個方向過去,以及碰到它以後整個場景會發生什麼變化。
Atlas 所代表的空間智能,某種程度上就是給已經十分發達的語言智能繼續加上一層關於幾何、物理、時間和行動的世界經驗。
LLM 把網際網路裡的知識交給了機器,世界模型接下來爭奪的,則可能是機器從數字世界走向現實世界的那張最真實的入場券。






