【李飛飛出Atlas】一張相片 生成1分鐘高清影片與立體3D空間 背後累計融資額高達12億美元 估值傳逼近50億美元
「AI教母」李飛飛創辦的 World Labs,於9月1日發布新一代世界模型 Atlas,被形容為全球首個「多模態世界模型」,能夠原生處理文字、圖片、影片、鏡頭視角及3D深度資訊,並在單一模型內完成場景生成、空間重建與時空模擬三項工作,公司過去合共已獲約12億美元融資。
【一張相到一個世界】Atlas 能做到甚麼
根據公開資料,Atlas 最多可用一至六張參考圖片,生成解像度達1440p、長達一分鐘的影片,並支援鏡頭軌跡的精準控制,即用家可指定鏡頭如何在畫面中移動及轉向,呈現效果較以往單靠文字指令生成影片的模型更為穩定。除影片生成外,Atlas 亦可從少至一張相片、多至數十張圖片重建三維場景,直接輸出點雲及3D高斯潑濺(Gaussian splats)等三維資產,供設計、遊戲或機械人開發者使用。公司又指模型支援「Real-to-Sim」工作流程,開發者只需用手機拍攝實體空間,即可轉化為機械人可導航的模擬環境,用於訓練機械人在虛擬世界中學習動作,再應用到現實場景。
【錢從何來】12億美元融資 估值傳逼近50億美元
World Labs 由李飛飛聯同多名學術界夥伴於2024年創立,成立初期已獲230萬美元種子輪融資,其後於今年2月再獲約10至12億美元新一輪融資,投資者包括 Nvidia、AMD 及 Autodesk 等科技巨頭,公司累計融資額約12億美元,市場消息指相關輪次的估值目標一度逼近50億美元,惟公司未有正式公布確實數字。今次 Atlas 發布前,World Labs 已於去年11月推出首個商業產品 Marble,主打生成可互動的3D世界,是次 Atlas 則被視為技術基礎更全面的「底層模型」,短期內僅開放予部分合作夥伴試用,尚未公布何時全面開放。
【誰是對手】Google、Meta旗下團隊都在做同類技術
Atlas 所屬的「世界模型」賽道,近年已吸引多家科技巨頭與初創競逐,包括 Google 旗下影片生成模型,以及由圖靈獎得主 Yann LeCun 新創辦的世界模型公司等,均嘗試以AI理解物理世界的空間與動態關係,被視為通往通用人工智能的其中一條路徑。李飛飛長年主張的「空間智能」理論認為,AI若要真正理解及操作現實世界,就必須具備原生的三維空間推理能力,而不只是依靠文字或平面圖像作訓練,Atlas 正是這套理論的具體實踐。公開的第三方盲測結果顯示,Atlas 在鏡頭控制生成任務中,對比主流同類模型的勝率超過七成,個別測試項目更高達九成以上,3D重建的平均誤差亦低於多個公開基準模型。
| 項目 | 內容 | 洞察 |
|---|---|---|
| 模型名稱 | Atlas,全球首個多模態世界模型 | 單一模型同時處理生成、重建、模擬三項工作 |
| 影片生成 | 1至6張圖片生成最長1分鐘、1440p影片 | 支援精準鏡頭軌跡控制,穩定性優於文字驅動生成 |
| 3D能力 | 單張相片可重建立體空間 | 輸出點雲及3D高斯潑濺,可直接用於開發流程 |
| 累計融資 | 約12億美元,投資者含Nvidia、AMD、Autodesk | 資金與晶片巨頭深度綁定,反映產業對世界模型的押注 |
| 開放程度 | 現階段僅部分合作夥伴可試用 | 距離大眾化應用仍有距離,商業化路徑待觀察 |
一張相片變出一整個立體世界,聽落像科幻情節,但背後代表的是AI開發方向的轉移——由只識生成平面圖像及文字,走向理解真實空間與物理規律。Atlas 現時仍局限於合作夥伴試用,能否真正走入設計、遊戲及機械人產業的日常工作流程,將是決定這套「空間智能」理論能否兌現的下一步關鍵。
免責聲明:本專頁刊載的所有投資分析技巧,只可作參考用途。市場瞬息萬變,讀者在作出投資決定前理應審慎,並主動掌握市場最新狀況。若不幸招致任何損失,概與本刊及相關作者無關。而本集團旗下網站或社交平台的網誌內容及觀點,僅屬筆者個人意見,與新傳媒立場無關。本集團旗下網站對因上述人士張貼之資訊內容所帶來之損失或損害概不負責。

