文生視頻只是序章:世界模型正為物理世界裝上「數字大腦」

文生視頻打開了AIGC的想像空間,世界模型則把技術價值推向更廣闊的產業腹地,遊戲、機器人與製造業均在加快布局
財聯社Marketwatch專欄
近年來AI完成了圖像、視頻、音頻內容生成的多次驚人跳躍,生成內容與真實世界的邊界日益模糊,而一個利用AI生成數字內容的高潛力領域——AIGC正冉冉升起。然而,當畫面足夠逼真、聲音足夠自然之後,AI的下一步究竟該走向何方?隨著產業的多元化迭代,一個日漸清晰的答案正浮現而出:AI需從「生成畫面」走向「理解世界」。
從生成內容到理解世界
如果說過去兩年AIGC完成了對數字內容的「模仿」,那麼產業下一階段的核心命題正聚焦讓AI走出屏幕,具備在真實場景中實時交互與解決實際問題的能力。
而在這一點上,技術基座的通用性為跨界遷移創造了條件。訓練視頻模型所需的算力集群、海量數據清洗和模型訓練能力,與世界模型的技術基座高度相通。幾乎所有頭部文生視頻廠商都在布局世界模型,而已有的大規模基礎設施投入可以平滑遷移,因此邊際成本可控而價值顯著。
而作為對比,文本大模型的規模化紅利正在見頂,視頻與遊戲生成模型仍處於明確的紅利期,持續擴大數據規模即可穩定提升效果,這為世界模型的技術投入提供了清晰的回報預期。鑒於此,讓AI從「生成內容」走向「理解世界」,已成為產業下一階段的集體共識。
世界模型補上物理規則
在這一目標下,世界模型相較於傳統AIGC工具在能力維度上實現了系統性躍升。首先,世界模型的訓練數據大量來源於真實物理世界的交互數據,而非單純的視頻畫面,這使得模型內化了重力、慣性、光影衰減等基本物理規則。在爆炸、粒子系統、流體等高動態複雜場景中,世界模型生成的畫面在物理邏輯上更加自洽,從根本上降低了穿幫概率。這不僅提升了視覺質量,更強調生成內容具備了可被物理世界驗證的「真實性」基礎。
另外,傳統視頻生成工具需要用戶輸入提示詞後等待成片,屬於單次生成、被動接收的線性流程。而世界模型則支持全程實時反饋、實時調整與實時渲染,用戶無需等待即可在生成過程中持續干預和優化,將創作模式從「生成-修改-重生成」的迭代循環升級為連續的交互流。
以生數科技的產品矩陣為例,實時交互模型Vidu S1、世界生成模型Vidu,以及面向具身智能機器人的世界動作模型Motubrain,三條產品線分別對應世界模型從理解到交互再到行動的能力遞進,形成了覆蓋數字內容與物理實體的完整技術拼圖。
但是,世界模型的商業價值最終需在具體場景中接受檢驗,一個首要的應用陣地是遊戲產業。遊戲作為最高維度的數字內容形態,天然需要物理模擬、實時交互與三維空間理解,與世界模型的能力邊界高度重合。
從虛擬世界走向具身智能
值得關注的是,遊戲領域積累的技術能力正在反向賦能物理世界。網易(NTES.US;9999.HK)旗下具身智能品牌「網易靈動」將《逆水寒》《永劫無間》等遊戲中沈澱的3D虛擬技術與底層技術框架遷移至工程機械領域,在虛擬三維場景中完成挖掘機、裝載機等設備的模型預訓練與問題排查。由遊戲研發得來的AI能力遷移到工程機械智能化體系搭建中,並推出了挖掘機、裝載機兩大主力產品。
另一方面,具身智能與物理AI的系統性融合正進一步加強。比如,極佳視界研發出全棧世界模型產品矩陣,覆蓋內容創作、駕駛仿真到具身智能的多場景應用。據預測,成熟的世界模型具備通用理解能力,未來機器人能夠像人類一樣觀測環境並預判動作,無需針對每項任務單獨訓練,而將依託海量世界認知自主完成複雜操作。
不可否認,AIGC正站在從「數字內容的模仿者」向「物理世界的理解者」躍遷的關鍵節點。世界模型作為這一輪範式轉移的核心技術底座,重新定義了AI與真實世界的關係,使機器有望像人類一樣理解空間、預判動態、實時交互並執行複雜任務。遊戲、影視、具身智能、工業製造等場景的應用探索已經啓動,當前AI的發展階段類似早期的移動互聯網,與千行百業的深度結合才剛剛開始。
財聯社Marketwatch專欄提供有關中國各行業的洞察與分析。他們的聯絡方式:liujingyi@cls.cn
欲訂閱咏竹坊每周免費通訊,請點擊這裏