文生视频只是序章:世界模型正为物理世界装上“数字大脑”

文生视频打开了AIGC的想像空间,世界模型则把技术价值推向更广阔的产业腹地,游戏、机器人与制造业均在加快布局
财联社Marketwatch专栏
近年来AI完成了图像、视频、音频内容生成的多次惊人跳跃,生成内容与真实世界的边界日益模糊,而一个利用AI生成数字内容的高潜力领域——AIGC正冉冉升起。然而,当画面足够逼真、声音足够自然之后,AI的下一步究竟该走向何方?随着产业的多元化迭代,一个日渐清晰的答案正浮现而出:AI需从“生成画面”走向“理解世界”。
从生成内容到理解世界
如果说过去两年AIGC完成了对数字内容的“模仿”,那么产业下一阶段的核心命题正聚焦让AI走出屏幕,具备在真实场景中实时交互与解决实际问题的能力。
而在这一点上,技术基座的通用性为跨界迁移创造了条件。训练视频模型所需的算力集群、海量数据清洗和模型训练能力,与世界模型的技术基座高度相通。几乎所有头部文生视频厂商都在布局世界模型,而已有的大规模基础设施投入可以平滑迁移,因此边际成本可控而价值显著。
而作为对比,文本大模型的规模化红利正在见顶,视频与游戏生成模型仍处于明确的红利期,持续扩大数据规模即可稳定提升效果,这为世界模型的技术投入提供了清晰的回报预期。鉴于此,让AI从“生成内容”走向“理解世界”,已成为产业下一阶段的集体共识。
世界模型补上物理规则
在这一目标下,世界模型相较于传统AIGC工具在能力维度上实现了系统性跃升。首先,世界模型的训练数据大量来源于真实物理世界的交互数据,而非单纯的视频画面,这使得模型内化了重力、惯性、光影衰减等基本物理规则。在爆炸、粒子系统、流体等高动态复杂场景中,世界模型生成的画面在物理逻辑上更加自洽,从根本上降低了穿帮概率。这不仅提升了视觉质量,更强调生成内容具备了可被物理世界验证的“真实性”基础。
另外,传统视频生成工具需要用户输入提示词后等待成片,属于单次生成、被动接收的线性流程。而世界模型则支持全程实时反馈、实时调整与实时渲染,用户无需等待即可在生成过程中持续干预和优化,将创作模式从“生成-修改-重生成”的迭代循环升级为连续的交互流。
以生数科技的产品矩阵为例,实时交互模型Vidu S1、世界生成模型Vidu,以及面向具身智能机器人的世界动作模型Motubrain,三条产品线分别对应世界模型从理解到交互再到行动的能力递进,形成了覆盖数字内容与物理实体的完整技术拼图。
但是,世界模型的商业价值最终需在具体场景中接受检验,一个首要的应用阵地是游戏产业。游戏作为最高维度的数字内容形态,天然需要物理模拟、实时交互与三维空间理解,与世界模型的能力边界高度重合。
从虚拟世界走向具身智能
值得关注的是,游戏领域积累的技术能力正在反向赋能物理世界。网易(NTES.US;9999.HK)旗下具身智能品牌“网易灵动”将《逆水寒》《永劫无间》等游戏中沉淀的3D虚拟技术与底层技术框架迁移至工程机械领域,在虚拟三维场景中完成挖掘机、装载机等设备的模型预训练与问题排查。由游戏研发得来的AI能力迁移到工程机械智能化体系搭建中,并推出了挖掘机、装载机两大主力产品。
另一方面,具身智能与物理AI的系统性融合正进一步加强。比如,极佳视界研发出全栈世界模型产品矩阵,覆盖内容创作、驾驶仿真到具身智能的多场景应用。据预测,成熟的世界模型具备通用理解能力,未来机器人能够像人类一样观测环境并预判动作,无需针对每项任务单独训练,而将依托海量世界认知自主完成复杂操作。
不可否认,AIGC正站在从“数字内容的模仿者”向“物理世界的理解者”跃迁的关键节点。世界模型作为这一轮范式转移的核心技术底座,重新定义了AI与真实世界的关系,使机器有望像人类一样理解空间、预判动态、实时交互并执行复杂任务。游戏、影视、具身智能、工业制造等场景的应用探索已经启动,当前AI的发展阶段类似早期的移动互联网,与千行百业的深度结合才刚刚开始。
财联社Marketwatch专栏提供有关中国各行业的洞察与分析。他们的联络方式:liujingyi@cls.cn
欲订阅咏竹坊每周免费通讯,请点击这里