Multimodal AI growth forces companies to rethink computing costs

多模态应用持续升温 企业AI算力帐单改写

多模态内容创作占比上升,影片生成的算力消耗远高于文字任务,应用重心的移动,意味着企业的算力帐单也在改写    头豹研究院 多模态内容创作正从大模型应用中的小众场景走向前列。头豹研究显示,这类应用在九类核心业务场景中的占比,半年间由0.6%升至11.9%,成为增长最快的方向。变化不止于报表:生成10秒1080p影片约消耗35万Token,是文字任务的数百倍。这件事关系到内容平台、营销部门,以及每一位规划算力采购的决策者。 排序在半年内改写 报告统计了约700个大模型应用样本。2025年上半年,文字内容创作以23.7%的占比位居第一,问答助手、数据处理分析紧随其后。多模态内容创作只占0.6%,排在九类场景的末位。 半年后,排序开始变化。多模态内容创作升至11.9%,智能客服从5%升至9.4%,AI搜索从3.1%升至4.7%。报告将这三个方向列为增长前三,多模态是其中最大的增量。 基础盘并未被动摇。下半年,文字内容创作仍以19.5%居首,问答助手与数据处理保持较高占比。多模态拿走的是增量,并未取代文字场景。 增长为何出现在多模态?报告的解释是,多模态技术能力在2025年持续提升,带动内容生产、资讯获取和客户互动三类需求加速释放。率先放量的是内容密集型场景:Steam平台使用生成式AI的游戏,从2024年的1,000多款增至2025年的7,818款以上,报告标注增长681%。 影片生成服务的收入也在增长。快手(1024.HK)公布,旗下可灵AI于2026年第二季度录得逾8.5亿元人民币收入,按年增长逾200%;同季,平台上AI生成短影片营销素材的投放消耗按年增长逾70%。从影片制作到广告投放,多模态应用正进入更多商业场景。 帐单的计量单位变了 场景占比的移动,改变的是算力消耗的计量单位。报告测算,生成10秒1080p影片约消耗35万Token,数百倍于文字任务。应用从写文案转向做影片,单个任务的算力消耗不在同一量级。 消耗还被使用方式继续放大。报告观察到,应用价值正由单次生成转向持续推理与任务闭环:搜索、营销、客服、办公等高频业务流程嵌入模型,调用量、互动频率和推理负载同步上升。 全国Token调用量也在增长。国家数据局公布,中国日均Token调用量于2026年3月超过140万亿;国家统计局其后表示,日均调用量已达“数百万亿”,但未公布更精确的数字。这项统计涵盖各类AI应用,反映整体模型调用规模扩大。 这些数字合起来,改变的是算力预算的算法。过去按“模型能不能用”评估投入,现在要按“调用量乘以单位任务消耗”测算成本。任务从文字转向影片、从单次转向持续,成本增速可能快于用户量增速。 谁先付这笔帐 压力不会平均分摊。多模态放量集中在游戏等内容密集型场景,互联网内容平台与AI原生企业最先承担成本。报告对这类客户的判断是:需求本质是高并发、弹性扩展与低成本调用,适合模型即服务(MaaS)与云端推理服务,商业模式以按调用量付费为主。 上述场景占比基于约700个样本,反映的是场景结构变化,不等于行业收入分布。多模态能否持续放量,还取决于影片生成成本下降的速度。报告将供给侧价格与成熟度,列为影响算力需求的核心变数之一。 对企业而言,影响落在三件事上:把多模态内容制作成本纳入年度预算;在采购合同中明确调用计费方式;逐项评估哪些环节值得从文字生成升级到影片生成。规划AI预算时,先算清业务中有多少任务会从文字转向影片、从单次生成转向持续推理。 多模态不是多了一个功能选项,而是把单任务算力消耗放大数百倍的变量。规划AI预算时,与其盯模型榜单,不如先算清楚:业务里有多少任务会从文本转向视频、从单次生成转向持续推理。前者决定体验,后者决定成本。 头豹研究院中国是行企研究原创内容平台和创新的数字化研究服务提供商,拥有近百名资深分析师,联系方式:CS@leadleo.com 本文内容纯属作者个人意见,不代表咏竹坊立场 欲订阅咏竹坊每周免费通讯,请点击这里