这个夏天,AI短剧赛道杀出一匹“黑马”。
近期,一部总时长约73分钟的短剧《被裁掉的女孩》“出圈”,引发网友热烈讨论。该部短剧于6月上线,并于8月1日更新第二季。截至8月2日,该剧抖音平台播放量达到2.4亿,男女主角更是相继开通账号,以Vlog等形式与粉丝互动,被称为首批AI网红。
时代财经注意到,《被裁掉的女孩》聚焦于小镇女孩奔赴大城市追梦,不断蜕变的成长历程,故事题材不算新颖,但AI技术的成熟应用为其增色不少。不同于早期短剧脸崩、肢体扭曲、塑料质感的观感,该短剧中的人物微表情十分细腻,不同情绪都可通过面部、瞳孔、眉头变化等方式层层递进,不再是刻板的AI模板脸,刷新观众对AI短剧的认知。
某种程度上而言,这是AI视频生成技术向前跃进的缩影——AI不再是噱头,而是已经真正融入内容创作。当前,大模型赛道百舸争流,行业普遍认为视频生成模型正从内容生成走向理解世界,且随着模型对物理规律理解能力的增强,其应用边界将进一步扩大。
带着商业落地场景,各大模型扎堆“上新”
过去几年,以ChatGPT为代表的大语言模型推动人工智能完成了一次重要跃迁。此后,图像生成和视频生成的多模态模型也快速发展,AI产业化落地走进“深水区”,尤其是在视频应用赛道。
回溯来看,早期AI视频大模型多以数十秒短视频素材生成为核心,侧重于短视频特效、图片动态化等轻量化场景;现阶段,行业攻克了人物一致性、长时序叙事、画面连贯三大核心难题,正式具备短剧、品牌宣传片、电商内容、动漫剧集等长链路内容生产能力。
比如7月,“独角兽”企业智象未来(HiDream.ai)推出Vivago R1多模态创作智能体,其可生成任意连续时长视频,同时具备长链路叙事规划能力,统一画面风格、人物设定与叙事逻辑,缓解长视频生成时出现的画面跳变、人设割裂等问题。
再比如,MiniMax正式发布的通用全模态生成模型H3,可输出原生双声道音视频,最高支持15秒2K分辨率视频生成;字节跳动推出的Seedance2.5可单次生成30秒高质量视频片段,并支持多轮延长。
不同于以往的参数比拼,这些大模型的面世还都伴随着一个极为鲜明的特点——把商业化落地路径讲明白。
据时代财经了解,H3主打商用级多场景内容生成能力,2K分辨率下每秒价格不到主流模型的1/3,768P分辨率下每秒价格不到1/2;Seedance2.5则已与徐工集团、小鹏汽车、灵初智能等多家企业确认合作,开始进入工业制造、具身智能等更广泛产业场景。
智象未来则提出“1+1+3”的商业模式。其创始人兼首席执行官梅涛向时代财经表示,公司以HiDream系列大模型为底座,构建Token Hub平台提供标准化模型能力输出,并在此基础上围绕商业营销、影视创作、内容创作三大场景,实现AIGC产品创新。
截至目前,智象未来的产品服务范围已经覆盖全球100多个国家和地区,拥有超过4万家企业客户以及超过5000万OPC用户,Token月消耗量超4万亿。
“今年以来,大家都能明显感到,大模型的发展速度已经不是线性增长,而是爆发式增长。”梅涛在谈到大模型发展进程时感叹,今年头部AI大模型公司无论在用户规模、收入增长,还是模型能力上,都进入了加速阶段,“可以说是狂飙突进”。
行业高速迭代,但绕不开算力、算法、数据三大底层考验
对话中,梅涛回顾了大模型的技术发展路线。他直言,2022年ChatGPT让通用大语言模型真正“破圈”。随后,图像生成和视频生成快速发展,从StableDiffusion、Midjourney、DALLE,到Sora、Veo、Seedance、可灵AI、智象未来HiDream,整个多模态生成赛道进入高速迭代周期。
近两年,大模型开始分化,双线并行:一条是沿着基础大语言模型和推理模型持续演进,比如更长上下文、更强推理、更强代码能力、更强Agentic能力;另一条则是多模态模型向世界模型演进,即AI不再只是理解文字,也不只是生成图片和视频,而是开始建模空间、时间、动作、物理规律和因果关系。
梅涛选择押注世界模型,他认为纯文本只是信息的一种载体,而多模态天然包含图像、视频、音频、动作和物理世界信号,更接近AGI的入口。
一个现实情况是,当前行业对世界模型还处在探索期。在生数科技联合创始人、首席执行官骆怡航看来,世界模型并非一个全新概念,随着视频生成、多模态模型和具身智能快速发展,它正在从学术研究走向产业中心。
骆怡航指出,语言模型主要处理人与语言、知识和信息之间的关系,而世界模型面向的,是智能体与整个世界的交互,“如果只依靠大语言模型理解世界,相当于只使用了人类智能中很小的一部分,大模型时代还需要一个达到LLM范式级别的世界模型”。
对于世界模型搭建的技术难点,骆怡航向时代财经表示:行业所有从业者都绕不开算力、算法、数据三大底层考验。
其中,算力短缺是国内AI大模型研发所面临的共性难题,制约着视频与世界模型的训练、推理全流程;在算法层面,相较于发展较为成熟的大语言模型,AI视频生成乃至世界模型尚未形成固定最优技术路线,架构、算子、推理策略仍处在持续创新迭代阶段。
据汇生国际资本总裁黄立冲估算,国内模型大厂的编程完善时间要比美国慢半年,且中国的算力分配不一样,未来算力紧缺会更严重。
他以KimiK3举例,企业若想要落地部署KimiK3,开展常态化商用,算力配套至少需要投入2000万元至2500万元。目前由于算力不足、模型复杂尚未调优,导致同等工作任务,KimiK3所需耗时要高出行业标准3至5倍,“算力成本可能比美国同行高,模型倒是不错的”。
数据则是搭建世界模型的最大瓶颈。骆怡航称,行业比拼的并非单纯的数据体量,而是完整的数据治理体系,高质量素材归集、标注、筛选、二次利用整套工程体系门槛极高。当下,不少企业依托具身智能路线研发世界模型,这需要依靠实体机器人采集海量实景运行数据,一旦数据储备不足,模型泛化能力便会受限,仅能适配小众场景,无法走向规模化商用。
“整体来看,当前全球世界模型发展大致对应大语言模型GPT-2至GPT-3阶段,还未实现完备的智能涌现与通用推理能力。”
资本买单,过去三个月行业融资规模达百亿
针对上述痛点,各家企业基于自身技术积淀给出了差异化解法。比如生数科技,其在长期的视频大模型的技术积累上,公司逐步构建起一条清晰的通用世界模型战略:以基座世界模型为核心底层,向上延展出贯通数字空间与物理空间的双轨体系,形成面向通用智能的核心基础架构。
目前,该公司的视频生成模型Vidu Q系列已渗透漫剧、短剧、广告、电商、动画和影视等内容生产体系中,并于近期发布了Vidu S1实时交互模型;世界行动模型方面,其在去年末开源了Motus,并在今年4月推出MotuBrain,深耕具身智能机器人的通用“大脑”。
骆怡航将这一模式总结为“一体两翼”,即一个技术复用两个空间,且可以相互协同增强,“这是生数(科技)最具特色的地方”。
这套商业与技术叙事也获得一级市场资本的青睐。今年7月中旬,生数科技完成新一轮5亿美金融资,是迄今为止国内通用世界模型领域最大的单笔融资。本轮融资落地后,公司短期累计融资规模超50亿元。
另据《科创板日报》报道,生数科技或计划在2026年上半年启动港股IPO流程。工商信息显示,其已于3月末完成股份制改造,公司主体由“北京生数科技有限公司”变更为“北京生数科技股份有限公司(未上市)”,完成了上市前核心的主体架构调整。
智象未来亦于7月完成了一笔15亿元的C轮融资。算下来,2026年至今智象未来已经完成三轮融资,累计融资额超21亿元,投后估值已突破10亿美元。同步完成C轮系列融资的还有AI视频生成及实时世界模型企业爱诗科技,该轮融资累计总额达29.8亿元,公司投后估值超20亿美元。
如此密集的融资事件反映出行业情绪之高。据投中网不完全统计,仅过去三个月,世界模型及相关方向的融资金额已达到百亿级别,头部项目估值更是节节走高。
今年7月初,巨头快手分拆可灵AI独立融资落地,规模近30亿美元,这是行业的标志性事件,意味着视频大模型赛道资产价值获得资本市场独立定价,有望加速视频大模型发展进程。
对于这片繁荣景象,黄立冲直言,大模型发展至今,已经来到了人类文明转型的时刻,中国、美国都在不遗余力地加大对算力需求的投入,“美国的AI大厂和算力大厂都在极力参与这个竞赛,生怕掉队”。