当前位置:首页 > AI其它类

AI视频生成为什么只有几秒?不是限制你,是再长就崩了

3天前AI其它类11

AI视频生成为什么只有几秒?不是限制你,是再长就崩了

打开任何一个AI视频生成工具,你会发现一个共同点——单次生成基本卡在5到15秒。Sora 2是20秒封顶,可灵3.0是15秒,即梦和Vidu大多在5到10秒。很多人觉得这是平台故意限制,逼你充会员才能生成更长的视频。

我一开始也这么想,直到去查了技术原理才发现——不是人家不想给你长的,是真的给不了。时间一长画面就开始崩,崩得没法看。

先说说AI视频到底是怎么生成的

现在主流的AI视频生成用的是扩散模型,跟AI画图的原理有点像,但多了个时间维度。

简单说就是:从一堆纯噪声开始,一步步去噪,逐步还原出符合你描述的画面。画图只需要处理一帧,视频需要处理连续的几十帧,而且帧与帧之间还得连贯——同一个人物不能突然变了个脸,杯子不能凭空消失,光线不能莫名其妙跳变。

为了处理这个时间维度,Sora这些模型用了个叫"时空补丁"的技术。把视频当成一个三维数据块——X轴是宽度,Y轴是高度,T轴是时间。模型在这个"冰块"里整体雕刻,而不是一帧一帧分开画。理论上这样能保证前后帧的一致性。

但理论归理论,实际跑起来就是另一回事了。

5秒之后开始崩,是有数据支撑的

有人做过实测,把生成时长和画面质量的关系量化了一下:

0到5秒这个区间,时序稳定性很好,人物外观准确,光影连贯,几乎零误差。5到8秒开始出现轻微穿帮——可能是衣服颜色微妙地变了,或者背景里的某个物体挪了位置。8秒以上,时间一致性显著下降,人物可能突然多出根手指,或者走路走到一半腿变成三条。

所以那些你看过的比较长的AI视频——AI短剧、电影级片段——没有一个是单次生成的。全部是5秒一段5秒一段分开生成,然后手动拼接、调色、配音拼起来的。一段一分钟的视频,背后可能是十几次甚至几十次生成加后期拼接的工作量。

Sora 2把120秒长视频的穿帮率从1.0版本的41%降到了0.3%,听着挺厉害。但在多镜头测试里,让雨滴轨迹和咖啡渍形态全程保持一致,依然是搞不定的。

为什么"物理常识"这么难搞

AI视频翻车的方式有时候挺搞笑的。玻璃杯掉地上不是碎了而是像液体一样融化穿过地板。人咬了一口饼干但饼干上没有缺口。人还没吹蜡烛,火苗就先灭了。跑步机上跑着跑着方向突然反了。

这些翻车的根源在于——AI并不真的"懂"物理。它是一个基于概率的统计模型,看过千万小时的真实视频,学到了"通常情况下事情是怎么发展的"。遇到训练数据里常见的场景,它模仿得有模有样。遇到复杂的物理交互——比如玻璃碎裂的方式、液体飞溅的轨迹——训练数据里见得不够多,它就只能瞎猜了。

Sora 2跟NVIDIA合作整合了物理模拟模块,让模型有了点"物理常识"。但这只是降低了翻车率,没消除。本质还是个模仿者,不是真正的物理引擎。就像一个人看了很多做饭视频但不代表他真的会做饭——看着像那么回事,真上手操作就可能翻车。

能用来干什么,不能用来干什么

先说能干的。短视频带货是现阶段AI视频用得比较好的场景。商家输入产品描述和促销信息,AI生成几秒的产品展示视频,传统几天的制作周期压缩到小时级。有美妆品牌用Sora生成多语种带货视频,单条成本从两千美元降到三百多美元。

教育场景也有价值。把教学大纲变成动画演示,"太阳系行星运行"这种靠想象理解不了的东西做成动态画面,确实比静态图片管用。

广告和概念验证也合适。快速出几版视觉方案给客户看,比花时间拍样片效率高得多。用不着画面多精细,能传达意思就行。

再说不适合干的。需要精细表演的场景——演员微妙的表情变化、情绪的层次递进——AI目前做不到。需要精确物理交互的场景也不行——比如两个人打斗的动作设计、精密操作展示。需要长镜头连续叙事的也不合适——拼出来的片段在转场处总有不自然的地方。

还有一个被忽略的短板:生成之后改不了。传统拍摄如果某一帧不满意可以逐帧调整,AI视频生成之后如果某个地方穿帮了,你没法局部修改,只能整个重新生成。重生成意味着结果可能跟上次完全不一样——又一个随机盲盒。

运动控制是个大问题

AI视频还有一个让新手头疼的问题——运动不好控制。你写"一只猫在跑",它可能给你生成一只站在原地四肢动弹的猫。你写"镜头推向远处的山",它可能理解成山在变大而不是镜头在推。

原因是AI对运动的理解来自文字描述,而文字描述天然是模糊的。"跑"到底是慢跑还是冲刺?"推镜头"是快速推进还是缓慢推进?同一个词在AI眼里可能是多种运动的合集,它随机选一个方向执行。

想控制得精确一些,提示词得写得很具体:主体在什么位置做什么动作、相机是推进还是拉远还是环绕、光线从哪个方向来、运动速度是快还是慢。把这些要素都写清楚了,AI执行的一致性会好不少。但也只是"好不少",不是"可控",因为模型本身有随机性。

现在这技术到底到哪一步了

2024年Sora刚发布的时候,60秒的预览片震惊了所有人,被称作"视频的ChatGPT时刻"。但真正用起来大家发现,预览片和实际能用是两回事。

2025年到2026年这一年间,各家都在拼的几个方向:延长时长、提高物理一致性、加入音频同步生成、实现角色跨镜头一致性。可灵3.0支持了多镜头序列和跨镜头主体一致性——意思是第一个镜头里的人物,到第二个镜头里还是同一个人。这在以前是做不到的,但也还需要配合参考图来用。

Veo 3做到了原生生成对话、音效和环境音频,不再需要后期单独配音。这在体验上是个大进步,但音频质量跟专业录音还有差距。

商业化方面,可灵AI的表现比较突出。截至2025年底月收入超2000万美元,全球用户超6000万,累计生成超6亿条视频。说明这个方向确实有市场需求,不是纯概念炒作。

一个现实判断

AI视频生成这个技术,现阶段我认为它更像是一个"快速出草稿"的工具,不是一个"直接出成品"的工具。

你拿它做产品展示视频、教学动画、广告概念片——这些对画面精细度要求不高的场景,它是能帮上忙的。省时间省成本,值得用。

但你要指望它直接输出一段可以拿去播的成品——不管是短剧、广告正片还是教学课程——现阶段不现实。5秒一段的限制、物理穿帮、运动不可控、生成了改不了——这些问题每一个都需要人工兜底。AI帮你搭骨架,你来做血肉,这个分工目前是比较合理的。

技术还在快速迭代,半年前做不到的事现在做到了,半年后能做到的事肯定更多。但至少在今天,别被那些酷炫的演示视频误导了——演示归演示,实际用起来是另一回事。

你用过AI视频生成工具吗?体验怎么样?评论区聊聊。

ai-video-cover.jpg

相关文章

发表评论

访客

◎欢迎参与讨论,请在这里发表您的看法和观点。