从AI绘画到AI视频:一张静图动15秒的成本与翻车实测
图动起来不难,难的是预算表:一张静图变15秒像样的视频,我的实测是十次生成、三段素材、一个半小时起步。这篇把三条图生视频路线的账算给你看——时间、额度、翻车率,全是我自己趟出来的数。
事情起因是位老客户,拿了张我之前画的古风插画问:能不能动一下,发朋友圈动态封面用。15秒,落花要飘,衣袖要动。我心想这不就是把图喂进去的事?结果第一晚折腾到十二点,出的素材里仙鹤的脖子拧成了麻花。第二晚重整思路,才算把这15秒做顺。前后两次的总耗时、生成次数、失败素材数,我都记了,这篇就是这笔账。
先把丑话说在前面:各家工具的生成时长、定价和额度规则一直在调,具体以官方页面为准。我这里的数字只代表我实测那几天的体感。
三条路线,先选路再动手
静图变视频有三条路:单图生成、首尾帧补间、直接文生视频再截帧,可控性依次下降。要画面忠于原图选第一条,要运镜花样才考虑后两条。
这三条路我都在那张古风图上试过,差别比想象中大。
| 路线 | 怎么操作 | 可控性 | 适合什么 |
|---|---|---|---|
| 单图生成 | 喂一张图,写运动描述 | 高,画面基本不跑 | 产品图、头像、要认得出原图的场景 |
| 首尾帧补间 | 给起点和终点两张图 | 中,中间过程听天由命 | 转场、变身、花开这类有明确起止的 |
| 文生视频直出 | 不喂图,纯文字生成 | 低,跟原图关系松散 | 只要氛围一致、不要求是「那张图」 |
客户要的是「我那张图动起来」,那就只有第一条路可选。另外两条当备胎,首尾帧那条我试了四回,三回的人物在补间中途脸换了个人——两张端点图之间,AI自己脑补的过程管不住。
15秒视频的真实成本账
单段5秒视频一次生成约两分钟,可用的概率七成不到,15秒成片实际要生成十次上下、总耗时约一个半小时。时间花在重roll和剪接上,不在生成那一下。
拆开算。落花飘动那段最顺,第二次就过了,两次生成四分钟。衣袖摆动是重灾区:写了「衣袖随风轻摆」,出来的是整条手臂反关节甩,五连败。后来把运动幅度从「摆动」改成「几乎静止、仅衣料微微起伏」,第三次过。仙鹤入画那段则卡在脖子拧麻花,换了三次运镜描述才行。三次改描述的等待时间里,我净坐在屏幕前看进度条。
最后凑成片的素材比例不难看:生成十次,能用三次,剩七次进回收站。若是按次计费的额度制,这笔浪费要提前算进去——按我的翻车率,成片成本是理想情况的三倍。别按「一条视频一次生成」去做预算,那是没动手过的人的算法。
剪接本身倒不费事,三段素材在剪辑软件里拼起来加个淡入,十分钟搞定。真正的成本全在「等一个能用的镜头」,等不到就只能改描述再来。
首帧决定下限,描述决定上限
喂进来的静图越「满」,视频越难做:主体占满画面、肢体交叉、图里带字,全是翻车高发点。出静图时就要给运动留白,这是绘画端能做的最有价值的一件事。
这趟下来我给绘画端的建议就三条。一,主体别顶满画面,四周留出运动空间,不然一飘花只能往人物脸上飘。二,能不画交叉肢体就不画,动起来交叉处必糊,我那批废片一半栽在手上。三,图里别带文字,一帧都别带——静态图上的字生成视频后必乱码,客户盯着那个「福」字看了半天问我这是什么符。
运动描述也有一套土办法:动词越小越稳。「轻拂」「微微」「缓缓」这类词的成功率,肉眼可见地高于「飞舞」「奔跑」。视频端不管你原图多精致,它只认运动幅度,幅度写得越克制,越接近你想要的「图在呼吸」的感觉。
还有个救急招:实在不动的死镜头,别硬生成。把静图放进剪辑软件加个缓慢推近加光斑飘过,观众根本分不出真假,零翻车成本。我最后那15秒里就有5秒是这么混过去的,客户挺满意。
回头看那15秒,技术含量真不高,贵在预期管理。生成前把「十次出一」的翻车率告诉客户,把额度预算摆开,谈的双方都踏实。AI绘画练的是把图做好,往AI视频这一步迈的时候,练的是把丑话说在前头。
常见问题
一次生成多长的视频最划算?
我的习惯是按工具支持的最短段生成,5秒上下。段越短,单次翻车的浪费越小,坏了重roll不心疼,最后拼接的余地也大。
人物视频为什么手和关节总出问题?
运动中的手部结构是图生视频的普遍弱项,没有稳定通吃的解法。实用对策就两条:运动描述写克制,或者构图上干脆让手藏在袖子里。
生成的视频能直接商用吗?
商用权限跟工具的会员协议绑定,各家条款不一样,生成前把协议里的授权范围看清楚,拿不准就问客服,以官方书面答复为准。
静图是别人画的,能拿去生成视频吗?
著作权不因为转成视频就消失,没授权的图别拿去生成或发布,跟直接盗图是一回事。