短视频脚本怎么变成分镜图?ai绘画流水线实测
开门见山:脚本到分镜图这条流水线,数量公式比提示词技巧更重要——每七到八秒画面换一张,按这个密度拆完脚本,出图反而是最省事的环节。一条220字脚本拆出九张图的完整记录在此。
帮一个做家居好物口播号的朋友干过两单活。他的脚本写得顺,但人不上镜、也懒得搭景,视频一直是PPT式的白底图文,数据平平。第二条视频开拍前他问我:能不能不拍,全程AI出图?这条60秒的口播,脚本220个字,最后拆成九张分镜图,从头到尾没用一台相机。这篇把流水线一步一步写下来,中间那次一致性翻车也原样保留。
先拆脚本再谈画面:数量公式定生死
口播视频按每七到八秒一换画面的密度拆镜,60秒视频九张左右;先给脚本标段落,再给每段定画面类型,最后才写提示词。顺序反了就会出一堆好看但用不上的图。
具体拆法。220字脚本我通读三遍,标成五个段落:开场痛点、产品出场、功能演示、价格钩子、行动号召。然后按"七到八秒一张"换算——开场痛点两秒一句话配两张图(问题的两个侧面)、产品出场一张、功能演示三张(三个卖点各一张)、价格钩子两张(前后对比)、行动号召一张。合计九张,正好对上60秒。这个数量我不是拍脑袋定的,第一条视频我拆了十四张,剪的时候发现根本切不过来,好几张图停留不到三秒就被翻页,白出。降回九张后节奏才舒服。
画面类型也要在出图前定好。我的分法就三种:场景图(交代环境)、特写图(卖点细节)、情绪图(人物反应)。五段脚本里,段落性质决定类型占比,功能演示段以特写为主,开场以场景和情绪为主。提示词是照着类型写的,不是照着句子写的——这一点想明白,出图效率翻倍。给你一个当天的样本:脚本第14个字到第31个字那句"下班回家,一开门是一屋子乱糟糟",我配的就是一张情绪图,玄关的暖灯、散落的鞋盒,人物只给一个垮着的肩膀,词就写了两行,一次过。
一致性翻车:九张图里的产品换了三次脸
同一个产品在九张图里颜色形状各不相同,是这条流水线最大的坑;解法是先出一张产品标准图,后续全部垫图生成。垫图能救七成相似度,剩下的靠后期统一调色。
翻车现场还原。第一遍我按九个提示词各自出图,单张都挺好看,拼进剪辑轨道一看——产品的圆润把手在三张图里变成了方的,还有两张直接把米白色的机身画成了浅木色。观众未必说得出来哪里不对,但潜意识会判定"这视频不专业"。我返工的办法是先精修一张产品的三视图当基准图,出图约十五秒,然后把它垫进后面八张的生成里,相似度立刻上来了。剩下两张角度太刁钻的,我在剪辑里统一压了色温和饱和度,勉强算齐。
时间账也在这给你算了:九张图单张平均十二秒,全部出完不到两分钟,但加上拆脚本四十分钟、写提示词改提示词一个小时、垫图返工四十分钟,整条流水线实际花了我两个多小时。跟实拍比,省的是场地、设备和补光灯,费的是前期脑力。
哪类镜头AI扛得住,哪类别硬上
静态场景、产品特写、氛围情绪图是AI的舒适区;手部动作、使用过程、人物口型这三类别用AI硬画,用了必假。流水线不是全自动,知道在哪停才是本事。
| 镜头类型 | AI表现 | 我的用法 |
|---|---|---|
| 家居场景空镜 | 稳 | 放心用 |
| 产品特写 | 稳,需垫图 | 垫基准图 |
| 人物情绪侧脸 | 中等 | 选背影或剪影 |
| 手部使用动作 | 差 | 实拍两秒插入 |
| 口播人像口型 | 差 | 字幕加画外音顶替 |
最后那条值得多说一句。朋友第二条视频的手部特写,是我用手机垫着一副耳机拍的两秒钟素材插进去的,一共花了五分钟。全AI和全实拍都是执念,混着来才是普通人的最优解——AI负责它擅长的八成画面,实拍补上它一碰就碎的两成,视频照样成立。
那条九张分镜图的视频发出去,朋友把数据截图发我:播放量是他之前PPT式视频的四倍多,评论区还有人问"这场景在哪拍的"。他回了一句"没拍,画的",对面回了三个问号。脚本好,画面跟得上,这条流水线的全部意义就在这——220字的脚本不再只是声音,它有了脸。
常见问题
没有绘画和摄影基础,能跑通这条流水线吗?
能,这条流水线考验的是拆解能力不是美术能力。把脚本按段落标号、按七到八秒一张定数量,剩下的提示词照着画面类型套就行。
分镜图要什么尺寸?
跟着成片比例走,竖版视频用9:16出图。我的习惯是按成片尺寸直接生成,裁切会浪费构图,特别是特写图。
产品一致性除了垫图还有别的办法吗?
还有一个笨但稳的办法:把产品摆纯色背景实拍一张当基准图,垫图效果比AI自己出的基准图更好,因为真实细节最全。
整条流水线最耗时间的是哪一步?
拆脚本和写提示词,占一半以上。出图本身快得惊人,别把时间预算花在等图上,要花在想清楚每一张图负责哪句话上。
延伸阅读
- ai绘画ai剪辑怎么串成流水线?短视频封面与空镜素材的笨办法——分镜图出来之后的剪辑端衔接,这篇接得住。