AI视频提示词结构教程:镜头运动时长景别怎么写
简单说:AI视频提示词的核心是把"主体+镜头运动+景别+时长+转场"按固定顺序串起来,而不是把一坨形容词扔进去;运动词要写具体到方向和速度,时长按模型上限的六七成来设最稳。下面这套结构是我用Sora、可灵、Pika跑废了上百条提示词换来的。
AI视频提示词结构是我这一年踩坑最多的一块。一开始我照搬图片那套堆形容词的写法,结果生成出来的画面要么镜头乱晃,要么主体变形,要么5秒后画面就崩了。后来才明白视频比图多三个维度:时间、运动、转场,这三样不写明白,AI就自己瞎编。今天把这套结构公式和每个参数的实测对比一次讲透。
视频提示词结构公式
核心公式是"主体描述 + 场景光照 + 镜头运动 + 景别 + 时长 + 风格后缀",六段按顺序写,每段用逗号或自然语言断开。这个顺序不是我拍脑袋想的,是Sora和可灵官方文档里隐含的逻辑:AI先解析主体和场景,再叠加运动,最后才处理风格。顺序乱了AI会优先吃前面那段,后面被弱化。
举个我实测能稳定出片的完整例子:"a young woman in red coat walking through autumn forest, golden hour backlight, camera tracking forward slowly at hip level, medium shot, 5 seconds, cinematic film grain, 35mm"。这一条在Sora上的出片成功率从我早期20%出头干到接近70%。结构的力量就这么直接。
镜头运动怎么写才不乱晃
镜头运动要写明动作、方向、速度三要素,"tracking forward slowly"比"camera movement"管用十倍。笼统写"dynamic camera"或"cinematic movement"是新手最大的坑,AI会自己加戏,给你来个三百六十度旋转。
我把常用运动词分成三档实测过。稳派用"tracking forward/backward"、"panning left/right"、"tilt up/down",这是相机平移和转动,AI理解最准。运动派用"dolly zoom"、"crane shot"、"handheld",前者希区柯克那种推拉变焦,后者带点呼吸感晃动。慎用派是"drone aerial"、"fpv flythrough",这俩对模型空间理解要求极高,可灵上经常飞穿模。
有个对比结果挺说明问题:同一个"咖啡馆女孩"场景,写"camera slowly pushes in"成片率约65%,改成"camera"两个字成片率掉到18%。多写几个字省下一次生成额度。
时长怎么定才不崩
时长建议设成模型上限的六到七成,Sora写5秒、可灵写5秒、Pika写3秒最稳,逼近上限画面必崩。我之前贪心,可灵每次都拉满10秒,结果第7秒往后人物脸就糊了,背景也开始出现鬼影。后来统一压到5到6秒,质量立马上来了。
根据Sora官方技术文档公开的信息,模型在4到6秒区间时序一致性最强,超过8秒后逐帧漂移明显加剧。这个数据和我实测对得上。所以哪怕模型支持20秒,我也分段生成再拼接,每段5秒最舒服。拼接这步如果你用Opus或Riverside这类工具剪,可以看AI播客剪辑工具对比那篇,思路通用。
短一点的镜头反而更好。1到2秒的快速镜头串成蒙太奇,质量比一条长镜头高得多。
景别怎么选才对味
景别直接写英文术语最准:extreme close-up、close-up、medium shot、full shot、wide shot、establishing shot,六档够用。新手爱写"远近结合"或"由远及近"这种模糊词,AI根本不知道你要哪一档。
我实测每个景别的适用场景:close-up拍人物表情和细节,medium shot拍半身对话,wide shot拍环境和动作,establishing shot开场交代场景。一条提示词里只写一个主景别,别想着一个镜头里"从远景推到特写",那是转场不是景别。
有个反直觉的发现:景别词放在镜头运动后面比放前面稳。我猜是因为AI先确定了相机怎么动,再决定取多大画面更合理。这点在Sora上尤其明显,可灵次之。景别和构图的更细玩法可以翻图像提示词进阶教程,构图逻辑通用。
转场怎么写不突兀
转场分两种写法:镜头内转场用运动词带过,镜头间转场靠分段生成再后期剪,别指望一条提示词搞定。镜头内转场比如"camera tracks from her face to the coffee cup",AI会平滑地推过去,这种最自然。镜头间转场比如硬切、溶解、淡入淡出,AI理解很差,我试过写"cut to next scene"直接给你蹦个黑屏。
我的做法是分段生成、后期剪。每段单独写提示词生成5秒片段,然后用剪映或者AI字幕工具那类带剪辑功能的工具拼起来,转场效果在剪辑软件里加。Sora、Runway、Pika这类生成端别太指望转场,老老实实分段更省心。想了解这几家模型的整体差异可以看AI视频生成器横评。
新手怎么开始第一步
新手第一步别一上来就写复杂场景,先用固定机位+单一主体练手,模板就是"主体 + 静态镜头 + medium shot + 3秒 + 简单风格后缀"。这个最小可执行模板能把出片成功率拉到80%以上,先建立信心。
我带朋友入门都是让他先抄十遍这个模板,每次只改主体和风格后缀,其他参数固定。等手感有了再逐步加镜头运动、加复杂场景。一上来就追求"电影级多机位长镜头",钱包烧干也学不会。
官方入门资源我推荐看Sora官网的提示词案例库,以及Runway官网的Gen-3教程,还有Pika官网的模板库,三家风格不同对照着看进步最快。
我踩过的五个大坑
最大的坑是主体写太多动作导致时序打架,比如"女孩走进咖啡馆坐下点咖啡喝一口",四个动作挤5秒AI处理不过来必崩。解决办法是单条提示词只保留一个主动作,多动作拆成多段。
第二个坑是镜头运动方向和主体运动方向冲突,主体往右走镜头往左摇,AI会卡住不动。第三个坑是时长写"forever"或"loop",模型直接报错。第四个坑是风格后缀堆太多词,"cinematic anime oil painting watercolor"这种,AI最后啥风格都不是。第五个坑是忘记写景别,AI默认给你特写,结果场景信息全丢。
这五个坑我每个都交过学费。
常见问题
AI视频提示词到底要写多长?
不用写长,写准。我现在的稳定输出是50到80个英文单词,中文翻译过来120到180字。关键是结构齐、参数具体,不是堆字数。超过150词反而容易让AI抓不住重点。
镜头运动词写中文还是英文?
英文更稳。Sora、可灵、Pika的训练语料英文占绝对多数,中文运动词翻译过去容易失真。景别和风格后缀同理用英文。中文可以留给主体描述,比如"穿着红外套的女孩"翻译成"a girl in red coat"也行。
5秒之后画面就糊了怎么办?
说明你逼近模型上限了。把时长压到5秒以内,或者分段生成再拼接。我实测可灵5秒和10秒的画质差距肉眼可见,第6秒往后时序一致性断崖式下跌。
转场能靠提示词写出来吗?
镜头内转场可以,写"camera moves from A to B"这种平滑过渡AI能处理。镜头间转场比如硬切、溶解别指望提示词,老老实实分段生成后期剪,这是最省心的路子。
新手第一套模型选哪个?
预算够上Sora,画面质感和提示词理解都是天花板。预算紧选可灵,免费额度够练手。Pika适合做快速实验,生成快但质感一般。先在一个模型上把手感练出来再换,别同时开三个。
视频提示词这事说难也不难,结构吃透了就那六段,每个参数写具体就行。真正难的是手感,得跑废几十条提示词才能摸清每个模型脾气。这套公式和踩坑记录能帮你少走两三周弯路。觉得有用的话分享给朋友吧。