为什么流程比工具更重要
大多数人第一次接触 AI 视频,都是从某个热门工具的免费试用开始的。写下"一个女孩在雨夜的天台上回头",十几秒后得到一段四秒的画面,惊艳感很强。可当他们真的要交付一条三十秒的短片时,问题一个接一个地冒出来:主角在第二个镜头里换了张脸,雨的方向前后矛盾,台词和口型对不上,动作忽快忽慢,最后二十几个零散片段堆在时间线上,怎么剪都不顺。
这并非某个工具不行,而是流程缺席。生成式视频本质上是概率性的:同样的描述,两次得到的结果可能差别很大。要把这种不确定性变成可控制的生产力,唯一的办法是把整条链路拆成若干可复用、可回滚、可局部替换的环节。每个环节都有明确的输入、输出和验收标准;某一环出问题,就只重做那一环,而不是推翻全部重来。
七个阶段各自负责什么
一套完整流程大致包含七个阶段:选题与脚本、视觉定调与角色设定、分镜与关键帧、图生视频、声音设计、剪辑与后期、版本管理与质量验收。这七步的顺序不是随便排的,前一步的产物就是后一步的输入,跳步会立刻在后面付出代价。
- 选题与脚本产出:一份带时长与台词的镜头表。
- 视觉定调产出:一段可复用的风格前缀,加一份角色特征清单和三张参考图。
- 分镜与关键帧产出:每个镜头一张或数张候选静帧。
- 图生视频产出:带速度、方向、情绪的三到五秒动态素材。
- 声音设计产出:对白轨、环境音轨、音乐轨。
- 剪辑后期产出:统一节奏与色彩的主时间线。
- 版本管理与验收产出:可追溯的参数记录和一份过检清单。
没有定好角色参考图就去生成镜头,后面必然出现人物漂移;没有写清楚运镜意图就交给模型,剪辑时就会发现所有镜头都是同一种缓慢推近,节奏扁平得让人想快进。这些代价都不是工具造成的,而是环节缺失造成的。
什么时候可以走"快速通道"
流程不等于繁文缛节。如果你只是做一条信息流投放用的六秒素材,完全可以跳过完整分镜,用一张关键帧加一句运动描述直接出片。判断标准很简单:这条片子是否需要"多个镜头之间存在一致性"。只需要一个镜头的,走快速通道;需要三个以上镜头、并且观众要认出同一主角的,老老实实走完整流程。中途才决定把短视频扩展成长片,是最常见的返工来源。
第一阶段:选题与脚本
把抽象主题翻译成可被镜头捕捉的句子
选题阶段最容易犯的错,是把抽象概念直接交给模型。比如"拍一个关于孤独的片子"——这是主题,不是画面。模型需要的是具体的、可被镜头捕捉的信息:谁、在哪、什么时间、做什么、情绪如何通过动作或环境体现。把"孤独"翻译成"深夜便利店里,一个人吃完关东煮,把纸巾叠成方块放回托盘",这句话就具备了变成画面的全部要件。
一个实用的训练方法:把每个镜头写成"主体 + 动作 + 环境 + 镜头语言 + 光线氛围"的五段式。五段不必都写满,但至少要占三样。缺主体的描述会让模型自由发挥,缺镜头语言会让它默认给出最常见的缓慢推近。
再进一步,可以给每一段加上"情绪动词"。情绪不是形容词,而是可以被摄影机拍到的行为:攥紧杯子、迟迟不按下电梯按钮、把已经关掉的灯又打开一次。形容词描述的是观感,动词描述的是画面,后者才是模型的直接输入。
脚本表格怎么排
专业流程里,脚本不是一篇散文,而是一张表格。建议至少包含这些列:镜号、时长、画面描述、台词或旁白、音效、字幕、备注。把时长写进表格,可以在开拍前就发现总时长超标——三十秒的片子写了十八个镜头,每个镜头平均不到两秒,观众根本来不及看清画面。
旁白要按"呼吸"断句。写成一整段长句,配音出来会像机器念稿;拆成短句并标出停顿位置,声音的节奏立刻就对了。同时提前标出哪些镜头需要口型同步,因为需要口型同步的镜头在生成时要用不同的处理方式,通常要求正脸、光线稳定、人物不做大幅移动,这反过来会影响你的脚本设计。
还有一个容易被忽略的动作:在脚本阶段就标出"必须由画面承担的信息"和"可以由旁白承担的信息"。信息可以由旁白承担时,画面就可以更自由;必须由画面承担时,就必须预留足够的停留时间。这个判断能直接决定成片是清晰还是让人困惑。
第二阶段:视觉定调与角色设定
用"样片"确定风格
在批量生成之前,先花时间做三到五张"风格样片"。不要贪多,把关键词集中在两三个维度上:材质感(胶片颗粒、数字锐利、手绘)、色彩倾向(冷青、暖橙、低饱和)、光线气质(柔光、硬光、逆光)。选定之后,把这些词固化成一段可复制的"风格前缀",之后每个镜头的描述都带上它。这是让不同镜头看起来属于同一部片子的最低成本手段。
风格前缀的长度也有讲究。超过两三个短句,模型会开始忽略其中的一部分,甚至把风格描述误当成内容描述,让画面里真的出现"胶片"这种物体。保持精简、具体、不含名词实体,是写出好前缀的要点。
角色一致性:三件套
角色漂移是 AI 视频最普遍的痛点。可行的做法是把一致性拆成三层:
第一层是参考图。挑一张正面、一张四分之三侧面、一张全身,作为固定的视觉锚点。生成时把它们作为参考输入,而不是只用文字描述。参考图的背景尽量干净,光线尽量统一,否则模型会把背景元素也一起学进去。
第二层是特征清单。用文字固定几个不会变的东西:发型、发色、眼部特征、服装的主色与材质、标志性配件。注意是"不会变的东西",如果每个镜头都换衣服,那本身就应该被拆成不同的角色设计阶段来管理。
第三层是种子与参数记录。同一个随机种子配合同一段描述,往往能得到接近的结果。把每个镜头的种子、模型版本、关键参数记在分镜表里,是后期补救的唯一依据。
顺带提醒:不要试图用"完美复刻"的标准来要求生成结果。观众对一致性的容忍度比创作者高得多,只要发型、服装主色、体型大致稳定,注意力就会被剧情带走。把精力花在"特征清单是否稳定"上,比追求像素级相同更有价值。
如果项目里有两个以上角色,建议给每个人准备一份独立的特征清单文件,并且明确两人之间的视觉差异点:身高差、色系差、服装材质差。观众区分角色靠的是差异,而不是相似度。
第三阶段:分镜与关键帧
分镜表需要哪些信息
分镜是把脚本从文字转成画面的中间层。一张好用的分镜表至少要回答五个问题:这个镜头在画面里占多大(景别)、摄影机怎么动(机位与运镜)、主体在画面哪个位置(构图)、什么光(时间与光源方向)、这个镜头和前后镜头怎么衔接(转场意图)。
景别建议用远、全、中、近、特五档来标记,不要写"稍微近一点"这种主观描述。运镜只选一个主要动作:固定、横移、推近、拉远、跟随、环绕。同时给两个运动往往会得到混乱的结果,模型会把它们平均成一种莫名其妙的抖动。
转场意图也值得提前写。是硬切、是顺着动作切、还是用同一个视觉元素做匹配剪辑?提前想清楚,剪辑时就不会出现"这两个镜头接起来很别扭"却不知道该怪谁的情况。
关键帧提示词的写法
关键帧是图生视频的起点,它的质量决定了成片的上限。写关键帧描述时,顺序很关键:先主体,再动作,再环境,然后镜头与光线,最后才是风格词。原因很简单,模型对句子开头的权重更高,把最重要的信息放在前面,能显著降低"跑偏"的概率。
一个可参考的模板是:
- 主体与状态:(谁,穿着什么,什么表情)
- 动作瞬间:(正在做什么,动作停在哪个节点)
- 环境:(在哪里,周围有什么,天气与时间)
- 镜头与光线:(景别、机位、光源方向)
- 风格:(材质、色彩、整体气质)
负面描述同样要写。常见的需要排除的东西包括:多余的手指、文字水印、模糊人脸、扭曲的肢体、多余人物。把负面清单固定下来复用,比每次临时想词更省时间,也更稳定。
生成关键帧时建议一次出四张,挑一张最接近意图的。不要在第一张不满意就反复重写整段描述,先试着只改一个变量——把"黄昏"改成"清晨",或者把"中景"改成"近景",这样你才能知道自己到底在控制什么。连续调整五次都无改善时,问题多半在参考图,而不在文字。
第四阶段:图生视频
运动幅度的取舍
从静帧到动态,最常见的两种失败是"几乎不动"和"动得太多"。几乎不动通常是因为描述里只有静态画面信息,缺少动作动词;动得太多则往往是运动幅度参数给得太高,或者描述了多个同时发生的动作。
实用的技巧是:给每个镜头只安排一个主要动作,并且动作要是"可完成"的。比如"她转过头"可以在三秒内完成,"她走完一条街"在三秒里只能表现出一小段,观众会感到突兀。把长动作拆成多个镜头,用剪辑把它们连起来,是更符合电影语法的做法。
另一个技巧是给动作加一个"终点状态"。比如不要只写"她把杯子放下",而是写"她把杯子放到桌面右侧,手停住"。有终点状态,模型知道该在哪里收住,画面就不会在末尾突然加速或反复抖动。
时长、帧率与首尾帧
五秒是很多模型的舒适区。超过八秒,画面开始出现结构漂移;低于两秒,动作还没展开就结束了。因此在分镜阶段就要按三到五秒来设计单镜头,需要更长的段落就用多个镜头组接。
帧率影响的是"观感"而不是"信息量"。二十四帧更接近电影质感,三十帧更接近日常视频。无论选哪个,同一个项目里要保持一致,否则剪辑时会出现微妙的不流畅。
首尾帧控制是提高可控性的重要手段。想让人物从坐着变成站着,可以分别生成"坐"和"站"两张图,把前者设为首帧、后者设为尾帧,中间交给模型补间。这样得到的运动方向通常比纯文字描述准确得多。对于需要精确轨迹的镜头,比如一只手机从桌上滑到沙发底,首尾帧配合是最省试错的方案。
常见失败与修复路径
- 画面撕裂或结构融化:通常是运动幅度过大或时长过长,先把时长砍一半再试。
- 人脸在运动中变形:降低运动幅度,或改用侧面、背影、远景来处理运动镜头,把正脸留给相对静止的镜头。
- 镜头漂移(明明是固定机位却在缓慢移动):检查描述里是否出现了"跟随""环绕"等词,把它们删掉或改成"固定机位"。
- 颜色前后不一致:在剪辑阶段统一调色,而不是逐个重生成。重生成的时间成本远高于调色。
- 背景元素突然出现或消失:把背景描述写得更具体,或者用首尾帧把背景锚死。
- 材质闪烁(比如衣服纹理一帧一变):降低动作幅度,或把镜头改为更远的景别,让细节占比下降。
第五阶段:声音设计
配音:先定节奏,再选音色
配音的工作顺序经常被搞反。多数人先挑一个好听的音色,然后发现语速和画面完全对不上。正确顺序是:先按画面节奏标出每句话的起止时间,确定总时长和停顿位置,再选择音色和语速。音色决定的是"这个人是谁",节奏决定的是"这句话能不能落在正确的位置"。
如果需要口型同步,注意三点:一是尽量用正脸、光线均匀的镜头;二是台词不要太长,一句话控制在八到十二个字更稳;三是留出一点缓冲,不要让配音紧贴镜头首尾,剪辑时才有调整余地。
同一部片子里,同一个角色的音色要固定。中间换一次音色,观众会立刻感觉换了个人。如果确实需要不同情绪状态下的声音差异,也应该靠语速、力度、气息来处理,而不是换人。
音乐与音效的层次
声音大致分三层:对白层,环境层,音乐层。环境层最容易被忽略,但它对"真实感"的贡献最大——风声、脚步声、纸张摩擦声、远处的车流,这些东西会让观众相信画面里存在一个真实空间。音乐层则负责情绪引导,建议在剪辑的后期再铺,先让画面和环境音站住,再决定哪里需要音乐推动。
音量关系上,对白永远是最清楚的。音乐在有人说话时压低,在转场和空镜时抬起来。这个简单的动态处理,比换一首更"高级"的配乐更能提升成片质感。
还有一个细节:环境音要做得比画面"早一点点"进来,比画面"晚一点点"出去。这样切点不会太生硬,观众感觉到的是空间的延续,而不是一段一段的拼接。
第六阶段:剪辑与后期
时间线结构与节奏
拿到几十个片段之后,第一件事不是精剪,而是粗排。把所有可用片段按镜号丢上时间线,不管长短,先看整体叙事是否成立。这一步能立刻发现哪些镜头是多余的,哪些地方缺一个过渡镜头。
节奏的核心是"变化"。如果每个镜头都是同样的时长、同样的运动速度,观众很快会疲劳。可以有意识地在均匀的节奏里插入一个明显更短或更长的镜头,用来强调情绪转折。这个技巧成本极低,效果却很明显。
另外,不要舍不得删。生成出来的漂亮镜头如果对叙事没有推进作用,它就是在拖慢节奏。判断标准是:删掉这个镜头,观众是否还能理解剧情?能,就删。
调色与统一感
不同批次生成的片段常常有细微的色温差异。统一的方法不是逐个调,而是在整条时间线上加一层统一的基础调整:先统一白平衡和曝光,再叠加一层整体风格化,最后才处理个别镜头的特殊情况。顺序反了会越调越乱。
如果片子有明确的色彩主题,比如冷青配一点暖橙的皮肤高光,那就把这个方向写成一段可复用的调整参数,所有镜头都套用同一套,个别镜头只做微调。
颗粒和锐化也属于统一样式的一部分。给整条时间线加同一层轻微颗粒,比逐个镜头加更容易保持连贯;锐化则要谨慎,生成素材本身可能已经有锐化痕迹,叠加过度会显得廉价。
字幕与包装
字幕不只是把台词写出来。位置要避开画面里人物脸部所在的区域,字号要保证在手机屏幕上也能看清,出现和消失要给一点点缓动而不是硬切。片头片尾的包装尽量统一字体和动效语言,不要一个镜头一种风格。
导出时关注三件事:分辨率、码率、色彩空间。上传平台前先自己用手机看一遍,很多在电脑上看起来没问题的字幕,在竖屏上会被裁掉。多个平台同时投放时,建议先出一版无字幕后叠字幕,这样调整字幕位置不需要重新渲染画面。
第七阶段:版本管理、批量交付与质量验收
命名与版本规则
项目一多,文件命名就是灾难。建议固定一套命名规则:项目名_镜号_版本_状态。比如"夜行_012_v3_已通过"。状态字段可以只用四个值:草稿、待审、已通过、已废弃。有状态字段,团队沟通成本会下降一大截。
同时保留一份"参数记录表":每个镜头用了哪一版模型、哪张参考图、什么种子、什么时长。当客户要求"把第三镜改成黄昏",你能在五分钟内复现出那个镜头的完整生成条件,而不是重新摸索一遍。
如果项目由多人协作,还要约定两条纪律:一是不要覆盖别人的文件,只新建版本;二是改动脚本或角色设定后,必须在记录表里写一行说明,否则一周后没人知道为什么某个镜头长得不一样。
交付前的验收清单
在导出成片之前,用一份固定清单过一遍:
- 画面层面:有没有明显的结构错误、多余的肢体、闪烁的纹理?前后镜头的角色特征是否稳定?
- 声音层面:对白是否清晰、有没有削波?音乐在有对白处是否压低?片尾是否留了适当的淡出?
- 节奏层面:总时长是否符合要求?有没有某个镜头停留过久?转场是否自然?
- 技术层面:分辨率、帧率、码率是否符合平台要求?字幕有没有超出安全区域?
- 内容层面:画面里有没有出现不该出现的文字、标志或第三方素材?
这份清单看起来繁琐,但它能把"返工"从常态变成例外。养成习惯之后,过一遍只需要几分钟。
常见错误与排查清单
错误一:一次性追求完美
最常见也最致命的错误,是想在第一轮就把每个镜头做到满意。正确做法是先让整条片子达到"六十分",确认叙事、节奏、时长都成立,再逐个镜头提升。因为叙事层面的问题往往会导致整段被删掉,先精修这些镜头是纯粹的浪费。
错误二:把所有问题都归因于工具
镜头不动、人脸漂移、颜色跳变,很多情况下不是模型能力问题,而是输入描述里存在矛盾信息。排查顺序建议是:先看描述里有没有两个互相冲突的动作或风格词,再看参考图是否清晰且方向一致,最后才怀疑参数。把这三步做成习惯,能省下大量试错时间。
错误三:忽略声音对画面的"救场"作用
一个生成质量一般的镜头,配上准确的音效和合适的节奏,观众往往会接受;反过来,一个画面很漂亮的镜头配上错位的音效,观众立刻会感到别扭。预算有限时,把时间分配给声音,回报通常高于继续打磨画面。
错误四:不留可回滚的中间结果
覆盖式保存是另一个隐形陷阱。每次导出都新建一个版本号,看起来占空间,但当你需要回到三个版本之前的那一版时,它就是唯一的保险。
错误五:把流程当成一次性的
做完一个项目就把表格丢掉,下一个项目重新摸索,是最可惜的浪费。真正有价值的是那些可以跨项目复用的资产:风格前缀、负面清单、角色特征模板、验收清单。每做完一条片子,花十分钟更新它们,下一个项目的起点就会更高。
常见问题解答
一个项目应该用几个模型?
建议主用一个模型完成主体镜头,再用另一个模型处理它明显不擅长的部分,比如需要复杂手部动作或快速运动的镜头。混用太多会让风格统一变得非常困难,因为不同模型的默认色彩和镜头习惯不同。判断标准是:如果混用带来的收益小于统一风格的成本,就不要混用。
每张关键帧要生成多少次才够?
经验值是四到八张里挑一张。如果连续十几张都达不到要求,问题通常不在数量上,而在于描述本身有歧义,或者参考图质量不足。这时候应该停下来改描述,而不是继续抽卡。
另外,把"挑选标准"写下来也有帮助。比如"必须能看到角色的右侧脸、背景不能出现文字、手部不能入画",有明确标准时,挑选速度会快很多,也更容易和协作者达成一致。
没有美术基础能做分镜吗?
能。分镜的目的不是画得好看,而是把"这个镜头要什么"写清楚。用简单的方块加箭头标注构图和运镜,配合文字说明,完全够用。真正需要练习的是"把感受翻译成可执行指令"的能力,而不是绘画技巧。
竖屏和横屏应该怎么选?
先看投放平台和观看场景。竖屏适合手机端信息流,构图要更集中,主体尽量放在画面中上部,字幕避免贴底。横屏适合较长的叙事和电脑端观看,能容纳更多环境信息。两者最好不要共用一个版本,因为同一组关键帧裁成竖屏往往会切掉关键构图。
生成速度慢怎么办?
把"描述定稿"和"批量生成"分成两个时间段。描述在定稿之前反复改动,会浪费大量生成时间。集中生成还有个好处:同一批任务使用同一套参数,风格更容易统一。
什么时候应该放弃重新生成,改用剪辑补救?
如果问题在画面结构层面(比如出现了不该有的人或物体),只能重生成。如果问题在节奏、颜色、时长层面,剪辑和调色往往更快。判断标准很简单:这个问题能不能在不改变画面内容的前提下解决?能,就用后期;不能,就回到生成。
团队协作时最容易出问题的地方在哪?
通常是角色设定和版本命名这两件事。角色设定没有单一事实来源,每个人按自己的理解生成,最后拼在一起就会像两部不同的片子;命名不统一,剪辑时找不到正确版本,就会拿错素材。把这两件事做成明文规则,团队效率的提升非常直接。
整条片子最短多久能做完?
如果是三十秒、三到五个镜头、不需要口型同步的短片,熟练之后一天之内能完成从脚本到导出的全过程。如果包含口型同步、多角色、复杂运镜,时间通常要按天甚至按周计。规划时把"生成等待"和"人工判断"分开估时,会比笼统地拍脑袋更准。
结语:把流程变成资产
最后想说一句可能反直觉的话:真正让你交付越来越快的,不是你越来越会写提示词,而是你手里积累的那些固定资产——一份稳定的角色特征清单、一套复用的负面描述、一张记满参数的镜头表、一份导出前的验收清单、一个命名规则。这些东西不会因为某个模型更新换代而失效,它们会让每一次更换工具的成本都变得很低。
流程的价值,在于把"这一次碰巧做对了",变成"下一次也能做对"。当你发现自己不再需要靠运气去抽到一个好镜头,而是能在心里预估到第几次尝试会得到可用的结果,你就已经把 AI 视频从一次性的实验,变成了稳定的生产能力。


