为什么现在需要一套稳定的 AI 视频工作流
生成式视频工具的进步,几乎全部体现在「单次生成」的质量上:画面更细腻、运动更合理、可出片的时长更长。但一个团队能否持续交付,取决的不是某一次惊艳的结果,而是「下一次还能不能做到同样好」。工具决定上限,工作流决定下限。
更现实的问题是:单点能力提升并不等于成片质量提升。你可以在某个模型上生成一条极漂亮的镜头,但它可能与前后镜头在光影、焦段、人物长相、运动节奏上完全不搭,剪辑时才发现无法拼接。把生成能力转化为交付能力,靠的是流程、规范和验收标准,而不是继续换工具。
没有工作流时,最常见的五种浪费是:
- 反复重生成同一个镜头,却不知道问题出在提示词、参考图还是运动描述;
- 角色在不同镜头里脸型、发型、服装漂移,剪在一起像不同的人;
- 音频与画面对不上,口型和节奏全靠后期硬拗;
- 素材命名混乱,几天后找不到「哪一版才是最终版」;
- 每次开工都从零开始,上一支片子的经验无法复用。
一套稳定的工作流至少解决三件事。第一是可复现:同样的输入能得到接近的输出,好结果可以被记录、被复用。第二是可协作:换一个人接手同一个项目,能在十分钟内看懂进度和资产位置。第三是可验收:有明确的通过标准,而不是「感觉还行」。
整个链路可以压缩成七个阶段,下面是总览:
| 阶段 | 核心交付物 | 主要风险 | 通过标准 |
|---|---|---|---|
| 立项与剧本拆解 | 剧本、节奏块、信息点 | 一个镜头塞太多信息 | 每个节奏块只有一个记忆点 |
| 分镜与提示词 | 镜头表、提示词、负面提示 | 运镜与动作混写 | 每条提示词可被他人复现 |
| 角色与风格一致性 | 角色设定卡、参考图组、风格锚点 | 参考图中途更换 | 并排对照无明显漂移 |
| 静帧转动态 | 候选镜头、选定镜头 | 运动幅度过大 | 选片率稳定在可接受区间 |
| 声音设计与同步 | 分句配音、混音工程 | 响度忽大忽小 | 音画误差小于 2 帧 |
| 剪辑、调色与输出 | 时间线、成片、输出文件 | 逐镜调风格导致越调越花 | 规格与平台要求一致 |
| 验收与复盘 | 验收清单、问题表 | 无标准的主观判断 | 清单逐项打勾 |
建议的用法是:先用一个小项目把这七个阶段完整走一遍,哪怕只有 15 秒。走通之后,再针对自己最容易出错的那一环做优化。这比追逐每一个新模型更能提升实际产能。
阶段一:立项与剧本拆解,把创意变成生产清单
先定成片规格,再写脚本
很多返工源于顺序错误:先写脚本、再做画面,最后才发现画幅和时长根本装不下。正确顺序是先锁规格。需要确定的字段包括:
- 平台与画幅:竖屏 1080×1920 还是横屏 1920×1080;
- 总时长:15 秒、45 秒还是 3 分钟;
- 单镜时长区间:竖屏建议 3–6 秒,横屏可放宽到 4–8 秒;
- 帧率:24、25、30fps,一旦确定全片统一;
- 字幕:硬字幕还是外挂,是否需要双语;
- 是否需要对口型:这决定后期是「配音优先」还是「画面优先」;
- 交付格式与码率。
规格一旦确定,就不要在中途改动画幅。竖屏构图和横屏构图对运镜的要求完全不同:竖屏适合中近景和垂直方向运动,横屏才能承载大远景和横向调度。中途改画幅等于重拍。
三步拆解法
第一步,写主题句。用一句话说清「谁在什么处境下做了什么,结果如何」。如果这句话写不出来,说明创意还没成型,不要急着进入画面阶段。
第二步,切节奏块。把总时长切成 4–6 块,每块给一个时长预算。以 45 秒竖屏短片为例:
- 0–3 秒:钩子,必须出现一个反常画面或一句反问;
- 3–12 秒:铺垫,交代人物与处境;
- 12–25 秒:冲突,问题升级;
- 25–35 秒:转折,给出解法或反转;
- 35–45 秒:收束,落到品牌或行动指引。
第三步,给每块只保留一个信息点,并写下来。信息点超过一个,观众通常一个都记不住。把信息点写成一句话,后续所有创作决策都以它为裁判。
交付物清单与命名规范
一个可执行的立项包应包含:剧本(带镜号)、节奏块时长表、信息点清单、角色设定卡占位、命名规范。
命名规范看起来琐碎,却是团队协作中最省时间的一条规则。推荐格式:项目名_场次_镜号_版本_日期,例如 咖啡短片_S02_007_v03_0612。不要用「最终版」「最终版2」「真的最终版」这类命名,它们会在大约第三天失效。
阶段二:分镜设计与提示词工程
镜头表该写哪些字段
镜头表是整条工作流的脊柱。推荐字段:镜号、时长、景别(远/全/中/近/特)、机位与运镜、光线与色温、主体动作、环境与道具、情绪关键词、声音备注。字段越齐全,生成阶段的猜测越少。
一个高频错误是把「运镜」和「主体动作」写在一起,比如「镜头推进,人物走近」。模型会理解成两者都做一点点,结果画面容易抖动或语义混乱。请把它们分成两栏:运镜写相机怎么动,主体动作写人怎么动。
提示词的四层结构
把提示词拆成四层,能显著提高可复现性:
- 主体与外观:年龄、发型、服装材质与颜色、标志性特征;
- 动作与状态:正在做什么、速度、幅度;
- 环境与光线:时间、天气、光源方向、景深;
- 镜头与质感:焦段、机位高度、运动方式、颗粒感。
模板示例(可直接改写):
- 主体:28 岁女性,齐肩黑发,米白色羊毛外套
- 动作:缓慢转身看向镜头,右手抬起整理领口,幅度小
- 环境:清晨的旧书店,侧逆光,浮尘可见,浅景深
- 镜头:35mm 视角,平视,极缓慢横移,自然颗粒
另一个镜头的写法:主体不变,动作改为「低头翻书,手指停在书页边缘」,环境改为「黄昏窗边,暖光源从右侧进入」,镜头改为「50mm 特写,固定机位」。注意:主体描述一字不改地复用,这是保持一致性的最省力手段。
负面提示与随机种子
负面提示优先处理最常见的问题:多余手指、文字与水印、面部扭曲、多余肢体、突然出现的路人、画面撕裂。不要一口气堆二十个词,那会削弱主体描述的作用力。挑选三到五个最影响当前项目的项目即可。
更重要的是记录随机种子。当一条镜头效果不错,把种子、提示词、参考图、模型版本一起存档。这是把运气变成资产的唯一方式:下次需要类似镜头时,先复用存档再微调,而不是重新赌一次。
迭代顺序:先构图,再光影,最后细节
多数人反着来:在构图明显不对的画面上反复修手指,浪费时间却得不到可用镜头。正确顺序是先确认主体位置与画面比例,再调整光线方向和强弱,最后才处理皮肤、纹理、配饰等细节。前三层没问题,再进入下一层。
阶段三:角色与风格一致性控制
角色设定卡包含什么
一张设定卡至少要写清五项:基准图(正面、侧面、四分之三视角各一张)、服装配色与版型、发色与发型、标志性配饰、不允许改变的特征(例如疤痕位置或眼镜框形)。同时写清允许变化的范围:表情、姿态、手势可以变,脸型与发际线不可以变。
参考图准备的四条规则
- 分辨率足够:短边不低于 1024 像素,避免模型放大时产生涂抹;
- 背景干净:优先中性灰或纯色,避免把参考图的杂乱背景带进生成结果;
- 光线中性:不要用强逆光或极端色温的照片做基准图;
- 数量克制:一个角色三到五张足够,过多参考图会互相干扰。
跨镜头一致性的四个手段
第一,固定参考图。同一组参考图贯穿全片,不因场景变化而更换。场景变化应通过环境描述和光照描述来实现,而不是换参考图。
第二,多图融合。把角色基准图与场景参考图同时输入,让模型在保持身份特征的同时适配场景光线。这在「同一个人出现在白天街道和夜晚室内」这类需求上特别有效。
第三,局部重绘。当整体构图已经满意、只有脸部或手部出问题时,只重画局部,保留已经生成好的身体与环境。整帧重生成会把之前的好结果一起丢掉。
第四,风格锚点。用一句固定的风格描述出现在每个提示词末尾,例如「柔和自然光、低饱和、轻微颗粒、浅景深」。它是全片质感的黏合剂,一句话就能大幅降低拼贴感。
一致性检查点
每完成三到四个镜头,就把角色截图并排放在一张对照图上,检查五个点:脸部轮廓、发际线、服装版型、配饰位置、肤色在不同光源下的表现。并排看比单帧看更容易发现漂移。这个动作只花几分钟,却能避免成片后的大规模返工。
阶段四:从静帧到动态镜头
文生视频还是图生视频
判断标准很简单。如果画面里有人物身份或品牌元素必须精确,用图生视频,先出满意的静帧再驱动运动;如果只是一个不强调具体身份的过渡镜头、空镜或氛围画面,文生视频更快,也更容易得到自然运动。
运动描述的三个维度
- 相机运动:固定、横移、推进、拉远、环绕、升降、手持晃动;
- 主体运动:幅度(极小/小/中/大)、速度(慢/中/快)、方向;
- 环境运动:风吹、雨落、人群走动、光影闪烁、烟尘飘动。
一次只强调一个维度。三个维度都写「很大」,画面会失控。经验做法是:主体运动给「小」,相机运动给「极缓慢」,环境运动给「轻微」,多数模型在这种克制描述下表现最好。
时长、批次与候选数量
单镜生成 3–6 秒成功率最高。需要更长镜头时,拆成两段并在剪辑中接起来,接点选在动作停顿处。一次生成 4 个候选,选出最佳后在此基础上微调;不要一次生成二十个再挑,比较疲劳会让你误判,也会显著拖慢节奏。
如果连续三批候选都不满意,不要继续加量。回到镜头表检查:是不是主体与动作混写了?是不是参考图不当?是不是运动幅度超出模型能力?调整输入比增加次数有效得多。
运动模糊与稳定性的取舍
轻微模糊有助于掩盖生成瑕疵,尤其是在快速动作和转场镜头中。但如果主体本身模糊、细节无法辨认,就说明运动幅度超出模型能力,应降低幅度或把镜头拆成两段。宁可要一条干净克制的镜头,也不要一条炫技但不可用的镜头。
阶段五:声音设计与语音同步
三种声音方案的适用场景
- 先配音后对口型:适合口播、讲解、访谈类内容,稳定可控,返工量最小;
- 先生成画面后配音:适合氛围片和叙事短片,但节奏需要靠剪辑对齐,对剪辑能力要求更高;
- 无口型需求:只用旁白、音乐与音效,成本最低,出错概率最小。
多数团队在时间紧张时应该直接选第三种,把口型需求压缩到一两个关键镜头。
配音流程的五个步骤
脚本分段 → 试听两到三个音色 → 固定语速 → 按句子切分导出 → 与画面对齐。关键点是按句子而不是按整段导出,这样某一句不满意时可以局部替换,不必重配全片。
选音色时不要只看音色本身,要放到画面里听。同一句话配不同的画面节奏,感受差别很大。语速建议先在整片范围内统一,再针对个别句子微调,避免忽快忽慢。
口型对齐的实用技巧
- 每句台词控制在 8–15 个字,过长会导致口型松散、中间糊掉;
- 句子之间留 0.3–0.5 秒停顿,给剪辑留出余量;
- 对齐仍不理想时,改用侧脸、背影或插入 B-roll 掩盖;
- 特写对口型的镜头不要超过两秒,超过就容易暴露瑕疵。
音乐、音效与响度
响度是业余与专业最明显的分界线之一。参考区间:人声 –16 至 –12 LUFS(短视频平台可略高);音乐垫底比人声低 12–18 dB;转场音效不要每个切点都加,只加在节奏块交界处;关键台词前留半秒静音,比再加一个音效更有效。
整体混音完成后再统一做一次响度归一化,而不是逐段手动调音量。逐段调的结果通常是人声忽大忽小,观众在移动端会立刻察觉。
阶段六:剪辑、调色与输出
时间线组织
建议三条视频轨:主画面、插入画面(B-roll)、字幕;两条音频轨:人声、音乐与音效。把生成的候选镜头标为「备选」,不要与「已选用」混在同一条轨上。每个镜头两端各留 6–12 帧余量,方便对齐台词和音乐节拍。
剪辑顺序建议是:先铺人声与节奏,再填主画面,最后加 B-roll 与字幕。先铺画面后配音,往往会在对齐时被迫裁掉关键画面。
调色三步
生成镜头的色彩往往不一致,这是拼贴感的主要来源。做法是:第一,用一级校色把每个镜头拉回中性(统一白平衡与曝光);第二,套统一的风格曲线或 LUT;第三,做局部提亮,把面部提出来。
不要逐镜调风格,否则越调越花。如果某个镜头怎么调都不合群,最省时间的做法通常是重新生成一条,而不是在调色台上耗一小时。
转场与节奏
AI 生成镜头之间用硬切最安全,因为硬切不会暴露运动轨迹的不连续。需要柔和过渡时,用叠化或轻微模糊过渡,时长控制在 6–12 帧。避免复杂的变形转场,它会把两个镜头的瑕疵同时放大。
节奏上,短视频前 3 秒必须出现钩子:一个反常画面、一句反问或一个快速动作。中段每 4–6 秒给一次视觉变化(景别变化、光线变化、出现新元素),否则观众会在第 10 秒左右划走。
输出规格速查
- 竖屏:1080×1920,30fps,H.264 高码率;
- 横屏:1920×1080,24 或 25fps;
- 字幕:竖屏建议硬烧,长视频可外挂;
- 交付前导出 15 秒样片,确认压缩后画质仍可接受;
- 保留一份无损母版,平台压缩不可逆。
质量验收与常见错误排查
验收清单
生成完成不等于成片完成。交付前逐项打勾:
- 角色在全部镜头中身份一致,无明显漂移;
- 无多余手指、肢体、文字或水印;
- 每个镜头的运动方向与镜头表一致;
- 音频与画面对齐误差小于 2 帧;
- 全片响度统一,无爆音或突然静音;
- 首 3 秒出现钩子;
- 字幕无错别字、不遮挡主体与关键信息;
- 输出规格、时长、码率与平台要求一致;
- 「已选用」与「备选」素材分目录存放。
常见错误排查表
| 现象 | 可能原因 | 处理方式 |
|---|---|---|
| 画面闪烁、纹理跳变 | 运动幅度过大,或各镜所用模型版本不一致 | 降低幅度,统一版本,缩短单镜时长 |
| 角色脸型漂移 | 中途更换了参考图,或缺少参考图 | 恢复同一组参考图,改用局部重绘 |
| 手指异常 | 手部占比小且运动快 | 让手离开画面,或用插入镜头替代 |
| 画面干净得像塑料 | 缺少质感描述 | 加入颗粒、光斑、浅景深描述 |
| 声音忽大忽小 | 分段配音未做整体归一化 | 全片统一响度后再混音 |
| 生成慢、反复不满意 | 提示词没有结构化 | 按四层结构重写,先定构图 |
| 拼贴感强 | 各镜光线方向不统一 | 在提示词中固定光源方向与色温 |
| 观众前 5 秒流失 | 开场无钩子、信息点过多 | 把最反常的画面提到第 1 秒 |
团队协作、资产管理与产能估算
目录结构与版本管理
推荐结构:项目名 / 01_脚本 / 02_分镜 / 03_参考图 / 04_生成候选 / 05_选定镜头 / 06_音频 / 07_成片 / 08_交付。命名带两位版本号 v01、v02。保留「选定」与「备选」两个子目录,避免误删好素材。
另一条实用规则:任何素材在被选进时间线之前,都不算「选定」。这样能避免出现「我以为这条已经用了」的混乱。
交接文档
一页纸写清四件事:当前进度、下一步、已知问题、待确认项。团队协作中最大的损耗往往不是技术问题,而是「不知道别人做到哪一步了」。交接文档不需要长,需要的是每天更新。
产能估算(经验值)
- 30 秒竖屏动画短片:约 8–14 个镜头,2–3 天(含返工);
- 60 秒产品讲解:约 12–20 个镜头,3–5 天;
- 3 分钟叙事短片:约 30–50 个镜头,2–3 周。
把「生成时间」和「挑选与返工时间」分开估算。后者通常占总时长的 50% 以上,忽略它会导致排期严重失真。
成本与时间的取舍
想做长片,优先控制镜头数量,而不是单镜质量;想做品牌片,优先控制一致性,而不是镜头数量。两个目标同时拉满,工期通常失控。需要精确手部动作、复杂多人互动、真实品牌道具或长镜头连贯运动时,考虑用实拍补拍,而不是继续用生成去逼近。
模板化与复用
把跑通的成果沉淀成模板:镜头表模板、提示词四层模板、负面提示清单、验收清单、混音响度预设。下一次开工时从模板开始,能省下的时间通常比换一个更快的工具更多。
常见问题 FAQ
一条镜头要生成多少次才算够?
经验上四个候选里挑一个是效率最高的区间。若连续三批都不满意,问题多半不在运气,而在提示词结构、参考图或运动描述,回到镜头表逐项检查。
没有美术基础能做吗?
可以。把「构图」换成可执行规则:主体占画面三分之一、眼睛位于上三分之一线、背景元素不超过三个。规则比直觉更容易复制,也更容易交给别人执行。
竖屏和横屏能共用同一套素材吗?
部分可以。中景和特写通常能裁切复用;大远景和需要横向空间的动作镜头建议分别生成,否则构图会被裁坏。
如何避免「一眼就是 AI」的观感?
三个有效手段:加入轻微镜头呼吸与颗粒;不要每个镜头都完美对焦;让光线有明确方向而不是均匀平光。此外,剪辑节奏比画面本身更影响观感。
团队里谁负责提示词?
一个人写词会成为瓶颈。更好的分工是:一人负责镜头表与提示词规范,其余人按规范执行,并回填「哪条结构最有效」。规范与执行分离,效率最高。
需要多强的硬件?
主要算力开销在生成与渲染环节,剪辑与调色用中等配置即可。没有本地算力时,采用云端生成加本地剪辑的组合更灵活,也更容易扩容。
60 秒的片子应该有几个镜头?
竖屏建议 12–20 个,平均单镜 3–6 秒。镜头太少的后果是每个镜头都要承担太多信息,观众来不及消化;镜头太多则节奏碎,观众记不住主线。
每次都要写负面提示吗?
建议保留一份固定清单(多余手指、文字水印、面部扭曲、多余肢体),再针对具体项目增删两到三项。完全不用负面提示,通常会在细节上浪费时间。
把工作流跑通之后,你会发现真正省时间的不是更快的工具,而是更少的返工。先用一个小项目把七个阶段完整走一遍,再集中优化你最容易出错的那一环——这比追逐每一个新模型都更能提升产能。


