为什么你需要一套可复用的工作流,而不是靠运气生成
大多数人在第一次接触 AI 视频时,都会经历同一个循环:输入一段描述,等几分钟,看到结果,惊喜或失望,然后重新改词,再来一次。这个循环跑上二十遍之后,人会陷入一种错觉——好像只要措辞再巧妙一点,就能一次得到完美镜头。现实是,单次生成的上限由模型决定,而整条片子的下限由工作流决定。
把 AI 视频当成“抽卡”的人,交付周期永远不可控;把它当成流水线的人,才能承诺时间、承诺风格、承诺修改。两者的差距不在工具,而在结构。
一条成熟的 AI 视频流水线通常分成四层:
- 输入层:创意、脚本、分镜表、角色设定图、风格板。
- 生成层:模型选择、参数设定、参考图使用方式、批量生成与筛选。
- 融合层:剪辑、转场、配音、音效、配乐、调色统一。
- 交付层:版本命名、审片节点、导出规格、归档规范。
绝大多数人卡在第二层,因为他们没有认真做第一层。脚本没拆到镜头级,参考图只给一张,参数没有记录,于是每一次“改一改”都在重新开始,而不是在迭代。下面这份指南按实际制作顺序展开,每一步都给出可执行的清单和判断标准。
第一步:把创意拆成可执行的脚本与分镜
从一句话到三幕结构
任何一支几十秒到几分钟的 AI 视频,都需要一个最小的叙事骨架。最省力的方式是套用三幕:建立情境、制造变化、给出结果。即便是产品展示片,也可以用“问题场景—解决问题—使用后状态”来替代传统故事结构。
一开始不要写文学化的旁白,先写动作句。例如“她走进咖啡馆”比“她带着一丝疲惫推开了那扇老旧的木门”更容易转化为可执行的镜头描述。前者的镜头信息很明确,后者需要你先把它翻译成视觉动作。把修辞留到最后一个人工润色环节,而不是留在提示词里。
镜头表是整条流水线的骨架
一份可用的镜头表至少包含这些字段:
| 字段 | 说明 | 示例 |
|---|---|---|
| 镜号 | 唯一编号,便于回溯 | S02-SH04 |
| 时长 | 目标秒数,决定生成片段长度 | 3.5s |
| 景别 | 远、全、中、近、特 | 中近景 |
| 机位运动 | 固定、推、拉、摇、跟 | 缓慢推近 |
| 主体动作 | 一个镜头只放一个主动作 | 抬手看表 |
| 环境 | 地点与关键物件 | 地铁站台,雨天 |
| 光线 | 时间与光源方向 | 傍晚侧逆光 |
| 转场 | 与下一镜的连接方式 | 硬切 |
| 音频提示 | 环境音、对白、音乐节点 | 列车进站声 |
把这张表填满,你会发现原本模糊的“做一支 60 秒视频”,变成了 18 个可以逐个击破的小任务。每个小任务失败,成本都极低;整支片子重做,成本极高。
结构化提示词的写法
有效的提示词不是形容词堆砌,而是按固定顺序排列的信息块:
主体 + 动作 + 环境 + 光线 + 镜头语言 + 风格 + 画质约束
例如:
一位三十岁左右的女性,深蓝色风衣,站在雨后的地铁站台,抬头看向进站方向,动作缓慢;傍晚侧逆光,地面有反光水洼;中近景,镜头缓慢推近,浅景深;写实电影质感,柔和颗粒,冷色调;画质清晰,无字幕,无多余人物。
注意两个细节:一是一个镜头只描述一个主动作,二是明确排除项。模型不会读心,你希望画面里没有的东西,必须写出来。
提示词模板的复用价值
把同一段提示词拆成“可变部分”和“固定部分”。固定部分是风格锚点、画质约束、排除项;可变部分是动作与景别。这样你在生成 18 个镜头时,只需要改动可变部分,风格漂移的概率会显著下降。
第二步:建立视觉一致性体系
一致性是 AI 视频里最贵的能力。观众可以接受画面不够华丽,但很难接受主角在第三秒换了张脸。
角色一致性:参考图是身份锚
为每个主要角色准备一套设定图,通常 3 到 5 张就够:正面、四分之三侧面、背面、以及一到两种情绪状态。要求同一服装、同一发型、同一光源条件。
在生成时把这些图作为参考输入,而不是只靠文字描述外貌。文字描述在不同镜头里会被模型重新解释,参考图则提供一个相对稳定的视觉锚点。经验上,参考图数量不是越多越好,2 到 3 张高质量同源图,效果往往优于 6 张风格不一致的图。
另外,把角色的关键属性写成一行可复制的“身份串”,例如:
深蓝色风衣、黑色短发、左耳银色小耳环、米色围巾、无眼镜
每次生成都带上这一行,并与参考图同时使用。文字负责约束,图像负责质感。
场景与风格一致性:色彩脚本与地标元素
除了角色,场景也需要锚点。做法是给每个场景定义:
- 主色板:三到四个颜色,最好写成十六进制值,便于后期调色统一。
- 地标元素:场景里始终出现的物件,例如红色邮筒、老式挂钟。
- 光线基调:晨光、正午硬光、黄昏暖调、夜景霓虹。
当地标元素反复出现在多个镜头中,观众会下意识认为“这是同一个地方”,即便背景细节并不完全一致。这是一种低成本的空间连续性技巧。
关键帧锚定:首帧、中帧、尾帧
对运动幅度较大的镜头,使用首帧与尾帧同时约束,可以让模型在两端都有明确目标。中帧锚定适合处理“转身”“开门”这类中期状态容易崩坏的镜头。
实际操作中,比较有效的顺序是:
- 先确定首帧画面是否满意,不满意就先用图生图反复打磨。
- 再用尾帧约束运动终点。
- 最后才调整运动强度与时长。
反过来做,也就是先跑视频再反过来修首帧,返工率会高得多。
风格统一:固定随机种子与风格参考
如果模型支持固定随机种子,把每个场景的种子记录下来。同一个场景内的多个镜头共用同一风格参考图与种子,风格漂移会明显减少。风格参考图最好来自同一来源或同一批拍摄,避免风格互相冲突。
第三步:模型与参数的取舍策略
文生视频、图生视频、视频转视频,分别用在什么时候
| 方式 | 适用场景 | 优势 | 主要风险 |
|---|---|---|---|
| 文生视频 | 概念探索、氛围镜头、空镜 | 速度快,创意空间大 | 主体不稳定,难以控制细节 |
| 图生视频 | 有角色或产品主体、需要精确构图 | 构图可控,一致性较好 | 运动幅度受限,可能出现僵硬感 |
| 视频转视频 | 已有实拍素材需要风格化或补帧 | 保留真实运动,改风格成本低 | 风格化过度会丢失质感 |
一个常见的高效组合是:空镜与氛围镜头用文生视频,人物与产品镜头用图生视频,实拍素材用视频转视频。不要用同一种方式硬套所有镜头。
分辨率、时长与运动强度的三角关系
这三个参数互相拉扯。时长越长,主体变形的累积风险越高;分辨率越高,细节越清晰,但瑕疵也会被放大;运动强度越大,画面越有张力,也越容易出现肢体错位。
建议的策略是分层推进:
- 草稿层:低分辨率、短时长、快速生成,只用来确认构图与节奏。
- 定稿层:参数锁定后,用较高分辨率与目标时长重跑。
- 补丁层:只重做失败的镜头,而不是整段重做。
运动强度方面,可以遵循“动作越小,镜头越稳”的经验。人物对话镜头用极小的运动强度反而更自然;跑步、追逐类镜头才需要拉高运动参数。
帧率与镜头时长的匹配
不同镜头的时长需要匹配它的信息量。一个特写镜头停留 1.5 秒就够,一个远景建立镜头通常需要 3 到 4 秒。AI 生成的片段越长,出错概率越高,所以更实际的做法是:生成略长于需要的时长,在剪辑时裁掉首尾,而不是一次性追求精确长度。这样既留了剪辑余量,也规避了片头片尾常见的形变。
第四步:素材管理、任务队列与成本控制
命名规范决定返工效率
一套简单的命名规则可以省掉大量沟通成本:
项目_场景_镜号_版本_状态
例如 brandfilm_s02_sh04_v03_ok。状态标记可以使用 draft(草稿)、review(待审)、ok(通过)、fix(待修)。当你有两百个生成文件时,唯一能救你的就是文件名。
用队列思维替代手动等待
批量生成时,把任务按优先级分组:先跑所有草稿层镜头,确认整体节奏;再统一跑定稿层。手动一个个点生成的效率极低,而且容易在等待中失去判断力。
几个可执行的习惯:
- 把不紧急的精修任务放在空闲时段批量跑,醒来后集中筛选。
- 同一镜头的多个候选版本一次性生成 3 到 4 个,横向比对。
- 对通过的镜头立刻归档到一个独立文件夹,避免在候选堆里混淆。
预算怎么分配才不浪费
无论你使用的是按次计费还是配额制,都可以按经验比例分配生成预算:
- 探索与草稿:约 20%,用于确定风格与构图。
- 主生成:约 60%,用于正式镜头。
- 补拍与修补:约 20%,留给意外失败的镜头。
最常见的浪费有两种:一是在草稿阶段就用高规格反复重跑,二是在没有锁定参考图的情况下反复试错。把参数先定死,再谈生成次数。
建立自己的参数档案
每完成一个项目,把有效的参数组合记录下来:模型、分辨率、时长、运动强度、参考图数量、种子、提示词模板。这份档案的价值远超任何教程,因为它是针对你自己的题材和风格校准过的。
第五步:剪辑、配音与音画对位
剪辑节奏:先定音乐,再定剪辑点
AI 生成片段缺少天然的节奏感,因为每一段都是独立生成的。解决办法是先铺一条音乐轨或节奏参考,再按鼓点或乐句切镜头。这样即便画面本身平淡,观感也会紧凑很多。
两个实用技巧:
- J-cut 与 L-cut:让声音先入或后出,可以掩盖镜头切换的生硬感。
- 动作剪接:在主体动作的中途切换镜头,观众的注意力会自然跟随动作,忽略切换点。
配音与口型
如果片子有对白,优先录制真人配音,再让画面去匹配声音节奏,而不是反过来。AI 配音适合旁白与说明性内容,对白则容易出现情绪扁平的问题。口型对齐可以在剪辑软件中做局部变速微调,比重新生成整个镜头划算得多。
调色统一与画面质感
不同模型、不同批次生成的素材,色温与对比度往往不一致。在剪辑末端加一层统一的调色节点或 LUT,可以快速拉齐整体观感。同时建议加轻微颗粒与锐化控制,过度锐化会让 AI 生成素材的边缘显得不自然。
字幕与信息层
字幕放到最后一层添加。不要在生成阶段要求模型在画面里写字,文字渲染目前在多数视频模型里仍不稳定,容易产生乱码。所有文字信息都用后期叠加。
第六步:质检清单与常见失败排查
成片前跑一遍质检清单,能拦住大部分低级问题:
- 角色身份在镜头之间是否前后一致?
- 服装、发型、配饰有无突然变化?
- 场景光线基调是否连贯?
- 镜头之间的运动方向是否冲突(例如前一镜向右推,后一镜突然向左摇)?
- 声音与画面是否对位?
- 是否存在明显的肢体畸变或多余手指?
- 画面里有没有不该出现的文字或水印?
常见问题的排查方式:
| 现象 | 可能原因 | 处理方式 |
|---|---|---|
| 画面闪烁或抖动 | 运动强度过高、帧间一致性差 | 降低运动参数,缩短单段时长,分段拼接 |
| 角色面部漂移 | 缺少参考图或参考图风格不一致 | 补充 2 至 3 张同源设定图,加入身份串描述 |
| 肢体畸变 | 动作幅度过大、人物占比过小 | 减少同时发生的动作数量,放大主体 |
| 画面过曝或死黑 | 光线描述模糊 | 明确光源方向与时间,加入曝光约束词 |
| 镜头运动突兀 | 首尾帧不匹配 | 用首尾帧双端约束,或在剪辑中用转场缓冲 |
| 风格忽明忽暗 | 风格参考不统一 | 统一参考图与随机种子,同场景共用参数 |
排查的顺序建议是:先看提示词,再看参考图,最后才怀疑模型。绝大多数问题来自前两者。
团队协作与交付规范
审片节点要少而明确
流程里设置三个审片点就够了:脚本与分镜确认、草稿层整体节奏确认、成片确认。每个节点只回答一个问题——是否进入下一阶段。避免在中间环节反复来回修改,那会让生产节奏彻底失控。
交付规格提前锁定
在开工前就确定:画幅比例(横屏还是竖屏)、分辨率、帧率、码率、字幕规范、片头片尾时长、文件命名规则。竖屏内容尤其要注意构图——生成时就要留出上下安全区,否则后期裁切会切掉人物头部。
归档与复用
项目结束后,把可复用的资产整理出来:角色设定图、场景色板、风格参考、有效的提示词模板、剪辑工程文件。下一个项目开始时,你会省掉大量重复劳动。长期来看,真正积累下来的不是某一条片子,而是这套越来越熟练的流水线。
常见问题
1. 一个镜头要生成几次才算正常?
对于难度中等的镜头,3 到 5 次候选属于正常范围。如果需要超过 10 次仍无法得到可用结果,通常说明问题不在运气,而在提示词结构或参考图质量。此时应该回头改输入,而不是继续加生成次数。
2. 没有美术基础,怎么保证画面好看?
借用参考图与色彩板。找三到五张你喜欢的画面作为风格参考,提取其中的主色调与光线条件,把它们写成固定描述。风格判断可以借,构图能力可以练。
3. 为什么我的视频看起来很“AI”?
通常有三个原因:镜头运动过于平滑且缺少变化、画面缺少前景与景深层次、音效与配乐缺失。加入手持感的轻微晃动、前景遮挡物、以及真实环境音,观感会立刻不同。
4. 长视频是不是只能一段段拼?
目前更可靠的方案确实是分段生成再拼接。关键是把每一段的时长控制在模型表现稳定的区间内,并在剪辑时用动作剪接掩盖接缝。
5. 生成成本怎么控制?
三个原则:草稿阶段用低规格、参数锁定后再高规格重跑、失败镜头单独重做而不整段重来。另外,把同一批任务集中处理,比零散随时生成更省时间也更容易管理。
6. 人物走路镜头总是很奇怪,怎么办?
让主体在画面中的占比大一些,减少镜头本身的运动幅度,改用侧向跟拍而不是正面推进。如果模型支持,用首尾帧约束步伐的起止位置。
7. 需要给每个镜头都写完整提示词吗?
不需要。建立模板后,固定部分直接复用,只改动作与景别部分。这样既省时间,又能让整支片子的风格更统一。
8. 什么阶段适合引入人工修图?
在首帧阶段引入最划算。首帧一旦定稿,后续视频生成的可控性会大幅提升,远比在成片阶段做修补省力。
从会用到稳定产出,中间隔着流程
AI 视频工具的进化速度很快,但一个稳定的创作流程变化得没那么快。真正让产出可预测的,是把创意拆到镜头级、把一致性交给参考图与参数档案、把成本留给草稿与补拍、把观感交给剪辑与声音。
如果你现在还在“抽卡式”生成,可以先从一件小事开始:为下一个项目写一份完整的镜头表,并为主角准备三张设定图。做完这两步,你会立刻感受到返工率的变化。然后再逐步补上参数档案、命名规范与质检清单。流程一旦成型,工具换代就只是换零件,而不是重学一门手艺。

