一、为什么AI视频制作需要“工作流思维”
很多人第一次接触AI视频,是从一句提示词开始的:输入一段描述,等待片刻,得到一个几秒钟的片段。第一次看到画面动起来时的震撼是真实的,但当你真要做一支能对外发布的完整作品时,问题会一个接一个地冒出来:主角在第二个镜头里换了脸,光线风格前后打架,动作衔接突兀,节奏拖沓,声音和画面对不上,导出到手机上再看一遍,画质又糊了一层。
原因并不神秘。生成模型擅长的是“单点任务”——把文字变成画面,把图片变成运动。而一支成片需要的是“链条”:创意、脚本、分镜、视觉设定、素材生成、剪辑、声音、输出。链条上任何一环缺失,最终效果都会垮掉。
把AI视频制作当成“工作流工程”而不是“抽卡游戏”,是效率与质量的分水岭。一套稳定的工作流至少带来三件东西:
- 可复现:同一套设定与提示词结构,下一次还能得到相近的结果,不必每次从零摸索。
- 可并行:脚本、设定、生成、声音可以分给不同的人,或安排在不同时间段推进,不必串行等待。
- 可迭代:出问题时,你知道该回到哪一步去修,而不是整支片子推倒重来。
还有第四个隐性收益:协作。当你的镜头表、风格锚点、提示词都写在文档里,第二个人接手时不需要你口头解释半小时,他打开文件就能继续往下做。这一点对独立创作者同样重要——三个月后的你,就是那个“第二个人”。
下面按实际生产顺序,把整条链路拆成六个阶段,每个阶段给出可直接照做的方法、字段模板和常见坑。你可以按顺序通读一遍,也可以直接跳到当前卡住的那一步。
二、第一步:把创意拆成可执行的分镜脚本
三种脚本粒度,别跳级
大多数AI视频项目失败在“从概念直接跳到生成”。中间缺了两层。
- 概念级:一句话说清“谁、在什么地方、遇到什么、最后怎样”。例如:“一个外卖员在暴雨夜送完最后一单,发现收件人是他多年未见的父亲。”
- 大纲级:把概念拆成三到六个段落,每段一句话描述情绪与事件推进。这一段决定节奏与信息密度。
- 镜头级:把大纲里每一段拆成具体镜头,写成表格。这一步才是模型能“读懂”的输入。
三级跳的做法看似省时间,实际会让你在生成阶段反复返工——因为你会一边生成一边想剧情,成本成倍增加。
镜头表必须写清的九个字段
- 镜号:唯一编号,方便后续讨论“第 7 镜要重做”。
- 时长:以秒为单位,标注预期长度,例如 3 秒或 5 秒。
- 景别:远景、全景、中景、近景、特写。景别决定观众与角色的心理距离。
- 主体与动作:谁在做什么,动作的起点与终点分别是什么。
- 镜头运动:固定、推、拉、摇、跟、环绕、手持。运动方式要在生成时就定,不要指望后期裁切补救。
- 环境与时间:室内外、天气、白天夜晚、季节。
- 光线:主光方向、色温、硬光还是柔光、有无实用光源。
- 声音:对白、环境音、动作音效、音乐情绪。
- 转场:切、叠化、遮挡转场、动作衔接。
写满这九项之后,你会发现原本“感觉不对”的问题,大多能定位到某个具体字段上。
一个 30 秒短片的镜头表示例
假设要拍一支 30 秒的手冲咖啡短片,可以这样拆:
- 镜 1(2 秒):特写,热水注入滤杯,蒸汽升腾,固定镜头,清晨侧光。
- 镜 2(3 秒):近景,手握着壶把手微微倾斜,动作缓慢,浅景深。
- 镜 3(3 秒):中景,人物侧脸,逆光轮廓,缓慢推镜。
- 镜 4(4 秒):俯拍,咖啡液滴入分享壶,节奏与音乐鼓点对齐。
- 镜 5(3 秒):特写,手指轻轻转动杯子,暖色台灯补光。
- 镜 6(4 秒):中景,人物端起杯子走到窗边,跟拍。
- 镜 7(3 秒):近景,第一口,眼睛微微眯起,自然光。
- 镜 8(3 秒):远景,窗边剪影,画面渐暗,标题浮出。
这份表本身就是拍摄说明书,也是提示词的骨架。到了生成阶段,你只需要按镜号逐个填提示词,而不是对着空白页面发呆。
最容易被忽略的错误
- 把氛围词当指令:“高级感”“电影感”这类词对模型几乎无用,真正起作用的是“主光来自左侧窗户、色温 5600K、浅景深、低饱和”。
- 一个镜头塞进两个动作:模型会在动作切换处崩掉。一个镜头只做一件事。
- 忽略时长与信息量匹配:2 秒的镜头里塞三段信息,观众只会觉得画面在闪。
三、第二步:建立视觉基调与角色一致性
风格锚点文档
在生成任何一段素材之前,先写一份“风格锚点”文档,它要能回答一个问题:这支片子看起来像什么?内容至少包括:
- 色彩:主色、辅色、禁止出现的颜色。例如“主色是雾蓝与暖木色,避免高饱和红”。
- 光线:整体是柔光还是硬光,常用色温范围,是否允许强烈反差。
- 质感:胶片颗粒、数字锐利、手绘笔触、金属反射。
- 镜头语言:常用焦段(35mm 的观察感、85mm 的压缩感)、是否允许手持晃动。
- 参考:两三张图或两三段片子,作为团队内部的“共同语言”。
这份文档的作用是让每一个镜头的提示词都能挂靠到同一套坐标上,而不是各写各的。
角色一致性:参考图与描述词双轨并行
角色一致性是AI视频里最难的环节。单靠文字描述,模型每次都会给你一个“差不多的陌生人”。可行的做法是双轨并行。
第一轨:参考图。 准备同一角色的三到五张图,覆盖不同角度(正面、四分之三侧、侧面)、不同景别(半身、特写),以及不同表情。角度覆盖越全,模型在不同镜头里越稳。参考图本身要干净:单一背景、光线均匀、没有多余人物。
第二轨:固定特征词表。 把角色的可识别特征写成一段固定文案,每次生成时原样复制,例如:“四十岁男性,短发,右侧眉骨有一道浅疤,戴细框眼镜,穿深灰色针织衫,颧骨突出,眼窝偏深。”不要在同一次生成里临时加形容词,也不要随意改变词序。
服装与道具连续性表
角色一致不只是脸。服饰、配饰、手里拿的东西,同样是观众判断“这是同一个人、同一场戏”的依据。做一张表:
| 镜号 | 服装 | 配饰 | 随身道具 | 备注 |
|---|---|---|---|---|
| 1-3 | 深灰针织衫 | 细框眼镜 | 无 | 室内 |
| 4-6 | 深灰针织衫外披风衣 | 细框眼镜 | 纸杯 | 外出 |
这张表能避免“上一镜还在室内穿毛衣,下一镜出门突然换外套却没有任何过渡”这类剪辑事故。
多图参考与权重控制
当平台支持多张参考图输入时,把它们当成“配方”而不是“堆料”。一般思路是:主体参考图权重最高,风格参考图次之,环境参考图最低。如果发现角色的脸被风格图带偏,就降低风格图权重,或者只让风格图影响后半段镜头。
四、第三步:模型选择与生成策略
按镜头类型匹配模型
没有哪个模型在所有镜头上都最强。按镜头类型分工,是提升成片质量最快的办法:
- 写实人物特写:优先选择皮肤质感、眼神光表现好的模型,注意检查牙齿与手指。
- 大场景与航拍:优先选择空间透视稳定、远景细节不崩的模型。
- 动作与运动:优先选择运动模糊自然、肢体不扭曲的模型,必要时拆成更短片段。
- 产品微距:优先选择材质反射与高光控制好的模型。
- 风格化动画:优先选择画风一致性强、线条稳定的模型或工作流。
实际做法是:先用同一段提示词在两到三个模型上各跑一次短片段,对比后再决定整支片子用哪个。这段“试跑”看起来浪费时间,但它避免了你跑到第 20 个镜头才发现模型不适合。
文生视频、图生视频与首尾帧控制
三种模式各有适用场景:
- 文生视频:适合探索阶段、空镜、氛围镜头。控制力最弱,但速度最快。
- 图生视频:适合角色镜头与产品镜头。先用图像工具把构图、服装、光线定死,再让视频模型只负责“运动”,稳定性大幅提高。
- 首尾帧控制:适合需要精确衔接的两个镜头,例如“杯子从满到空”“门从关到开”。给模型起点和终点,中间过程它自己补。
如果你要一个通用的建议:关键人物镜头优先图生视频,转场镜头优先首尾帧,氛围空镜可以用文生视频。
提示词结构模板
把提示词写成有层次的短句,而不是长段落。推荐顺序:
- 主体与外观(谁,长什么样,穿什么)
- 动作(做什么,动作的速度与幅度)
- 环境(在哪里,时间,天气)
- 镜头(景别,运动,焦段)
- 光线(主光方向,色温,明暗对比)
- 风格(质感,色调,颗粒)
- 负面约束(不要变形、不要多余肢体、不要文字水印)
示例:“四十岁男性,短发,细框眼镜,深灰针织衫,坐在窗边;缓慢转头看向镜头;清晨公寓室内,窗外有树影;中景,固定机位,85mm 压缩感;主光来自左侧窗户,柔光,色温 5200K;低饱和,轻微胶片颗粒。”
生成长度与镜头切分
一次生成三到五秒的片段,通常比一次生成十秒要稳。原因有两个:模型在长片段里更容易累积误差,而剪辑本身也需要切点。把十秒拆成三个三到四秒的镜头,你得到的是更可控的素材和更多的剪辑选择。
如何判断该用AI还是实拍
不是所有镜头都值得交给AI。判断标准可以简化为三问:
- 这个镜头需要精确的物理交互吗(倒水、开锁、握手)?如果需要且是画面重点,实拍更省事。
- 这个镜头里有长时间的人脸特写吗?如果需要细腻表演,实拍或真人素材更可靠。
- 这个镜头的核心价值是“想象力的可视化”吗(不可能的场景、历史场景、概念演示)?如果是,AI几乎是唯一选择。
混合流程往往是最优解:实拍关键人物与手部动作,AI 生成环境、空镜、转场与概念画面。
五、第四步:镜头连贯性与剪辑节奏
六种廉价但有效的衔接技巧
- 动作衔接:上一个镜头结尾是“抬手”,下一个镜头开头是“手落下”,观众会自动补全中间过程。
- 视线匹配:角色看向画面右侧,下一镜出现他看的东西。
- 遮挡转场:角色或物体从镜头前扫过,用遮挡瞬间切换镜头。
- 同色过渡:两个镜头的色调接近,切点几乎察觉不到。
- 形状匹配:圆形接圆形,线条接线条,视觉上形成呼应。
- 声音先行:下一镜的声音提前半秒进入,画面切换会变得顺滑得多。
节奏:镜头长度与信息密度
节奏不是“快就好”。判断标准是:这个镜头需要观众用多久才能读完信息?一个新场景的第一个镜头,通常需要更长时间让观众建立空间感;而同一个空间内的连续动作,可以切得更快。
一个可用的经验:信息型镜头(人物加环境加字幕)留三到四秒;纯动作镜头留一点五到二点五秒;情绪特写留两到三秒;空镜留一到两秒。整支片子的平均镜头长度控制在二点五到三点五秒,大多数观众不会疲劳。
用音轨当节拍器
先放一条参考音乐,把切点标在波形图上。你会发现原本“说不清哪里怪”的剪辑,一旦对齐鼓点,立刻顺畅了。注意不要每个切点都卡拍,那样会显得机械——让关键转折点卡拍,其余保持自然节奏。
六、第五步:声音设计——配音、音效与音乐
配音
AI 配音已经能覆盖大部分解说、口播与旁白需求。选音色时别只看“好听”,要看三件事:语速是否可控、停顿是否自然、情绪是否稳定。常见做法是先生成完整配音,再按配音节奏去调整画面长度,而不是反过来——因为调音频比调画面便宜得多。
如果片子有真人出镜且需要情感表达,优先用真人录音。口型对不上时,可以在剪辑里用侧脸、背影、遮挡镜头来规避。
音效的三层结构
- 环境层:空调声、雨声、街道远景车流。作用是让画面“有空间”。
- 动作层:脚步、衣物摩擦、杯子放下的轻响。作用是让动作“有重量”。
- 强调层:低频冲击、金属嗡鸣、短促的提示音。作用是引导注意力。
三层都有的镜头,观众会觉得“真实”;只有动作层的镜头,会觉得干;只有音乐没有环境音的镜头,会觉得飘。
音乐
音乐决定情绪走向。选曲时关注三点:起始情绪、峰值位置、结束方式。把音乐的情绪曲线与你的故事线叠在一起看,如果峰值出现在没有戏剧冲突的地方,就该换曲或重新剪。
混音的基本顺序
先对白,再音效,最后音乐。顺序反了会不断返工。大致思路是:对白保持在最清晰的位置,音乐在高频段给对白让路,环境音始终保持在“听得见但不注意”的音量。导出前一定要在手机扬声器和耳机上各听一遍——很多混音问题只在其中一个环境里暴露。
七、第六步:后期合成、画质提升与输出
画质处理
AI 生成的片段常见问题是分辨率不一致、细节偏软、有轻微闪烁。处理顺序建议:先去噪与稳定,再补帧,最后放大。顺序错了会把噪点一起放大。
- 降噪:针对暗部噪点,注意别把皮肤纹理一起抹平。
- 稳定:如果原镜头设计是手持感,适度保留晃动,不要做成完全静止。
- 补帧:把 24 帧素材补到 60 帧适合慢动作段落,但叙事段落保持原生帧率更有电影感。
- 放大:需要上大屏或做局部裁切时再用,放大后一定要检查眼睛、牙齿、文字边缘。
色彩统一
把不同来源的素材放进同一条时间线,最先暴露的问题就是“颜色不一体”。做法是:先给整条片子定一个基础校正(曝光、白平衡、对比),再用一个统一的风格层压在全部镜头上,最后对个别镜头做微调。不要逐镜头单独调色,那样会越调越乱。
字幕与信息层
字幕的三个实用建议:一行不超过 18 个汉字、出现在画面下方安全区内、停留时间不少于一点二秒。信息图、标题、角标要统一字号与位置,避免每个镜头都在跳。
输出规格
- 竖屏短视频:9:16,1080×1920,码率尽量高一些。
- 横屏长视频:16:9,1920×1080 或更高。
- 平台对封面的要求各不相同,建议同时导出一张不带字幕的干净帧作为备选封面。
八、常见错误与排查清单
| 现象 | 可能原因 | 处理方式 |
|---|---|---|
| 人脸在镜头间变化 | 参考图角度不足、特征词不固定 | 补参考图,固定特征词,改用图生视频 |
| 手指数量异常 | 手部占画面比例过大 | 缩小手部在画面中的占比,或改用遮挡构图 |
| 画面闪烁、纹理抖动 | 单帧细节过密、生成片段过长 | 减少画面细节密度,缩短单次生成长度,后期去噪 |
| 动作中途漂移 | 一个镜头里塞了多个动作 | 拆成多个镜头,每个镜头一个动作 |
| 场景比例失真 | 环境参考缺失、透视描述不清 | 补环境参考图,明确焦段与机位高度 |
| 声音与画面不同步 | 先剪画面后配声音 | 先定配音与音乐,再对齐画面 |
| 导出后画质下降 | 码率过低、经过多次压缩 | 从工程直接导出,避免中间转码 |
| 观众看不懂剧情 | 缺少建立镜头与因果衔接 | 在每个场景开头补一到两秒建立镜头 |
这张表可以贴在显示器边上。遇到问题时先查表,能省下大量盲目重新生成的时间。
九、团队协作、版本管理与资产沉淀
命名规范
建议格式:项目加镜号加版本。例如 coffee_shot03_v2。不要用“最终版”“最终版二”“真的最终版”这类命名,它们会在两周后毁掉你的下午。版本号只增不改,新版本另存。
目录结构
一个够用的结构:
01_script:概念、大纲、镜头表02_style:风格锚点、参考图、角色参考03_gen:原始生成素材,按镜号分文件夹04_edit:剪辑工程与导出05_audio:配音、音效、音乐06_output:成片与封面
审片与反馈
反馈要具体到镜号与字段。不要说“这段感觉不对”,要说“第 6 镜的色温偏冷,和第 5 镜的暖光冲突”。每次审片只提一轮意见,改完再看,避免多人同时改导致混乱。
提示词库
把跑通的提示词按类型归档:人物特写、空镜、产品、转场。三个月后,你的提示词库就是最有价值的资产,它比任何单个模型都更持久——模型会更新,你的结构不会。
十、常见问题解答
完全没剪辑基础,能做出可发布的AI视频吗?
可以,但建议把第一部片子的目标定低:30 秒、单一场景、无对白、只用音乐和字幕。把流程跑通一次,比一开始就挑战三分钟多场景叙事更有效。跑通之后再逐步加难度。
需要同时掌握很多个模型吗?
不需要全都精通。掌握“两类模型加一种工作流”就够用:一类擅长写实人物,一类擅长环境与风格。关键是知道什么镜头该交给哪一类,以及如何在剪辑里把它们接起来。
为什么生成的人物总是长得不一样?
八成是参考图和描述词没固定。检查三件事:参考图角度是否覆盖;特征词是否每次原样复制;是否在同一个项目里混用了不同模型的人物设定。
AI视频能做多长?
技术上可以很长,但建议按 30 到 60 秒一个单元来组织。超过这个长度,观众注意力与你的质量控制难度都会显著上升。长片更适合拆成系列短片,而不是一条超长视频。
一定要写分镜表吗?
如果只做 5 秒的测试片段,不用。但只要需要两个以上镜头之间存在因果关系,分镜表就是必需的。它不是束缚,而是让你在生成阶段少走弯路的工具。
声音重要到什么程度?
可以说,观众对“廉价感”的判断,一半来自声音。画面不错的片子配上干瘪的环境音,观感会瞬间掉档;而画面普通但声音层次完整的片子,观众往往觉得挺专业。
AI生成的素材能商用吗?
这取决于你使用的平台与模型的具体条款,也和素材来源有关,例如参考图是否拥有授权。在正式发布前,务必逐条确认授权范围,尤其是涉及人物肖像与品牌元素时。
每天只有一小时,怎么推进?
把任务切成固定单元:周一写镜头表,周二做角色参考,周三周四各生成两个镜头,周五剪辑与配音,周末审片与调整。固定节奏比灵感更可靠。
什么时候应该放弃一个镜头?
如果同一个镜头重做超过五次仍不满意,通常是这个镜头在脚本上就不成立——它可能信息量过大、动作太复杂,或者根本不需要存在。这时回到镜头表删掉或拆开它,比继续重新生成更划算。
最后提醒一句:模型会不断更新,今天最强的工具过一段时间可能就被替代,但“拆解创意、固定设定、控制一致性、设计声音、统一后期”这套流程不会过时。先把流程搭起来,再挑工具,你的作品会更稳,也更快。


