很多人第一次接触 AI 视频生成,都是从一句提示词、一段几秒钟的片段开始的。新鲜感过去之后,问题会一个个冒出来:同一个角色在不同镜头里换了脸,上一秒是黄昏下一秒变成正午,配音和口型对不上,素材堆了几十条却拼不出一支能发布的成片。这些问题的根源,通常不是模型不够强,而是缺少一套稳定的工作流。
本文不堆砌某一款平台的功能清单,而是给出一条从零基础练习到专业级交付的通用路径:怎么挑工具、怎么写分镜和提示词、怎么维持角色与场景的一致性、怎么处理音频、怎么筛选和迭代、怎么交付,以及哪些坑几乎每个人都会踩一次。
为什么“工作流”比“工具”更重要
工具会换,模型会更新,界面会改版,但工作流的骨架相当稳定。它把“创意—脚本—分镜—素材—音频—剪辑—交付”串成一条可以重复执行的流水线。有了流水线,你的产出就不再依赖某一次生成的手气;没有流水线,你永远停在“偶尔做出一条还不错的片子”的阶段。
初学者、进阶使用者与专业创作者的分水岭
| 维度 | 初学者 | 进阶 | 专业 |
|---|---|---|---|
| 关注点 | 单张画面是否好看 | 一条片子是否完整 | 能否稳定、批量、按规格交付 |
| 提示词 | 一句话描述 | 带镜头与光线描述 | 分镜级参数化提示词加版本记录 |
| 一致性 | 基本不考虑 | 用参考图维持角色 | 角色库、关键帧与光位表 |
| 音频 | 事后随便配一段音乐 | 配音与画面粗略对齐 | 音画节奏设计加口型修正 |
| 返工率 | 高且不可控 | 中等 | 低且可预期 |
| 交付 | 个人分享 | 平台发布 | 多规格成片、封面、字幕与工程归档 |
这张表最有价值的一列是“返工率”。专业创作者并不是生成得更多,而是废片更少。他们把不确定性尽量前移到策划阶段,让生成阶段只需要执行,不需要反复试错。
一条完整流水线包含哪五个环节
- 策划与脚本:确定目标受众、时长、发布平台规格与核心信息。
- 分镜与提示词:把脚本拆成镜头,为每个镜头准备画面描述、运镜、光线与音频备注。
- 素材生成与筛选:按镜头生成视频片段、关键帧与参考图,边生成边筛选,不要留到最后再挑。
- 音频与节奏:配音、音效、音乐,先确定时长节奏,再微调画面。
- 剪辑、调色与交付:时间线组装、统一质感、输出多规格成片。
新手最容易漏掉的一步
不是提示词,也不是剪辑,而是“标准”。在动手之前写下三句话:这支片子给谁看、看完要记住什么、交付成什么格式。这三句话会在后面每一个犹豫的瞬间替你做出决定——要不要保留这个镜头、要不要重做配音、要不要为了一个细节再生成十条。没有标准的人,会在无数个可选项里消耗掉全部耐心。
工具与模型选型:按任务挑,不按名气挑
先分清五类工具
- 文生视频:从文字直接生成画面,适合快速验证概念、做氛围镜头与空镜。
- 图生视频:用一张关键帧驱动运动,是维持角色与场景一致性的主力工具。
- 图像生成与局部重绘:产出角色设定图、分镜草图,或者修补某一帧里的瑕疵。
- 音频工具:配音、音乐、音效,以及口型同步与语音转字幕。
- 剪辑与合成:时间线剪辑、调色、字幕、多版本输出。
五类工具各司其职,不要指望某一款工具包办全部。最省时间的组合通常是:图像工具定造型,图生视频保证连续性,音频工具做对白与节奏,剪辑软件完成最终的呼吸感。
用小样测试替代道听途说
选型最有效的方法是自己做一次受控测试。选一个你真实需要的镜头,用同一段提示词、同一个参考图,在候选模型上各生成两条,只比较五个指标:主体稳定性、运动自然度、细节完整度(手、文字、眼睛)、可控参数数量、生成耗时。把结果记在一张表里,两天时间就能形成属于你自己项目的选型结论,比看十篇评测都可靠。
| 任务类型 | 优先看什么 | 常见问题 |
|---|---|---|
| 人物特写 | 面部稳定、皮肤质感 | 眼神漂移、五官融化 |
| 大场面远景 | 构图透视、氛围层次 | 建筑扭曲、比例失衡 |
| 动作镜头 | 运动连贯、镜头跟随 | 肢体粘连、速度忽快忽慢 |
| 产品展示 | 材质高光、文字清晰 | 标志变形、反光异常 |
| 对白镜头 | 口型同步、表情自然 | 下颌抖动、牙齿糊成一团 |
不要忽略“非生成”的那一半工具链
文件夹结构、命名规范、素材日志、版本备份,看起来不酷,却决定了你三个月后还能不能找回某个镜头的原始提示词。建议从一开始就使用统一的命名规则:项目名加镜号加版本加日期,并为每个镜头保留一份文字记录,写清提示词、参数、参考图与最终选择的理由。当你想把一个效果复用到下一条片子时,这份记录就是你的资产。
第一阶段:用一个三十秒的项目打基础
为什么是三十秒、单一场景、单一角色
新手最常见的选择失误,是一上来就做三分钟、多个场景、多个人物的短片。结果每个环节都出问题,却无法判断究竟是哪一环错了。第一个练习项目的目标不是作品,而是打通流程:三十秒、一个场景、一个角色、无对白或只有一句旁白、六到八个镜头。做完这一遍,你会清楚地知道自己的瓶颈在哪里。
分镜表的最小模板
| 镜号 | 时长 | 景别 | 画面内容 | 运镜 | 光线 | 音频 |
|---|---|---|---|---|---|---|
| 1 | 4s | 远景 | 清晨街道,薄雾,角色背影入画 | 缓慢推进 | 冷调晨光 | 环境声 |
| 2 | 3s | 中景 | 角色推开店铺的门 | 固定 | 室内暖光 | 门铃声 |
| 3 | 3s | 特写 | 手部把杯子放上桌面 | 微推 | 侧逆光 | 瓷器轻响 |
| 4 | 5s | 近景 | 角色抬头看向窗外 | 缓慢环绕 | 自然光 | 音乐进 |
这张表本身就是提示词的骨架。写分镜的时候顺手把光线和音频填上,生成阶段会省掉大量返工,剪辑阶段也不会因为找不到合适的过场镜头而卡住。
提示词的最小可用版本
一个能用的提示词至少包含六件事:主体与外观、动作与情绪、环境与时间、光线与色调、镜头与风格,以及一条明确的约束。新手常犯的错误是只写“一个女孩走在街上,电影感”,缺少动作、光线与镜头信息,模型只能靠猜,而猜出来的结果无法复现。
完成标准要提前写下来
- 角色在所有镜头中是否明显是同一人?
- 光线方向与色温是否前后一致?
- 镜头之间有没有节奏变化,还是全是同一景别?
- 有没有明显崩坏的帧(手、脸、文字)?
- 整片看下来,是否能在三十秒内传达一个完整的小情绪?
五项里做到四项,就可以进入下一个难度的练习。逐项打勾的过程,比反复重做整个项目更能提升能力。
提示词与镜头语言:把描述写成调度
五段式提示词结构
把提示词写成五段,顺序固定,以后只需要替换内容,不必每次重想结构:
- 主体:年龄、性别、服装、发型、气质、标志性道具。
- 动作:具体到身体部位与方向,例如“右手推门,身体微微前倾”。
- 环境:地点、时间、天气、周围物件与人群密度。
- 光线与色调:光源方向、软硬、色温、整体色彩倾向。
- 镜头与风格:景别、运镜、焦段感、质感参照。
顺序固定还有一个好处:当你需要做批量生成时,把第一到第四段固定,只替换动作与镜头,就能得到同一场景下的一组连贯镜头。
常用镜头词汇表
| 类别 | 常用词 | 使用场景 |
|---|---|---|
| 景别 | 远景、全景、中景、近景、特写、大特写 | 控制信息量与情绪距离 |
| 运镜 | 推、拉、摇、移、跟、升降、环绕、手持 | 控制节奏与代入感 |
| 角度 | 平视、俯拍、仰拍、过肩、主观视角 | 控制视角与人物关系 |
| 光线 | 顺光、侧光、逆光、轮廓光、柔光、硬光 | 控制氛围与立体感 |
把“她很难过”翻译成“近景,侧逆光,低垂的眼睑,肩部微微内收,镜头缓慢推近”,模型才有机会给出你想要的东西。这也解释了为什么同一句话在不同人手里效果差很多:差别不在形容词,而在于是否给出了可执行的调度。
负面约束与“不要什么”
负面提示词常常比正面提示词更救命。建议固定一组:多余的手指、面部变形、肢体粘连、文字水印、字幕、标志、镜头剧烈抖动、过度锐化、色彩断层。它们不保证每次都生效,但能显著降低废片比例,也让你的提示词在不同模型之间迁移时更稳。
一次只改一个变量
提示词调优最大的忌讳,是同时改三处再比较结果。把主体描述、光线、运镜分开测试,你才能知道哪一个词真正起了作用,并把它沉淀进自己的模板。长期来看,你积累的不是提示词,而是一套属于自己项目的“可复现参数”。
角色一致性与场景连续性:成片感的来源
观众判断一支片子是否专业,往往不是因为画面多华丽,而是因为角色没有换脸、光线没有跳变、道具没有凭空消失。这三点做到,即使画面朴素,也会被当成“像样”的作品。
建立角色卡
为每个主要角色准备一张卡:正面、四分之三侧面、侧面、背面参考图各一张,写清服装、发型、年龄感、肤色、常用道具,以及三种常用光位下的样貌。每次生成前先把角色卡挂上去,再写提示词,顺序不要颠倒。
关键帧驱动
更稳的做法是“先静后动”:先用图像工具产出符合分镜的静帧,把它作为首帧去生成运动。这样运动的起点是确定的,一致性大幅提升。需要精确落点时,可以同时给首帧和尾帧,让模型在两帧之间补运动,成片会顺畅得多。
分段生成的接缝处理
长镜头需要分段生成时,三个技巧最有效:
- 相邻片段保留零点五到一秒的重叠,剪辑时在重叠处对切。
- 每段都从同一张关键帧或上一段的最后一帧出发。
- 保持提示词前缀完全一致,只修改动作部分。
一致性检查清单
- 角色:脸型、发型、服装、配饰、身高比例。
- 场景:建筑朝向、家具位置、墙面颜色、窗外天气。
- 光线:光源方向、色温、阴影软硬、时间推进是否合理。
- 道具:杯子、手机、袋子有没有凭空出现或消失。
- 镜头:视线方向与运动方向是否遵循轴线,避免跳轴造成方向混乱。
音频层:配音、音效、音乐与口型同步
先定语速,再剪画面
配音是很多人的盲区。经验值:中文旁白大约每分钟二百二十到二百六十字,英文大约每分钟一百四十到一百六十词。先录出配音,量出每句时长,再按这个时长倒推镜头长度,画面节奏会立刻变得可信。反过来操作的代价,是要么画面被拉得很慢,要么配音被强行加速,听起来像机器人在赶时间。
音乐、音效、人声的分工
- 人声负责信息,必须清晰,压低配乐两到三分贝给它让位。
- 音效负责空间感,关门声、脚步、衣物摩擦声能让画面真正落地。
- 音乐负责情绪曲线,最有效的手法是在情绪转折处让音乐先进、画面后到。
口型同步的适用边界
口型同步在正面、稳定、光线均匀、嘴部无遮挡的镜头上效果最好。侧脸、遮挡、快速运动或大幅表情变化时容易失败。遇到这类镜头,改用画外音、背身镜头或手部特写,比硬修口型更省时间也更自然。
音画节奏:踩点与留白
把音乐波形打开,找出重音点,把镜头切换放在重音前一至两帧,观众会感到顺畅。同时记得留白:整片都塞满音乐会显廉价,在关键情绪前留一秒安静,比加十层音效都有效。
迭代与质量筛选:把生成变成可控实验
一次生成几条才合理
没有统一答案,但有一个判断标准:当你无法再说出这一条比上一条好在哪,就该停止。通常每个镜头三到六条足够,超出这个范围往往说明提示词或分镜本身有问题,继续生成只是重复同一个错误。
用记录表代替记忆
| 日期 | 镜号 | 提示词版本 | 改动点 | 参考图 | 结果评价 | 是否保留 |
|---|---|---|---|---|---|---|
这张表的真正作用不是流水账,而是让你发现规律。三次之后你会发现,废片八成集中在同样的两类问题上:主体描述互相冲突,或者运动幅度超出模型能力。
什么时候该重写提示词
出现以下信号,就该停下来重写而不是继续重试:连续三条都在同一个部位崩坏;画面风格与预期系统性偏离;运动方向始终不对;构图里主体总是从同一侧偏出画框。这些都是结构性问题,靠多生成几条解决不了。
三种最贵的浪费
- 反复生成同一镜头却不改任何变量,这是抽卡,不是创作。
- 直接删除不理想的片段。其中很多在剪辑里作为过场、插入镜头或反打镜头非常有用。
- 不做版本命名,导致最终成片用的素材找不到对应参数,无法复现与迭代。
剪辑与交付:从素材到可发布成片
粗剪先解决“讲清楚”
把可用片段按镜号顺序放上时间线,先不管转场和调色,只看两件事:信息是否讲清楚了,节奏是否拖沓。经验上,粗剪版本往往比预期长百分之三十,减掉冗余镜头是必经步骤,也是提升观感性价比最高的一步。
精剪处理节奏与呼吸
- 前五秒必须有钩子:一个动作、一句提问或一个反差画面。
- 中段每三到五秒给一次视觉变化:景别、角度或光线。
- 情绪高点前留半拍到一拍的静止,之后再加速。
调色与统一质感
素材来自不同模型,色调往往不统一。最省事的做法是加一层统一的色温与曲线调整,再给高光加一点同一色相,让整片看起来像同一台摄影机拍的。统一比漂亮更重要,因为观众会先感觉到“不协调”,再感觉到“不好看”。
交付规格清单
- 画幅:竖屏九比十六、横屏十六比九、方屏一比一,按渠道分别输出。
- 分辨率与帧率:1080p 起步,与素材帧率保持一致,避免插帧造成的抖动。
- 字幕:不超过两行,放在安全区内,字号在手机上一眼可读。
- 封面:单独制作,不要直接截首帧。
- 归档:保留工程文件、素材、提示词记录与最终成片。
常见错误与排查
| 现象 | 可能原因 | 处理方式 |
|---|---|---|
| 主体闪烁、边缘融化 | 提示词内部冲突,或运动幅度超出模型能力 | 简化提示词,缩短片段,改用图生视频 |
| 角色在不同镜头换脸 | 缺少统一参考 | 建立角色卡,从同一关键帧出发 |
| 画面像塑料 | 过度锐化、缺乏颗粒与景深 | 加入真实材质描述,后期补轻颗粒与暗角 |
| 手部异常 | 手部占画面比例小且快速运动 | 改为手部特写单独生成,或改用无手构图 |
| 音画不同步 | 先剪画面后配音,时长被迫拉伸 | 先配音量时长,再倒推镜头长度 |
| 整片哪里都对但不好看 | 缺少节奏变化与留白 | 重排镜头顺序,增加景别对比,删掉一个镜头 |
| 输出后画质下降 | 多次转码、码率不足 | 中间环节保持无损,仅在最终输出压缩一次 |
排查的基本原则是从上游找原因。一半以上的画面问题,答案在分镜和提示词里,而不在模型参数里。把镜头拆得更简单、把描述写得更具体,通常比换工具更有效。
常见问题 FAQ
完全没有剪辑经验,可以直接开始吗?
可以,但要先做两个减法:把项目规模压到三十秒以内,把镜头数压到八个以内。剪辑的基本功其实就是判断“这个镜头要不要”“这里要不要停一下”,做过三个小项目之后,你会比看十小时教程更懂节奏。
需要很强的电脑配置吗?
大多数生成任务在云端完成,本地主要负责剪辑与预览。真正需要的是稳定的网络、足够大的硬盘,以及一块能顺畅播放高码率素材的显卡。硬盘空间往往比显卡更早成为瓶颈,尤其是当你开始保存多版本素材之后。
一定要写英文提示词吗?
不是必须。多数工具中英文都能识别,但当你需要精确的镜头术语和材质描述时,英文关键词往往更稳定。实用做法是用中文构思内容,用英文关键词补充镜头、光线与材质描述,两者结合最省事。
为什么我的片子看起来总有 AI 味?
常见来源有三个:镜头缺少运动、光线过于均匀、剪辑没有节奏。解决办法很具体:给每个镜头安排一个明确运动,把均匀打光改成一个方向明确的主光,切镜头时踩在音乐重音上。修正这三点,观感通常会有明显变化。
如何让系列内容保持统一风格?
建立风格包:固定的色板、固定的景别组合、固定的开场与转场方式、固定的字幕样式与配乐风格。把风格包写成一段文字,每次生成都把它放进提示词,久而久之会形成稳定的辨识度。
多久可以从新手到稳定产出?
以每周完成一个三十秒小项目计算,一两个月就能明显感到废片率下降;三到六个月可以稳定产出结构与节奏都成立的作品。关键变量不是生成数量,而是每次是否记录了改动与结果。
一个镜头反复失败怎么办?
先换思路:改景别、改角度、改时间点,或者干脆把这个镜头拆成两个更简单的镜头。绕开比硬碰更专业,因为你在优化的是成片,而不是某一个镜头的完美度。
落地清单:把流程跑起来
- 写下三句标准:给谁看、记住什么、交付什么格式。
- 选一个三十秒、单场景、单角色的练习题目。
- 做一张分镜表,填满景别、运镜、光线、音频四列。
- 为角色做一张参考卡,固定服装与常用光位。
- 用受控测试挑出两到三个主力生成工具。
- 建立素材命名与记录表,保留所有提示词版本。
- 先完成音频,再倒推镜头长度。
- 粗剪看逻辑,精剪调节奏,调色统一质感。
- 按渠道输出多规格成片与独立封面。
- 归档工程与提示词,写下这次踩到的坑,作为下一次的起点。
工作流听起来枯燥,但它带来的是自由:当流程稳定之后,你才有多余的注意力去关心真正重要的东西——讲什么故事,以及怎么让人愿意看到最后。


