引言:把「找一个最强模型」换成「搭一条能复用的产线」
很多创作者第一次接触 AI 视频,思路是先去寻找那个「最强模型」,然后把它当成唯一工具。结果往往是这样:第一条片子惊艳,第十条片子开始崩坏,第三十条片子已经无法按时交付。问题通常不在模型本身,而在于缺少一条稳定的工作流。
AI 视频生成目前还没有出现能同时解决构图、运动、一致性、时长、声音与后期的单一方案。不同模型在不同任务上的表现差异极大:有的擅长写实人物特写,有的擅长动漫与插画风格,有的在镜头运动上更稳,有的对复杂中文提示的理解更准确。把这些能力拼接起来,比押注单一工具更可靠,也更容易在需求变化时替换零件。
这篇文章不打算评判谁「最强」,而是给出一套可以直接照着执行的中文创作工作流:从需求拆解、模型分工、提示词结构、角色一致性,到剪辑衔接、算力预算、故障排查与团队协作。你可以把它当成一份可以长期放在手边、随时翻阅的操作手册。
第一步:先定义成片标准,再去挑工具
大多数失败的项目不是败在生成环节,而是败在需求从未被写清楚。在打开任何一个生成工具之前,先用文字把成片标准写下来。
交付平台决定基础参数
竖屏短视频(抖音、快手、视频号、Shorts 类):1080×1920,30fps,单镜头 2 至 4 秒,镜头切换快,前 3 秒必须出现视觉钩子。
横屏品牌片或预告片:1920×1080 或 3840×2160,24fps 更有电影质感,30fps 更适合信息密度高的内容。单镜头 3 至 6 秒,允许长镜头呼吸。
方屏与信息流素材:1:1 或 4:5,适合电商主图视频和投放素材,主体必须保持在中央安全区。
一份可以直接复制使用的规格表
把下面这些字段填满,再开始生成:
- 分辨率与宽高比:9:16 / 16:9 / 1:1,并写明最终交付上限。
- 帧率:24 / 25 / 30 / 60,注意后期变速时的插帧需求。
- 单镜头时长:平均几秒,最短几秒,最长几秒。
- 总时长:成片目标秒数,以及允许的浮动范围。
- 镜头数量:由总时长除以平均镜头长度估算。
- 运动强度:静止微动 / 缓慢推拉 / 手持晃动 / 高速运动。
- 人物出现方式:全景、中景、近景、特写的比例。
- 字幕与包装:是否有字幕条、下三分之一、LOGO 角标。
- 声音:是否需要人声配音、环境音、音效、配乐。
- 交付格式:MP4 / H.264 或 H.265,码率上限,是否需要无字幕版本。
用出片率反推生成量
出片率是整个工作流里最容易被低估的数字。新手常常以为生成 10 段就能用 10 段,实际可用率通常在 20% 到 40% 之间。假设成片需要 20 个可用镜头,按 25% 的出片率计算,你至少要准备 80 段素材。把这句话写在项目文档最上方,它会直接决定你的时间与算力预算。
第二步:给模型分工,而不是让一个模型包打天下
当你知道自己需要什么之后,接下来是决定每个环节交给谁。生成式视频的环节可以拆成五块:关键帧图像、图生视频、文生视频、声音、后期修复与放大。
关键帧与美术设定交给图像模型
视频的一致性问题,八成可以在图像阶段提前解决。用图像生成工具(Stable Diffusion 系列、Flux 系列、Midjourney 等)先产出角色设定图、场景概念图、关键帧构图。这一步成本低、迭代快,改十版也不心疼。关键帧质量高,后续视频模型的工作量会明显下降。
实用做法:为每个主要角色出一张正脸、一张侧脸、一张全身、两张不同情绪的表情图,放在同一个文件夹里,命名为角色名加编号。这套图会在后面所有环节反复使用。
图生视频用于可控镜头
需要精确控制构图、人物位置、产品外观的镜头,优先使用图生视频。上传关键帧,描述运动方式,模型只负责让它动起来,构图风险大幅降低。产品广告、人物对话、固定机位的镜头都属于这一类。
文生视频用于创意探索与空镜
文生视频(如 Runway、Pika、Luma、Kling、PixVerse、Sora 类工具)适合两类场景:一是导演还没想清楚画面长什么样,需要快速看十几个方向;二是空镜、环境镜头、转场素材。这类镜头即使细节有瑕疵,也容易在剪辑中被遮住或快速带过。
声音环节独立处理
不要指望视频模型直接产出可用的中文配音。正确的顺序是:先定稿画面与字幕,再用语音合成工具(如 ElevenLabs、Azure 语音、国内主流 TTS)生成配音,最后在剪辑软件里对齐时间轴。环境音与音效从音效库挑选,比让模型凭空生成更可控。
后期修复与放大的固定动作
- 放大与增强:Topaz Video AI、Upscayl、Real-ESRGAN 类工具,用于把 720p 素材提升到 1080p 或 4K。
- 稳定与去闪烁:达芬奇(DaVinci Resolve)的稳定器与降噪节点。
- 抠像与合成:After Effects 或达芬奇的魔术遮罩。
- 变速与补帧:达芬奇的光流变速,或专门的补帧工具。
把每个环节的工具固定下来,团队里每个人都知道素材该往哪里走,返工率会显著下降。
第三步:写出可复现的提示词结构
提示词不是咒语,而是一份规格说明。它的目标是让另一个人、或者三个月后的你自己,能够复现同样的画面。
五段式结构
一段可靠的视频提示词通常包含五个部分:
- 主体:谁或什么。包含年龄、服装、材质、显著特征。
- 动作:正在发生什么。用动词,避免抽象形容词。
- 环境:地点、时间、天气、背景元素、光线来源。
- 镜头:景别、机位、运动方式、焦段感、景深。
- 风格与画质:影像风格、色调、颗粒感、参考年代感。
示例模板:
「一位三十岁上下的女性咖啡师,深蓝色围裙,袖口卷起,双手将奶泡倒入白色陶瓷杯;清晨靠窗的吧台,侧逆光从左侧窗户进入,木质台面有细微反光;中近景,摄影机缓慢向右平移,浅景深,背景虚化;写实电影质感,暖色调,轻微胶片颗粒,35mm 镜头感。」
镜头语言要用模型能懂的词
模型的训练数据里,镜头词汇的密度并不均匀。以下词汇通常更稳定:慢速推近、缓慢拉远、向右平移、环绕主体、固定机位、低角度仰拍、俯视、过肩视角、手持轻微晃动。
相对容易失控的表述:镜头飞旋、极速环绕、瞬间切换视角、多镜头连续变化。想要复杂运镜,最稳妥的办法是拆成两个镜头,在剪辑里接起来。
否定提示的正确用法
否定提示应该用来排除结构性问题,而不是用来堆砌形容词。有效的例子:不要文字、不要水印、不要多余手指、不要脸部扭曲、不要画面分裂、不要出现第二个主体。
无效的例子:不要难看、不要廉价、不要奇怪。这类词模型无法映射到具体像素。
提示词长度与参数
太短会失控,太长会互相冲突。经验值是把主体、动作、环境、镜头各写一句,风格写一句,总共四到六句。运动强度参数从中等开始,不要一上来就拉满。种子值固定后,只改一个变量做 A/B 测试,这样才能知道是哪个词在起作用。
第四步:用参考图与首尾帧解决角色一致性
「同一个人出现在五个镜头里,每个镜头长得都不一样」是 AI 视频最常见的投诉。解决办法不是反复重生成,而是用工程手段锁定一致性。
建立角色设定图集
为每个角色准备固定的参考图集:正面、四分之三侧、侧面、背面、全身、半身,以及两到三种情绪状态。所有图使用同一背景、同一光线、同一色调。图集越统一,模型输出的稳定性越高。
首尾帧衔接法
想做长一点的连续动作时,可以先确定起始帧和结束帧两张图,再让模型在两者之间插值生成。这样既能控制起点和终点,也能让运动方向符合预期。适合开门、转身、拿起物品、坐下这类有明确起止的动作。
风格锁定
如果使用本地部署方案(如 ComfyUI 或 Automatic1111 类界面),可以为角色训练小型风格适配模块,或者用 IP-Adapter、ControlNet 之类的条件控制输入参考图。云端工具则更多依赖「参考图 + 角色描述」的组合,需要在提示词里反复强调同一组特征词,例如「深蓝色围裙、左手腕银色手表、右眉上小痣」。
服装与道具清单
把角色涉及的服装、配饰、道具列成清单,并且固定描述词。不要今天写「红色外套」,明天写「酒红色夹克」。模型不理解这两个是同一件衣服。
场景一致性同样重要
同一场景的多个镜头,要在提示词里复用同一组环境描述:同一扇窗的位置、同一盏灯的光向、同一张桌子的材质。可以先把场景图生成出来,之后所有该场景的镜头都以这张图为参考。
第五步:按可剪辑的标准生成素材
生成阶段就要为剪辑做打算,否则后期会非常痛苦。
多生成一到两秒
每个镜头多生成 1 到 2 秒的余量。剪辑时需要留手,入点和出点都要有可调整空间。尤其是运动镜头,前几帧往往还在「预热」,起幅不干净。
保持运动方向一致
相邻镜头如果运动方向相反,观众会感觉突兀。同一个段落里的镜头,尽量保持相似的运镜方向,或者使用明确的匹配剪辑:人物向左走出画面,下一镜头从左侧进入。
转场素材单独准备
准备一批专用转场镜头:快速甩镜、遮挡物划过、光线闪白、水面溅起、镜头穿过门框。这些素材可以反复用于不同项目,是很划算的资产。
节奏表
把成片按时间轴拆成段落,标出每段的情绪与节奏:开场钩子、问题呈现、方案展开、证明、行动号召。按节奏表去安排镜头长度,比事后再硬剪要高效得多。短视频的前三秒建议用最强画面,不要用片头动画。
第六步:算力、时间与预算的排布方式
生成式视频的成本结构与传统拍摄不同:它消耗的是算力与时间,而不是场地与人头。
先做低成本抽样
正式批量生成之前,先用低分辨率、短时长、低运动强度的参数跑五到十段测试。确认构图、人物、风格方向都对了,再切换到高参数批量生产。这一步能省下大量重复渲染。
云端与本地混合
日常探索、风格测试、批量空镜可以放在本地显卡上跑,成本固定且不受排队影响。需要最高画质的关键镜头、或者要调用特定云端模型能力时,再用云端服务。把「哪种镜头走哪条路」写进流程文档。
渲染队列安排
- 把无脑批量任务放在夜间或空闲时段。
- 把需要人工判断的关键镜头安排在工作时段,方便即时调整。
- 同一批任务使用相同的参数组合,避免变量混乱。
- 记录每次生成的参数、种子和结果,建立可追溯的日志。
时间预算示例
一个 60 秒的竖屏短片,20 个镜头,出片率按 25% 计算:
- 前期策划与规格表:半天到一天。
- 角色与场景参考图:一天。
- 视频生成与筛选:两到三天(含排队与重跑)。
- 配音、音效、剪辑、调色:一天到一天半。
- 审片与修改:半天到一天。
总计约五到七个工作日。如果压缩到两天,通常牺牲的是一致性和声音质量。
第七步:常见故障与排查顺序
遇到问题时,不要盲目重跑,按顺序排查效率更高。
画面抖动与闪烁
原因通常是运动强度过高、帧间一致性不足,或分辨率与运动幅度不匹配。处理方式:降低运动强度参数、缩短单镜头时长、开启模型的稳定相关选项,后期再用稳定器与去闪烁处理补救。
人物形变与手指崩坏
近景与特写最容易暴露问题。处理方式:把人物放在中景或全景、给手部明确动作描述(例如「双手自然垂放」而不是「手在比划」)、避免手部遮挡面部、关键近景改用图生视频并上传高质量关键帧。
背景元素乱入
提示词里缺少环境约束时会频繁出现。补上环境描述,并在否定提示中排除不需要的元素。如果背景变化对叙事无影响,也可以在后期用遮罩与合成替换。
文字与字幕崩坏
不要在生成阶段让模型产出文字。正确做法是生成干净画面,文字全部在剪辑或设计软件里添加。如果画面里必须有招牌、包装、屏幕文字,用图像工具先做好贴图,再合成。
音画不同步
先确认画面素材的帧率是否统一。混用 24fps 与 30fps 素材是最常见的元凶。统一转码后,再对齐配音与口型节奏。若人物有说话动作,尽量缩短正面讲话镜头的时长,用切镜或背影规避口型问题。
速度突变与动作跳跃
多出现在长动作被切成多段生成时。处理方式:分段之间保留重叠区间,剪辑时在重叠区找最佳切点;或者用首尾帧衔接法保证段落之间的连续性。
第八步:团队协作、版本管理与合规
个人创作可以随意,团队创作必须留下痕迹。
命名规范
建议格式:项目名_场景编号_镜头编号_版本号。例如「咖啡短片_S02_SH05_v03.mp4」。不要用「最终版」「最终版2」「真的最终版」这类命名。
素材库结构
- 01_策划:规格表、脚本、节奏表。
- 02_参考图:角色、场景、道具。
- 03_生成素材:按场景分文件夹,保留原始输出。
- 04_声音:配音、音效、配乐。
- 05_工程:剪辑工程文件与调色节点。
- 06_交付:成片、无字幕版、竖屏与横屏版本。
审片节点
设置三个固定审片点:参考图确认、粗剪确认、终版确认。每个节点只允许一次集中反馈,避免反复推翻方向。
素材授权与合规
使用商业素材库、字体、音乐时,确认授权范围是否覆盖投放渠道。涉及真实人物形象、品牌标识、受保护角色的内容,需要在发布前做合规检查。生成内容若用于广告投放,建议保留生成参数与素材来源记录。
第九步:一份可以直接套用的执行清单
把下面这份清单打印出来,每个项目走一遍:
- 成片规格表已填写完整。
- 镜头数量与出片率已估算。
- 角色与场景参考图已确认。
- 每个镜头的提示词已写好并归档。
- 关键镜头已确定使用图生视频。
- 测试批次已通过,参数已锁定。
- 生成日志已记录种子与参数。
- 素材命名符合规范。
- 配音与音效已准备就绪。
- 剪辑节奏表已对照检查。
- 字幕与包装在剪辑阶段添加。
- 交付版本包含无字幕与多宽高比版本。
常见问题 FAQ
一定要同时用多个模型吗?
不一定。如果你的内容风格单一、镜头简单、发布频率不高,一个稳定的模型加一套固定的提示词模板就够用。当你开始遇到「某个镜头怎么都做不出来」的情况时,再引入第二个模型专门解决这类问题。
新手应该从哪个环节开始练?
从参考图开始。图像生成成本低、反馈快,能最快建立对构图、光线、风格的理解。图像能力提升后,视频环节的难度会明显下降。
为什么同一个提示词,今天和昨天的结果不一样?
云端服务会更新模型权重与推理参数,同一提示词的结果可能随时间变化。解决办法是固定种子、保存参数记录,并把满意的结果立即下载归档,不要只依赖云端历史记录。
长视频能不能一次生成完成?
目前更可靠的做法是分镜生成再剪辑拼接。单次生成的长片段容易出现中途形变、运动漂移和叙事失控。把长视频拆成 3 到 6 秒的镜头,是行业里更常见的做法。
如何让画面更有电影感?
三件事最有效:控制景深与焦段感、统一色调、让摄影机运动有明确的动机。避免让摄影机无意义地一直旋转。缓入缓出的运动、合理的前景遮挡、以及有来源的光线,都能明显提升质感。
中文提示词和英文提示词哪个更好?
取决于模型。部分模型对中文语境和中文专有名词理解更好,部分模型在英文提示上的稳定性更高。建议用同一画面分别测试,把表现更好的语言固定下来,团队内统一。
生成素材需要做二次修复吗?
大多需要。放大、降噪、稳定、轻微锐化几乎是标配流程。但注意不要过度处理,反复放大与锐化会让画面出现塑料感,反而降低可信度。
怎样判断一个镜头该重做还是该修?
看问题是否涉及结构性错误。人物身份错误、动作完全不对、构图崩坏,属于结构性问题,建议重做。轻微抖动、边缘瑕疵、色彩偏差,属于可修复问题,交给后期。
团队里没有专职剪辑怎么办?
优先保证素材质量与统一规格,剪辑难度会大幅下降。把节奏表写清楚,按节奏表拼接,即使剪辑经验有限,也能产出结构完整的内容。
结语:稳定产出来自流程,而不是运气
AI 视频生成看起来像一场关于模型能力的竞赛,但真正决定产出质量的,是流程的稳定程度。定义清楚成片标准、给不同环节分配合适工具、写出可复现的提示词、用参考图锁定一致性、按可剪辑标准生成素材、提前安排算力与时间、建立故障排查顺序——这些动作单独看都不复杂,组合起来却能把「碰运气」变成「可交付」。
下一次开始新项目时,不要先打开生成工具。先打开文档,写完成片规格表。这一步花掉的一小时,通常能省下后面的一整天。

