Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

AI视频生成工作流完整指南:从分镜、提示词到角色一致性与成片发布

Sep 22, 2026

工作流优先:为什么顺序比模型更重要

大多数人接触AI视频的第一件事,是打开工具列表比较哪家画质最好。这个顺序是反的。模型只是流水线上的一个环节,而真正决定成片质量的,往往是它前后的步骤:分镜是否清晰、参考素材是否统一、提示词有没有把变量拆开、后期是否把镜头缝合起来。

把AI视频当成一条生产线来看,会得到稳定得多的结果。一条完整链路至少包括:创意与脚本 → 分镜与时长设计 → 提示词与参考素材 → 模型生成 → 素材筛选 → 后期剪辑与声音 → 发布与数据反馈。任何一个环节缺失,都会在后面以“画面乱飘”“人物换脸”“节奏散掉”的形式暴露出来。很多创作者以为是模型不行,其实是流程缺了一环。

模型的可替换性比想象中高。今天某个模型擅长写实,过几周另一个在动画风格上更强,这类变化几乎每个月都在发生。如果你的工作流把模型当成可插拔的组件,那么更换模型只是换一个渲染器;如果把全部希望押在某个模型上,每次技术更迭都意味着重做一遍。

还有一个容易被忽略的成本:切换模型的隐性代价。同一份提示词在不同模型上的反应并不相同,有的对镜头语言敏感,有的对光线描述更敏感。如果你没有把自己的提示词结构固定下来,换模型就等于重新学习一遍写作方法。所以在讨论“用哪个模型”之前,先把自己的流程和语言固定下来。

本文按“工作流优先”的顺序展开:先讲怎么把创意拆成可执行的分镜,再讲提示词怎么写、模型怎么挑、一致性怎么保住,最后落到批量生产、后期与发布。

第一步:把创意拆成可执行的分镜脚本

AI视频最常见的失败不是画面不美,而是画面不听话。而“不听话”的根源,通常在于脚本层面就没有把动作说清楚。写一份分镜表,是把模糊创意变成可执行指令的最低成本手段。

分镜表至少要包含哪些字段

一份能直接喂给生成工具的分镜表,建议至少包含以下字段:镜头编号、时长、景别(远景/中景/近景/特写)、画面主体、主体动作、镜头运动、环境与光线、音频或对白、与前一个镜头的衔接方式。字段不必多,但“主体动作”和“镜头运动”必须分开写,因为它们对应提示词里两个不同的控制维度。

一个反例是“主角在一个很酷的场景里做很酷的事”。这句话无法生成任何稳定的画面。一个正例是“中景,一位穿深灰色风衣的男性从画面左侧走入,停在路灯下抬头看,镜头缓慢向右平移,夜晚,暖黄路灯,地面有湿反光,轻微雾气”。第二种写法把摄影师需要的信息全部交代清楚了。

用“最小可行动作”代替抽象描述

一个镜头里塞进三个以上动作,模型通常会选择性忽略其中两个,或者把它们揉成一团。把复杂动作拆成多个镜头:推门、走进、坐下、抬头,每个镜头承担一个动作。这样不仅生成更稳定,剪辑时也更容易调整节奏。

如果必须在一个镜头里表现连续动作,就明确主次:把最重要的动作写成句子的主干,其余作为环境描述。动作的幅度也要写出来,“缓慢转身”和“猛地转身”完全是两种结果。

时长预算与节奏设计

生成模型对单段时长通常有上限,常见区间是几秒到十几秒。与其硬凑长镜头,不如按节奏拆:开场用一个两到三秒的强视觉镜头抓住注意力,中段用五到八秒镜头承载信息,情绪高点可以给一个八到十秒的缓慢运镜。

在写脚本阶段就把每段时长标出来,可以避免后期发现素材长度不够、只能靠放慢速度硬撑的尴尬。一张几十行的分镜表,能省掉几百次无效生成。

音频与对白的预留

如果成片需要旁白或人物对白,在分镜阶段就标出每句话落在哪个镜头。AI生成的口型与语音很难精确对齐,务实做法是把关键台词放在画外音或背影镜头里,把对白密集的部分交给后期处理。提前规划,可以避免后期为了对口型而反复重生成。

第二步:提示词工程,把画面拆成可控变量

提示词不是咒语,而是一份规格书。好的提示词让人一眼看出画面里有什么、在动什么、镜头怎么走、光从哪来。

六层结构:主体 / 动作 / 镜头 / 光线 / 材质 / 风格

把提示词按六层组织,写作时逐层填充,排查问题时也能逐层删除:

  • 主体层:人、物、场景的身份与外观特征
  • 动作层:主体在做什么,幅度与速度如何
  • 镜头层:景别、机位高度、运动方向与幅度
  • 光线层:光源类型、方向、色温、时间与阴影
  • 材质层:皮肤纹理、布料、金属、水面的表面质感
  • 风格层:写实、胶片、广告感、动画、纪录片等整体影像语言

示例:主体=三十岁女性,短发,米色针织衫;动作=缓慢转身并微笑;镜头=中近景,轻微手持晃动,缓慢推近;光线=清晨侧逆光,柔和阴影;材质=皮肤自然纹理,针织纹理清晰;风格=写实广告片质感。

六层结构最大的好处是可复用。做一个新项目时,你只需要替换主体层和动作层,其余四层可以直接沿用上一个项目里已经验证过的描述。

负向提示词与排除项

负向提示词的作用是提高下限,而不是提高上限。常见需要排除的内容包括:画面中出现文字或水印、多余的手指或肢体、面部变形、镜头剧烈抖动、过度锐化、塑料感皮肤、不自然的慢动作。把反复出现的问题写进排除项,比每次重新描述更省事。

需要提醒的是,排除项不要一次性堆几十条。排除项太多会让模型变得保守,画面也会失去活力。按项目出现的实际问题逐条添加,才是最有效的做法。

参考图与首尾帧的用法

文字描述永远无法覆盖全部视觉信息,用参考图可以快速锁定风格和角色。三种常见用法:一是风格参考,用一张图定义色调和质感;二是角色参考,用同一人物的多角度照片锁定脸部;三是首尾帧,给定起始画面和结束画面,让模型补出中间的运动过程,这对控制运镜和物体位移尤其有效。

使用参考图时要注意一致性:如果同一场景的三个镜头分别用了三张色调不同的参考图,结果一定会跳色。建议为每个场景只固定一到两张参考图,并在整个项目里沿用。

提示词的迭代节奏:一次只改一个变量

这是提高效率最重要的习惯。同时改五个词,你无法知道是哪个词带来了改善。建议的迭代顺序是:先固定风格与光线,再调整主体外观,再调整动作幅度,最后微调运镜。每一轮只改一处,保留能用的结果并记录有效短语,几轮之后你会拥有一份属于自己的短语库。

这份短语库的价值会随时间复利增长。它是你的私人说明书,比任何公共提示词模板都更贴合你的题材和审美。

第三步:模型选择的决策框架

模型没有绝对强弱,只有适配与否。选择时可以按四个维度打分:画面类型、一致性能力、单段时长、生成速度与成本。

按画面类型选模型

写实人像、产品特写、自然风景、动画风格、二维插画、超现实概念图,这几类画面在不同模型上的表现差异很大。务实做法是:用同一个提示词在三个候选模型上各生成一次,直接比较结果,而不是看宣传片。测试时固定参数,才有可比性。

测试样本不要超过三组:一组人物近景、一组物体运动、一组环境镜头。三组做完,基本就能看出这个模型在你的题材上是否可靠。

按一致性与镜头长度选模型

如果项目需要同一个角色跨多个镜头出现,优先选择支持角色参考、首尾帧或视频续写的模型;如果项目以短平快的素材为主,可以更看重生成速度和批量能力。长镜头一致性通常是成本最高的能力,不要为不需要它的项目买单。

生成成本、速度与迭代次数的权衡

真正决定预算的不是单次生成的价格,而是“可用率”。一个便宜但十次只有一次能用的模型,实际成本高于一个贵但三次就出片的模型。评估时记录两组数字:平均每个可用镜头需要生成几次、每次生成需要等待多久。把这两个数字乘起来,才是你的真实生产效率。

举例来说,A 方案每次生成很快但平均要试八次,B 方案慢一倍但平均两次就够用。算下来 B 的总耗时通常更短,而且你的注意力消耗也更低,后者在长项目里往往比时间更宝贵。

多模型混合使用的策略

成熟的做法不是只用一个模型,而是分工:用擅长写实的模型做人物镜头,用擅长风格的模型做概念镜头,用擅长运动的模型做动作镜头。统一它们的方式是后期调色和统一的提示词风格描述。只要风格层描述一致,混用模型的画面差异通常可以在剪辑和调色阶段被抹平。

第四步:角色与风格一致性

一致性是AI视频里最容易翻车、也最能体现专业度的地方。观众记不住你的运镜,但一定会发现主角在第二个镜头里换了张脸。

建立角色设定表

为每个主要角色写一份设定表:年龄、脸型、发型、发色、瞳色、常穿服装、标志性配饰、体态特征、说话时的习惯动作。这份表既是提示词的素材库,也是团队协作时的沟通依据。设定越具体,不同镜头之间的偏差越小。

一个实用技巧是给角色设置一个“视觉锚点”,比如始终戴着同一副眼镜、同一枚戒指或同一件外套。当脸部出现轻微漂移时,观众的注意力会被锚点稳定住。

参考图、人脸锁定与多角度素材

准备角色的正面、侧面、四分之三角度、全身和半身素材各若干张。生成时优先使用带角色参考的功能,其次是用详细文字描述加相同风格参考。需要注意的是,参考图质量比数量重要,模糊或光线混乱的照片会把偏差带进结果。

场景与色调的一致性

角色一致只是第一步,场景一致同样重要。为每个场景固定:主光源方向、色温、时间、天气、地面材质。如果同一个场景在不同镜头里一会儿冷蓝一会儿暖黄,观众会立刻感到跳脱。后期调色可以小幅修正,但无法拯救方向完全相反的布光。

分段生成加后期修补

不要指望一次生成完美镜头。更可靠的流程是:先生成结构正确的版本,再针对有问题的局部重新生成或用后期修补。例如人物动作正确但背景飘移,就保留人物部分,在剪辑中用放大或局部处理的思路解决背景问题。

第五步:镜头运动、物理合理性与画面稳定

常见运动指令的写法

镜头运动有相对固定的词汇:推(缓慢靠近主体)、拉(远离主体)、摇(水平旋转)、移(平行移动)、跟(跟随主体移动)、升降(垂直移动)、环绕(围绕主体旋转)、手持(轻微不规则晃动)。写提示词时把运动方向和幅度都写出来,例如“缓慢向右平移,幅度小”,比只写“镜头运动”有效得多。

物理合理性的常见失败

AI视频在物理上最常出问题的地方包括:液体流动不符合重力、物体碰撞没有反馈、布料和头发运动僵硬、多人接触时肢体穿插、镜面与水面反射错误。规避方法是减少复杂性:少用高速动作,避免多个物体同时交互,把复杂动作交给短镜头加剪辑来表现。

手部、文字、反射与快速运动

这四类内容是当前模型的共同弱项。可行策略包括:让手离开画面或处在阴影中;把文字信息留给后期字幕而不是让模型生成;用固定机位减少反射变化;把快速运动拆成两个镜头,中间用剪辑衔接。这些处理听起来像妥协,但在成片里几乎看不出来。

用首尾帧约束运动

当需要精确控制物体的位置变化时,首尾帧是最直接的手段。给定起始和结束画面,模型只需要补中间过程,运动轨迹会稳定得多。这在产品展示、转场设计和特效镜头里尤其有用。

第六步:批量生成与任务管理

当项目从“试一个镜头”变成“做一支片子”,管理能力就变成了瓶颈。

队列、并发与失败重试

批量提交任务时,把镜头按优先级排序:先做关键镜头,再做填充镜头。对失败的任务设置自动重试,但重试次数要有上限,避免把时间耗在本身提示词就有问题的镜头上。如果连续两次失败,先改提示词再重试,而不是继续等运气。

版本命名与素材归档

一个简单但极其有效的规则:文件名包含项目、镜头号、版本号、日期和参数摘要,例如“项目-镜头号-版本-景别-参考图编号”。三周后回头看素材时,你会感谢自己。归档时按“可用”“备选”“废弃”分文件夹,不要让可用素材淹没在几百个文件里。

素材筛选:保留率与可用率

建立一个简单的记录表:每个镜头的生成次数、可用次数、最终采用版本。几周后你会清楚看到哪类提示词效率高、哪个模型在你的题材上更稳。这些数据比任何评测文章都更贴合你的实际需求。

团队协作与评审流程

多人协作时,把分镜表作为唯一事实来源:谁负责哪个镜头、当前状态(待生成/生成中/已选中/已定稿)、评审意见。避免用聊天工具传素材,因为版本会失控,而且没人知道哪一版才是最新的。

存储与备份

生成素材的体积通常比想象中大,尤其是高分辨率的多版本输出。建议项目中期和交付后各做一次完整备份,并保留一份精简的“成片素材包”,只包含最终采用的文件、对应提示词和参数记录。下一个项目启动时,这份素材包就是最省时间的起点。

第七步:后期制作,把素材变成成片

生成只是半成品,成片质量的一半来自后期。

剪辑节奏

AI素材通常缺少自然的呼吸感,所以剪辑要比常规素材更主动。开场前两秒必须有视觉钩子;每个镜头切点落在动作完成或视线转移的位置;不要因为是“AI生成的”就舍不得剪短。观众不会心疼你的生成次数,他们只会离开。

色彩匹配与画质修复

不同模型、不同镜头之间的色温和对比度差异,用统一的基础调色(白平衡、对比、饱和度、轻微颗粒)可以明显拉齐。画质方面常用处理包括:降低噪点与闪烁、轻微锐化、必要时提升分辨率。注意不要过度锐化,那会让AI痕迹更明显。

配音、音乐与音效

声音是提升质感最快的手段。人声配音、环境音、动作音效三层的组合,可以让画面里的瑕疵被忽略。音乐选择上,节奏点尽量与剪辑点对齐;如果找不到合适的配乐,先用简单节拍器对齐节奏,再替换成正式音乐,效率会高很多。

字幕与本地化

字幕既能传递信息,也能掩盖口型与文字的瑕疵。做多语言版本时,优先保持画面无文字,把文字全部放在后期,这样一套素材可以复用到多个市场。

导出设置

导出时按平台要求选择分辨率和码率,不要为了“保留画质”导出超大文件,上传平台往往还会二次压缩。建议保留一份高码率母版,再按平台各导一份适配版本。

第八步:发布、分发与复用

不同平台的比例与时长

横版、竖版、方版的需求不同。建议在生成阶段就用较宽的构图,后期裁切出竖版;如果主要投放竖屏,则直接按竖屏构图生成,避免裁切后主体被切掉。构图时把关键动作放在画面中央区域,是最省事的保险做法。

一稿多投

同一批素材可以拆成:完整版、短剪版、花絮版、静帧图文版。把最抓人的三秒放在最前面,其余按平台习惯调整节奏。一次生成投入,往往可以支撑三到四个不同渠道的发布需求。

数据反馈回到提示词

发布后的完播率、停留时间、互动率,是下一轮提示词优化的依据。如果观众在第三秒大量流失,说明开场镜头的钩子不够;如果中段掉得厉害,可能是节奏拖沓或信息密度不足。把结论写回分镜表,下一个项目就会更快。

常见错误与常见问题

常见错误速查

现象 可能原因 处理方式
人物脸部在不同镜头中不一致 缺少角色参考,描述过于笼统 建立角色设定表,固定同一组参考图
画面物体无端变形 提示词中动作过多,物理交互复杂 拆镜头,减少同屏交互
镜头抖动明显 运镜描述矛盾,手持与稳定指令混用 明确写清运动方向与幅度
画面偏色跳变 场景光线描述不一致 固定光源方向与色温,后期统一调色
生成结果总是差一点 一次修改多个变量 每轮只改一处,记录有效短语
素材很多却无法成片 缺少分镜与时长设计 回到脚本阶段补齐镜头表

常见问题解答

一个项目需要准备多少参考图? 每个主要角色建议准备三到五张不同角度的清晰照片,每个场景准备一到两张风格参考。质量比数量重要。

生成出来的片段太短怎么办? 不要硬拉长时间。用多个短镜头加剪辑来表现连续动作,通常比一个长镜头更稳定、更好看。

是否需要同时使用多个模型? 如果项目对一致性和风格有明确要求,分工使用多模型是常规做法;如果只是快速产出,单模型已经足够。

提示词用中文还是英文? 多数模型对英文理解更稳定,一些中文模型对中文语境的细节更敏感。建议用一种语言写主提示词,并在全项目保持一致,避免混用造成风格漂移。

怎么判断一个镜头可以定稿了? 三个标准:动作与分镜意图一致、与前后镜头在光线和角色上连贯、单独观看时不出现明显扭曲。三条都满足就可以进入剪辑。

预算有限时应该先省哪一步? 先省生成次数,而不是省分镜和后期。分镜不清会浪费最多生成,后期不足会让好素材变得廉价。

怎么减少重复劳动? 把所有有效的提示词短语、参考图和参数记录归档,做成自己的模板库。第二个项目开始时,你会省下一半时间。

怎么处理模型突然更新导致风格变化? 在做重要项目期间不要随意更新工具链。把当前可用的参数和提示词版本记录下来,等交付完成再测试新版本。

把流程当成可复用的资产,才是这个领域真正的长期优势。工具会持续变化,但一份清晰的分镜表、一套分层提示词、一组稳定的参考素材、一份筛选与版本记录,再加上扎实的后期,这些组合起来就是可复用的生产能力。工具只是把它们串起来的那根线。

Alexander

Alexander