Commencer Gratuitement
Offre à durée limitée : forfaits annuels Starter et Basic à 50% de réduction 🎉

AI视频生成工作流完整指南:提示词、分镜、角色一致性与成片交付方法

Sep 30, 2026

为什么需要一套可复用的AI视频工作流

过去两年,视频生成的讨论焦点几乎全部集中在"模型能生成什么"上。谁家的画面更真实,谁家的运镜更自然,谁能把一句中文提示词理解得更准确。但当真正把AI视频用在项目里,你会发现成败的关键并不在于某一次生成有多惊艳,而在于你能不能稳定地、可重复地产出符合要求的镜头。

这是一次视角的切换。模型是能力,工作流是产能。能力再强,如果没有一套清晰的流程把创意拆解、把素材组织、把结果验收,最后得到的往往是一堆互相不匹配的片段,无法剪成一支完整的片子。

真正的问题集中在三个地方:

  • 一致性:同一个角色在五个镜头里长着五张脸,同一件外套在三个场景里变换颜色。
  • 可控性:模型给出了漂亮的画面,但方向、景别、动作节奏和你的分镜完全不符,重试成本高。
  • 可交付性:生成出来的片段分辨率不足、有闪烁、有肢体畸变,无法直接进入剪辑时间线。

一套成熟的工作流,本质上是在这三个问题上建立护栏。它把"碰运气"变成"可控范围内的概率优化"。以下内容按真实项目的推进顺序展开:从定义交付物开始,到提示词、分镜、一致性、模型选择、质量排查、后期整合,最后是协作与常见误区。

动手之前:先定义交付物和验收标准

绝大多数失败项目,问题都出在按下生成按钮之前。你在没有明确交付物的前提下开始生成,只能凭感觉判断"这个镜头好不好",而感觉无法被复用,也无法被团队对齐。

明确格式、比例和时长

先写下四个数字:目标平台、画面比例、单镜头时长、成片总时长。竖屏短视频通常使用 9:16、单镜头 3 到 5 秒、成片 30 到 60 秒;品牌宣传片常见 16:9、单镜头 4 到 8 秒、成片 60 到 120 秒。

这些数字会反过来决定你的生成策略。竖屏近景特写对背景细节要求低,但在人物脸部一致性上要求极高;横屏大景别对模型的空间理解能力要求高,但对人脸细微变化更宽容。

把成片拆成镜头表

不要用"一段视频"来思考,用"镜头"来思考。一个 60 秒的成片,通常对应 12 到 20 个镜头。为每个镜头写清楚:镜号、场景、人物、动作、景别、运镜、时长、情绪、备注。

分镜表是你唯一能在多个工具之间保持判断一致的东西。当生成结果不理想时,你能明确知道是哪一项没被满足。

建立书面验收清单

把"好"翻译成可检查的条目:

  1. 角色面部和服装是否与参考一致;
  2. 肢体结构是否正常,手指、手臂、腿部有无畸变;
  3. 画面在时间轴上是否闪烁,纹理是否漂移;
  4. 运动是否符合物理直觉,有无突然加速或漂移;
  5. 构图是否留出后期字幕和贴图空间;
  6. 色彩是否与相邻镜头统一。

这份清单看似繁琐,却是把返工次数从十次压到两次的关键。

提示词的工程化写法

提示词不是咒语,而是需求说明。写清楚的提示词可以被复用、被团队修改、被记录在案。写模糊的提示词只能靠反复抽卡。

一个可复用的七段结构

把提示词拆成七个部分,按固定顺序书写:

  1. 主体:谁或什么,年龄感、发型、服装材质、显著特征;
  2. 动作:正在做什么,动作的起始与结束状态;
  3. 环境:地点、时间、天气、背景元素的数量与层次;
  4. 镜头:景别、机位高度、镜头类型、焦段感;
  5. 光线:主光方向、色温、光比、是否有轮廓光;
  6. 风格:质感倾向,例如纪实、胶片颗粒、冷调科幻、暖调生活;
  7. 约束:你不想看到什么,例如无字幕、无多余人物、无慢动作。

示例(中文):"一位三十多岁的女性咖啡师,深棕色短发,穿着米色棉质围裙,双手将咖啡杯放到木质吧台上,动作平稳利落;环境为清晨的小型咖啡店,窗外有柔和晨光,背景有两张空桌;中近景,机位略低于视线,50mm 焦段感;暖色主光从左前方打入,右侧留出柔和阴影;纪实风格,轻微胶片颗粒;画面中不出现文字、不出现其他顾客、不使用慢动作。"

这个结构最大的价值不在文字本身,而在于它把"摄影指导要做的决策"显式写了出来。当结果不对,你能定位到是镜头段、光线段还是约束段出问题。

参考图比形容词更有效

形容词是有歧义的。"高级感""电影感"在不同人眼中有不同定义。如果有明确的视觉目标,直接使用参考图,让模型从图像中提取色调、构图与材质。

参考图使用时注意三点:

  • 参考风格时,选择画面干净、光影明确的图,避免复杂拼贴;
  • 参考人物时,尽量提供同一人物不同角度的多张图;
  • 不要让参考图承载互相冲突的信息,比如一张暖光室内图和一张冷调夜景图同时作为风格参考。

提示词写作的常见错误

  • 堆砌形容词:"超高清、极致、完美、无与伦比"几乎不产生可验证的变化,改成可观察的具体描述。
  • 一个提示词塞进多个动作:模型在 5 秒内很难完成"走进房间、坐下、拿起杯子、抬头微笑",拆成两个镜头更稳。
  • 忽略负面约束:不写约束时,模型倾向于添加字幕、水印感和多余人物。
  • 中文与英文混写没有统一:确定一种主语言并保持一致,混写容易让语义被平均掉。

分镜、镜头语言与运动控制

AI 生成的片段之所以常常"不像电影",不是因为画质不够,而是因为缺少镜头语言的层次。每个镜头都在同一景别、同一机位、同一运动方式,剪辑起来就变成了一组动态壁纸。

用镜头表驱动生成任务

在镜头表里,为每个镜头标注三类信息:叙事功能(建立环境、推进动作、情绪收束)、景别(远景、全景、中景、近景、特写)、运镜(固定、推、拉、摇、跟、升降)。

一个 30 秒竖屏短片可以这样安排节奏:远景建立环境 3 秒,中景展示人物 4 秒,近景动作细节 3 秒,特写情绪 2 秒,中景收束 4 秒,其余留给文字与转场。这样一算,只需要五到六个质量过硬的核心镜头,不必生成二十个平庸片段。

控制运动的几种可行手段

不同模型提供的控制手段不同,但思路是相通的:

  • 首尾帧控制:指定起始画面与结束画面,让模型补全中间运动。适合需要精确落点的动作,例如手从桌面抬起、人物转身面向镜头。
  • 轨迹或方向描述:在提示词中明确运动方向与速度感,比如"镜头缓慢向右横移",避免使用"镜头自由运动"这类模糊表述。
  • 参考视频驱动:用一段真实拍摄的简单运镜作为运动参考,让生成结果继承运动节奏。
  • 分阶段生成:把复杂运动拆成两个镜头,用剪辑衔接代替模型硬扛。

让剪辑师提前介入

在生成阶段就考虑剪辑点。如果每个片段都在画面中央做快速动作,剪辑师将无处下手。为转场预留空间:让主体在大约三分之二的时长处完成主要动作,最后三分之一保持相对稳定,给剪辑留出匹配点和余量。

角色与场景一致性:最难的工程问题

一致性是 AI 视频从"演示"走向"生产"的分水岭。它不是靠一次生成解决的,而是靠素材管理、锚点设计和后期修正共同完成的。

为每个角色建立角色卡

角色卡包含:正面、四分之三侧面、侧面、背面四张基础形象;三到五种表情;两到三套服装设定;一段固定的人物描述文本。这段文本在所有提示词中原样复制,不要每次重新描述。

描述越稳定,输出越稳定。"深棕色短发"不要这次写"深棕短发",下次写"棕色齐耳短发"。模型会把措辞变化理解为形象变化。

用锚点锁住连续性

在每个镜头中保留一个视觉锚点:同一件外套、同一枚手环、同一个背景招牌、同一束方向不变的光。锚点让观众在潜意识里确认"还是同一个人、同一个时空"。

尤其是光线方向。哪怕人物形象略有差异,只要主光方向一致,观众仍然会认为这是同一场戏。反之,同一个场景里主光方向来回跳变,会被立刻察觉为不连贯。

场景连贯的时间一致性

场景一致性比人物一致性更容易被忽略,也更容易修补。建议做法:

  • 先锁定一个"基准镜头",作为整个场景的视觉参考;
  • 后续镜头尽量使用基准镜头的画面作为风格与色调参考;
  • 如果模型无法稳定复现场景,考虑用同一张背景图与不同前景人物合成,再送入图生视频流程。

当一致性确实无法在生成阶段解决时,转到后期:局部遮罩修复、局部替换面部、色彩匹配,往往比无限重试更省时间。

建立自己的模型工具箱:选择决策框架

把模型当成团队里的不同岗位,而不是互相替代的竞品。有人擅长写实人像,有人擅长运动镜头,有人擅长快速草稿,有人擅长长时长叙事。

六个评估维度

  1. 真实感:皮肤、材质、光照是否符合物理直觉;
  2. 提示词遵循度:画面是否完整执行了七段结构中的每一项;
  3. 运动稳定性:复杂动作下是否出现结构崩坏;
  4. 可控性:是否支持首尾帧、参考图、运动参考等输入;
  5. 时长能力:单次可生成的有效时长,以及延长后的一致性表现;
  6. 速度与迭代成本:一次试错需要多久,这决定了你一天能迭代多少轮。

三段式组合策略

粗生成阶段用速度快、成本低的模型探索构图与节奏,一次生成多个版本,快速筛掉方向错误的方案。精修阶段用遵循度高、细节强的模型,基于选定的构图重新生成高保真版本。收尾阶段进行分辨率提升、去噪与色彩统一。

这套流程的核心是不要在错误的构图上反复精修。先用低成本把方向确定,再把算力花在正确的方向上。

不要迷信单一模型

没有哪个模型在所有任务上都最好。写实人像、宏大场景、卡通风格、产品特写,最优解往往不同。为不同镜头类型准备两到三个备选,并在项目开始前的测试阶段跑一轮小样对比,会比中途换工具高效得多。

质量排查手册:常见失真与修复路径

以下是最常遇到的问题以及对应的排查顺序,建议按顺序尝试,避免盲目重试。

肢体畸变与多余结构

先检查提示词中是否存在容易引发歧义的动作描述,例如同时包含"双手交叉"和"拿着杯子"。简化动作,明确手部状态。如果仍不稳定,改用更近的景别或让手部离开画面,用剪辑暗示动作。

画面闪烁与纹理漂移

闪烁通常来自时长接近上限、运动幅度过大或提示词中风格描述冲突。缩短单次生成时长,把长镜头拆成两个短镜头;减少提示词中互相矛盾的质感描述;避免在同一镜头中同时要求"强烈运动"和"稳定细节"。

运动断裂与主体漂移

如果中途画面突然跳变,优先使用首尾帧控制固定起点与终点;如果主体在运动过程中变形,降低运动强度,改为更平稳的运镜;如果背景元素无故增删,减少背景描述中的数量词。

文字与手部

目前绝大多数视频模型对画面内文字的还原仍不稳定。项目中的文字、标志、价格、字幕,应当放到后期添加,而不是让模型生成。手部同理:把关键手部动作交给实拍或静帧处理,比反复抽卡更可靠。

一次只改一个变量

排查时最容易犯的错误,是同时修改提示词、模型、参考图和时长,然后对比结果。这样你永远不知道是哪个变量起了作用。每次只改一项,记录结果,才能积累出属于你项目的"配方"。

从片段到成片:声音、剪辑与调色

生成结束只完成了大约一半的工作量。真正决定成片观感的是后期阶段的节奏与声音。

配音与口型

如果画面中出现正脸说话,口型与语音的匹配要求会显著提高。可行策略:用侧脸、背影、手部动作或环境镜头承担对白,把正脸说话控制在少量镜头内;对需要严格对齐的镜头,先确定音频,再让画面适配节奏。

中文配音要特别注意语气与停顿。机械式朗读会让画面再精致也显得廉价。录制真人配音,或用语音合成生成后再手动调整停顿,通常能明显提升成片质感。

音乐与音效

AI 生成的画面往往"没有重量",原因是缺少环境音。脚步声、衣物摩擦、杯子落桌、风声、远处车流,这些细节能让观众相信画面是真实发生的。建议在剪辑阶段铺三层声音:底噪环境、主体动作音、音乐。音乐的节奏点应与镜头切换点对齐。

剪辑节奏

AI 片段的可用部分通常集中在中段,头尾各有不稳定帧。剪辑时裁掉前后各一到两帧常常能显著提高观感。同时注意:不要为了用满素材而拉长镜头,节奏感永远优先于素材利用率。

分辨率提升与输出

如果最终用于大屏,考虑先降分辨率生成再放大,通常比直接高分辨率生成更省时间。输出前统一色彩与颗粒,让不同模型生成的片段看起来出自同一支摄影机:统一色温、统一对比曲线、统一一层轻微颗粒和柔光。这一步往往是区分"AI 拼贴感"和"成片感"的关键。

协作、资产管理与成本控制

个人创作可以靠记忆,多人协作必须靠规范。

版本命名与素材库

为每个镜头建立固定命名规则:项目代号_镜号_版本_日期。所有提示词、参考图、生成结果、模型选择记录在同一个镜头条目下。这样一个月后回看,你仍然知道某个镜头是怎么做出来的。

推荐三类文件夹:assets(参考图、角色卡、音乐)、prompts(提示词与参数记录)、renders(按镜号与版本存放的输出)。不要把素材堆在桌面。

审核流程

设定两轮审核:第一轮只判断构图与运动方向,不看细节;第二轮才评估一致性、畸变与色彩。把所有问题集中反馈,避免边看边改导致的反复推翻。

时间与算力的取舍

预算永远有限,因此要优先把资源投入到观众真正会注意的地方:人脸、手部、主体动作、开头三秒。背景远景可以适度降低要求,观众不会逐帧检查树叶的摆动。

一个实用的分配比例:核心人物镜头占总生成量的六成,环境与转场镜头占两成,备用素材与保险镜头占两成。

常见误区与FAQ

误区一:以为提示词越长越好

长度不等于信息量。七段结构可以写得很长,但如果每一段都是形容词,模型得到的是噪声。把字数换成可核查的具体信息,比如镜头类型、光位、动作起止状态。

误区二:把生成当成一次性任务

专业流程里,一个镜头生成五到十五个版本是常态。把"重试"理解为"迭代",建立筛选标准,而不是期待一击必中。

误区三:忽略声音与剪辑的前置规划

如果等到画面全部做完才考虑配音和节奏,往往会发现镜头长度对不上台词。先做出音频草图,再决定镜头时长,会省下大量返工。

误区四:同时更换所有工具

每次项目都换模型和流程,你就永远在重新学习。稳定使用两到三个主力模型,只在明确的短板出现时才引入新工具。

常见问题

问:完全零基础,应该先学什么?

先学分镜表和七段式提示词。这两项与具体工具无关,掌握之后切换到任何模型都能立刻上手。

问:一个 60 秒的成片大概需要生成多少素材?

按镜头数三到五倍的冗余准备比较稳妥,也就是 12 到 20 个有效镜头,对应生成 40 到 80 条片段。经验越丰富,冗余比例越低。

问:角色一致性总是不稳定怎么办?

优先检查三件事:人物描述文本是否每次一致、参考图是否包含多角度、主光方向是否固定。如果仍然不稳,改用侧脸与背影镜头承担叙事,把正脸特写数量降到最低。

问:生成的画面有轻微闪烁,值得重新生成吗?

先评估观看距离与播放场景。手机竖屏短视频中,轻微闪烁常常被忽略;大屏播放则需要处理。可以先用降低锐化、轻微模糊与颗粒覆盖的方式修补,再决定是否重生成。

问:应该固定使用一个模型吗?

建议固定一个主力模型建立熟练度,同时保留一到一个备用模型处理特定短板,例如运动镜头或写实人像。完全固定会限制上限,完全自由会牺牲效率。

问:团队里谁应该负责提示词?

最理想的情况是分镜或导演岗位负责提示词,因为他们最清楚每个镜头的叙事意图。如果由执行岗位编写,务必保持分镜表与提示词的逐条对应关系。

问:如何判断一个镜头可以进入后期?

用前面的验收清单逐条打勾。只要面部、肢体、运动三项都通过,细微的色彩差异交给后期处理,不必追求生成阶段的完美。

问:多久能形成稳定的生产节奏?

按每周完成一个 30 到 60 秒短片计算,通常需要四到六个项目才能形成属于自己的提示词库与模型选择直觉。真正的加速来自素材与经验的沉淀,而不是换更贵的工具。

结语:把注意力从模型转移到流程

AI 视频生成的能力还会继续提升,今天需要精修的畸变,明天可能不再出现。但工作流不会因此过时,因为工作流解决的问题——如何把创意拆解成可执行单元、如何保证跨镜头一致性、如何判断结果是否达标——属于创作本身,而不属于任何一代模型。

如果你现在准备开始一个项目,不妨先花一小时写完镜头表与验收清单,再打开生成工具。这一小时的价值,通常超过后面十小时的反复重试。

Alexander

Alexander