Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

AI视频生成工作流实战指南:从脚本分镜到角色一致性与后期交付

Oct 5, 2026

为什么AI视频项目需要工作流,而不是“抽卡”

很多创作者第一次接触文生视频,体验都差不多:输入一句描述,等上几分钟,得到一个十几秒的片段。画面确实惊艳,但经常在第二秒就开始漂移——人物脸型变了、手指数量不对、背景突然从夏天换成冬天。于是再抽一次,再抽一次,最后把时间和耐心都耗在了碰运气上。

问题往往不在模型本身,而在于我们把一个需要工程化管理的生产过程,当成了单次调用。一个三十秒的成片,意味着几十个镜头、上百次生成、若干次局部重做,还要配上音乐、旁白、字幕和调色。任何一个环节缺少护栏,都会在后面被放大。

一套可复用的AI视频工作流能带来三个直接收益:

  • 可预测:每个阶段有明确的输入和交付物,你知道自己卡在哪一步,也知道下一步该做什么。
  • 可复用:角色设定、提示词模板、镜头语言词表、质检表都可以沉淀下来,下一个项目直接套用。
  • 可交付:客户和平台要的是能过审、能上线的成片,而不是一堆“很酷但接不上”的片段。

还有一个容易被忽略的现实:不同模型各有所长。有的擅长写实光影,有的擅长动画风格,有的对中文提示理解更准,有的在图生视频上更稳。把它们当成一个工具箱来调度,比押注单一工具更接近专业制作的真实需求。

本文不讨论某一家平台的功能清单,而是给出一套与工具无关的工作流方法。无论你最终使用哪一种视频生成模型,这套流程都能直接套用。

工作流全景:七个阶段与它们的交付物

先看整体。把AI视频项目拆成七个阶段,每个阶段都有明确的产出,避免“一边做一边想”。

阶段 核心任务 主要输入 交付物 时间占比参考
一、创意开发 明确目标、受众、时长、调性 需求简报 一句话创意+剧本初稿 10%
二、分镜与关键帧 把剧本拆成镜头,画出关键画面 剧本 分镜表+关键帧图 20%
三、模型与路由 为每个镜头匹配生成方式 分镜表 任务清单+参数模板 5%
四、一致性控制 锁定角色、场景、风格 参考图、词表 身份锚点提示词包 10%
五、生成与质检 批量生成、打分、重跑 任务清单 通过质检的镜头素材 30%
六、剪辑与声音 拼节奏、配乐、配音、字幕 镜头素材 粗剪与精剪版本 15%
七、交付与归档 输出规格、命名、备份 精剪版本 成片+工程文件 10%

这张表最大的价值不是时间分配,而是提醒你:真正决定成片质量的,是第二、四、六三个阶段,而这三个阶段恰恰是大多数人跳过的。很多人把90%的时间花在第五阶段的反复生成上,结果依然得不到能用的成片。

阶段一:创意开发与“可生成剧本”

传统剧本写给导演和演员看,AI视频剧本还要写给模型看。这意味着剧本里除了情节,还必须包含可被视觉化的信息:谁、在哪、什么时候、做什么动作、镜头怎么运动、光线如何。

把创意改写成模型能执行的脚本

一个可执行的分镜脚本,每一条至少包含六个字段:

  • 镜头编号:如 S01-03,方便后期对应。
  • 景别与机位:远景、中景、近景、特写,平视、俯拍、仰拍。
  • 主体与动作:一句话说清主体在这一镜里完成的动作,不要写两个动作。
  • 环境与时间:室内外、天气、昼夜、季节,越具体越稳定。
  • 光线与色调:逆光、侧光、霓虹、冷调、暖调、低饱和。
  • 时长与节奏点:这一镜大约几秒,是否有转场。

例如,把“她很伤心地走在街上”改写成:“中景,女性角色沿人行道缓慢前行,低头,风衣下摆被风吹动,夜间城市街道,霓虹灯光从侧面打在她脸上,冷蓝色调,约四秒。”后者生成的可控性会高出一个量级。

建立镜头语言词表

词表是工作流里投入产出比最高的资产。把常用的描述固化成短语,团队成员直接复制,避免每个人写出风格迥异的提示词。建议词表至少覆盖:

  • 景别:大远景、全景、中景、中近景、特写、大特写。
  • 运动:推、拉、摇、移、跟、升降、环绕、手持轻晃。
  • 光线:黄金时刻、阴天散射、硬光、柔光、轮廓光、实用光源。
  • 质感:胶片颗粒、数字锐利、浅景深、广角畸变、长焦压缩。
  • 情绪:克制、紧张、温柔、荒诞、纪实。

词表要写成中英双列。多数模型对英文摄影术语的理解更稳定,但中文创作时先写中文更方便沟通,交付前统一翻译成英文提示词即可。

阶段二:分镜与关键帧设计

关键帧先行,而不是先跑视频

初学者最常见的顺序是:写一段提示词 → 生成视频 → 不满意 → 改提示词 → 再生视频。这个循环既慢又贵。更高效的做法是反过来:先把关键画面做成静态图,确认构图、人物、色调都没问题,再让图片动起来。

理由很简单。静态图的迭代速度比视频快几倍,修改成本也低得多。当你在图片阶段就把构图、比例、光线、角色长相全部锁定,视频生成阶段就只剩“运动是否自然”这一个变量了。

具体做法是:

  1. 按分镜表为每个镜头生成1到3张候选关键帧。
  2. 挑选最好的一张,做轻度修图:修正手指、清理多余物体、统一色调。
  3. 用这张图作为首帧,进入图生视频流程。
  4. 需要更长时长时,把上一段的末帧作为下一段的首帧,接力生成。

图生视频的衔接技巧

接力生成最怕的是“接缝感”。三个经验可以减少断裂:

  • 重叠一小段:让第二段从第一段的最后一秒附近开始,剪辑时再裁掉重叠部分。
  • 保持提示词后缀一致:风格、光线、色调的描述在两段里逐字相同,只改动作部分。
  • 避免在运动最快的地方切:动作幅度大的瞬间切帧,观众最容易看出形变。选一个动作趋缓的节点作为接缝。

如果某个镜头无论怎么接都不顺,别硬接。改成一次生成更短的完整动作,再在剪辑里用另一个机位衔接,观感通常更好。

阶段三:模型选择与任务路由

按镜头类型分配工具

把所有镜头都交给同一个模型,是最省事也最容易翻车的做法。更合理的方式是按镜头类型路由:

  • 写实人物近景:优先选对皮肤质感和面部稳定性处理更好的模型。
  • 大幅度动作与运动镜头:选物理运动更连贯、形变较少的模型。
  • 风格化动画与插画感:选风格一致性强的模型,避免中途“跳风格”。
  • 文字、标识、UI 界面:尽量用后期合成,不要指望生成模型把中文字写对。
  • 环境空镜与转场:可以用相对轻量的模型,成本低、速度快,观众注意力也不在细节上。

判断标准其实很朴素:观众会盯着看的地方,用最强的模型;观众一扫而过的地方,用最快的模型。

分辨率、时长与帧率的取舍

参数不是越高越好,而是要和交付场景匹配。

  • 短视频竖屏:1080×1920 已经足够,帧率 24 或 30。
  • 横屏中长视频:1080p 起步,帧率 24 更有电影感,30 更接近纪录片。
  • 大屏与投影:考虑生成后做放大处理,而不是直接用模型生成超高分辨率,后者既慢又不一定更稳。

单段时长建议控制在四到八秒。更长的镜头拆成多段,不仅更容易重跑,也方便剪辑时调整节奏。

队列、批处理与成本意识

生成任务是可以批量的。把同一批镜头按统一参数提交,睡前排队,第二天统一质检,比一条一条盯着看效率高得多。

同时要养成“成本意识”而不是“成本焦虑”:每个项目结束后统计一次总生成次数与最终使用镜头数的比值。这个比值通常在第一部作品里高达 20:1,工作流跑顺之后会降到 5:1 以内。这个数字比任何教程都更能说明你的流程是否有效。

阶段四:角色与风格一致性控制

这是AI视频里最难、也最能拉开差距的环节。

参考图策略

让角色保持一致,最可靠的办法是给模型足够多的身份信息。建议为每个主要角色准备一组参考图:

  • 正面、四分之三侧面、侧面各一张,表情中性。
  • 同一套服装至少两张,避免模型把服装也当成变量。
  • 不同光线条件下的两张,让模型理解“同一个人”而不是“同一种打光”。
  • 如果有条件,加一张全身图,用于远景镜头。

参考图本身要干净:背景简单、无遮挡、无其他人脸、分辨率足够。模糊或杂乱的参考图,会把噪声一起带进生成结果。

提示词中的身份锚点

把角色描述固定成一段标准文本,每次生成原样复制。这段文本里不要出现“微笑”“奔跑”这类会变化的词,只保留不会变的部分:年龄段、发型与发色、面部特征、服装款式与颜色、体态。

变化的动作、表情、机位写在锚点之后,作为独立的一段。这样做的意义在于:模型每一帧看到的是同一份身份描述,漂移的概率会明显下降。

漂移的六种典型表现与修复

表现 可能原因 修复方向
脸部逐渐变形 参考图不足或身份描述被动作词稀释 增加参考图,拆分身份与动作段落
服装颜色变化 光线描述与服装描述冲突 明确服装颜色,减少光线对色相的干扰
发型长度改变 缺少侧面参考 补充侧面与背面参考图
场景风格突变 分段生成时风格描述不一致 统一风格后缀,逐字复制
手指与肢体异常 手部入镜过近、动作过于复杂 改写机位避免手部特写,或后期修复
背景元素无端增减 提示词里存在冗余物体词 精简提示词,只保留必要元素

遇到漂移,先检查提示词是否“贪多”。一句里塞进三个以上主体、两种光线、四个动作,几乎必定出问题。

阶段五:生成执行、质检与重跑策略

一套可复用的质检打分表

把主观感受变成可比较的分数,团队协作才不会陷入“我觉得不行”。建议四个维度,每项一到五分:

  1. 角色一致性:与参考图相比,脸型、发型、服装是否可辨认。
  2. 运动自然度:是否出现抽搐、闪烁、肢体扭曲、场景跳动。
  3. 构图与曝光:主体位置、留白、亮度是否符合分镜意图。
  4. 可用性:是否能直接进剪辑,还是需要修复。

总分低于十四分的直接重跑,不要试图在后期救。救一个三分的素材,花的时间足够生成五条新的。

常见瑕疵分类与优先级

  • 闪烁与噪点:最容易修复,后期降噪即可,优先级低。
  • 轻微形变:可用遮罩局部重做或短片段替换解决,优先级中。
  • 主体错误:比如人物变成另一个人,必须重跑,优先级高。
  • 物理逻辑错误:穿过物体、物体凭空消失,必须重跑。
  • 文字错乱:一律用后期合成替换,不要重跑。

什么时候重跑,什么时候修

判断标准是“瑕疵是否在观众注意力的中心”。观众盯着主角的脸,那么脸上任何问题都要重跑;瑕疵在画面边缘的远景人群里,可以用模糊、压暗或裁切处理掉。把有限的精力集中在观众真正看的地方,是质量控制的核心原则。

对于需要长镜头的情况,可以用“分段生成+局部重做”替代整段重跑:只重做出问题的那两秒,再把前后接回去。这样既省时间,也避免了重跑后整段风格再次变化。

阶段六:剪辑、音频与后期整合

节奏决定成败

AI生成的素材往往“太满”——每一秒都在运动,每一帧都在炫技。真正专业的成片需要呼吸感。剪辑时可以做三件事:

  • 删掉开头和结尾各零点几秒,通常这两段最不稳定。
  • 在不同镜头之间插入短促的空镜或特写,给观众一个心理换气点。
  • 音乐先铺,画面后剪。先确定音乐的情绪曲线,再按节拍点安排镜头长度,成片的专业度会立刻提升。

声音与口型

口型同步是目前最容易被高估、也最容易被滥用的功能。实用建议:

  • 说话镜头尽量用中景或侧脸,正面大特写的口型瑕疵会被放大。
  • 旁白型视频干脆不露口型,用画面+配音的方式,成片质量立刻上一个台阶。
  • 配音先录、再生成画面,比先出画面再配口型更容易对齐。
  • 环境音与音效不要省。脚步声、风声、键盘声能让观众相信画面是真的。

修复、放大与降噪

生成素材进入后期前,统一做三件事:去闪烁、轻度降噪、锐度与颗粒的平衡。需要对大屏输出时,用专门的视频放大工具处理,而不是重新生成更高分辨率的版本。放大后的画面往往比重新生成更稳定,因为构图和表演已经被锁定了。

调色阶段要注意统一。不同模型生成的片段,白平衡和对比度往往不一致。为每个项目建一个基础调色预设,所有镜头先套一遍,再逐个微调,是效率与质量兼顾的做法。

阶段七:交付、归档与团队协作

命名规范与版本管理

混乱的文件名是项目后期最大的隐形成本。建议采用固定结构:

项目名_场次_镜头号_版本_状态
例如:brandfilm_S02_S03_v04_approved

状态只用四个值:draft(草稿)、review(待审)、approved(通过)、final(定稿)。任何人在文件名里看不到这几个词,就说明命名不规范。

生成过程中的提示词也要存档。每一条通过的素材,都应附带它所用的完整提示词和参数。下周需要补拍一个类似镜头时,这份记录能省下几个小时。

交付清单

一次完整交付通常包含:

  • 成片主版本(不同画幅与分辨率各一版)。
  • 无字幕版,便于二次剪辑。
  • 字幕文件独立输出,不要烧死在画面里。
  • 音频分轨:旁白、音乐、音效分开。
  • 提示词与参数存档。
  • 素材备份与项目工程文件。

最后一项经常被忽略,但它决定了这个项目能不能被复用。三个月后客户要求改一个字幕,如果没有工程文件,你只能从头再来。

常见问题解答

没有美术基础,能做好分镜和关键帧吗?
可以。分镜的核心是信息而不是画功。用简单的火柴人加箭头标注机位和运动,同样能清楚表达意图。关键帧则可以直接用生成模型来做,你只需要判断“这张图对不对”,不需要自己画。

一部三分钟的视频大概需要生成多少次?
这取决于流程成熟度。流程不熟练时,每个镜头生成十次以上很常见;流程稳定后,平均每个镜头三到五次就能得到可用素材。重点不是减少生成次数,而是减少无效生成的次数。

角色一致性要求很高,有什么顺序上的建议?
先做角色参考图组,再做关键帧,最后做视频。任何一步前提不稳,后面都会返工。不要一边生成视频一边调整角色设定,那样前后镜头一定对不上。

竖屏短视频和横屏长片的工作流一样吗?
框架一样,参数不同。竖屏更强调前两秒的视觉冲击,镜头可以更短,平均两到三秒一个;横屏长片需要更多环境交代和情绪铺垫,单个镜头可以到六到八秒。

生成出来的素材总感觉“不够真实”,是模型的问题吗?
多数时候是提示词和后期的问题。真实感来自三处:具体的光线描述、合理的镜头运动、以及后期的颗粒与调色。只写“写实风格”四个字,几乎不可能得到真实感。

团队协作时,最容易出问题的是哪一步?
提示词和素材的版本管理。两个人用同一套角色设定却写出了不同版本的描述,结果就是成片里出现了“两个人”。解决办法只有一个:把提示词模板当成共享资产,写进文档,所有人复制同一份。

预算有限时,应该把资源集中在哪个阶段?
集中在角色一致性和剪辑节奏上。前者决定观众是否相信这个故事,后者决定观众是否看得下去。特效与画面细节反而是最值得妥协的部分。

这套流程需要多久才能跑顺?
通常第一部完整作品会很慢,第二部开始明显提速,第三部时大部分模板已经成型。真正值得投入的不是某一个技巧,而是这套可以被反复使用的流程本身:词表、模板、质检表、命名规范。它们不会因为模型换代而失效,反而会在每次工具升级时释放出更大的价值。把工作流当成产品来维护,是AI视频创作里最稳的长期策略。

Alexander

Alexander