Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

AI视频制作全流程指南:从脚本分镜到成片输出的实战方法

Oct 6, 2026

一、为什么AI视频制作需要“工作流思维”

很多人第一次接触AI视频,是从一句提示词开始的:输入一段描述,等待片刻,得到一个几秒钟的片段。第一次看到画面动起来时的震撼是真实的,但当你真要做一支能对外发布的完整作品时,问题会一个接一个地冒出来:主角在第二个镜头里换了脸,光线风格前后打架,动作衔接突兀,节奏拖沓,声音和画面对不上,导出到手机上再看一遍,画质又糊了一层。

原因并不神秘。生成模型擅长的是“单点任务”——把文字变成画面,把图片变成运动。而一支成片需要的是“链条”:创意、脚本、分镜、视觉设定、素材生成、剪辑、声音、输出。链条上任何一环缺失,最终效果都会垮掉。

把AI视频制作当成“工作流工程”而不是“抽卡游戏”,是效率与质量的分水岭。一套稳定的工作流至少带来三件东西:

  • 可复现:同一套设定与提示词结构,下一次还能得到相近的结果,不必每次从零摸索。
  • 可并行:脚本、设定、生成、声音可以分给不同的人,或安排在不同时间段推进,不必串行等待。
  • 可迭代:出问题时,你知道该回到哪一步去修,而不是整支片子推倒重来。

还有第四个隐性收益:协作。当你的镜头表、风格锚点、提示词都写在文档里,第二个人接手时不需要你口头解释半小时,他打开文件就能继续往下做。这一点对独立创作者同样重要——三个月后的你,就是那个“第二个人”。

下面按实际生产顺序,把整条链路拆成六个阶段,每个阶段给出可直接照做的方法、字段模板和常见坑。你可以按顺序通读一遍,也可以直接跳到当前卡住的那一步。

二、第一步:把创意拆成可执行的分镜脚本

三种脚本粒度,别跳级

大多数AI视频项目失败在“从概念直接跳到生成”。中间缺了两层。

  1. 概念级:一句话说清“谁、在什么地方、遇到什么、最后怎样”。例如:“一个外卖员在暴雨夜送完最后一单,发现收件人是他多年未见的父亲。”
  2. 大纲级:把概念拆成三到六个段落,每段一句话描述情绪与事件推进。这一段决定节奏与信息密度。
  3. 镜头级:把大纲里每一段拆成具体镜头,写成表格。这一步才是模型能“读懂”的输入。

三级跳的做法看似省时间,实际会让你在生成阶段反复返工——因为你会一边生成一边想剧情,成本成倍增加。

镜头表必须写清的九个字段

  • 镜号:唯一编号,方便后续讨论“第 7 镜要重做”。
  • 时长:以秒为单位,标注预期长度,例如 3 秒或 5 秒。
  • 景别:远景、全景、中景、近景、特写。景别决定观众与角色的心理距离。
  • 主体与动作:谁在做什么,动作的起点与终点分别是什么。
  • 镜头运动:固定、推、拉、摇、跟、环绕、手持。运动方式要在生成时就定,不要指望后期裁切补救。
  • 环境与时间:室内外、天气、白天夜晚、季节。
  • 光线:主光方向、色温、硬光还是柔光、有无实用光源。
  • 声音:对白、环境音、动作音效、音乐情绪。
  • 转场:切、叠化、遮挡转场、动作衔接。

写满这九项之后,你会发现原本“感觉不对”的问题,大多能定位到某个具体字段上。

一个 30 秒短片的镜头表示例

假设要拍一支 30 秒的手冲咖啡短片,可以这样拆:

  1. 镜 1(2 秒):特写,热水注入滤杯,蒸汽升腾,固定镜头,清晨侧光。
  2. 镜 2(3 秒):近景,手握着壶把手微微倾斜,动作缓慢,浅景深。
  3. 镜 3(3 秒):中景,人物侧脸,逆光轮廓,缓慢推镜。
  4. 镜 4(4 秒):俯拍,咖啡液滴入分享壶,节奏与音乐鼓点对齐。
  5. 镜 5(3 秒):特写,手指轻轻转动杯子,暖色台灯补光。
  6. 镜 6(4 秒):中景,人物端起杯子走到窗边,跟拍。
  7. 镜 7(3 秒):近景,第一口,眼睛微微眯起,自然光。
  8. 镜 8(3 秒):远景,窗边剪影,画面渐暗,标题浮出。

这份表本身就是拍摄说明书,也是提示词的骨架。到了生成阶段,你只需要按镜号逐个填提示词,而不是对着空白页面发呆。

最容易被忽略的错误

  • 把氛围词当指令:“高级感”“电影感”这类词对模型几乎无用,真正起作用的是“主光来自左侧窗户、色温 5600K、浅景深、低饱和”。
  • 一个镜头塞进两个动作:模型会在动作切换处崩掉。一个镜头只做一件事。
  • 忽略时长与信息量匹配:2 秒的镜头里塞三段信息,观众只会觉得画面在闪。

三、第二步:建立视觉基调与角色一致性

风格锚点文档

在生成任何一段素材之前,先写一份“风格锚点”文档,它要能回答一个问题:这支片子看起来像什么?内容至少包括:

  • 色彩:主色、辅色、禁止出现的颜色。例如“主色是雾蓝与暖木色,避免高饱和红”。
  • 光线:整体是柔光还是硬光,常用色温范围,是否允许强烈反差。
  • 质感:胶片颗粒、数字锐利、手绘笔触、金属反射。
  • 镜头语言:常用焦段(35mm 的观察感、85mm 的压缩感)、是否允许手持晃动。
  • 参考:两三张图或两三段片子,作为团队内部的“共同语言”。

这份文档的作用是让每一个镜头的提示词都能挂靠到同一套坐标上,而不是各写各的。

角色一致性:参考图与描述词双轨并行

角色一致性是AI视频里最难的环节。单靠文字描述,模型每次都会给你一个“差不多的陌生人”。可行的做法是双轨并行。

第一轨:参考图。 准备同一角色的三到五张图,覆盖不同角度(正面、四分之三侧、侧面)、不同景别(半身、特写),以及不同表情。角度覆盖越全,模型在不同镜头里越稳。参考图本身要干净:单一背景、光线均匀、没有多余人物。

第二轨:固定特征词表。 把角色的可识别特征写成一段固定文案,每次生成时原样复制,例如:“四十岁男性,短发,右侧眉骨有一道浅疤,戴细框眼镜,穿深灰色针织衫,颧骨突出,眼窝偏深。”不要在同一次生成里临时加形容词,也不要随意改变词序。

服装与道具连续性表

角色一致不只是脸。服饰、配饰、手里拿的东西,同样是观众判断“这是同一个人、同一场戏”的依据。做一张表:

镜号 服装 配饰 随身道具 备注
1-3 深灰针织衫 细框眼镜 无 室内
4-6 深灰针织衫外披风衣 细框眼镜 纸杯 外出

这张表能避免“上一镜还在室内穿毛衣,下一镜出门突然换外套却没有任何过渡”这类剪辑事故。

多图参考与权重控制

当平台支持多张参考图输入时,把它们当成“配方”而不是“堆料”。一般思路是:主体参考图权重最高,风格参考图次之,环境参考图最低。如果发现角色的脸被风格图带偏,就降低风格图权重,或者只让风格图影响后半段镜头。

四、第三步:模型选择与生成策略

按镜头类型匹配模型

没有哪个模型在所有镜头上都最强。按镜头类型分工,是提升成片质量最快的办法:

  • 写实人物特写:优先选择皮肤质感、眼神光表现好的模型,注意检查牙齿与手指。
  • 大场景与航拍:优先选择空间透视稳定、远景细节不崩的模型。
  • 动作与运动:优先选择运动模糊自然、肢体不扭曲的模型,必要时拆成更短片段。
  • 产品微距:优先选择材质反射与高光控制好的模型。
  • 风格化动画:优先选择画风一致性强、线条稳定的模型或工作流。

实际做法是:先用同一段提示词在两到三个模型上各跑一次短片段,对比后再决定整支片子用哪个。这段“试跑”看起来浪费时间,但它避免了你跑到第 20 个镜头才发现模型不适合。

文生视频、图生视频与首尾帧控制

三种模式各有适用场景:

  • 文生视频:适合探索阶段、空镜、氛围镜头。控制力最弱,但速度最快。
  • 图生视频:适合角色镜头与产品镜头。先用图像工具把构图、服装、光线定死,再让视频模型只负责“运动”,稳定性大幅提高。
  • 首尾帧控制:适合需要精确衔接的两个镜头,例如“杯子从满到空”“门从关到开”。给模型起点和终点,中间过程它自己补。

如果你要一个通用的建议:关键人物镜头优先图生视频,转场镜头优先首尾帧,氛围空镜可以用文生视频。

提示词结构模板

把提示词写成有层次的短句,而不是长段落。推荐顺序:

  1. 主体与外观(谁,长什么样,穿什么)
  2. 动作(做什么,动作的速度与幅度)
  3. 环境(在哪里,时间,天气)
  4. 镜头(景别,运动,焦段)
  5. 光线(主光方向,色温,明暗对比)
  6. 风格(质感,色调,颗粒)
  7. 负面约束(不要变形、不要多余肢体、不要文字水印)

示例:“四十岁男性,短发,细框眼镜,深灰针织衫,坐在窗边;缓慢转头看向镜头;清晨公寓室内,窗外有树影;中景,固定机位,85mm 压缩感;主光来自左侧窗户,柔光,色温 5200K;低饱和,轻微胶片颗粒。”

生成长度与镜头切分

一次生成三到五秒的片段,通常比一次生成十秒要稳。原因有两个:模型在长片段里更容易累积误差,而剪辑本身也需要切点。把十秒拆成三个三到四秒的镜头,你得到的是更可控的素材和更多的剪辑选择。

如何判断该用AI还是实拍

不是所有镜头都值得交给AI。判断标准可以简化为三问:

  • 这个镜头需要精确的物理交互吗(倒水、开锁、握手)?如果需要且是画面重点,实拍更省事。
  • 这个镜头里有长时间的人脸特写吗?如果需要细腻表演,实拍或真人素材更可靠。
  • 这个镜头的核心价值是“想象力的可视化”吗(不可能的场景、历史场景、概念演示)?如果是,AI几乎是唯一选择。

混合流程往往是最优解:实拍关键人物与手部动作,AI 生成环境、空镜、转场与概念画面。

五、第四步:镜头连贯性与剪辑节奏

六种廉价但有效的衔接技巧

  1. 动作衔接:上一个镜头结尾是“抬手”,下一个镜头开头是“手落下”,观众会自动补全中间过程。
  2. 视线匹配:角色看向画面右侧,下一镜出现他看的东西。
  3. 遮挡转场:角色或物体从镜头前扫过,用遮挡瞬间切换镜头。
  4. 同色过渡:两个镜头的色调接近,切点几乎察觉不到。
  5. 形状匹配:圆形接圆形,线条接线条,视觉上形成呼应。
  6. 声音先行:下一镜的声音提前半秒进入,画面切换会变得顺滑得多。

节奏:镜头长度与信息密度

节奏不是“快就好”。判断标准是:这个镜头需要观众用多久才能读完信息?一个新场景的第一个镜头,通常需要更长时间让观众建立空间感;而同一个空间内的连续动作,可以切得更快。

一个可用的经验:信息型镜头(人物加环境加字幕)留三到四秒;纯动作镜头留一点五到二点五秒;情绪特写留两到三秒;空镜留一到两秒。整支片子的平均镜头长度控制在二点五到三点五秒,大多数观众不会疲劳。

用音轨当节拍器

先放一条参考音乐,把切点标在波形图上。你会发现原本“说不清哪里怪”的剪辑,一旦对齐鼓点,立刻顺畅了。注意不要每个切点都卡拍,那样会显得机械——让关键转折点卡拍,其余保持自然节奏。

六、第五步:声音设计——配音、音效与音乐

配音

AI 配音已经能覆盖大部分解说、口播与旁白需求。选音色时别只看“好听”,要看三件事:语速是否可控、停顿是否自然、情绪是否稳定。常见做法是先生成完整配音,再按配音节奏去调整画面长度,而不是反过来——因为调音频比调画面便宜得多。

如果片子有真人出镜且需要情感表达,优先用真人录音。口型对不上时,可以在剪辑里用侧脸、背影、遮挡镜头来规避。

音效的三层结构

  • 环境层:空调声、雨声、街道远景车流。作用是让画面“有空间”。
  • 动作层:脚步、衣物摩擦、杯子放下的轻响。作用是让动作“有重量”。
  • 强调层:低频冲击、金属嗡鸣、短促的提示音。作用是引导注意力。

三层都有的镜头,观众会觉得“真实”;只有动作层的镜头,会觉得干;只有音乐没有环境音的镜头,会觉得飘。

音乐

音乐决定情绪走向。选曲时关注三点:起始情绪、峰值位置、结束方式。把音乐的情绪曲线与你的故事线叠在一起看,如果峰值出现在没有戏剧冲突的地方,就该换曲或重新剪。

混音的基本顺序

先对白,再音效,最后音乐。顺序反了会不断返工。大致思路是:对白保持在最清晰的位置,音乐在高频段给对白让路,环境音始终保持在“听得见但不注意”的音量。导出前一定要在手机扬声器和耳机上各听一遍——很多混音问题只在其中一个环境里暴露。

七、第六步:后期合成、画质提升与输出

画质处理

AI 生成的片段常见问题是分辨率不一致、细节偏软、有轻微闪烁。处理顺序建议:先去噪与稳定,再补帧,最后放大。顺序错了会把噪点一起放大。

  • 降噪:针对暗部噪点,注意别把皮肤纹理一起抹平。
  • 稳定:如果原镜头设计是手持感,适度保留晃动,不要做成完全静止。
  • 补帧:把 24 帧素材补到 60 帧适合慢动作段落,但叙事段落保持原生帧率更有电影感。
  • 放大:需要上大屏或做局部裁切时再用,放大后一定要检查眼睛、牙齿、文字边缘。

色彩统一

把不同来源的素材放进同一条时间线,最先暴露的问题就是“颜色不一体”。做法是:先给整条片子定一个基础校正(曝光、白平衡、对比),再用一个统一的风格层压在全部镜头上,最后对个别镜头做微调。不要逐镜头单独调色,那样会越调越乱。

字幕与信息层

字幕的三个实用建议:一行不超过 18 个汉字、出现在画面下方安全区内、停留时间不少于一点二秒。信息图、标题、角标要统一字号与位置,避免每个镜头都在跳。

输出规格

  • 竖屏短视频:9:16,1080×1920,码率尽量高一些。
  • 横屏长视频:16:9,1920×1080 或更高。
  • 平台对封面的要求各不相同,建议同时导出一张不带字幕的干净帧作为备选封面。

八、常见错误与排查清单

现象 可能原因 处理方式
人脸在镜头间变化 参考图角度不足、特征词不固定 补参考图,固定特征词,改用图生视频
手指数量异常 手部占画面比例过大 缩小手部在画面中的占比,或改用遮挡构图
画面闪烁、纹理抖动 单帧细节过密、生成片段过长 减少画面细节密度,缩短单次生成长度,后期去噪
动作中途漂移 一个镜头里塞了多个动作 拆成多个镜头,每个镜头一个动作
场景比例失真 环境参考缺失、透视描述不清 补环境参考图,明确焦段与机位高度
声音与画面不同步 先剪画面后配声音 先定配音与音乐,再对齐画面
导出后画质下降 码率过低、经过多次压缩 从工程直接导出,避免中间转码
观众看不懂剧情 缺少建立镜头与因果衔接 在每个场景开头补一到两秒建立镜头

这张表可以贴在显示器边上。遇到问题时先查表,能省下大量盲目重新生成的时间。

九、团队协作、版本管理与资产沉淀

命名规范

建议格式:项目加镜号加版本。例如 coffee_shot03_v2。不要用“最终版”“最终版二”“真的最终版”这类命名,它们会在两周后毁掉你的下午。版本号只增不改,新版本另存。

目录结构

一个够用的结构:

  • 01_script:概念、大纲、镜头表
  • 02_style:风格锚点、参考图、角色参考
  • 03_gen:原始生成素材,按镜号分文件夹
  • 04_edit:剪辑工程与导出
  • 05_audio:配音、音效、音乐
  • 06_output:成片与封面

审片与反馈

反馈要具体到镜号与字段。不要说“这段感觉不对”,要说“第 6 镜的色温偏冷,和第 5 镜的暖光冲突”。每次审片只提一轮意见,改完再看,避免多人同时改导致混乱。

提示词库

把跑通的提示词按类型归档:人物特写、空镜、产品、转场。三个月后,你的提示词库就是最有价值的资产,它比任何单个模型都更持久——模型会更新,你的结构不会。

十、常见问题解答

完全没剪辑基础,能做出可发布的AI视频吗?
可以,但建议把第一部片子的目标定低:30 秒、单一场景、无对白、只用音乐和字幕。把流程跑通一次,比一开始就挑战三分钟多场景叙事更有效。跑通之后再逐步加难度。

需要同时掌握很多个模型吗?
不需要全都精通。掌握“两类模型加一种工作流”就够用:一类擅长写实人物,一类擅长环境与风格。关键是知道什么镜头该交给哪一类,以及如何在剪辑里把它们接起来。

为什么生成的人物总是长得不一样?
八成是参考图和描述词没固定。检查三件事:参考图角度是否覆盖;特征词是否每次原样复制;是否在同一个项目里混用了不同模型的人物设定。

AI视频能做多长?
技术上可以很长,但建议按 30 到 60 秒一个单元来组织。超过这个长度,观众注意力与你的质量控制难度都会显著上升。长片更适合拆成系列短片,而不是一条超长视频。

一定要写分镜表吗?
如果只做 5 秒的测试片段,不用。但只要需要两个以上镜头之间存在因果关系,分镜表就是必需的。它不是束缚,而是让你在生成阶段少走弯路的工具。

声音重要到什么程度?
可以说,观众对“廉价感”的判断,一半来自声音。画面不错的片子配上干瘪的环境音,观感会瞬间掉档;而画面普通但声音层次完整的片子,观众往往觉得挺专业。

AI生成的素材能商用吗?
这取决于你使用的平台与模型的具体条款,也和素材来源有关,例如参考图是否拥有授权。在正式发布前,务必逐条确认授权范围,尤其是涉及人物肖像与品牌元素时。

每天只有一小时,怎么推进?
把任务切成固定单元:周一写镜头表,周二做角色参考,周三周四各生成两个镜头,周五剪辑与配音,周末审片与调整。固定节奏比灵感更可靠。

什么时候应该放弃一个镜头?
如果同一个镜头重做超过五次仍不满意,通常是这个镜头在脚本上就不成立——它可能信息量过大、动作太复杂,或者根本不需要存在。这时回到镜头表删掉或拆开它,比继续重新生成更划算。

最后提醒一句:模型会不断更新,今天最强的工具过一段时间可能就被替代,但“拆解创意、固定设定、控制一致性、设计声音、统一后期”这套流程不会过时。先把流程搭起来,再挑工具,你的作品会更稳,也更快。

Alexander

Alexander