Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

AI广告视频制作全流程:从脚本分镜到成片交付

Sep 22, 2026

为什么广告视频的瓶颈不再是摄影设备

过去做一支像样的广告片,流程几乎是固定的:写脚本、找导演、选角、勘景、布光、拍摄、剪辑、调色、混音,最后交付。这条链条上的每一环都意味着时间、预算和沟通成本。一支三十秒的品牌片,从立项到成片跨过几周并不罕见,而中途任何一次创意调整,都可能让已经完成的拍摄素材作废。对中小团队来说,昂贵的不是某一台设备,而是整套协作系统的固定开销。

生成式视频模型改变了这件事的重心。当画面可以在几十分钟内得到可看的草稿时,昂贵的部分就不再是摄影机、灯光和演员,而是判断力:什么样的镜头值得保留,什么样的风格能代表品牌,什么样的节奏能让人看完。很多团队第一次尝试AI广告视频时把难点想错了——他们以为难点在工具,实际上难点在流程。工具会不断更新,流程却可以沉淀下来,成为团队真正的资产。

这篇文章不讲概念炒作,而是把一套可以直接上手的工作流拆开:从接到需求到最终交付,每个环节该做什么、判断标准是什么、哪里最容易翻车。全文围绕一个目标:让小团队甚至单人创作者,在不依赖昂贵摄影团队的前提下,稳定产出可投放的广告视频。

需要先建立一个预期:AI并不是把专业制作变成“按一个按钮就结束”。它把试错成本降低了,把迭代速度提高了,但并没有取消创意决策、品牌管理和质量把关。把AI当成一个不知疲倦的摄影助理,而不是一个能替你思考的导演,工作流会顺畅得多。

开工前的三张清单:规格、资产与验收标准

在打开任何生成工具之前,先花半小时把三张清单写出来。这一步能省下后面几小时甚至几天的返工。生成的成本看起来低,但试错的时间成本并不低,而绝大部分返工都源自需求没有被说清楚。

投放规格清单

先把“在哪里播”定死,再谈创意。不同平台的硬性要求差得很远:竖屏信息流通常要求前三秒抓住注意力,横屏官网首屏允许更慢的节奏,贴片广告则对品牌露出时间有硬性规定。把下面几项写成一行一行的约束,贴在项目文档最上方:

  • 画幅与分辨率:9:16、1:1、16:9,主投放平台决定母版方向。
  • 时长:6秒、15秒、30秒、60秒,先做主时长再衍生。
  • 品牌露出:第几秒出现、出现几次、是否必须出现产品实物全貌。
  • 字幕安全区:避开平台界面遮挡的上下边缘区域。
  • 声音策略:是否允许自动播放静音,字幕是否必须承载全部信息。
  • 合规红线:行业禁用词、对比性表述、需要标注的声明。

这些约束看起来琐碎,但它们直接决定生成阶段的分镜设计。比如竖屏信息流要求主体集中在画面中央,那么横屏母版里的左右两侧信息在转竖屏时就会被裁掉,必须在分镜阶段就预留位置。

品牌资产清单

AI视频最容易露怯的地方是品牌资产。让模型“想象”你的标志,结果通常是扭曲的字母和错误的字体。正确做法是把品牌资产当成后期贴图处理,而生成环节只负责画面氛围和人物。需要提前准备的包括:

  • 透明底标志,横向与方形两种。
  • 产品多角度实拍图,至少正面、四分之三侧、背面。
  • 品牌色色值、常用字体的授权文件。
  • 虚拟形象或真人代言人的参考图集,同一人不同角度、不同表情各三到五张。
  • 既有广告片的截图,用来统一色调和质感。

如果品牌有固定的包装设计、瓶身曲线或标志性配色,务必把这些参考图放在手边。生成时用文字描述“红色瓶身”和用参考图锁定“这个红色瓶身”,结果是两回事。

验收清单

把“好看”翻译成可以打勾的条目,否则每次评审都会变成主观争论。建议的验收项包括:画面是否稳定无闪烁、产品外观还原度是否可接受、人物手部与五官有无明显变形、字幕是否有错别字、配音与字幕节奏是否同步、结尾品牌落版是否清晰可读。每一条都写成“通过/不通过”,而不是“感觉还行”。

验收清单还有一个作用:它让客户或品牌方在早期就参与标准制定。等到成片出来再争论“这个人物不像我们品牌”,成本已经付出了。提前确认标准,等于提前锁定返工边界。

从卖点到脚本:把创意翻译成可执行的分镜表

脚本这一步是整条流程里唯一无法被工具替代的部分。模型可以生成画面,但不能替你决定要说什么。广告的说服力来自信息结构,而不是画面数量。

十五秒结构:钩子、证据、行动

十五秒广告最稳的结构是:前三秒制造注意,中间八到十秒给出证据,最后两到三秒推动行动。钩子可以是反常识的画面、一个具体数字、一个痛点场景。证明不是形容词堆砌,而是可视化的事实:产品被使用的过程、前后对比、材质特写。行动则要具体,一个动作、一句指令、一个清晰可见的落版。

很多AI广告失败的根源不是画质不够,而是十五秒里塞了六个卖点,结果一个都没记住。宁可只讲一个点讲透。把卖点按重要性排序,只保留第一个,其余留到系列视频里分别展开。这是内容策略,不是技术问题。

提示词模板与排除项

把提示词写成固定结构,可以大幅降低输出波动。一个可复用的模板是:主体 + 动作 + 环境 + 镜头语言 + 光线 + 风格 + 画质描述 + 排除项。例如:

“一位三十岁左右的女性在清晨厨房里打开冰箱取出一瓶果汁,中景,缓慢推近,侧逆光,柔和自然光,清爽明亮的商业广告风格,浅景深,皮肤质感真实,排除:多余的手指、文字、水印、画面抖动。”

注意最后一项。模型对“不要什么”的响应不如“要什么”那么好,但明确列出排除项仍然能减少一部分常见瑕疵。更重要的是保持同一支广告里所有镜头的风格段落措辞完全一致,只替换主体和动作。不要在镜头一写“清晨暖光”,在镜头二写“棚拍冷光”,除非那是有意的转场设计。

分镜表的列设计

把脚本拆成分镜表,是让生成过程可管理的关键。建议用表格,每一行是一个镜头,列包括:镜号、时长、画面描述、运镜方式、首帧参考、尾帧参考、音效、字幕文案。十五秒片子通常是五到八个镜头,每个镜头一到三秒。

分镜表还有一个隐性作用:它让你提前发现逻辑断裂。比如镜头三到镜头四之间人物位置突然改变却没有过渡,这种问题在看文字脚本时很难发现,画成表就很明显。分镜表也是团队协作的接口:剪辑师、配音师、投放人员都可以在同一张表上找到自己的输入。

关键帧与角色一致性:把随机性关进笼子

先图后视频

直接用文字生成视频,等于把两个不确定性叠加在一起:模型既要猜画面长什么样,又要猜它怎么动。更可控的做法是先确定关键帧图像,再让模型基于图像生成运动。图像环节可以反复重抽,成本低、反馈快,定稿后再进入视频生成,废片率会明显下降。

对广告来说,这一步还有额外好处:静态关键帧可以直接给客户或品牌方确认构图、色调和产品位置,避免在视频阶段才发现方向不对。把关键帧当作“视觉合同”,确认之后再动,返工概率会低很多。

首帧与尾帧控制

支持首尾帧控制的模型能把画面从“随机运动”变成“定向运动”。做法是把一个镜头拆成起点图和终点图,让模型在两帧之间插值生成。这在产品展示里特别有效:从产品全景到标志特写,从包装到内容物,运镜路径清楚,成片可用率会高得多。

如果没有尾帧控制,退一步的做法是缩短单镜头时长。三秒以内的运动,模型失控的概率显著低于八秒以上的长镜头。广告本身也适合短切,不要被“一镜到底”的执念绑住。

角色参考图集

广告里最致命的缺陷是人物在不同镜头之间“换了张脸”。解决办法是建立角色参考图集:同一个人物的多角度、多表情图像,作为每个镜头的参考输入。参考图质量比数量重要,光线和角度尽量一致,背景尽量干净。

如果人物是真人代言人,务必确认肖像使用授权范围是否覆盖AI生成内容,这一点在广告投放层面属于合规问题,不是技术问题。对于虚拟形象,则要确保不同表情下的五官比例一致,避免“微笑时像另一个人”。

一致性排查表

如果人物仍然在不同镜头里变脸,按顺序排查:参考图是否包含足够角度;参考图之间光线差异是否过大;提示词中的外貌描述是否前后矛盾;单镜头时长是否过长导致模型在中途重新想象人物;是否混用了不同生成策略且没有统一风格描述。多数问题出在参考图和时长,而不是模型本身。

另一个常被忽略的点是服装和道具。把服装、发型、配饰写进提示词的固定段落,逐字复制,不要改写。同一件衣服在镜头一叫“米色针织衫”,在镜头二叫“浅色毛衣”,模型就可能理解为两件不同衣服。

按镜头任务选择生成策略

不同生成方式擅长的方向差别很大,与其寻找“最强方案”,不如按镜头任务分配。

人物特写与口播

重点是面部稳定性、皮肤质感和口型。人物特写镜头建议缩短时长,一到两秒一个切点,用剪辑节奏替代长镜头表演。口播类内容如果对唇形同步要求高,可以考虑真人实拍加上生成的背景或产品插入镜头,混合方案往往比纯生成更可信。

选择人物镜头时,先问三个问题:这个镜头需要观众看清表情吗?需要连续说话超过三秒吗?人物和产品需要同框互动吗?如果答案是肯定的,优先考虑实拍或混合方案。AI生成更适合人物作为氛围元素出现的镜头。

产品微距与材质

液体流动、织物纹理、金属反光这类镜头,生成效果通常不错,但产品外观必须与真实产品一致。最稳的做法是:生成的画面只提供光影和氛围,产品主体在后期用实拍图或三维渲染贴回。这类混合处理在成片中几乎看不出来,却能避免“产品被改造”的严重问题。

如果必须完全生成产品,至少用多张参考图锁定包装比例和标志位置,并在剪辑时逐帧检查。食品、化妆品、电子产品对颜色和形状的敏感度尤其高,色差半档就可能让品牌方无法接受。

大场景与运镜

城市航拍、自然风光、抽象空间这类镜头,适合交给生成模型,因为观众对细节准确性要求低,而AI在氛围营造上效率极高。运镜描述要具体:缓慢横移、稳定推进、轻微手持晃动,不同措辞会带来截然不同的观感。

大场景还有一个用途:作为转场。用一个快速的穿过云层或穿过走廊的镜头,把两个不相干的场景连接起来,比直接硬切更自然。这类镜头不需要复杂叙事,只需要运动方向与前后镜头匹配。

风格化转场

粒子、流体、超现实转场适合用来做过渡镜头,长度保持在一秒以内,主要作用是遮盖前后镜头之间的视觉跳跃。不要滥用,否则观众会注意到转场本身,而不是广告信息。最专业的转场往往是最不显眼的。

声音设计:配音、音乐与音效的层次

观众能容忍画面有点瑕疵,但很难容忍声音廉价。声音决定了“专业感”的下限。

配音

AI配音的进步很大,但选择音色时要考虑品牌调性,而不是找最像播音员的那个。语速比音色更影响观感:广告旁白通常比日常对话慢百分之十左右,句尾留出停顿,字幕才有呼吸空间。生成配音后先做一次朗读稿校对,特别注意数字、英文缩写和品牌名的读法。

如果品牌名容易被读错,就在脚本里用注音或拆分音节标注。不要让配音演员或合成引擎自行猜测。一个读错的品牌名,足以抵消前面所有的制作努力。

音乐

音乐承担情绪引导的作用。选择时确认授权范围覆盖商业投放,尤其是信息流广告。找不到合适曲目时,用生成的无旋律氛围铺底,再叠加少量真实乐器采样,往往比直接生成完整歌曲更自然。音乐音量要压在旁白之下,副歌部分尤其注意不要盖住关键信息。

音效

音效是最容易被忽略、提升却最明显的一层。每一次画面切换、产品出现、文字落版,都值得配一个轻量的音效。三个层次要分清:环境音铺底、动作音跟随画面、强调音服务节奏点。音效音量压在旁白之下,只做感知层面的补充。

如果成片看起来“不够高级”,先检查声音:旁白是否太干、音乐是否太满、音效是否缺失。很多时候,加一个细微的“叮”或“唰”,比重新生成十个镜头更有效。

剪辑、节奏与交付:从素材到可投放成片

生成素材的可用率通常在三分之一到一半之间,也就是说十秒素材里大概有三到五秒能用。剪辑第一步是做减法:挑出可用的片段,按分镜表顺序排列,先不管衔接是否顺畅。

减法与节奏曲线

第二步是调节奏。广告的节奏曲线一般是“快—稳—快”:开头三秒高密度切换抓注意力,中间放慢给产品展示空间,结尾加快收束并落在品牌落版上。如果成片看起来“平”,问题通常不是素材,而是每个镜头时长太接近。试着把最想强调的镜头延长半秒,把过渡镜头缩短半秒,节奏感会立刻不同。

转场与字幕

第三步是处理转场。AI素材之间的跳变可以用三种方式遮盖:动作匹配剪辑、遮挡物转场、以及一到两帧的黑场或闪白。不要滥用花哨转场,广告里最专业的转场往往是最不显眼的。

第四步是字幕。字幕要与旁白节奏同步,一行不超过十二个字,关键信息加粗而非变色。所有文字建议在后期叠加,不要交给生成模型直接画字,模型生成的文字几乎一定会有错字或变形。

多平台适配与版本管理

母版完成之后,适配工作量往往被低估。同一支广告投放到不同平台,不是简单裁切,而是重新构图。横屏母版转竖屏时,主体位置、字幕位置、标志位置都需要重新安排。更高效的做法是在分镜阶段就预留安全区,让关键信息集中在画面中央区域,这样横竖转换时损失最小。

需要交付的版本通常包括:主投放版本、竖屏版本、六秒精简版、静音字幕版、封面图。六秒版不是原来十五秒的截取,而是重新选择最强的三到四个镜头重组。封面图单独制作,选一帧信息最完整的画面,加上标题文字。

文件命名和版本管理同样重要。建议用“项目名_版本_画幅_时长”的固定格式,避免投放时拿错素材。交付前检查一遍:字幕是否有错字、标志是否清晰、声音是否左右平衡、最后一帧是否停留足够时间。

常见错误与排查清单

以下是实际项目中反复出现的坑,按发生频率排序。

  • 提示词过长导致主体丢失。描述越复杂,模型越容易漏掉关键元素。把最重要的三个信息放到提示词最前面。
  • 让模型直接生成文字。招牌、包装文字、字幕交给后期处理,这是硬性规则。
  • 人物手部变形。通过调整机位、避免手部大特写、裁切构图或在剪辑中缩短出现时间来规避。
  • 画面闪烁或纹理抖动。缩短单镜头时长、更换生成策略、减少画面中的高频细节密度。
  • 产品外观被改变。回到混合方案:生成背景,贴回真实产品图。
  • 追求一镜到底。长镜头在生成里是高风险高成本的选择,绝大多数广告靠剪辑拼接效果更好。
  • 忽略静音观看场景。超过一半的信息流观看发生在静音状态,字幕必须承载完整信息。
  • 没有版本管理。最后交付时找不到正确文件,是流程问题,不是技术问题。
  • 声音层次单一。只有旁白,没有音乐和音效,成片会显得像教程而不是广告。
  • 验收标准缺失。每次评审都靠感觉,返工没有尽头。

排查时按“画面—声音—结构”的顺序检查。画面问题优先看稳定性和人物,声音问题优先看旁白清晰度和音乐音量,结构问题回看分镜表,确认信息顺序是否合理。

时间与成本规划:什么时候值得自建流程

把工作流跑顺之后,一支十五秒广告的实际投入大致可以分为几块:需求与脚本半天、分镜与关键帧一天、视频生成与筛选半天到一天、配音与音乐半天、剪辑与适配一天。合计三到四天的产出周期,对于多数中小团队是可以接受的。

真正需要判断的是批量场景。如果一个月要产出十支以上的变体广告,模板化收益极大:固定分镜结构、固定提示词骨架、固定调色预设,只替换主体和卖点。这种情况下值得投入时间搭建内部素材库和提示词库。

如果一年只做两三支高预算品牌片,生成式流程更适合承担前期概念可视化和分镜预演,实拍仍然更稳妥。决策标准很简单:看这个项目对“真实质感”和“品牌资产精确度”的要求有多高,要求越高,越应该用生成做前期、用实拍或三维做最终画面。

另一个判断维度是团队能力。如果团队里有会剪辑、懂镜头语言的人,生成流程的产出会稳定得多;如果完全没有人懂后期,先把剪辑基础补上,比换更贵的工具更有效。工具解决的是素材问题,判断力解决的是成片问题。

FAQ:关于AI广告视频的高频疑问

完全不熟悉视频制作,能直接用生成工具做出广告片吗?
可以做出成片,但需要补上两门功课:镜头语言的基本常识,包括景别、运镜和节奏;以及剪辑软件的基础操作。这两项不需要精通,知道原理就足够判断素材好坏。

生成的人物能用在同一支广告的多个镜头里吗?
可以,前提是建立角色参考图集并保持提示词中的外貌描述完全一致。如果对一致性要求极高,缩短镜头时长、增加剪辑切点是最有效的补救手段。把人物放在中景或远景,比大特写更容易保持一致。

生成的画面能达到投放标准吗?
取决于品类。氛围类、场景类、抽象类画面基本可以;涉及产品外观、包装文字、功效展示的部分建议用实拍素材或后期贴回。混合流程的成片质量最接近传统广告。

为什么不直接把品牌文字交给模型生成?
模型生成文字的准确率不足以满足广告要求,错一个字就可能造成品牌事故。所有文字都应通过后期叠加或三维渲染完成。包括包装上的小字、背景里的招牌、衣服上的印花。

一支广告应该准备多少可用素材?
按可用率三分之一估算,如果成片需要三十秒素材,至少要生成九十到一百二十秒的候选片段,同时多留几个备选镜头用于剪辑替换。不要等到剪辑时才发现少一个产品特写。

配音用合成还是真人?
短平快的效果类广告、批量变体广告适合合成配音;强调信任感和情绪层次的品牌片,真人配音的细微呼吸和语气仍然难以替代。可以先做合成版本验证节奏,再决定是否换成真人。

怎么判断一支生成广告“合格”?
三个标准:静音观看时信息是否完整;不看标志能否感觉出调性统一;最后一秒是否清楚告诉观众下一步做什么。三条都过,基本可以投放。

画面里出现奇怪的细节怎么办?
先判断这个细节是否影响信息传达。如果只是背景里一闪而过的瑕疵,可以用剪辑裁掉或缩短镜头;如果出现在产品、人物面部或标志附近,不要将就,重新生成或用后期替换。广告的容错率远低于个人作品。

把生成工具当成起点,而不是终点。真正稀缺的从来不是摄影团队,而是清楚知道自己要什么的那份判断。清单先行,脚本定调,关键帧定风格,生成做素材,剪辑和声音定专业感。把这几步跑顺,你会发现所谓“一键生成”,改变的是试错的速度,而不是专业判断的价值。

Alexander

Alexander