电商促销视频的核心矛盾:快、多、稳
做电商的人很快会发现一个尴尬的现实:促销视频的需求量在暴涨,但可用的制作方式没有同步进化。一个大促周期里,同一款产品可能需要竖屏信息流版本、直播间切片版本、详情页主图视频版本、达人分发版本,再加上不同卖点组合的测试版本。如果每个版本都走传统拍摄流程——找模特、租场地、约摄影、剪辑、调色、配音——那么光是排期就会把整个促销节奏拖垮。
更麻烦的是,促销视频不是品牌形象片。它必须在几秒钟内完成注意力抢夺、卖点传递和行动指令三层任务,而且要在平台算法的冷启动阶段就抓住人。这意味着视频的"钩子"必须足够强,节奏必须足够紧,信息密度必须足够高。传统的三分钟品牌片逻辑,在这里几乎完全失效。
AI视频生成把这件事的门槛拉低了一个数量级,但门槛降低不等于结果变好。真正拉开差距的,是有没有一套稳定的工作流:从促销目标出发,把卖点翻译成镜头语言,把镜头语言翻译成结构化提示词,再通过一致性和后期处理把零散片段捏成一条能投放的成片。这篇文章不讲概念,只讲流程,把整条链路拆成可以照着执行的步骤。
开工前:把促销目标翻译成可执行的视频规格
先问清楚这条视频要完成什么任务
不同类型的促销视频,结构完全不同。把任务搞错,后面所有努力都会浪费。
- 冷启动曝光:目标是让陌生用户停下来。前 2 秒必须有强视觉冲击或反常识画面,卖点可以后置。
- 种草讲解:目标是让用户理解产品解决什么问题。需要痛点场景、使用演示、效果对比三个层次。
- 直接转化:目标是让用户点击下单。需要价格锚点、限时感、信任背书和明确的行动指令。
- 复购与会员:目标是维系关系。语气更温度、更社群化,产品信息可以弱化。
同一条视频想同时完成四件事,结果通常是四件事都没做好。正确做法是先确定一个主任务,再决定其他任务是否只做辅助。
写一份可执行的视频简报
在打开任何工具之前,先把下面这些信息写成一页纸:
- 目标受众画像:年龄、使用场景、最在意的三个点。
- 核心卖点,最多三条,超过三条就要排序。
- 必须出现的信息:品牌标识、产品外观、活动时间的形式规范、必要的合规提示。
- 明确禁止的元素:竞品对比的越界表述、绝对化用语、未经授权的音乐与肖像。
- 交付规格:画幅、时长、分辨率、字幕语言、是否需要配音。
- 参考片两到三条,并写明具体参考的是节奏、色调还是构图。
这份简报的价值在于,它是后面所有提示词的来源。提示词写得再花哨,如果简报本身是模糊的,生成结果一定跑偏。
确定画幅与时长矩阵
先做母版还是先做分版,是一个需要提前决定的问题。经验做法是:以竖屏 9:16 为主版本,因为绝大多数信息流和短视频场景都是竖屏;同时规划一个 1:1 方版用于部分电商平台的图文视频位,以及 16:9 横版用于详情页顶部或海外平台。母版剪辑时把主体放在中心安全区,裁切到其他画幅时才不会切掉关键信息。
时长上,常见的组合是 15 秒、30 秒和 45 秒三档。15 秒用于冷启动测试,只保留最强钩子和一个卖点;30 秒是主力版本,可以容纳钩子、卖点、场景、行动指令;45 秒用于种草讲解,需要更完整的叙事。
素材与资产准备:输入质量决定输出上限
AI 生成的效果上限,往往由你喂进去的参考素材决定。很多人把精力全花在提示词上,却用一张模糊的手机截图当参考图,结果自然不理想。
产品素材的最低标准
- 白底或纯色底的多角度图,正面、侧面、背面、俯视各一张。
- 细节特写,尤其是决定购买决策的部分:材质纹理、接口、按钮、logo 压印。
- 真实使用场景照,哪怕拍得粗糙,也能给模型提供环境线索。
- 包装图与配色参考,用于统一整条视频的色调。
如果用截图或网图,注意分辨率至少能满足生成需求,并且要确认使用授权。产品颜色是最容易出错的地方,建议单独整理一份色值清单,后期校色时作为基准。
建立角色与场景资产库
如果视频需要出镜人物,提前准备一套人物参考图非常关键:不同角度的面部、不同表情、常见服装搭配。这套资产一旦建立,后续所有镜头都可以复用,人物一致性会大幅提升。场景同理,把常用的客厅、厨房、办公室、户外街道等场景各准备几张参考图,形成自己的素材库。
品牌资产标准化
字体、色值、logo 安全边距、字幕样式、结尾落版模板,这些都应该提前固定下来。AI 生成的是动态画面,但品牌感知往往来自那些静态的、反复出现的元素。把这些元素做成模板,剪辑时直接套用,既统一又省时间。
从卖点到分镜:结构化提示词的写法
一个可复用的提示词骨架
把提示词写成一句话的形容词堆砌,是新手最常见的失败方式。更可靠的做法是使用固定骨架,逐项填写:
镜头类型 + 主体 + 动作 + 环境 + 光线 + 材质细节 + 运镜 + 风格 + 画幅 + 时长 + 负向约束
举个例子:中近景,一名年轻女性在晨光中的厨房台面上拿起白色保温杯,缓慢旋转杯身展示磨砂表面,柔和侧逆光,背景轻微虚化,镜头缓慢环绕推近,真实商业广告质感,竖屏 9:16,约 4 秒,避免手部变形、避免文字出现、避免背景杂乱。
每一段都有明确职责:镜头类型决定构图,动作决定时间轴,光线决定质感,运镜决定节奏,负向约束决定可控性。
三种典型促销镜头的写法差异
产品特写型:主体单一,重点是光影和材质。运镜要慢,避免镜头晃动导致细节糊掉。
使用场景型:人物加环境,重点是动作合理性。动作越简单越容易生成成功,比如"拿起""放下""打开""倒入",而不是"快速奔跑并同时转身"。
对比演示型:需要前后两个状态,建议拆成两个独立镜头分别生成,再用匹配剪辑连起来,比让模型一次生成状态变化要可控得多。
常见提示词错误
- 形容词堆砌,比如"超级震撼极致高清完美",模型无法解析这类主观词。
- 一条提示里塞多个连续动作,导致时间轴崩坏。
- 缺少运镜描述,画面变成静态幻灯片。
- 忘记写画幅和时长,输出与剪辑要求不匹配。
- 依赖模型生成文字,结果字幕变成乱码,正确做法是后期叠加。
- 没有负向约束,出现多余手指、奇怪反射、品牌标识变形。
生成阶段:按镜头类型选择工具
首帧优先原则
最稳妥的生产方式是先出图、再做图生视频。用图像生成把构图、光影、产品外观定型,确认无误后再让视频模型让它动起来。相比纯文本生成视频,这种方式的可控性高得多,返工率也低得多。
镜头分类与工具匹配
- 静物与产品展示:优先使用图像生成加轻微运镜,这类镜头最忌讳大幅度运动。
- 人物口播:需要稳定的面部与口型,建议用专门的对口型工具,并保持人物参考图一致。
- 生活方式场景:可用文生视频快速探索,找到合适氛围后再回到首帧流程精修。
- 特效与转场:生成短片段后期叠加,避免在长镜头里追求复杂特效。
不同工具在写实度、运动幅度、风格化程度上各有偏向。建议固定两到三个主力工具,形成肌肉记忆,而不是每次换新工具重新试错。
批量生成与筛选
一个实用的做法是,对同一镜头一次生成多条,快速过一遍,标记为三档:可直接用、需微调、废弃。只对第一档和第二档投入精修时间。千万不要在一条明显失败的生成结果上反复抽卡,重写提示词的成功率通常更高。
一致性攻坚:产品、人物、风格三层锁定
一致性是 AI 视频能否用于商业投放的分水岭。观众不会在意单个镜头多漂亮,但一定会注意到产品颜色前后不一致、主角换了张脸。
产品一致性
核心手段是复用参考图与首帧。所有涉及产品的镜头,尽量从同一张产品图衍生,保持角度、光线方向和背景逻辑统一。如果必须调整角度,用局部重绘而不是重新生成整张图。产品上的 logo、按键、纹理是最容易变形的地方,生成后要逐帧检查。
人物一致性
三点最关键:固定的参考图集、详细的面部与服装描述、避免大幅度角度跳变。如果同一个角色要从正面切到侧面再到背面,最好拆成多条独立生成,然后靠剪辑衔接,而不是指望模型在一个长镜头里保持长相稳定。服装颜色要写清楚具体色相,比如"雾霾蓝针织开衫"比"蓝色上衣"稳定得多。
风格一致性
即使每个镜头单独看都不错,拼在一起也可能像几支不同广告的片段。解决方式是统一三件事:光线方向、色调倾向、镜头质感的锐度与颗粒。后期可以用统一的调色预设把整条片子拉齐,但前期生成时就要尽量靠近同一套视觉语言。
跨镜头衔接技巧
- 动作接动作:上一个镜头结尾的动作,与下一个镜头开头的动作方向一致。
- 匹配剪辑:利用形状相似的物体做转场,比如圆形的杯子切到圆形的表盘。
- 遮挡转场:让人物或物体短暂遮挡镜头,掩盖两个片段之间的差异。
- 声音先行:下一段的声音提前半秒进入,观众的注意力会被带走,视觉断裂感减弱。
后期与声音:把片段变成能投放的成片
剪辑节奏
促销视频的节奏遵循一个粗略的经验结构:前 3 秒钩子,第 4 到 10 秒核心卖点,第 11 到 20 秒场景与信任,最后 5 秒行动指令和落版。这个结构不是铁律,但可以作为粗剪的起点。每次切换到新镜头时,问自己一个问题:这个切换是在推进信息,还是只是在换画面?
字幕与信息层
字幕是促销视频里信息密度最高的部分,也是最容易被平台界面遮挡的部分。剪辑时在画面上叠一层平台 UI 占位参考,把字幕放在安全区内。字号要大到手机小屏也能一眼看清,一句话不超过十二个字,长句拆成两屏。
配音与音乐
配音要匹配目标受众的语速习惯。语速过快会让信息流失,过慢会让前几秒的钩子失效。情绪上,转化型内容偏果断有力,种草型内容偏轻松自然。音乐要注意授权来源,商用投放场景下务必使用可商用曲库。
音效设计
很多人忽略了音效,但它对"专业感"的贡献极大。转场处的轻微 whoosh、产品出现的点击音、价格出现的短促提示音,都能显著提升观看完成率。音效不要堆叠,一条视频控制在五到八个关键音效点就够。
多版本、多平台与投放适配
一稿多剪的正确做法
不要为每个版本重新生成素材,那是极大的浪费。正确方式是保留同一批镜头素材,只替换三类元素:开头钩子、卖点排序、结尾落版。这样可以在很短时间内产出五到十个版本,且制作质量保持稳定。
A/B 测试的变量设计
一次只测一个变量,否则无法归因。常见变量包括:钩子类型(痛点开场 vs 结果开场)、卖点顺序、产品呈现方式(静态展示 vs 使用演示)、配音性别、整体节奏快慢。每个变量至少准备两个版本,投放时保证其他条件一致。
平台适配要点
竖屏信息流需要更强的钩子和更大的字幕;直播间切片需要更快的节奏和更直接的话术;详情页视频可以放慢节奏,强调细节与参数;海外投放则要注意字幕语言、文化符号的适配,以及模特形象与当地审美的一致性。
流程、审核与复用:让产出稳定下来
建立固定流水线
一条可复用的流水线大致是:视频简报 → 脚本与分镜 → 首帧生成 → 片段生成 → 粗剪 → 审核 → 精剪与声音 → 交付。每一步都有明确的输入和输出,避免出现"素材给过来就开始生成"这种混乱状态。
设置审核节点
至少设三个审核点:脚本审核、首帧审核、粗剪审核。首帧审核尤其重要,因为一旦进入视频生成阶段,修改成本会成倍上升。让决策者在首帧阶段就把意见提完。
素材复用与模板化
把高频使用的镜头做成模板:产品旋转展示、使用场景开场、价格落版、品牌收尾。下次做活动时,只替换产品素材和文案,结构不变。这种做法能把制作时间压缩到原来的很小一部分,同时保持品牌视觉的连贯性。
团队分工建议
- 策划负责简报与卖点提炼。
- 提示词负责人负责把卖点翻译成分镜与提示词。
- 生成负责首帧与片段产出,并做初步筛选。
- 剪辑负责节奏、字幕、声音与多版本输出。
- 投放负责反馈数据,反哺下一轮钩子与卖点排序。
常见问题
问:没有专业人员,一个人能完成整条流程吗?
可以,但要做好任务分级。一个人时,把精力集中在脚本和首帧上,因为这两步决定成败。片段生成和剪辑可以借助模板化流程快速完成。不要试图每条视频都精雕细琢,把标准流程跑顺比追求单条完美更重要。
问:AI 生成的视频可以直接用于广告投放吗?
需要做合规检查。重点看三件事:平台对 AI 生成内容的标识要求、广告法对宣传用语的约束、以及素材版权与肖像授权。促销文案中的绝对化表述、效果承诺、对比性言论都要谨慎处理。
问:产品颜色总是不对怎么办?
首先检查参考图是否准确;其次在提示词中写清色相与材质,比如"哑光深灰金属"而不是"灰色";最后在后期统一校色,并在关键镜头上手动微调。如果产品颜色是核心竞争力,建议在生成后用真实产品图做局部合成。
问:人物脸部在不同镜头里跳变怎么办?
减少人物的角度变化幅度,固定参考图集与服装描述,把大角度切换拆成多个短镜头。也可以通过构图规避,比如只拍手部动作或背影,把面部出镜集中在少数镜头里。
问:画面里的文字和 logo 怎么处理?
不要让模型生成文字。所有文字、价格、logo、二维码都在后期叠加。这样既准确,也方便多语言版本替换。
问:如何避免明显的"AI 感"?
三个方向:降低运动幅度,真实广告的运镜通常比 AI 生成的更克制;增加真实细节,比如轻微手部抖动、环境噪音、自然光变化;统一调色与颗粒感,让整条片子处于同一视觉世界。
问:一个促销周期应该准备多少条视频?
按测试需求反推。如果计划测试五个钩子、三个卖点排序,那么至少准备八到十条不同组合的版本。宁可版本多一些、每条更轻量,也不要只做一条重投入的片子。
问:素材版权要注意什么?
产品图要确认拍摄或授权来源,音乐要有商用授权,人物出镜要有肖像许可,AI 生成内容要留意所用工具的服务条款中关于商业使用的约定。
落地检查清单
- 视频简报已确认,包含目标、卖点、禁用项、交付规格。
- 产品参考图与色值清单已整理,人物与场景资产已归档。
- 分镜已拆解,每个镜头有明确的镜头类型、动作和时长。
- 提示词包含运镜、光线、负向约束与画幅信息。
- 首帧已审核通过,才进入视频生成阶段。
- 产品、人物、风格三层一致性已逐镜头检查。
- 字幕放在平台安全区内,文字全部后期叠加。
- 配音、音乐、音效已确认可商用且风格统一。
- 至少准备三个可测试版本,变量设计清晰。
- 竖屏、方屏、横版各版本已导出并检查主体未被裁切。
- 投放数据回收机制已建立,用于下一轮钩子优化。
把这套流程跑上两三个促销周期,你会发现真正被节省的不只是制作时间,更是决策成本。当团队知道每一步该产出什么、该由谁审核、该用什么标准判断好坏时,AI 才真正从"玩具"变成了可规模化的生产能力。



