为什么AI视频需要工作流而不是单次提示词
很多人第一次使用AI视频工具时,会直接把一句描述丢进输入框,然后期待生成一段可以直接发布的成片。结果通常是:画面很惊艳,但角色前后不一致、镜头运动混乱、节奏拖沓、声音与画面不匹配。问题不在于模型不够强,而在于缺少一套从创意到交付的完整工作流。
AI视频创作更像传统影视制作,而不是抽奖。它包含需求定义、脚本、分镜、提示词、模型选择、生成筛选、后期剪辑、质量检查等环节。每个环节都有明确的输入和输出。只有把每个环节标准化,才能稳定地产出可用内容,并在客户修改意见到来时快速定位问题。
一个成熟的AI视频工作流通常包含五个核心阶段:策划阶段确定目标与规格,前期阶段完成脚本和分镜,生成阶段完成提示词与模型调用,筛选阶段完成版本比较和质量评分,后期阶段完成剪辑、声音、包装与输出。五个阶段环环相扣,任何一环缺失都会导致返工。
本文将围绕一条可复用的AI视频工作流展开,重点讨论脚本分镜、提示词设计、角色一致性、关键帧控制、批量生成、后期剪辑和常见问题排查。无论你制作的是短视频、广告片、剧情短片、产品演示还是知识口播,都可以把这套方法迁移到自己的项目中。
第一步:明确目标、平台与交付规格
先确定成片用途
在写任何提示词之前,先回答几个问题:这条视频给谁看?发布在哪个平台?主要目标是品牌曝光、产品转化、知识传播还是娱乐?不同目标会直接影响镜头密度、信息量和情绪强度。例如,产品演示需要清晰展示使用场景和细节特写,剧情短片则更依赖角色表演和镜头调度。
如果目标不明确,最常见的结果是画面很漂亮但信息没有重点。观众看完只记得氛围,却记不住产品、人物或观点。为了避免这种情况,可以在项目开始时写一句目标陈述:这条视频要让观众在看完后知道什么、感受到什么、采取什么行动。
画幅、时长与节奏
横屏、竖屏和方形画幅会改变构图策略。竖屏更适合人物近景和快速切换,横屏更适合大场景和空间关系。方形画幅常见于社交媒体信息流,需要在中心区域安排主要视觉元素。选择画幅时,要考虑最终发布平台和观看设备。
时长方面,短视频通常需要在极短时间内抓住注意力,因此前几秒必须出现明确冲突、结果或视觉钩子。长视频则需要更完整的起承转合,并预留转场和呼吸空间。一个实用的判断标准是:如果三秒内没有新信息、新情绪或新画面变化,观众就可能划走。
建议在项目开始时写一份简短的交付规格:分辨率、画幅、帧率、目标时长、字幕语言、配音风格、音乐情绪、品牌色和禁用元素。这份规格会成为后续所有生成和剪辑决策的验收标准。
风格参考与验收标准
收集三到五张参考图或参考视频,明确色调、光线、镜头质感和角色气质。不要只说“电影感”,而要拆解成可执行的描述:低饱和冷色调、逆光轮廓、浅景深、手持微晃、颗粒感、宽银幕比例。验收标准越具体,返工越少。
在平台规格方面,还要考虑安全区域。竖屏视频的上下边缘容易被界面遮挡,重要文字和人物面部要放在中间安全区。横屏视频的左右边缘在电视上可能被裁切。字幕位置要避开平台自带按钮和进度条区域。提前确认这些细节,可以避免成片导出后才发现文字被遮挡。
第二步:脚本、分镜与镜头表
从核心卖点到一句话故事
先写一句话概括:谁,在什么处境下,做了什么,结果如何。这句话是整条视频的骨架。然后扩展成三幕结构:开端建立人物和场景,中段制造冲突或展示核心信息,结尾给出结果或行动号召。对于产品视频,可以把产品当作解决问题的主角;对于剧情视频,则要让角色目标清晰可见。
一句话故事不需要复杂,但必须具体。比如“忙碌的上班族在雨天错过公交,用一款应用快速叫到车,最终准时到达重要会议”,比“展示出行应用的功能”更容易转化为镜头。分镜阶段所有镜头都应服务于这句话,而不是为了炫技而存在。
分镜表应该包含哪些字段
一个实用的分镜表至少包含:镜号、时长、景别、镜头运动、画面内容、角色动作、台词或旁白、音效、音乐提示、转场方式和生成备注。生成备注里记录使用的模型、提示词版本、参考图编号和关键帧文件。这样在后续修改时,你不需要重新回忆当时为什么这样生成。
分镜表样例可以这样写:镜号一,时长两秒,远景,固定机位,画面内容是清晨城市天际线,角色旁白介绍背景;镜号二,时长三秒,中景,缓慢推近,画面内容是主角站在窗前看手机,表情焦虑;镜号三,时长两秒,特写,手持微晃,画面内容是手机屏幕弹出提醒。通过这种结构化写法,生成和剪辑都更有依据。
镜头类型、转场与节奏设计
镜头类型包括远景、全景、中景、近景和特写。远景交代环境,中景展示动作,近景和特写传递情绪。镜头运动可以用推、拉、摇、移、跟和升降。转场可以是硬切、叠化、遮挡转场、动作匹配或声音先入。节奏设计要考虑信息密度:复杂信息需要更长的镜头,情绪爆点可以用短镜头快速切换。
建议先画一个简单的节奏曲线:开头三秒给钩子,中段每五到八秒给一次新信息,结尾留出品牌落版或行动号召。这样在生成素材时,你就知道哪些镜头必须优先保证质量。对于对话场景,可以使用过肩镜头和正反打;对于动作场景,可以使用跟拍和快速硬切;对于情绪场景,可以使用长焦近景和缓慢推镜。
第三步:提示词设计:把创意翻译成模型能理解的语言
六要素结构
一个好用的提示词可以拆成六要素:主体、动作、场景、镜头、光线和风格。主体要具体到年龄、服装、表情和状态;动作要说明幅度、速度和方向;场景要交代时间、天气、地点和背景元素;镜头要写明景别、焦段、机位和运动;光线要描述光源方向、色温和对比度;风格要指定写实、动漫、插画、胶片或三维渲染。
例如,不要写“一个女孩在街上走”,而可以写“二十多岁的短发女孩,穿深蓝色风衣,提着旧皮包,在雨后的石板街上快步行走,中景跟拍,低机位,傍晚冷蓝色调,霓虹反射在积水中,电影感浅景深”。后者给模型的信息更充分,生成结果也更可控。
镜头术语可以帮助你精确控制画面。广角适合环境交代,标准焦段接近人眼,长焦适合压缩空间和突出人物,微距适合细节特写。俯拍显得角色渺小,仰拍显得角色强大,过肩镜头建立对话关系,主观视角让观众代入角色。把这些词写进提示词,比只写“好看”更有效。
光线术语同样重要。顺光清晰但平淡,侧光立体,逆光有轮廓和氛围,顶光压抑,底光诡异。黄金时刻温暖柔和,蓝调时刻冷静忧郁,伦勃朗光适合人物肖像。不同光线会改变观众对角色和场景的情绪判断。
正提示词、负提示词与权重
正提示词描述你想要的画面,负提示词描述你不想出现的元素,例如多余手指、文字乱码、面部扭曲、肢体重复、过度锐化或水印。权重可以用来强调关键元素,但不要同时调整太多变量。权重过高容易导致画面僵硬或元素冲突。
如果工具支持分段提示词,可以把主体、动作、场景和镜头分开写,方便单独调整。对于角色一致性要求高的项目,建议把角色描述做成固定模板,每次只替换动作、场景和镜头部分。负提示词也要保持稳定,避免每次生成时把不同的禁用项混在一起。
迭代方法:一次只改一个变量
生成结果不理想时,不要一次性重写全部提示词。先判断问题属于哪一类:角色不像、动作不对、构图不对、光线不对还是风格不对。然后只修改对应部分。例如角色不像,就调整角色描述和参考图;动作不对,就修改动作动词和速度描述;构图不对,就调整景别、机位和镜头运动。每次只改一个变量,才能知道哪个改动真正有效。
建议为每个项目建立提示词版本表,记录版本号、改动内容、生成结果评分和采用情况。这样在团队协作时,其他人可以快速理解当前最优提示词是怎么来的。版本表不需要复杂,一个共享表格就足够,关键是坚持记录。
第四步:模型选择与组合策略
不同任务对应不同模型
写实人物、动漫角色、产品展示、建筑空间、自然风景和抽象图形,对模型能力的要求不同。写实类更看重皮肤质感、光影和镜头语言;动漫类更看重线条、色彩和角色表情;产品类更看重材质、边缘和文字清晰度;自然类更看重运动逻辑和细节稳定性。
选择模型时,不要只看单次生成的惊艳程度,还要看一致性、可控性、生成速度、失败率和后期可修复性。一个生成速度稍慢但角色稳定的模型,往往比一个速度快但十次里只有一次可用的模型更高效。评估时可以给每个模型建立评分卡,记录它在不同任务上的表现。
文生视频、图生视频与首尾帧
文生视频适合快速探索概念和氛围,图生视频适合把已经确定的画面变成运动镜头,首尾帧控制适合需要精确转场或动作收尾的镜头。实际项目中,三者经常组合使用:先用文生视频找感觉,再用图生视频锁定构图,最后用首尾帧控制关键动作。
如果工具支持运动笔刷或区域控制,可以把运动限制在特定区域,例如让人物移动而背景保持稳定,或者让头发和衣摆轻微飘动。这样能减少全画面乱动的问题。对于产品展示,可以让镜头环绕产品缓慢旋转,同时保持产品形状和文字不变。
多模型组合的常见方案
一条成片不一定只用一个模型。常见组合是:用写实模型生成人物镜头,用风景模型生成空镜,用图形模型生成字幕背景,再在剪辑软件里统一调色和节奏。组合的关键是保持光线方向、色调和镜头质感一致。如果不同模型的画面风格差异太大,后期需要花大量时间匹配。
建议在分镜阶段就标注每个镜头预计使用的模型类型,而不是生成时随意切换。这样可以提前发现风格冲突,并在提示词中统一色调、光线和镜头语言。对于关键角色镜头,尽量使用同一个模型或同一组参考图,以减少面部漂移。
第五步:角色一致性与场景连贯
角色设定表
角色一致性是AI视频最大的难点之一。建议为每个主要角色建立设定表,包含姓名、年龄、身高体型、脸型、发型、发色、瞳色、服装、配饰、气质、常用表情和参考图编号。设定表越详细,提示词越稳定。
设定表还要记录角色在不同场景中的变化,例如是否淋雨、是否受伤、是否换装、是否戴帽子。这些变化会影响面部和服装的生成结果。如果没有记录,下一镜头很容易回到默认状态,导致连贯性断裂。
多图参考与关键帧
多图参考可以让模型同时学习角色的正面、侧面、背面和不同表情。上传参考图时,要选择光线一致、背景干净、面部清晰的照片或插画。关键帧则用于锁定特定动作的起始和结束画面,减少中间帧漂移。
如果角色需要在多个场景中出现,可以先制作一张标准角色图,再用它作为图生视频的起点。每个镜头都从同一张标准图出发,角色一致性会明显提高。对于重要项目,还可以用同一角色的多角度图片训练一个轻量角色适配器,但训练前要确保素材风格统一、分辨率足够、没有遮挡。
服装、道具与光线连续性
除了脸,服装、发型、配饰和道具也会影响连贯性。例如,角色在上一镜头穿红色外套,下一镜头不能变成蓝色。光线方向也要连续:如果上一镜头光源在左侧,下一镜头最好保持左侧光,否则剪辑在一起会显得跳戏。
建议在分镜表里增加“连续性检查”一列,记录每个镜头的服装、道具、光线方向和角色情绪状态。拍摄真人影视时这叫场记,AI视频同样需要。每次生成新镜头前,先对照上一镜头的连续性记录,再写提示词。
种子与版本管理
如果工具支持种子值,固定种子可以在相同提示词下获得更稳定的结果。但固定种子不代表完全一致,模型版本、参考图和参数变化仍会影响输出。因此,最好把种子、模型版本、提示词版本和参考图编号一起记录。
版本管理可以使用简单的表格,也可以使用文件夹命名规范。例如:项目名_镜号_版本_日期_模型_状态。状态包括待筛选、已采用、备用和废弃。这样在剪辑时不会拿错素材。对于团队项目,素材库要设置明确的读写权限,避免多人同时覆盖同一文件。
第六步:批量生成、筛选与版本管理
批量生成的参数控制
批量生成时,不要一次改变太多参数。可以先固定提示词和参考图,只改变种子或运动幅度,生成一批候选。然后根据评分表筛选出最好的几条。对于关键镜头,可以生成更多候选;对于过场镜头,可以减少数量,节省时间。
如果工具支持队列,可以把不同镜头分组提交,并在等待时处理其他工作。批量生成前,先确认分辨率、帧率和时长等基础参数一致,否则后期拼接时会出现尺寸和节奏不匹配的问题。
评分表与淘汰机制
建立一个简单评分表,从角色一致性、动作自然度、构图、光线、清晰度、瑕疵程度和可用性七个维度打分。每个维度一到五分。总分低于阈值的直接淘汰,不要因为“也许后期能修”而保留太多废片。后期修复的成本往往高于重新生成。
筛选时最好由两个人独立评分,再对比结果。单人评分容易受疲劳和主观喜好影响。对于争议较大的镜头,可以放到剪辑时间线上实际查看,因为单独看画面和放进成片中的感受可能完全不同。
命名规范与素材库
素材库按项目、场次、镜号和版本分类。文件名要包含关键信息,避免出现“最终版”“最终版2”“真的最终版”这种命名。推荐格式:项目代号_场次_镜号_版本_模型_状态。这样在剪辑软件里搜索和替换会更高效。
素材库还要保存提示词、参考图、关键帧和评分记录。一个镜头为什么被采用,往往比镜头本身更重要。下次遇到类似需求时,可以复用当时的提示词结构和参数组合,而不是从零开始。
第七步:后期剪辑、声音与包装
粗剪与节奏
先把可用镜头按分镜表顺序排列,形成粗剪。粗剪阶段不要纠结转场和特效,先看叙事是否清楚、节奏是否拖沓。如果某个镜头信息不足,就回到生成环节补拍,而不是用剪辑硬凑。
剪辑时可以用“三秒法则”检查节奏:如果三秒内没有新信息、新情绪或新画面变化,考虑切镜或缩短。对于解释性内容,可以保留稍长镜头,但要用字幕、箭头或局部放大引导注意力。对于情绪段落,可以适当延长镜头,让观众有时间感受。
配音、音乐与音效
声音决定成片质感。配音要匹配角色性格和视频节奏,语速不要过快。音乐情绪要与画面一致,音效则用于强调动作、转场和环境。例如,开门声、脚步声、雨声和键盘声都能增强沉浸感。注意音乐版权和配音授权,商用项目尤其要确认使用范围。
配音与口型不同步时,可以调整画面速度或重新生成口型镜头。背景音乐不能盖住人声,通常需要把人声频段做适度提升。音效不要堆得太满,否则会显得嘈杂。留白也是一种声音设计。
字幕、调色与输出
字幕要清晰、断句合理、停留时间足够。调色用于统一不同模型生成的画面,包括白平衡、对比度、饱和度和色彩倾向。输出时根据平台要求选择分辨率、码率和音频格式。建议保留一个高质量母版,再导出适合不同平台的版本。
调色时可以先用示波器检查曝光和肤色,再调整整体风格。如果不同镜头色温差很大,可以先统一白平衡,再做风格化处理。输出前检查字幕是否超出安全区,音频是否削波,文件命名是否符合交付规范。
第八步:发布前质量检查与常见问题排查
画面问题
常见画面问题包括:角色脸部变形、手指数量异常、肢体重复、背景闪烁、物体突然出现或消失、运动方向不一致、画面过曝或欠曝。检查时逐帧播放关键动作,尤其是人物转身、手部动作和快速运动。
如果问题出现在中间帧,可以增加关键帧或缩短镜头时长。如果问题出现在动作幅度过大时,可以降低运动速度,或者把动作拆成两个镜头。背景闪烁通常与参考图不一致或运动区域控制不当有关,可以尝试固定背景参考或减少全画面运动。
音频问题
音频问题包括:配音与口型不同步、背景音乐盖住人声、音效时间点错误、左右声道不平衡、整体响度不一致。发布前用耳机和手机扬声器各听一遍,确保不同设备上都能听清。
如果整体响度不一致,可以在剪辑软件中做响度标准化。如果人声和音乐冲突,可以用侧链压缩或手动调整音乐音量。音效时间点要对齐画面动作,误差过大会显得廉价。
叙事问题
叙事问题往往比技术问题更致命:开场不够吸引人、信息重复、角色动机不清、结尾没有落点、行动号召不明确。解决方法是回到一句话故事和三幕结构,检查每个镜头是否推动叙事。如果镜头只是好看但不推动故事,可以考虑删除或缩短。
还可以请没有参与制作的人观看粗剪,记录他们在哪个时间点走神、哪个信息没看懂、哪个情绪没有感受到。外部反馈通常比内部讨论更接近真实观众体验。
常见问题FAQ
问:为什么生成的角色每次都不一样?
答:通常是因为缺少角色设定表、参考图不统一或提示词每次都有变化。建议固定角色描述模板,使用多图参考,并尽量保持光线和构图一致。
问:生成视频很短,如何做成长片?
答:把长片拆成多个短镜头,每个镜头单独生成,再在剪辑软件中拼接。用统一的分镜表、角色设定和调色流程保持连贯。
问:画面很漂亮但动作很假怎么办?
答:降低动作幅度,增加中间关键帧,或者改用图生视频和首尾帧控制。也可以把复杂动作拆成多个简单动作镜头。
问:如何减少后期返工?
答:在生成前明确交付规格,使用分镜表和提示词版本表,批量生成后严格筛选,不要让低分素材进入剪辑。
问:团队协作时如何避免版本混乱?
答:统一命名规范,使用共享素材库,每次审片只反馈可执行修改,并指定一人负责最终版本合并。
问:提示词越长越好吗?
答:不是。提示词要覆盖关键变量,但不要堆砌互相冲突的描述。把主体、动作、场景、镜头、光线和风格写清楚,比堆形容词更有效。
问:什么时候该换模型?
答:当同一模型在多个项目中反复出现同类问题,且调整提示词和参考图后仍无法解决时,可以考虑换模型。换模型前先做小规模对比测试。
问:如何判断一个镜头是否合格?
答:把镜头放进时间线,检查它是否推动叙事、是否与前后镜头连贯、是否在手机小屏上仍然清晰。单独好看不等于成片可用。
第九步:效率提升、团队协作与持续优化
模板化
把常用提示词、分镜表、评分表和命名规范做成模板。新项目开始时直接复制模板,只修改项目专属内容。模板化可以显著减少重复劳动,也能让新成员快速上手。
模板还可以分层:基础模板包含通用结构,项目模板包含品牌色、角色和场景,镜头模板包含景别、光线和运动。分层模板既保证一致性,又保留灵活调整空间。
任务队列
生成任务可以按优先级排队:关键角色镜头优先,空镜和过场其次,实验性镜头最后。如果工具支持队列和批量提交,可以提前准备多组提示词,在等待时处理剪辑或文案工作。
队列管理还要考虑依赖关系。例如,某些镜头需要先确定角色标准图,某些镜头需要先完成上一镜头的关键帧。把依赖关系画成简单流程图,可以避免因为等待素材而卡住整个项目。
审片与复盘
每个项目结束后做一次复盘:哪些镜头一次通过,哪些反复失败,哪些提示词模板最有效,哪些参数容易出问题。把结论写进团队知识库。下一次项目就能站在上一次的经验上,而不是重新试错。
团队分工也可以更清晰:导演负责目标和叙事,分镜负责镜头表,提示词负责生成质量,剪辑负责节奏和声音,质检负责发布前检查。角色清晰后,沟通成本会明显下降。
结语:从会用到用好
AI视频工具会不断更新,但工作流的价值不会过时。明确目标、写好脚本、拆好分镜、设计提示词、选择合适模型、控制角色一致性、批量筛选、精细剪辑、严格质检,这些环节构成了稳定产出的基础。真正高效的创作者不是每次都能抽到好结果,而是能把好结果变成可重复的流程。
开始下一个项目时,不妨先花半小时写交付规格和分镜表,再花十分钟建立角色设定和提示词模板。你会发现,前期多做的这些准备,会在生成和后期阶段成倍节省时间。把每一次生成都当作一次有记录的实验,你的AI视频工作流就会越来越稳,成片质量也会越来越高。


