文本生视频的工作流全景
过去,一条三十秒的品牌短片意味着脚本、场地、演员、摄影、灯光、后期,至少一周的协作。现在,同一个目标可以先从一段文字开始:描述场景、镜头运动、光线氛围,让模型生成若干候选片段,再由人挑出可用素材进行剪辑。真正被改变的不是「AI会画画」,而是「从想法到可剪素材」这段路径被压缩到了几分钟。
这种压缩带来一个常见误解:既然生成只要几秒钟,那创作应该也很快。事实恰恰相反。生成速度越快,你面对的选择就越多;候选片段越多,判断和筛选的成本就越高。把文本生视频用得稳定的人,通常不是提示词写得最华丽的人,而是最懂镜头语言、剪辑节奏和素材管理的人。他们清楚模型能做什么,也清楚边界在哪里,于是把有限的生成机会花在最关键的镜头上。
一条完整的工作流大致包含七个环节:创意拆解、提示词撰写、首帧与关键帧设计、批量生成、筛选与整理、剪辑与声音、输出与分发。很多教程只讲第三步和第四步,也就是「怎么写提示词」和「用什么模型」,但真正决定成片质量的往往是第一步、第五步和第六步。一个镜头表写得清楚的人,即使使用能力一般的模型,也能剪出结构完整的成片;反之,提示词再花哨,也救不了一个没有叙事逻辑的项目。
还有一个容易被忽略的现实:AI 生成素材是「概率产出」,不是「精确执行」。同一个提示词生成四次,可能得到四条文风相近但细节不同的片段。这意味着你的工作方式必须从「下达指令、等待结果」转变为「设定范围、批量筛选、逐步收敛」。理解这一点,后面的所有技巧才有落脚点。
本文给出一套可迁移的做法:不绑定具体平台,不讨论付费方案,只关注流程、判断标准和常见坑。无论你最终用哪一款模型,这套框架都能直接套用。
第一步:把创意拆成模型能执行的任务
判断项目类型
文本生视频适合的项目类型其实很集中。第一类是概念片与情绪片:没有对白,靠画面和音乐传递氛围,比如品牌调性片、音乐可视化、氛围短片。第二类是产品与材质展示:需要干净的背景、稳定的运镜和清晰的主体,模型在金属、玻璃、织物、液体这类材质上的表现往往超出预期。第三类是叙事短片的空镜与转场:人物特写和复杂对白交给实拍,环境、天气、城市、回忆闪回交给生成。第四类是分镜预演:在正式拍摄前,用生成片段验证镜头节奏和构图是否成立。
把这四类分清楚,你就会发现大部分项目其实不需要「全片生成」,而是需要在特定环节使用生成能力。明确这一点,能避免掉进「整片都由 AI 完成」的陷阱。
什么内容不适合直接生成
有几类需求目前仍然不适合完全交给生成模型。长时间固定机位的对白戏,因为口型与表演细节很难保持稳定。需要精确品牌规范的产品特写,因为标志与文字容易变形。涉及真实人物肖像或受版权保护形象的内容,存在合规风险。需要严格物理逻辑的动作段落,比如复杂的器械操作、多人物肢体接触、精细的手部操作。
识别出这些边界,能帮你省下大量反复生成的时间。更聪明的做法是提前安排替代方案:该用实拍的地方用实拍,该用素材库的地方用素材库,把生成能力集中在它真正擅长的地方。
定义「成功」的标准
在开始生成之前,先写下这个项目「成功」的标准:是画面质感优先,还是叙事完整优先?是必须出现某个产品细节,还是只要氛围到位?是追求风格统一,还是允许镜头之间有明显差异?
这个标准会直接决定你选择哪类模型、每个镜头生成几条候选、后期愿意投入多少时间。没有标准的项目通常会在中途失控:不断重生成,不断修改提示词,最后既没时间也没素材。把标准写在一张纸上贴在手边,是成本最低的质量管理手段。
提示词工程:写给模型的镜头说明书
结构化的提示词模板
一个稳定的提示词通常包含六个部分:主体、动作、环境、镜头、光线、风格。把它们按固定顺序排列,可以显著降低结果的随机性。例如:「一位穿深色风衣的中年男性,站在雨后的街道上缓慢转身,背景是霓虹灯映照的便利店,中景,镜头轻微右移,冷色调侧光,写实电影质感,浅景深。」这比「一个男人在雨里很酷」要可靠得多。
固定顺序还有一个隐形好处:当结果不符合预期时,你能快速定位是哪一部分出了问题。是所有镜头都漂移,还是只有光线不对?是有序模板让排查变得可能。
镜头语言关键词表
镜头相关的词最值得单独累积:特写、中景、全景、大远景、过肩镜头、俯拍、仰拍、低角度跟拍、推轨、摇摄、手持晃动、稳定器跟随、慢速变焦、环绕运镜、第一人称视角。
光线词同样关键:逆光、侧逆光、黄昏黄金时刻、蓝色时刻、硬光高对比、柔光散射、实用光源(路灯、霓虹、屏幕反光)、顶光、窗外自然光。风格词则包括:纪录片质感、十六毫米胶片颗粒、动画赛璐璐、三维渲染、超现实、赛博朋克、极简主义、复古广告。
把这些词整理成自己的关键词表,写作时直接调用,比每次临时想词要高效得多。更进一步,可以按项目类型建立几套「预设组合」:情绪片用柔光加浅景深,产品片用硬光加干净背景,动作戏用手持加高对比。
动作与时间的描述技巧
模型对「单一动作」的理解远好于「连续动作」。与其写「他走进房间,坐下,然后打开笔记本」,不如拆成三个镜头分别生成。如果镜头内必须有动作变化,用时间副词明确节奏:「先停顿两秒,然后缓慢抬头」。
避免模糊的持续性动词,比如「一直跳舞」,改成「重复同一个转身动作」。也不要同时安排两个主体做不同动作,模型很容易让其中一个消失或者动作合并。
三个最常见的提示词错误
第一,信息过载。把十个形容词塞进一句话,模型只会随机抓取其中两三个。第二,否定式描述。「不要出现文字」往往会让模型更关注「文字」这个概念,改成正面描述你要什么,比如「干净无标识的背景墙」。第三,忽略画幅与构图。竖屏短视频和横屏电影的构图逻辑不同,提示词里的景别描述需要匹配最终画幅,否则会得到大量无法使用的边缘构图。
分镜与镜头表:长视频的隐形瓶颈
镜头表应该包含哪些字段
一份可用的镜头表至少包含:镜号、时长、画面内容、镜头运动、光线氛围、角色与服装、道具、对白或旁白、音效、备注。看起来繁琐,但它解决的是「生成之后怎么剪」的问题。当你有六十条素材需要归位时,镜头表就是唯一的秩序来源。
建议把镜头表做成表格,并为「画面内容」和「光线氛围」两列建立固定写法。固定写法的意义在于可复制:生成时直接粘贴,不用重新组织语言,减少变量。
用「锚点」维持角色一致性
角色一致性是文本生视频最大的痛点。实用做法是建立「角色锚点」:为每个主要角色写一段固定的外观描述,包括年龄、发型、发色、脸型特征、服装、配饰、标志性动作。每次生成该角色时,把这段描述原封不动复制进提示词。
同时保存一张效果最好的角色图作为参考图,后续镜头尽量以图生视频的方式启动,而不是纯文本生成。如果模型支持首尾帧控制,就让每个镜头从同一张角色图中开始,一致性会明显提高。
场景与道具的连续性管理
场景的连续性依赖三件事:光线方向、色调基调和空间结构。如果第一镜是「黄昏、暖橘色、街道左侧有路灯」,那么后续同场景镜头要沿用同样的光线和色调描述。道具更简单:把关键道具写进镜头表并固定描述词,比如「红色帆布手提袋、磨损的皮质提手」,避免每次生成都换一种样式。
还可以为每个场景制作一张「场景基调卡」,用三行文字概括光线、色调和主要材质。生成前对照一下,能挡掉大部分跳变问题。
工具选型:不同模型的能力边界
偏写实与物理合理性的模型
这一类模型的强项是场景的物理逻辑与镜头连贯性:物体不会突然消失,人物走动时重心合理,光影变化符合直觉。它们适合城市空镜、自然景观、交通工具、需要「看起来真实发生过」的镜头。弱项往往在人物面部细节和东方审美上,特写镜头容易出现轻微的塑料感。
偏人物细节与美学风格的模型
另一类模型在人物、服装、古风与动漫风格上表现突出,面部结构稳定,皮肤质感细腻,运镜也更电影化。它们适合人物特写、服饰展示、情绪镜头和风格化短片。弱项通常是复杂物理动作和多物体交互,手臂遮挡、多人接触这类场景容易出错。
还有一类模型专门优化了运动幅度和镜头调度,适合广告式的强节奏画面,但对静态细节的打磨不如前两类。
开源与本地部署的取舍
开源模型的价值在于可控性和可定制性:可以微调风格、可以做批量流水线、可以把整个流程放在自己的机器上,素材也不出本地。代价是需要硬件、需要调试、需要自己解决稳定性问题。
判断标准很简单:如果你需要重复生产同一种风格的素材,开源方案值得投入;如果只是偶尔做几条概念片,直接用成熟的云端工具更省事。团队规模也是因素——一个人维护本地环境的时间成本,往往高于它省下的麻烦。
选型决策清单
问自己四个问题:这个镜头最怕出现什么问题(人物崩坏还是场景失控)?我能否接受多次重新生成?我是否需要参考图与首尾帧控制?后期团队更熟悉哪种素材特性?
把答案写下来,选型基本就清晰了。更实用的做法是「一个项目两套模型」:人物镜头用一套,环境空镜用另一套,各取所长,最后在剪辑台上统一风格。
从素材到成片:剪辑与声音的工作流
粗剪:先保叙事再谈画面
生成素材的第一轮剪辑不要纠结画质。先把能讲清楚故事的片段按顺序摆好,用最粗糙的硬切连接,确认节奏和逻辑成立。只有当叙事链完整时,才值得为某个镜头重新生成更高质量版本。
反过来做,你会在还没确定结构时就烧掉大量时间。粗剪阶段建议关掉音乐,只用画面判断信息是否交代清楚。如果画面本身讲不清故事,指望配乐救场通常不现实。
声音设计决定成片质感
AI 生成的片段通常没有声音,或者声音与画面不同步。成片质感的一半来自声音:环境底噪(雨声、城市远处车流、室内空调声)、动作音效(脚步、开门、衣物摩擦)、音乐的情绪走向。
一个简单有效的做法是先铺环境音,再加音乐,最后补动作音效,层次会自然很多。旁白则建议先写好文本,用稳定的配音工具生成,再把画面往声音上对齐,而不是反过来。
还有一个细节值得注意:生成片段里存在大量无法解释的运动(衣摆飘动、发丝飞扬),配上合适的音效后,这些运动反而显得合理。声音在某种意义上是在为画面「补逻辑」。
调色与分辨率处理
不同来源的片段色调往往不统一。统一流程是:先做基础曝光和白平衡校正,再用统一的查找表做风格化,最后加轻微颗粒和暗角增加一致性。
分辨率方面,如果最终需要一个高分辨率特写,可以使用放大工具处理,但要注意过度放大容易把皮肤细节变成塑料质感,宁可保留一点噪点。另外,把生成片段放进时间线前先统一帧率,可以避免运动镜头出现顿挫感。
问题排查手册:一致性、物理与细节
人物变脸与身份漂移
症状:同一角色在不同镜头里像不同的人。原因通常是提示词描述不一致,或者缺少参考图。解决:固定角色描述文本,保存角色参考图,尽量采用图生视频,减少纯文本随机性。如果角色必须出现正脸特写,多生成几条,只挑最接近参考图的。
场景跳变与光线不一致
症状:同一场景的两个镜头,天色、光源方向或建筑细节不同。解决:把光线与色调描述写进镜头表模板,每次生成时复制粘贴;必要时先用一张环境参考图确定基调,所有同场景镜头都以它为起点。
手部、肢体与物理崩坏
症状:手指数量异常、物体穿透、动作不连贯。解决:避免手部特写,把手放在口袋、背后或持有道具;把复杂动作拆成两个短镜头;降低动作速度;减少画面中的人物数量。
如果崩坏集中出现在镜头后半段,可以把这条镜头裁短,只取前两秒使用。很多时候,问题镜头裁掉后半段就完全可用了。
文字与标志的失真
症状:画面中的招牌、书本、屏幕上出现乱码文字。解决:让画面避开文字区域,或后期用干净的图形覆盖;需要品牌露出时,在实拍素材或合成层里加标志,不要指望模型生成正确的文字。
可复用生产流程与质量评估
资产库与命名规范
建立一个简单的资产库:按项目、场景、角色、镜号分层存放。命名规范建议包含镜号、版本和状态,比如「SH012_v03_approved」。看起来是小事,但当素材超过一百条时,它决定了你能否在十分钟内找到正确的版本。
版本管理与迭代节奏
每次修改只调整一个变量:要么只改提示词,要么只改参考图,要么只改随机种子。同时改三样东西,你就无法知道哪一项起了作用。
迭代节奏上,建议每轮生成两到四条候选,筛掉明显不合格的,保留一条最好的进入下一轮,而不是一次生成二十条再挑花眼。稳定的迭代节奏比一次性的「抽到好牌」更能保证项目交付。
团队分工建议
小团队可以按角色分工:创意与分镜由导演或策划负责,提示词与生成由生成师负责,剪辑与声音由后期负责。三个角色之间用镜头表和资产库交接,而不是靠口头描述。
中型项目可以再增加一个质量把关角色,只做一件事:判断素材是否达到可用标准。把「判断」和「创作」分开,是防止团队陷入无休止重生成的有效手段。
五维评分表
评估一条生成结果时,用五个维度各打一到五分:画面质量、镜头稳定性、角色一致性、与脚本的贴合度、后期可修补性。总分低于十五分通常不值得进入剪辑,除非这个镜头极其关键。
复用率与浪费率
记录两个数字:每条成片使用了多少条生成素材(复用率),以及每条素材平均生成几次才可用(浪费率)。这两个数字会告诉你流程哪里出了问题:复用率低说明镜头表不够细,浪费率高说明提示词或选型需要调整。
进阶:混合工作流与多模型协作
生成加实拍
最常见的混合方案是:人物与对白用实拍,环境、空镜、闪回、想象中的画面用生成。这样做的好处是叙事有了真实表演支撑,同时画面想象力不受预算限制。
剪辑时要注意匹配:生成片段的光线方向和色温要向实拍素材靠拢,而不是反过来。提前把实拍的灯光参数和白平衡记下来,生成时作为描述的一部分。
分镜预演与动态预览
在正式制作前,用生成片段做一版动态分镜,可以提前发现节奏问题。这比静态故事板更直观:你能听到音乐和画面的配合,也能看到镜头切换是否突兀。预演版不需要高画质,只需要结构正确、时长准确。
让模型负责重复劳动
真正有价值的应用不是「一键生成电影」,而是把重复劳动自动化:批量生成同一产品的不同背景、为同一角色生成多个角度的素材、把一段旁白自动配上一组相关空镜、为同一个镜头制作多种画幅版本。
把模型放在流程的重复环节,而不是创意决策环节,产出会稳定得多,团队也更容易接受这套工具。
常见问题解答与收尾建议
一个镜头应该生成几条?
常规镜头两到四条,关键镜头六到八条。超过这个数量通常说明提示词本身有问题,应该回去修改描述,而不是继续抽卡。把「重生成」当成解法,是最容易上瘾也最没有回报的习惯。
竖屏短视频和横屏电影的工作流差别大吗?
差别主要在构图和节奏。竖屏更适合人物特写和垂直运动,画面信息量要更少,前两秒必须抓人。横屏可以容纳更多环境信息,但每个镜头的有效时长可以稍长。同一个项目如果需要双画幅输出,建议在生成时就规划两种构图,而不是靠后期裁切。
音乐和配音应该什么时候做?
建议在粗剪完成后立刻做。声音会改变你对画面的判断:同一组镜头配上不同的音乐,节奏感受完全不同,早做声音能避免后期大改。配音则越早确定越好,因为台词长度会决定镜头时长。
如何避免画面「一眼AI」?
三个方向:减少完美感,加入轻微的颗粒、不完全对称的构图、手持晃动;保证物理逻辑,光线方向、阴影位置、物体运动要合理;控制时长,把每个生成镜头的有效时长压到三到五秒,用剪辑衔接代替长镜头。
提示词要不要用英文?
大多数模型对英文的响应更稳定,但这取决于具体模型。稳妥做法是把关键描述词保留英文,把整体结构写成你最容易维护的语言,并建立自己的中英词表方便对照。
结语
文本生视频不是魔法棒,而是一个需要被编排的摄影组。模型提供画面能力,人提供叙事判断、镜头逻辑和质量标准。把工作流拆清楚、把镜头表写细、把声音做扎实,你会发现成片质量的上限并不取决于你用了哪一款模型,而取决于你如何组织整个流程。
如果你刚刚开始,建议从一个三十秒、无对白的情绪短片入手,把本文的七个环节完整走一遍。跑通一次全流程的价值,远高于收藏一百条提示词。




