为什么文本到视频需要一套工作流
很多人第一次用 AI 生成视频时,习惯把整段故事浓缩成一句话丢给模型,然后期待得到一条完整成片。结果通常很相似:画面很漂亮,但人物中途换了脸、动作对不上口型、镜头之间跳接突兀,最后只能从几十条结果里挑出两三秒勉强能用的片段。问题往往不在模型不够强,而在于缺少一条可重复的流程。
文本到视频(Text-to-Video,简称 T2V)本质上是「按镜头生成素材」,而不是「按影片生成作品」。它更接近实拍:先有剧本和分镜,再逐镜头取景,最后在剪辑台上组装成片。把这套逻辑搬到 AI 生成里,会带来三个直接好处:
- 可控性提升:每个镜头的变量更少,出问题能定位到具体镜头,而不是推翻整条片子。
- 一致性提升:人物、服装、光线、色调可以被显式约束,而不是靠运气。
- 成本更可预测:试错被限制在单个镜头内,不需要为整片重跑。
下面这套流程适合短片、品牌广告、教学动画、社媒竖屏内容与产品演示,也可以拆开单独使用——如果你只关心角色一致性,可以直接跳到对应章节。
三种常见的工作模式
- 纯文本驱动:只用文字提示生成。上手快,适合概念验证、氛围镜头和空镜。
- 图像到视频:先用文生图确定首帧,再驱动运动。控制力最强,是商业项目的主力方式。
- 视频到视频:用已有素材做风格迁移、补帧或延长。适合改造实拍素材。
大多数稳定产出的项目,都会以第二种为主、第一种为辅。原因很简单:一张确定的画面,比一段文字更接近「已经拍好的镜头」。当你把首帧定死,模型需要猜测的东西就少了一大半。
开工前必须定下的四件事
- 成片时长与画幅:15 秒竖屏和 3 分钟横屏,是两种完全不同的节奏设计,不要边做边改。
- 交付平台:不同平台对画幅、码率、字幕安全区的要求不同,提前确认能省掉一次重排。
- 视觉基调:写实、动漫、粘土、复古胶片、3D 渲染——它决定了后续模型与提示词的方向。
- 预算上限:包括生成次数、放大处理、配音配乐。没有上限的迭代会无限拉长周期。
这四件事写在纸上只要十分钟,却能避免后期大量的返工。
镜头拆解:把创意变成可生成的清单
分镜表应该包含哪些字段
一张够用的分镜表不需要复杂,但字段要齐。推荐最小字段集合如下:
| 字段 | 作用 | 示例 |
|---|---|---|
| 镜头编号 | 排序与版本管理 | S01 |
| 计划时长 | 控制节奏与总长 | 4 秒 |
| 景别 | 决定信息量 | 中近景 |
| 运镜 | 决定动感 | 缓慢推近 |
| 主体与动作 | 提示词核心 | 女性转身看向窗外 |
| 环境 | 空间与天气 | 雨夜咖啡馆 |
| 光线 | 决定质感 | 暖色侧逆光 |
| 参考图 | 一致性锚点 | 角色卡正面图 |
| 音频备注 | 对白或音效 | 雨声、杯碟轻响 |
| 优先级 | 决定先做哪条 | 高 |
字段里最容易被忽略的是「计划时长」和「优先级」。前者决定你能否在有限次数内跑完,后者决定当时间不够时先砍哪一条。
一个 30 秒短片的拆解示例
假设要做一个咖啡品牌的 30 秒竖屏短片,可以拆成 6 个镜头:
- S01(3 秒)俯拍咖啡豆落入研磨机,特写,固定机位。
- S02(4 秒)手部冲煮动作,中近景,轻微横移。
- S03(5 秒)主角端起杯子,半身,缓慢推近。
- S04(4 秒)窗外街景空镜,远景,固定。
- S05(6 秒)主角喝一口并微笑,近景,轻微手持感。
- S06(5 秒)产品包装静物,微距,环绕运镜。
每个镜头 3 到 6 秒,是当前多数模型最容易稳定输出的区间。超过这个长度,动作容易漂移、结构容易变形。
镜头时长的现实约束
大多数模型单次生成的有效时长有限,常见在 4 到 10 秒之间。所以拆镜头时按 3 到 6 秒设计最稳。如果叙事必须要有长镜头,有两种处理方式:
- 首尾帧衔接:把前一镜的最后一帧作为后一镜的首帧,保证空间连续。
- 分段生成再拼接:接受接缝,用剪辑手法(切、遮罩、动作遮挡)隐藏拼接点。
这一段最容易犯的三个错误
- 把多个动作塞进一个镜头:「她走进房间、坐下、打开笔记本、开始打字」——模型只会给你其中最明显的一个。
- 在同一句提示里切换景别:「从远景推近到特写」在部分模型上有效,但多数时候会得到含混的构图。景别变化应该拆成两个镜头。
- 忽略物理连续性:上一镜杯子在右手,下一镜换到左手,观众会立刻出戏。
模型与工具选择:按任务分配,而不是只挑最强
四类任务与匹配思路
没有「最好的模型」,只有「最适合这个镜头的模型」。可以按任务类型分配:
- 写实人物与人脸:优先选择在皮肤质感、面部结构、眼神细节上表现稳定的模型。
- 风格化与动漫:优先选择线条稳定、色彩不漂移、风格标签响应明确的模型。
- 大运动与特效:优先选择动作幅度大、运动模糊自然、不易崩解的模型。
- 产品与静物:优先选择边缘干净、反光可控、文字不易扭曲的模型。
实际项目里,一条片子混用三到四种模型很常见。人物特写用一种,环境空镜用另一种,风格化转场再用第三种——这比强迫一个模型包办所有镜头更省时间。
文本到视频与图像到视频的取舍
| 维度 | 文本到视频 | 图像到视频 |
|---|---|---|
| 上手速度 | 快 | 中等 |
| 构图控制 | 弱 | 强 |
| 一致性表现 | 一般 | 好 |
| 适合场景 | 概念验证、空镜、氛围 | 人物镜头、产品镜头、系列内容 |
| 迭代成本 | 低 | 中 |
如果项目要求角色在多个镜头中长相一致,直接选图像到视频。先在文生图阶段把角色定死,再驱动动作,能减少大量重复试错。
选择模型时要问的六个问题
- 它单次生成的有效时长是多少?
- 它对我这类提示词的跟随度如何?
- 输出分辨率和画幅能否满足交付要求?
- 运动幅度大时会不会出现结构崩解?
- 商用授权条款是否覆盖我的使用场景?
- 单位生成成本与我的预算是否匹配?
把答案写下来对比,比反复凭感觉试要快得多。
常见错误
- 盲目追新:新模型未必适合你的题材,尤其是产品镜头和文字类画面。
- 忽略授权:用于商业投放前,确认模型输出与训练数据的商用条款。
- 忽略画幅:生成 16:9 再裁成 9:16,会损失大量构图信息,最好一开始就按目标画幅生成。
提示词结构:把形容词换成可执行的指令
七段式模板
一个稳定的提示词结构可以拆成七段:
主体 → 动作 → 环境 → 镜头(景别/角度/运镜)→ 光线 → 风格与质感 → 负面约束
示例(中文):
一位三十岁女性,穿米白色针织衫,坐在窗边慢慢端起咖啡杯;雨夜咖啡馆室内,窗外霓虹反光;中近景,略低角度,缓慢推近;暖色侧逆光,柔和阴影;写实电影质感,浅景深,颗粒感轻微;不要多只手,不要文字,不要画面抖动。
同样的内容用英文重写一遍,往往会在以英文语料为主的模型上得到更准确的结果:
A woman in her thirties wearing a cream knit sweater slowly lifts a coffee cup by the window; rainy-night cafe interior with neon reflections outside; medium close-up, slightly low angle, slow push-in; warm rim light, soft shadows; cinematic realism, shallow depth of field, subtle grain; no extra hands, no text, no camera shake.
具体化比华丽化更重要
对比两组写法:
- 模糊版:「一个很美的女孩在很酷的地方做很酷的事。」
- 可执行版:「短发女性,穿黑色风衣,在地铁站台快速走过,随身背包,中景跟拍,冷白顶光,写实纪录片质感。」
第二组给出了主体、动作、地点、镜头和光线,模型需要猜的东西大幅减少,命中率自然更高。
中英文提示的差异
不同模型对语言的敏感度不同。经验上:
- 以英文语料训练的模型,用英文短句通常更准。
- 面向中文场景优化的模型,中文长句对文化语境的理解更好,但要控制从句数量。
- 混用语言时,把关键名词统一成一种语言,避免「中文描述 + 英文风格词」造成的语义割裂。
负向提示词的写法
负向提示词不要堆砌,只写你最常遇到的三个问题。例如人物镜头常驻「多余手指、扭曲面部、文字水印」,风景镜头常驻「畸变地平线、过曝、重复纹理」。写得太多反而会削弱主体描述。
常见错误
- 在提示词里描述整段剧情,而不是一个动作。
- 用抽象词代替物理描述,例如「高级感」「有氛围」。
- 忘记指定运镜,导致模型自由发挥出不可控的漂移。
角色与场景一致性:让镜头之间「接得上」
一致性是 AI 视频从「能看」到「能用」的分水岭。没有一致性,再漂亮的单帧也组不成片子。
建立角色卡
为每个主要角色准备三到五张参考图:正面、四分之三侧面、全身、以及一个特写。要求是同一张脸、同一套服装、同一光线条件。这些图会在后续所有镜头中被复用。
复用种子与参数
如果所用工具支持固定随机种子,把它记在分镜表里。同一角色的镜头尽量使用同一组基础参数,只改变动作和镜头描述。这能显著降低「换了个人」的概率。
用首尾帧衔接空间
多镜头叙事里,空间连续靠首尾帧。做法是:把前一镜的最后一帧导出,作为后一镜的首帧输入,只改变动作与运镜描述。观众感知到的是连续空间,而不是两个独立生成的片段。
服装、道具与光线的一致性
细节最容易崩。可以在提示词里固定一段「一致性短语」,例如「米白色针织衫、银色细链项链、左手无名指戒指」,在每个镜头里原样复制。光线同理,固定为「暖色侧逆光」后不要中途改成「冷色顶光」。
多角色同框的处理
两个角色同时出现时,出问题的概率会上升。可用策略:
- 用一张包含两人的合成参考图作为首帧。
- 明确描述两人的相对位置与视线方向。
- 避免让两人同时做大动作,一侧静止、一侧动,画面更稳定。
一致性排查表
| 症状 | 可能原因 | 处理 |
|---|---|---|
| 脸部随镜头变化 | 缺少参考图或参考图不一致 | 建立统一角色卡 |
| 服装颜色跳变 | 提示词未固定服装描述 | 复制同一段一致性短语 |
| 场景空间断裂 | 未使用首尾帧衔接 | 导出末帧作为下一镜首帧 |
| 光线突变 | 每镜重新描述光线 | 固定光线关键词不变 |
| 手部结构异常 | 动作幅度过大或遮挡不足 | 缩小动作、增加前景遮挡 |
运镜、节奏与剪辑点
常用运镜及其适用场景
| 运镜 | 效果 | 适用场景 |
|---|---|---|
| 固定机位 | 稳定、客观 | 产品静物、访谈 |
| 缓慢推近 | 聚焦情绪 | 人物特写、高潮前 |
| 缓慢拉远 | 交代环境 | 结尾、场景转换 |
| 横移 | 展示空间 | 环境空镜、陈列 |
| 跟拍 | 增强代入 | 行走、奔跑 |
| 环绕 | 强调主体 | 产品展示、角色登场 |
一次只用一种运镜。把「推近 + 环绕 + 升格」写进同一句,结果通常是什么都不明显。
剪辑点的三种处理
- 硬切:最省事也最有效。动作方向一致时,硬切几乎不会被察觉。
- 动作接动作:在动作进行到一半时切换镜头,观众的注意力被动作吸引,接缝被自然掩盖。
- 遮挡转场:让前景物体(走过的人、掠过的车)遮住画面完成切换,适合空间跨度大的场景。
能用硬切解决的地方,不要用花哨转场。转场越复杂,越容易暴露生成痕迹。
音乐与节奏对齐
先把音乐铺上时间线,再按节拍放镜头。常见做法是:主歌部分用较长镜头(4 到 5 秒),副歌部分切得更快(1.5 到 2.5 秒)。镜头时长跟着节奏走,成片会显得更专业。
配音、音乐与音效的三层结构
人声
旁白用文本转语音工具生成时,注意三点:语速比自然对话稍慢、句尾留出呼吸间隙、避免连续长句。如果是角色对白,尽量让每个角色的音色固定,不要中途更换。
使用声音克隆功能前,务必取得被克隆者的明确授权,并确认你拥有商用权利。这是不可省略的合规步骤。
音乐
音乐决定情绪走向。选择时优先看三点:节奏与剪辑点是否契合、情绪是否与画面一致、是否有清晰的段落结构(前奏、主歌、副歌、收尾)。使用素材库音乐时,注意授权范围是否覆盖商业投放。
音效
音效是最容易被忽略、却最能提升真实感的一层。常见必备音效包括环境底噪、动作点音效和空间混响。例如咖啡短片里,研磨声、注水声、杯碟轻响、雨声底噪,四层叠加后画面的可信度会明显上升。
一个小技巧:给每个镜头至少配一个「动作点音效」,即使画面本身不够完美,观众的注意力也会被声音引导到正确位置。
后期处理与交付规格
放大、补帧与降噪
生成素材常见问题是分辨率不足、帧率偏低、细节噪点多。处理顺序建议:
- 先降噪与去闪烁,避免放大时把瑕疵一起放大。
- 再放大到目标分辨率或 1.5 倍中间分辨率。
- 最后补帧到 24、25 或 30 帧,并检查是否产生新的形变。
补帧不要过度。把 16 帧强行补到 60 帧,容易出现果冻感;补到 24 或 30 帧通常最自然。
调色统一
不同模型、不同镜头之间的色温和对比度会不一致。最简单的方法是给整条时间线套一个统一的基础调色,再对个别镜头做局部校正。先统一亮度与白平衡,再统一饱和度,最后才是风格化。
字幕与安全区
竖屏内容的字幕要避开底部和右侧的界面遮挡区。建议把字幕放在画面下方约 15% 到 20% 的高度区间,并保持左右各留出 8% 到 10% 的边距。字号宁大勿小,手机端观看时小字几乎不可读。
交付规格参考
| 平台类型 | 画幅 | 建议分辨率 | 建议帧率 |
|---|---|---|---|
| 竖屏短视频 | 9:16 | 1080×1920 | 30 |
| 横屏长视频 | 16:9 | 1920×1080 | 24 或 30 |
| 方形社媒 | 1:1 | 1080×1080 | 30 |
| 大屏展示 | 16:9 | 3840×2160 | 24 |
导出前统一检查:响度是否一致、黑边是否干净、首尾是否有空白帧、字幕是否与配音同步。
时间、成本与质量的三角平衡
用低成本做批量测试
不要一上来就用最高质量参数生成整条片子。更高效的做法是:
- 用低分辨率、短时长快速试 8 到 12 个版本。
- 从里面挑出构图与动作最对的 2 到 3 个。
- 只对这些版本做高质量重跑与放大。
这条「先广后精」的策略,能省下大量无效开销。
对失败率有合理预期
即使是成熟流程,单镜头一次命中率也很难超过一半。把「每个镜头生成 3 到 5 次」写进计划,比事后焦虑更实际。真正专业的地方不是不出废片,而是废片不影响工期。
迭代预算怎么定
按镜头算而不是按整片算:
- 关键镜头(人物特写、产品镜头):多留预算,因为返工代价最高。
- 过渡镜头(空镜、环境):少留预算,构图简单、容错高。
- 纯氛围镜头:可以直接用第一次结果,不追求完美。
团队分工建议
如果多人协作,可以拆成三条并行线:脚本与分镜、生成与迭代、后期与交付。前一条线产出分镜表后,第二条线可以立刻开工;第三条线拿到第一批合格素材就能开始粗剪。并行比串行快得多。
常见问题
生成的视频只有几秒,怎么做出更长的片子?
把长片当成多个短镜头的组合。每个镜头 3 到 6 秒,通过首尾帧衔接与剪辑点隐藏接缝。观众感知的是连续叙事,而不是单次生成的长度。
人物为什么总是「换脸」?
最常见的原因是没有统一参考图,或者每个镜头的服装、光线描述都不同。解决办法是建立角色卡,并在所有镜头里原样复制同一段一致性短语。
提示词写得越长越好吗?
不是。有效的提示词是结构清晰、信息密度高,而不是字数多。先保证主体、动作、镜头、光线四项齐全,再考虑加风格词。
生成的动作总是不自然,怎么办?
先检查是不是一个镜头里塞了太多动作。把「走过来、坐下、拿起书、翻开」拆成四个镜头,每个镜头一个动作,自然度会明显提升。同时在负向提示里加入「肢体扭曲」「多余手指」。
需要多少参考图才够?
每个主要角色三到五张足够:正面、四分之三侧面、全身、特写。关键不是数量,而是这几张图本身的统一度。
背景音乐怎么选才不会被判侵权?
使用明确标注可商用的素材库,并保留授权记录。避免使用来源不明的音乐,也不要直接使用流行歌曲。
生成的画面有闪烁,怎么处理?
先做去闪烁处理再放大。如果闪烁出现在特定镜头,通常是提示词里存在相互冲突的光线描述,修正描述后重新生成往往比后期修复更快。
一个项目大概需要多长时间?
以 30 秒成片为例,熟练流程下从分镜到交付大约需要一到两天,其中大部分时间花在角色镜头的迭代上。首次尝试可能更久,主要成本在学习提示词结构和一致性方法。
最后的行动清单
把这套流程压缩成十步,可以直接贴在项目看板上:
- 定下时长、画幅、交付平台与视觉基调。
- 写剧本,拆成 3 到 6 秒的镜头清单。
- 为每个主要角色准备三到五张统一参考图。
- 按镜头类型分配模型,不要一个模型打天下。
- 用七段式结构写提示词,一次只描述一个动作。
- 先用低成本参数批量试错,再对选中版本做高质量重跑。
- 用首尾帧衔接保持空间连续,用一致性短语固定服装与光线。
- 先铺音乐再放镜头,让时长跟着节拍走。
- 配音、音乐、音效三层叠加,给每个镜头至少一个动作点音效。
- 统一调色、检查字幕安全区、按平台规格导出。
文本到视频真正的门槛从来不是「能不能生成」,而是「能不能稳定地产出可交付的成片」。当镜头拆解、提示词结构、一致性控制、声音与后期变成一套固定动作,AI 就不再是玩具,而是一条可以排期、可以复用的生产线。

