期間限定オファー:Pro / Ultraプラン初月が50%OFF🎉

AI 文本到视频完整工作流指南:从脚本拆解到成片交付

Sep 21, 2026

为什么文本到视频需要一套工作流

很多人第一次用 AI 生成视频时,习惯把整段故事浓缩成一句话丢给模型,然后期待得到一条完整成片。结果通常很相似:画面很漂亮,但人物中途换了脸、动作对不上口型、镜头之间跳接突兀,最后只能从几十条结果里挑出两三秒勉强能用的片段。问题往往不在模型不够强,而在于缺少一条可重复的流程。

文本到视频(Text-to-Video,简称 T2V)本质上是「按镜头生成素材」,而不是「按影片生成作品」。它更接近实拍:先有剧本和分镜,再逐镜头取景,最后在剪辑台上组装成片。把这套逻辑搬到 AI 生成里,会带来三个直接好处:

  • 可控性提升:每个镜头的变量更少,出问题能定位到具体镜头,而不是推翻整条片子。
  • 一致性提升:人物、服装、光线、色调可以被显式约束,而不是靠运气。
  • 成本更可预测:试错被限制在单个镜头内,不需要为整片重跑。

下面这套流程适合短片、品牌广告、教学动画、社媒竖屏内容与产品演示,也可以拆开单独使用——如果你只关心角色一致性,可以直接跳到对应章节。

三种常见的工作模式

  1. 纯文本驱动:只用文字提示生成。上手快,适合概念验证、氛围镜头和空镜。
  2. 图像到视频:先用文生图确定首帧,再驱动运动。控制力最强,是商业项目的主力方式。
  3. 视频到视频:用已有素材做风格迁移、补帧或延长。适合改造实拍素材。

大多数稳定产出的项目,都会以第二种为主、第一种为辅。原因很简单:一张确定的画面,比一段文字更接近「已经拍好的镜头」。当你把首帧定死,模型需要猜测的东西就少了一大半。

开工前必须定下的四件事

  • 成片时长与画幅:15 秒竖屏和 3 分钟横屏,是两种完全不同的节奏设计,不要边做边改。
  • 交付平台:不同平台对画幅、码率、字幕安全区的要求不同,提前确认能省掉一次重排。
  • 视觉基调:写实、动漫、粘土、复古胶片、3D 渲染——它决定了后续模型与提示词的方向。
  • 预算上限:包括生成次数、放大处理、配音配乐。没有上限的迭代会无限拉长周期。

这四件事写在纸上只要十分钟,却能避免后期大量的返工。

镜头拆解:把创意变成可生成的清单

分镜表应该包含哪些字段

一张够用的分镜表不需要复杂,但字段要齐。推荐最小字段集合如下:

字段 作用 示例
镜头编号 排序与版本管理 S01
计划时长 控制节奏与总长 4 秒
景别 决定信息量 中近景
运镜 决定动感 缓慢推近
主体与动作 提示词核心 女性转身看向窗外
环境 空间与天气 雨夜咖啡馆
光线 决定质感 暖色侧逆光
参考图 一致性锚点 角色卡正面图
音频备注 对白或音效 雨声、杯碟轻响
优先级 决定先做哪条

字段里最容易被忽略的是「计划时长」和「优先级」。前者决定你能否在有限次数内跑完,后者决定当时间不够时先砍哪一条。

一个 30 秒短片的拆解示例

假设要做一个咖啡品牌的 30 秒竖屏短片,可以拆成 6 个镜头:

  1. S01(3 秒)俯拍咖啡豆落入研磨机,特写,固定机位。
  2. S02(4 秒)手部冲煮动作,中近景,轻微横移。
  3. S03(5 秒)主角端起杯子,半身,缓慢推近。
  4. S04(4 秒)窗外街景空镜,远景,固定。
  5. S05(6 秒)主角喝一口并微笑,近景,轻微手持感。
  6. S06(5 秒)产品包装静物,微距,环绕运镜。

每个镜头 3 到 6 秒,是当前多数模型最容易稳定输出的区间。超过这个长度,动作容易漂移、结构容易变形。

镜头时长的现实约束

大多数模型单次生成的有效时长有限,常见在 4 到 10 秒之间。所以拆镜头时按 3 到 6 秒设计最稳。如果叙事必须要有长镜头,有两种处理方式:

  • 首尾帧衔接:把前一镜的最后一帧作为后一镜的首帧,保证空间连续。
  • 分段生成再拼接:接受接缝,用剪辑手法(切、遮罩、动作遮挡)隐藏拼接点。

这一段最容易犯的三个错误

  • 把多个动作塞进一个镜头:「她走进房间、坐下、打开笔记本、开始打字」——模型只会给你其中最明显的一个。
  • 在同一句提示里切换景别:「从远景推近到特写」在部分模型上有效,但多数时候会得到含混的构图。景别变化应该拆成两个镜头。
  • 忽略物理连续性:上一镜杯子在右手,下一镜换到左手,观众会立刻出戏。

模型与工具选择:按任务分配,而不是只挑最强

四类任务与匹配思路

没有「最好的模型」,只有「最适合这个镜头的模型」。可以按任务类型分配:

  • 写实人物与人脸:优先选择在皮肤质感、面部结构、眼神细节上表现稳定的模型。
  • 风格化与动漫:优先选择线条稳定、色彩不漂移、风格标签响应明确的模型。
  • 大运动与特效:优先选择动作幅度大、运动模糊自然、不易崩解的模型。
  • 产品与静物:优先选择边缘干净、反光可控、文字不易扭曲的模型。

实际项目里,一条片子混用三到四种模型很常见。人物特写用一种,环境空镜用另一种,风格化转场再用第三种——这比强迫一个模型包办所有镜头更省时间。

文本到视频与图像到视频的取舍

维度 文本到视频 图像到视频
上手速度 中等
构图控制
一致性表现 一般
适合场景 概念验证、空镜、氛围 人物镜头、产品镜头、系列内容
迭代成本

如果项目要求角色在多个镜头中长相一致,直接选图像到视频。先在文生图阶段把角色定死,再驱动动作,能减少大量重复试错。

选择模型时要问的六个问题

  1. 它单次生成的有效时长是多少?
  2. 它对我这类提示词的跟随度如何?
  3. 输出分辨率和画幅能否满足交付要求?
  4. 运动幅度大时会不会出现结构崩解?
  5. 商用授权条款是否覆盖我的使用场景?
  6. 单位生成成本与我的预算是否匹配?

把答案写下来对比,比反复凭感觉试要快得多。

常见错误

  • 盲目追新:新模型未必适合你的题材,尤其是产品镜头和文字类画面。
  • 忽略授权:用于商业投放前,确认模型输出与训练数据的商用条款。
  • 忽略画幅:生成 16:9 再裁成 9:16,会损失大量构图信息,最好一开始就按目标画幅生成。

提示词结构:把形容词换成可执行的指令

七段式模板

一个稳定的提示词结构可以拆成七段:

主体 → 动作 → 环境 → 镜头(景别/角度/运镜)→ 光线 → 风格与质感 → 负面约束

示例(中文):

一位三十岁女性,穿米白色针织衫,坐在窗边慢慢端起咖啡杯;雨夜咖啡馆室内,窗外霓虹反光;中近景,略低角度,缓慢推近;暖色侧逆光,柔和阴影;写实电影质感,浅景深,颗粒感轻微;不要多只手,不要文字,不要画面抖动。

同样的内容用英文重写一遍,往往会在以英文语料为主的模型上得到更准确的结果:

A woman in her thirties wearing a cream knit sweater slowly lifts a coffee cup by the window; rainy-night cafe interior with neon reflections outside; medium close-up, slightly low angle, slow push-in; warm rim light, soft shadows; cinematic realism, shallow depth of field, subtle grain; no extra hands, no text, no camera shake.

具体化比华丽化更重要

对比两组写法:

  • 模糊版:「一个很美的女孩在很酷的地方做很酷的事。」
  • 可执行版:「短发女性,穿黑色风衣,在地铁站台快速走过,随身背包,中景跟拍,冷白顶光,写实纪录片质感。」

第二组给出了主体、动作、地点、镜头和光线,模型需要猜的东西大幅减少,命中率自然更高。

中英文提示的差异

不同模型对语言的敏感度不同。经验上:

  • 以英文语料训练的模型,用英文短句通常更准。
  • 面向中文场景优化的模型,中文长句对文化语境的理解更好,但要控制从句数量。
  • 混用语言时,把关键名词统一成一种语言,避免「中文描述 + 英文风格词」造成的语义割裂。

负向提示词的写法

负向提示词不要堆砌,只写你最常遇到的三个问题。例如人物镜头常驻「多余手指、扭曲面部、文字水印」,风景镜头常驻「畸变地平线、过曝、重复纹理」。写得太多反而会削弱主体描述。

常见错误

  • 在提示词里描述整段剧情,而不是一个动作。
  • 用抽象词代替物理描述,例如「高级感」「有氛围」。
  • 忘记指定运镜,导致模型自由发挥出不可控的漂移。

角色与场景一致性:让镜头之间「接得上」

一致性是 AI 视频从「能看」到「能用」的分水岭。没有一致性,再漂亮的单帧也组不成片子。

建立角色卡

为每个主要角色准备三到五张参考图:正面、四分之三侧面、全身、以及一个特写。要求是同一张脸、同一套服装、同一光线条件。这些图会在后续所有镜头中被复用。

复用种子与参数

如果所用工具支持固定随机种子,把它记在分镜表里。同一角色的镜头尽量使用同一组基础参数,只改变动作和镜头描述。这能显著降低「换了个人」的概率。

用首尾帧衔接空间

多镜头叙事里,空间连续靠首尾帧。做法是:把前一镜的最后一帧导出,作为后一镜的首帧输入,只改变动作与运镜描述。观众感知到的是连续空间,而不是两个独立生成的片段。

服装、道具与光线的一致性

细节最容易崩。可以在提示词里固定一段「一致性短语」,例如「米白色针织衫、银色细链项链、左手无名指戒指」,在每个镜头里原样复制。光线同理,固定为「暖色侧逆光」后不要中途改成「冷色顶光」。

多角色同框的处理

两个角色同时出现时,出问题的概率会上升。可用策略:

  • 用一张包含两人的合成参考图作为首帧。
  • 明确描述两人的相对位置与视线方向。
  • 避免让两人同时做大动作,一侧静止、一侧动,画面更稳定。

一致性排查表

症状 可能原因 处理
脸部随镜头变化 缺少参考图或参考图不一致 建立统一角色卡
服装颜色跳变 提示词未固定服装描述 复制同一段一致性短语
场景空间断裂 未使用首尾帧衔接 导出末帧作为下一镜首帧
光线突变 每镜重新描述光线 固定光线关键词不变
手部结构异常 动作幅度过大或遮挡不足 缩小动作、增加前景遮挡

运镜、节奏与剪辑点

常用运镜及其适用场景

运镜 效果 适用场景
固定机位 稳定、客观 产品静物、访谈
缓慢推近 聚焦情绪 人物特写、高潮前
缓慢拉远 交代环境 结尾、场景转换
横移 展示空间 环境空镜、陈列
跟拍 增强代入 行走、奔跑
环绕 强调主体 产品展示、角色登场

一次只用一种运镜。把「推近 + 环绕 + 升格」写进同一句,结果通常是什么都不明显。

剪辑点的三种处理

  • 硬切:最省事也最有效。动作方向一致时,硬切几乎不会被察觉。
  • 动作接动作:在动作进行到一半时切换镜头,观众的注意力被动作吸引,接缝被自然掩盖。
  • 遮挡转场:让前景物体(走过的人、掠过的车)遮住画面完成切换,适合空间跨度大的场景。

能用硬切解决的地方,不要用花哨转场。转场越复杂,越容易暴露生成痕迹。

音乐与节奏对齐

先把音乐铺上时间线,再按节拍放镜头。常见做法是:主歌部分用较长镜头(4 到 5 秒),副歌部分切得更快(1.5 到 2.5 秒)。镜头时长跟着节奏走,成片会显得更专业。

配音、音乐与音效的三层结构

人声

旁白用文本转语音工具生成时,注意三点:语速比自然对话稍慢、句尾留出呼吸间隙、避免连续长句。如果是角色对白,尽量让每个角色的音色固定,不要中途更换。

使用声音克隆功能前,务必取得被克隆者的明确授权,并确认你拥有商用权利。这是不可省略的合规步骤。

音乐

音乐决定情绪走向。选择时优先看三点:节奏与剪辑点是否契合、情绪是否与画面一致、是否有清晰的段落结构(前奏、主歌、副歌、收尾)。使用素材库音乐时,注意授权范围是否覆盖商业投放。

音效

音效是最容易被忽略、却最能提升真实感的一层。常见必备音效包括环境底噪、动作点音效和空间混响。例如咖啡短片里,研磨声、注水声、杯碟轻响、雨声底噪,四层叠加后画面的可信度会明显上升。

一个小技巧:给每个镜头至少配一个「动作点音效」,即使画面本身不够完美,观众的注意力也会被声音引导到正确位置。

后期处理与交付规格

放大、补帧与降噪

生成素材常见问题是分辨率不足、帧率偏低、细节噪点多。处理顺序建议:

  1. 先降噪与去闪烁,避免放大时把瑕疵一起放大。
  2. 再放大到目标分辨率或 1.5 倍中间分辨率。
  3. 最后补帧到 24、25 或 30 帧,并检查是否产生新的形变。

补帧不要过度。把 16 帧强行补到 60 帧,容易出现果冻感;补到 24 或 30 帧通常最自然。

调色统一

不同模型、不同镜头之间的色温和对比度会不一致。最简单的方法是给整条时间线套一个统一的基础调色,再对个别镜头做局部校正。先统一亮度与白平衡,再统一饱和度,最后才是风格化。

字幕与安全区

竖屏内容的字幕要避开底部和右侧的界面遮挡区。建议把字幕放在画面下方约 15% 到 20% 的高度区间,并保持左右各留出 8% 到 10% 的边距。字号宁大勿小,手机端观看时小字几乎不可读。

交付规格参考

平台类型 画幅 建议分辨率 建议帧率
竖屏短视频 9:16 1080×1920 30
横屏长视频 16:9 1920×1080 24 或 30
方形社媒 1:1 1080×1080 30
大屏展示 16:9 3840×2160 24

导出前统一检查:响度是否一致、黑边是否干净、首尾是否有空白帧、字幕是否与配音同步。

时间、成本与质量的三角平衡

用低成本做批量测试

不要一上来就用最高质量参数生成整条片子。更高效的做法是:

  1. 用低分辨率、短时长快速试 8 到 12 个版本。
  2. 从里面挑出构图与动作最对的 2 到 3 个。
  3. 只对这些版本做高质量重跑与放大。

这条「先广后精」的策略,能省下大量无效开销。

对失败率有合理预期

即使是成熟流程,单镜头一次命中率也很难超过一半。把「每个镜头生成 3 到 5 次」写进计划,比事后焦虑更实际。真正专业的地方不是不出废片,而是废片不影响工期。

迭代预算怎么定

按镜头算而不是按整片算:

  • 关键镜头(人物特写、产品镜头):多留预算,因为返工代价最高。
  • 过渡镜头(空镜、环境):少留预算,构图简单、容错高。
  • 纯氛围镜头:可以直接用第一次结果,不追求完美。

团队分工建议

如果多人协作,可以拆成三条并行线:脚本与分镜、生成与迭代、后期与交付。前一条线产出分镜表后,第二条线可以立刻开工;第三条线拿到第一批合格素材就能开始粗剪。并行比串行快得多。

常见问题

生成的视频只有几秒,怎么做出更长的片子?

把长片当成多个短镜头的组合。每个镜头 3 到 6 秒,通过首尾帧衔接与剪辑点隐藏接缝。观众感知的是连续叙事,而不是单次生成的长度。

人物为什么总是「换脸」?

最常见的原因是没有统一参考图,或者每个镜头的服装、光线描述都不同。解决办法是建立角色卡,并在所有镜头里原样复制同一段一致性短语。

提示词写得越长越好吗?

不是。有效的提示词是结构清晰、信息密度高,而不是字数多。先保证主体、动作、镜头、光线四项齐全,再考虑加风格词。

生成的动作总是不自然,怎么办?

先检查是不是一个镜头里塞了太多动作。把「走过来、坐下、拿起书、翻开」拆成四个镜头,每个镜头一个动作,自然度会明显提升。同时在负向提示里加入「肢体扭曲」「多余手指」。

需要多少参考图才够?

每个主要角色三到五张足够:正面、四分之三侧面、全身、特写。关键不是数量,而是这几张图本身的统一度。

背景音乐怎么选才不会被判侵权?

使用明确标注可商用的素材库,并保留授权记录。避免使用来源不明的音乐,也不要直接使用流行歌曲。

生成的画面有闪烁,怎么处理?

先做去闪烁处理再放大。如果闪烁出现在特定镜头,通常是提示词里存在相互冲突的光线描述,修正描述后重新生成往往比后期修复更快。

一个项目大概需要多长时间?

以 30 秒成片为例,熟练流程下从分镜到交付大约需要一到两天,其中大部分时间花在角色镜头的迭代上。首次尝试可能更久,主要成本在学习提示词结构和一致性方法。

最后的行动清单

把这套流程压缩成十步,可以直接贴在项目看板上:

  1. 定下时长、画幅、交付平台与视觉基调。
  2. 写剧本,拆成 3 到 6 秒的镜头清单。
  3. 为每个主要角色准备三到五张统一参考图。
  4. 按镜头类型分配模型,不要一个模型打天下。
  5. 用七段式结构写提示词,一次只描述一个动作。
  6. 先用低成本参数批量试错,再对选中版本做高质量重跑。
  7. 用首尾帧衔接保持空间连续,用一致性短语固定服装与光线。
  8. 先铺音乐再放镜头,让时长跟着节拍走。
  9. 配音、音乐、音效三层叠加,给每个镜头至少一个动作点音效。
  10. 统一调色、检查字幕安全区、按平台规格导出。

文本到视频真正的门槛从来不是「能不能生成」,而是「能不能稳定地产出可交付的成片」。当镜头拆解、提示词结构、一致性控制、声音与后期变成一套固定动作,AI 就不再是玩具,而是一条可以排期、可以复用的生产线。

Alexander

Alexander