从文字到成片:先把工作流拆成三层
从一段文字到一段看起来像电影的影像,中间隔着的不只是模型能力,还有一整套制作流程。很多创作者第一次接触文生视频,会把全部注意力放在“提示词写得好不好”上,结果单个镜头惊艳、连起来却散乱:同一个角色前后长得不一样,光线从黄昏跳到正午,镜头运动毫无动机。问题往往不在模型,而在于流程没有被拆开。
一条可复用的 AI 视频工作流,通常分成三层。创意层负责剧本、分镜表和镜头清单;生成层负责模型选择、提示词撰写与参数控制;整合层负责剪辑、调色、声音与节奏。三层各有明确的交付物,任何一层省略,都会在成片里被放大。
| 层级 | 主要交付物 | 最常见的返工原因 |
|---|---|---|
| 创意层 | 剧本、分镜表、逐镜描述 | 写的是情绪,而不是可拍摄的动作 |
| 生成层 | 镜头素材、多个备选版本 | 没有固定种子与角色参考,无法复现 |
| 整合层 | 成片、配音、音效、字幕 | 只做硬切,忽略节奏与呼吸感 |
一个非常实用的原则是:先用最低成本把整条片子跑通一遍,再回头替换质量最差的镜头。新手最常犯的错误,是把一个镜头打磨二十遍,最后发现它在成片里只出现一秒。
在进入具体技术之前,先明确三个评估维度:可控性(能不能稳定复现)、一致性(跨镜头是否统一)、可信度(观众是否相信画面)。几乎所有技术选择,最终都可以回到这三个维度上做权衡。
技术底座:扩散、时空注意力与运动建模
从图像扩散到视频扩散
图像扩散模型的工作方式,是在潜在空间里逐步去噪,把随机噪声还原成一张图。视频生成把这件事扩展到时间维度:模型不只要保证每一帧像样,还要保证相邻帧之间的关系合理。为此,多数现代视频模型会在注意力机制里加入时间维度,让某一帧的像素可以“看到”前后若干帧的对应区域。
把视频压进潜在空间,是让计算量可控的关键。压缩程度越高,生成越快,但细碎纹理(发丝、雨滴、织物经纬)就越容易丢失;压缩程度越低,细节越好,显存与时间成本也越高。这也是为什么同一模型在不同分辨率下的表现差异会非常大。
时间一致性的三个层级
理解一致性,最好分三层看:
- 帧内一致性:单帧内部的解剖、透视、材质是否合理。图像阶段的问题会在这里暴露,比如手指数量、耳环位置、文字笔画。
- 镜头内一致性:同一镜头内,主体外观、光照方向、背景结构是否稳定。闪烁、纹理漂移、发丝边缘融化都属于这一层。
- 跨镜头一致性:不同镜头之间,角色脸型、服装、场景风格是否统一。这是叙事短片最致命的短板,也最难靠单次生成解决。
三层里,前两层靠模型能力和参数控制,第三层更多靠流程设计——角色档案、参考图、固定种子、以及后期的一致性校正。把问题归类到具体某一层,能避免“换一个模型试试”这种无效重试。
运动建模与相机运动先验
让画面“动得合理”,比让画面“动起来”难得多。人类对运动的敏感度极高,物理上不可能的加速度、突兀的位移、违反惯性的加减速,都会让观众立刻出戏。因此评估一个视频模型时,值得单独测试三类运动:主体运动(走路、转身、手势)、相机运动(推、拉、摇、移、环绕)、以及群体与环境运动(人群、水面、烟雾、布料)。
一些模型会内建相机运动的先验,理解“推进”“环绕”“手持晃动”这类描述;另一些模型需要你用文字反复约束,甚至用首尾帧间接指定运动幅度。测试时最好用同一段提示词横向比较,记录每个模型在哪一类运动上更稳。这份记录会随着项目积累,逐渐变成你最有价值的资产。
模型选择:先明确任务类型,再挑工具
四类常见任务与对应模型类型
- 纯文生视频:只有文字,从零生成。适合概念片、氛围镜头、空镜与转场。
- 图生视频:以一张图为起点,让人物或环境动起来。可控性远高于纯文生视频,是目前最主流的生产方式。
- 视频转视频:对已有素材做风格迁移、重绘、加特效或提升质感。适合已有实拍素材的团队。
- 局部编辑与补全:只改画面的一部分,比如替换背景、去除道具、延长镜头、补充画外区域。
如果不确定该从哪里入手,建议从“图生视频”开始:先用图像模型把关键帧做对,再交给视频模型让它动起来。这样能把创意控制留在相对可控的图像阶段,而不是在动态阶段反复碰运气。
云端服务与本地开源的取舍
云端服务的优势是省去硬件投入、迭代快、往往提供更成熟的运动与一致性能力;劣势是可控性受限于接口、批量生产时排队与速率限制、以及素材需要上传。本地开源方案的优势是隐私、可无限次试错、可用微调把某个角色“训”进模型;劣势是需要显卡、需要折腾环境、以及要自己解决稳定性与显存问题。
常见的开源与半开源路线包括基于潜在扩散的视频模型、以及一批轻量化实时方案,它们各自在分辨率、时长、显存占用上差异很大。一个务实的组合是:用云端服务做探索与关键镜头,用本地方案做大批量的重复性镜头和需要严格保密的内容。
建立自己的模型评测流程
不要依赖别人的排行榜。给自己准备一个小型测试集:一段人物特写、一段快速运动、一段多人场景、一段包含文字元素的画面、一段复杂光影。每个候选模型跑同样五段提示词,记录四个指标:稳定性、运动合理性、细节保真度、以及首尾帧的可用比例。跑三轮之后,你会得到一张属于自己的能力地图,比任何宣传都可靠。
提示词工程:把描述写成可执行的镜头语言
镜头六要素框架
一条能稳定出片的提示词,通常包含六个要素。缺项越多,模型自由发挥的空间越大,结果就越随机。
- 主体:谁或什么,外貌、年龄感、服装的关键特征。
- 动作:一个清晰、单一、可在数秒内完成的动作。
- 环境:地点、时间、天气、周围可见的物件。
- 光线:光源方向、色温、软硬、是否逆光。
- 镜头:景别、焦段、机位、运动方式。
- 风格:胶片质感、色调、参考类型(纪录片、广告、黑白默片等)。
把这六项写成一段连贯的话,而不是六个逗号分隔的标签,通常更稳定。标签式提示容易让模型在语义之间摇摆,尤其在多个风格词冲突时。
常用运镜与景别词汇表
| 类别 | 常用表达 | 适用场景 |
|---|---|---|
| 景别 | 大远景、全景、中景、近景、特写 | 交代空间、建立人物、强调情绪 |
| 运镜 | 推、拉、摇、移、跟、环绕、升降 | 引导注意力、交代关系、制造节奏 |
| 机位 | 平视、俯拍、仰拍、过肩、主观 | 决定观众的心理位置 |
| 质感 | 浅景深、手持微晃、长焦压缩、广角畸变 | 塑造风格与真实感 |
写运镜时,务必给出方向与幅度。“缓慢向右横移”比“镜头移动”有效得多;“从人物背后缓慢推近到侧脸”比“推镜头”有效得多。如果模型仍然无视你的运镜要求,那通常不是提示词问题,而是需要改用关键帧或轨迹控制。
负面描述与失败提示的写法
大多数模型对“不要出现某物”的响应并不好,直接写“不要有第三只手”有时反而会强化这个概念。更可靠的做法是正向改写:把“不要拥挤的人群”改成“空旷的街道,只有一个人”;把“不要现代物件”改成“场景中只有木质家具与铁质路灯”。
另一个技巧是把动作拆成起始状态和结束状态,分别用两张图描述,让模型在中间插值,而不是靠文字猜测运动轨迹。这样做的失败率会明显下降。
导演级控制:运镜、节奏与镜头衔接
首尾帧与关键帧控制
目前最实用的控制手段,仍然是关键帧。把镜头拆成“起幅”和“落幅”两张图,分别生成或绘制,再让模型补足中间的运动。这样做的额外好处是:关键帧本身就是极好的分镜素材,方便团队评审,也方便你判断这个镜头是否值得做。
轨迹、深度与姿态条件
如果你需要精确控制主体走位,可以考虑使用带轨迹或深度条件的工具链:在画面上画出运动路径,或提供深度图、姿态骨架作为约束。这类方法学习成本更高,但对广告、产品演示、以及需要严格匹配画外元素的镜头,回报很大。
让时长与动作量匹配
一个五秒镜头能承载的动作是有限的。常见的错误是让提示词描述“走进房间、坐下、打开电脑、开始打字”——模型在五秒内根本来不及完成,最终得到的是模糊的过渡帧。正确做法是拆成四个镜头,每个镜头只保留一个动作,并在剪辑时用节奏把它们连起来。
同样重要的是留白。电影感很大程度来自“不急于发生”。一个静止两秒的镜头、一次缓慢的呼吸、一次视线偏移,往往比满屏运动更高级。判断节奏是否合适,可以试着关掉声音看一遍,如果你感到“赶”,那多半是剪辑而非生成的问题。
角色一致性与跨镜头连续性
角色档案的建立方法
为每个主要角色建立一份档案:正面、侧面、背面、不同表情的参考图若干,加上固定的文字描述(年龄感、发型、面部特征、身高体态、常穿服装)。这份档案是跨镜头一致性的基础。数量上,三到五张高质量参考图通常比二十张模糊图更有效。
描述的一致性同样重要。不要一个镜头写“三十岁短发女性”,下一个镜头写“年轻女孩”。措辞的漂移会让模型重新解释角色,脸型随之改变。建议把角色描述写成一段固定文本,每次直接复制。
服装、道具与场景连续性清单
跨镜头最容易出错的地方,往往不是脸,而是细节:手表戴在哪只手、外套有没有扣子、桌面上的杯子位置、光照方向。建议为每个场景维护一张连续性表,逐镜记录这些元素。拍摄真人电影时场记做的工作,在 AI 制作里同样必要,只是执行者变成了你自己。
微调与参考图方案的选择
如果角色要反复出现,可以考虑两条路线:一是使用参考图或身份保持机制,优点是零训练成本、随时可用;二是对模型做轻量微调,把角色“训练”进去,优点是稳定性极高,缺点是前期投入大、难以快速调整造型。判断标准很简单:这个角色会出现在多少个镜头里?超过十几个镜头,微调的投入通常划算。
另外一个经验是固定随机种子。很多创作者担心固定种子会让画面僵化,其实它只是把“随机”变成“可控”,配合微调过的提示词,反而能显著减少重试次数。
长片段的拼接与后期工作流
分镜切分与转场设计
AI 生成的镜头时长通常有限,所以长片几乎都是拼出来的。拼接的关键不是把镜头粘在一起,而是让相邻镜头之间产生逻辑关系:视线匹配、动作接续、方向一致、色调统一。硬切之外,可以准备几种过渡手段:同色块转场、遮挡物转场、运动方向一致的动接动、以及声音先入。
一个容易被忽略的细节是方向轴线。如果人物在镜头 A 中向右走,在镜头 B 中却向左走,观众会瞬间感到空间混乱。生成阶段就应把方向写进提示词,而不是留到剪辑时补救。
补帧、超分与稳定化
生成素材常见的三个技术瑕疵是帧率不足、分辨率偏低、以及轻微抖动。补帧可以提升流畅度,但过度补帧会让运动出现“糖浆感”;超分能提升细节,但会放大噪点与伪影;稳定化能修复手持感,但可能裁掉构图边缘。建议的顺序是:先稳定化,再超分,最后按需补帧。
声音层:对白、拟音与配乐
声音对“电影感”的贡献常常被低估。画面再精致,如果环境音缺失、对白干涩、音乐与节奏脱节,观众仍然会觉得廉价。基础配置包括:底噪与环境音(风、雨、人群、室内混响)、动作拟音(脚步、衣物摩擦、开门)、以及一段随节奏起伏的配乐。对白可以用配音或语音合成完成,注意语速要与镜头时长对齐。
画面故障排查与质量自检
把常见问题整理成一张诊断表,比盲目重试有效得多。
| 症状 | 可能原因 | 处理方向 |
|---|---|---|
| 画面持续闪烁 | 时间一致性不足、提示词冲突 | 缩短时长、减少变化项、改用首尾帧控制 |
| 主体突然变形 | 运动幅度超出模型能力 | 拆分为两段、降低动作复杂度 |
| 背景纹理漂移 | 缺少环境锚点 | 在提示词中固定背景关键物件与光照方向 |
| 肢体比例错误 | 单帧结构问题被时间放大 | 先修好关键帧,再进入视频阶段 |
| 镜头无视运镜指令 | 运镜描述不够具体 | 给出方向、速度、幅度,或用关键帧指定 |
| 画面出现乱码文字 | 模型对文本渲染能力有限 | 避免让模型生成文字,后期叠加 |
| 色调前后不一致 | 缺少统一的风格描述 | 在每条提示词中重复同一段风格描述 |
| 运动过快或过慢 | 时长与动作量不匹配 | 调整镜头时长,而不是反复改提示词 |
自检时,建议把成片静音看一遍,只观察画面连贯性;再闭眼听一遍,只观察声音节奏。两个维度分开检查,比同时盯着看更容易发现问题。另外,把成片缩到小窗口播放也是一个实用技巧:小尺寸下仍然成立的构图与节奏,通常才是真正扎实的。
团队协作与资产管理的实用规范
当项目从个人变成团队,混乱的成本会迅速上升。几条基本规范可以省下大量时间。
命名规范:统一形如“场次-镜头-版本-日期”的文件名,避免出现最终版、最终版二、真最终版。生成素材天然是批量产出,没有命名规范几乎无法回溯。
提示词库:把稳定出片的提示词按场景、光线、运镜分类保存,并记录使用的模型与参数。一个有五十条高质量提示词的库,其价值不亚于一套镜头设备。
版本管理:关键镜头保留至少三个版本,并标注放弃原因。三个月后回头看,你会庆幸自己记录了“为什么不用它”。
评审流程:把评审分成两轮。第一轮只看故事与节奏,用低分辨率草稿;第二轮才看画质与细节。混在一起评审,讨论往往会从故事滑向“这个手指好像有点怪”。
素材归档:原始生成片段、关键帧、音频分轨、项目文件分目录存放,并在归档时附一份说明文档。AI 项目的素材量常常是传统剪辑的数倍,靠记忆管理几乎不可能。
常见问题解答
AI 视频生成现在能直接产出长片吗?
能产出短片,但长片仍然需要人来做结构。原因是模型擅长生成单个镜头,不擅长维持几十分钟的叙事逻辑与人物弧光。现实的做法是让 AI 承担镜头生产与部分剪辑辅助,人类负责剧本、分镜、节奏与最终判断。把期望放在“压缩制作成本”而不是“替代导演”,项目会顺利得多。
为什么同样的提示词每次结果都不一样?
因为生成过程本质上是从噪声出发的采样,随机种子不同,路径就不同。想要复现,需要同时固定种子、模型版本、分辨率、时长与提示词。即使全部固定,不同硬件与计算精度也可能带来细微差异,所以关键镜头最好在流程早期就锁定参数。
开源模型值得投入本地硬件吗?
取决于三个问题:你是否有大量需要保密的素材?你是否需要针对特定角色做微调?你的项目是否依赖大规模反复试错?三个问题里有两个回答“是”,本地方案通常更划算;否则先用云端服务把流程跑通更实际,等流程稳定后,再决定是否把部分环节搬到本地。
如何判断一个镜头是否真的有电影感?
看四件事:光是否有方向与动机,构图是否有层次(前景、中景、背景),运动是否有理由,留白是否足够。把这四条做成清单,逐镜打分,比凭感觉判断稳定得多。也可以把镜头静音播放,如果画面本身就能让人看出情绪,那它已经成功了一半。
生成的素材在商用上要注意什么?
不同来源的素材使用条款差异很大,涉及肖像、商标、音乐与训练数据等敏感点。发布前建议逐项确认素材来源与许可范围,涉及真人形象时尤其要谨慎,并保留生成参数与提示词的记录以便追溯。对品牌项目而言,把这一步写进流程清单,比事后补救便宜得多。
一个项目大致要预留多少算力与时间?
经验值是每个可用镜头背后有三到五倍的废弃素材。也就是说,一条一分钟、约二十个镜头的短片,实际可能需要生成六十到一百段素材。时间安排上,把总时长的三分之一留给生成,三分之二留给筛选、重生成与后期,通常比较接近现实。先按这个比例排期,再在第一个项目结束后用实测数据修正。
新手最该先学哪一项技能?
不是提示词技巧,而是分镜。能写出一张清晰的镜头表,就已经解决了大半问题。提示词只是把镜头表翻译成模型能理解的语言;如果镜头表本身含糊,再漂亮的提示词也只能产出漂亮的废片。



