三维生成正在重塑视频生产的基本逻辑
视频创作的门槛在过去几年被彻底重写。传统流程里,一支三十秒的品牌短片要经过分镜、选角、勘景、灯光、拍摄、调色、合成,任何一环出问题都要推倒重来。生成式模型把这个链条压缩成“描述—生成—筛选—重做”的短循环,试错成本从按天计算变成按次计算。但把生成式视频真正推进到可交付状态的,从来不是画面的惊艳程度,而是时间与空间的一致性。
一致性包含三个层面:同一角色在不同镜头里长得一样;同一场景在不同角度下结构成立;镜头运动符合真实摄影机的物理规律。二维模型在这三件事上都很吃力,因为它在像素平面上工作,没有“物体”这个显式概念。三维生成的价值在于把空间表示引入生成过程——相机、光照、几何体、材质一旦成为可控变量,模型在换镜头时就不会让物体的身份漂移。
因此,越来越多的团队把三维生成当成视频管线的中枢,而不是事后补的特效。它让“先定世界与角色,再决定镜头”成为默认做法,而不是像过去那样先写分镜、再为每个镜头单独造一个世界。
- 资产复用:同一个人物模型可以在多个镜头、多支片子之间重复调用,边际成本迅速下降。
- 镜头自由度:先确定场景,再自由选择机位、焦段与运动轨迹。
- 可控迭代:客户说“换个角度”,改的是相机参数,而不是重写整段提示词。
- 交付确定性:输出的是带材质与拓扑的资产,能进入后期与游戏引擎,而不是只停留在某个工具的预览窗口里。
主流技术路径:从文本、图像到可用的三维资产
理解三维生成,先要理解它的输入输出关系。不同路径的产出质量、可控程度与后期负担差别非常大,选错路径往往意味着后面要花三倍时间修补。
文生三维
只给一段描述,模型直接给出三维结构。这条路最省事,也最难控制:几何大体成立,细节常常含糊,拓扑结构对后期并不友好。适合概念草图、气氛图、快速占位,不适合需要精细面孔或机械结构的主体。
图生三维与多视图重建
用一张或多张参考图驱动生成,是目前性价比最高的路径。单图重建依赖模型对不可见部分的“猜测”,背面往往会穿帮;多视图重建则通过正面、侧面、四分之三视角的图片互相约束,把不确定性压到最低。实践中的最佳做法是先用图像模型生成四到六张同一角色不同角度的设定图,再交给重建环节。
视频重建
用一段绕物体拍摄的视频,通过运动恢复结构与多视图融合得到几何。这条路对真实物体的还原度最高,适合商品、文物、场地等“客观存在”的对象。缺点是依赖拍摄质量,手持抖动、反光材质、运动模糊都会带来噪点与破面。
隐式表示、网格与材质
很多生成模型内部使用的是隐式场或高斯表示,它们渲染出来很漂亮,但不是标准网格。交付给下游前通常需要转换成网格、重建 UV、烘焙贴图。这个过程决定了资产能不能被真正使用:没有合理 UV 的模型,材质再好看也无法编辑;拓扑混乱的网格,在引擎里做动画时会严重变形。
生成结果能不能直接用
判断标准很朴素:把模型放进引擎或后期软件里,检查四件事——面数是否可控、UV 是否展开、法线是否统一、材质是否可分离。四项都过关,才算“可用资产”;只过关两项,它更适合当参考而不是成品。
选择路径时可以问三个问题:这个对象是否真实存在?镜头会不会绕着它走?它需要被后期编辑吗?三个答案都是“是”,就用视频重建或多视图重建并保留网格;只有第一个是“是”,用单图重建即可;一个都不需要,直接用图像或视频生成,不必进入三维环节。记住一条经验:不是所有东西都值得做成三维,把三维留给真正需要空间自由度的部分。
一套可复用的AI视频工作流:从概念到成片
下面这套流程在短片、广告、产品演示三类项目上都跑得通。核心思路是:把不确定性大的环节前置,把昂贵的人工环节后置。
第一步:锁定视觉基调
先写一份一页纸的视觉设定,包括色彩倾向、光照逻辑、镜头语言与参考作品。这一页纸后续会成为所有提示词的公共前缀,也是团队之间对齐审美的依据。没有这一步,生成结果会变成风格拼盘。
第二步:建立角色设定图
用图像模型生成同一角色的正面、侧面、背面与四分之三视角,并且固定种子、风格词与比例。挑选其中一致性最好的四张作为“角色卡”。角色卡是整个项目里最重要的资产,后续所有生成都要带上它。
第三步:搭建场景与三维资产
场景同样先出概念图,再决定哪些部分需要真正的三维模型。判断原则很简单:会被镜头绕着走的部分需要三维,只在背景一扫而过的部分用二维贴片即可。这一步最容易被浪费,很多团队把整个环境都做成三维,最后发现镜头从未靠近过。
第四步:写分镜与镜头表
分镜表里至少要写清四列:镜号、画面描述、镜头运动、时长。镜头运动建议使用真实摄影术语——推、拉、摇、移、跟、升降、环绕,而不是“镜头很酷”这类描述。生成模型对摄影术语的响应明显更稳定。
第五步:生成镜头素材
每个镜头单独生成,不要试图用一个长提示词生成整支片子。单镜头可以反复采样,挑选最好的一条。为了控制角色一致性,把角色卡图片与一段固定的角色描述一起附在提示词中。
第六步:筛选与初剪
按镜号把素材导入剪辑软件,先做粗剪确定节奏,再决定哪些镜头需要重做。重做时优先调整提示词中的运动与光照描述,最后才改角色设定,因为角色设定一改,全片都要重来。
第七步:补帧、稳定与调色
生成素材常有时序抖动、边缘闪烁、运动不连贯的问题。补帧工具可以提升流畅度,稳定工具可以修正漂移,调色则统一不同镜头之间的色温与反差。这三步是把“能看”变成“能用”的关键。
第八步:声音与交付
配音、音效、音乐有时决定了观众对画面的宽容度。同一段素材配上准确的音效,观感提升往往超过再生成十次画面。交付前统一分辨率、帧率、色彩空间与命名规范,避免在最后一刻返工。
关于采样批次,经验值是每个镜头生成四到八条候选,从中挑一条。生成数量少于四条,通常挑不到满意的;超过十二条,筛选疲劳会让人草率决定。把候选按镜号归档,并标注每条的具体问题,例如“手部变形”“光照偏右”“节奏过慢”,这份标注会成为后续调整提示词的直接依据。
提示词同样要版本管理。建议每改一次就存一版,并写明改动点。很多团队在第三十次修改时才发现,第二版的角色描述其实最接近目标,但那一版已经被覆盖掉了。
一致性是核心难题:角色、场景与镜头语言
角色一致性
角色漂移的根源是模型每次生成都在重新“想象”这个人。解决思路有三层:一是固定参考图与风格词,让输入尽量确定;二是尽量少用大幅度的视角变化,尤其是从正面直接跳到背面;三是把角色拆成“可复用资产”,需要新角度时,先旋转三维模型渲染新角度的参考图,再交给视频生成。第三层最费事,但效果最稳。
场景与光照一致性
场景漂移最常见的表现是光照方向突然反转、材质从哑光变成高光、背景比例悄悄变化。控制方法是在提示词中显式写明光源位置与时间,例如“左侧低位主光、阴天漫射、午后”;同时固定镜头的焦段描述,避免广角与长焦混用。焦段一变,空间压缩感就变了,观众会觉得场景换了地方。
服装与纹理的漂移
服装与纹理是最容易被忽视的漂移来源。同一件外套的格纹在远景里是细格,在特写里变成粗格,观众未必说得出来,但会觉得“不太对”。解决办法是给关键服装单独生成一张纹理参考,并在提示词中用具体描述固定,例如“深灰羊毛、细密人字纹、哑光”。越具体的材质描述,越不容易漂移。
镜头衔接
两个镜头连在一起时,观众会下意识检查它们是否属于同一空间。常用技巧是保留一个共同的视觉锚点——同一扇窗、同一盏灯、同一个前景物体——出现在相邻镜头的画面边缘。另一个技巧是遵循三十度原则:相邻镜头的机位变化不要太接近,否则会产生跳切感。
一致性检查清单
- 角色的脸型、发型、服装纹理在相邻镜头中是否一致?
- 光源方向与阴影投射方向是否连贯?
- 场景中的标志性物体位置是否稳定?
- 镜头焦段与景深风格是否统一?
- 画面色彩在不同镜头之间是否落在同一色温区间?
提示词与镜头语言的写法
结构化提示词模板
把提示词分成六段最实用:主体、动作、环境、光照、镜头、风格。每段一到两句,顺序固定。固定顺序本身就能显著提升生成稳定性,因为它让模型每次接触到的信息结构一致。
示例:“主体:一名穿深灰色风衣的中年男性,短须,左手拿着折叠伞。动作:缓慢转身,视线从街道转向镜头。环境:雨后的旧城区街道,地面积水反射霓虹。光照:左侧低位暖色主光,顶部冷色环境光,薄雾。镜头:35mm,中景,缓慢环绕四分之一圈,浅景深。风格:写实电影感,轻微颗粒,冷调。”
相机运动词表
| 中文说法 | 等效英文术语 | 适用场景 |
|---|---|---|
| 缓慢推近 | slow push in | 情绪递进、揭示细节 |
| 缓慢拉远 | slow pull out | 收尾、交代环境 |
| 水平摇摄 | pan left / right | 扫视场景 |
| 垂直摇摄 | tilt up / down | 展现高度与体量 |
| 跟随移动 | tracking shot | 人物行走、追逐 |
| 环绕 | orbit / arc shot | 展示三维主体 |
| 手持 | handheld | 纪录片感、紧张感 |
| 升降 | crane up / down | 场景过渡 |
负面约束的写法
负面约束的写法要克制。堆砌几十个否定词会削弱主体描述的影响力。更有效的做法是只保留三到五条最重要的负面项,例如多余手指、文字水印、锐化过度、面部扭曲。权重写法上,把最重要的信息放在提示词前部,比使用权重符号更稳定。
常见提示词错误
- 一句话塞进十个动作:模型会平均分配注意力,结果每个动作都没做扎实。
- 缺少光照描述:没有光照信息,模型只能自由发挥,镜头之间的光源方向必然漂移。
- 混用镜头术语:“广角特写”这类自相矛盾的组合会让模型随机取舍。
- 忽略负面约束:明确写出不要出现的东西,例如多余的手指、文字水印、画面抖动,能省下大量筛选时间。
- 角色描述前后不一致:把角色描述单独存成一个文本块,每次复制粘贴,而不是凭记忆重写。
工具组合与选型:不同项目该怎么配
| 项目类型 | 生成重点 | 推荐组合思路 | 人工介入重点 |
|---|---|---|---|
| 品牌短片 | 氛围与镜头质感 | 图像模型做设定 + 视频模型出镜头 | 调色与音效 |
| 产品演示 | 结构准确 | 三维重建 + 视频模型做环境 | 产品几何校验 |
| 游戏前期 | 资产可编辑 | 三维生成 + 引擎内检查 | 拓扑与 UV |
| 电商素材 | 数量与速度 | 单图重建 + 模板化提示词 | 批量筛选 |
| 概念短片 | 风格统一 | 固定种子 + 风格前缀 | 剪辑节奏 |
选型的核心判断不是“哪个模型最强”,而是“哪个环节的错误最贵”。如果交付物是视频,角色漂移最贵,就要优先选一致性控制强的组合;如果交付物是三维资产,拓扑质量最贵,就要优先选支持网格导出与重拓扑的工具。
另一个常被忽略的维度是工作流可移植性。如果一个工具只能在自己的平台内使用生成结果,那么它与你的后期管线就是割裂的。选型时优先考虑导出能力:能否导出标准视频编码、能否导出带材质的网格、能否批量处理。可移植性决定了你半年后还能不能沿用同一套流程。
后期、资产管线与跨引擎交付
格式与命名
统一使用 FBX 或 glTF 作为交换格式,贴图使用 PNG 或 EXR,命名采用“项目_资产_版本”的规则。生成式项目最容易失控的地方就是文件名,几百个版本混在一起,两周后没人知道哪个是最终版。
拓扑与减面
生成的网格常常面数过高且分布不均。进入引擎前做一次减面与重拓扑,把主要面数集中在镜头会靠近的部分。角色模型还需要检查骨骼绑定区域的分段,否则做动画时关节会塌陷。
材质与烘焙
把生成过程中的程序化材质烘焙成贴图,包含基础色、粗糙度、金属度与法线。烘焙之后资产才能脱离生成工具独立存在,也才能被没有原工具的环境使用。
色彩空间与音频同步
色彩空间是最容易出错的一环。生成素材通常是 sRGB 或未标注的编码,而后期工程可能使用线性工作流。导入前统一转换,避免在同一工程里混入不同色彩空间的素材,否则调色时会出现“越调越脏”的情况。音频同样要统一采样率,避免最终合成时出现细微的同步偏移。
交付前检查清单
- 面数在项目预算范围内,主要区域密度合理。
- UV 无重叠、无拉伸,贴图分辨率与用途匹配。
- 法线朝外统一,导入引擎后无明显黑面。
- 材质贴图齐全,色彩空间设置正确。
- 静态网格与骨骼网格分别导出,命名一致。
常见问题排查手册
| 现象 | 可能原因 | 处理方式 |
|---|---|---|
| 角色脸型在镜头间变化 | 参考图不固定或种子变化 | 固定角色卡与种子,减少视角跨度 |
| 画面整体闪烁 | 时序一致性不足 | 降低运动幅度,启用补帧与稳定 |
| 手部与四肢变形 | 训练数据中的遮挡问题 | 简化动作,避免手部特写 |
| 光照方向突然反转 | 提示词缺少光源位置 | 显式写明主光方向与时间 |
| 三维模型背面穿帮 | 单视图重建的猜测误差 | 增加多视图参考或视频重建 |
| 导入引擎后模型发黑 | 法线反转或材质丢失 | 统一法线,重建材质连接 |
| 画面出现水印或文字 | 训练残留 | 加负面约束,后期裁切或修补 |
| 运动看起来“飘” | 缺少物理参照与重量感 | 加入地面接触、碎屑、扬尘等参照物 |
时间、成本与团队协作的现实预期
生成式流程并不能让项目瞬间完成,它改变的是成本结构。过去预算主要花在拍摄与场地,现在主要花在筛选、重做与后期修补。一个常见的误判是以为“生成很快所以可以无限重做”,结果项目在筛选环节耗尽时间。理性的做法是给每个镜头设定重做上限,超出上限就回到提示词结构或角色设定层面找原因,而不是继续盲抽。
协作层面,建议把角色卡、风格前缀、镜头术语表、命名规范做成共享文档,任何人接手都能产出风格统一的结果。生成式项目最怕的不是技术不够,而是每个人用自己的写法,最后拼出一支风格四分五裂的片子。
另外要有心理预期:三维生成的原始产物大多是“半成品”。它节省的是从零到六十分的时间,而从六十分到九十分仍然需要人工。把人工工时预算放在拓扑修复、调色与音效上,比放在无止境的重新生成上回报更高。
一个更实际的建议是设置“冻结点”。在项目过半时冻结角色设定与风格前缀,此后只允许调整镜头层面。没有冻结点,项目会陷入无限优化,而后期时间被持续挤压。冻结点不是妥协,而是把有限的时间分配给回报最高的环节。
常见问答
三维生成能完全替代传统建模吗
不能。它在批量生成、快速占位、风格探索上优势明显,但在需要精确尺寸、工程约束、复杂机械结构时,人工建模仍然不可替代。更现实的定位是把它当作第一稿生成器与素材扩充器。
没有三维基础也能用吗
可以,但需要理解几个基本概念:面数、UV、法线、材质通道。这些概念不需要你会建模,但决定了你能不能判断生成结果是否可用。
为什么同一个提示词每次结果都不一样
生成过程本身包含随机采样。想要稳定结果,需要固定种子、固定风格前缀、固定参考图,并且把提示词的结构固化下来。
视频生成和三维生成应该先做哪个
通常先做三维与角色设定,再做视频。如果反过来,你会为每个镜头单独造一个世界,一致性几乎不可能维持。
怎样判断一个镜头需要重做还是可以后期修
看错误是否随时间变化。静态错误(颜色、构图)可以后期修;随时间变化的错误(脸部漂移、结构闪烁)几乎无法修,必须重做。
生成素材需要多高的分辨率
按最终输出倒推。如果成片是 1080p,生成素材至少要到 1080p 以上,给稳定、裁切、重新构图留出余量。分辨率不足的素材在稳定与推近时会明显软化。
团队协作里最容易出问题的环节是什么
命名与版本管理。生成式流程每天产出几十个文件,如果没有统一命名,一周后团队会花大量时间在找文件,而不是做创意。
生成式三维资产可以直接商用吗
不同工具的使用条款差异很大。商用前需要逐项核对官方条款,特别是输入素材的授权范围与输出物的使用限制。不要依赖二手总结,直接读官方文档,并在团队内留下核对记录。
如何减少后期修补的工作量
把精力前移到设定阶段。角色卡越稳定、光照描述越具体、镜头术语越规范,后期需要修补的地方就越少。反过来,如果前期只写了一句模糊描述,后期几乎一定要重做。
什么时候应该放弃生成式方案
当项目的核心价值依赖精确的物理结构、真实的演员表演或严格的合规要求时,生成式方案的成本往往会超过传统方案。判断标准是:如果修补生成结果的时间已经超过重新拍摄或重新建模的时间,就该换路径。
三维生成与视频生成正在合流成一个统一的创作管线。掌握这套管线的人,优势不在于会用多少个模型,而在于知道每个环节的错误成本,以及在哪里放人工、在哪里放自动化。把角色卡、镜头表、命名规范这些看起来“无聊”的部分做扎实,成品的稳定性往往比换一个更强的模型提升得更明显。

