短视频的门槛早就不在"有没有设备",而在于"能不能把脑子里的画面讲清楚"。过去的流程是先写一份完整脚本,再约人拍摄、录制配音、进入剪辑台;现在更高效的做法是把创意拆成一组镜头意图,让生成模型去补画面,把人的精力留给判断、取舍与节奏。下面这套工作流,适合零基础的个人创作者,也适合需要稳定产出的小团队。
从"写脚本"到"搭镜头":创作重心的转移
传统影视流程里,脚本承担的是"信息传递"职责:谁在什么场景说了什么话,观众应该知道什么。AI 生成流程里,脚本的职责被拆成了两件事——一件是叙事骨架,一件是镜头意图。真正决定成片质量的是后者。
举个具体的例子。你要做一条 20 秒的咖啡店推广短片。传统脚本可能写成:
开场显示店铺招牌,一位年轻女性推门进入,店员微笑迎接,咖啡师磨豆、萃取、拉花,最后女性端起杯子坐在窗边,画面淡出显示店名。
这份脚本给了演员和摄影师足够信息,但对生成模型几乎没有指导价值。模型不知道第一个镜头是特写还是全景,不知道光从哪来,不知道镜头是固定还是缓慢推近。所以进入 AI 工作流之后,你需要把同一段话翻译成镜头表:
- 镜号 01|2 秒|招牌特写|固定机位|黄昏暖光|无人物
- 镜号 02|3 秒|门口全景|手持轻微晃动|人物背影入画
- 镜号 03|2 秒|咖啡师手部特写|俯角|动作:倒豆
- 镜号 04|3 秒|萃取特写|侧逆光|蒸汽升腾
- 镜号 05|4 秒|窗边中景|自然光|人物端杯、望向窗外
- 镜号 06|2 秒|杯子特写|浅景深|画面留白给店名
同样的内容,第二种描述可以直接喂给生成工具,也方便你在剪辑时判断"哪一段缺了"。这就是创作重心转移的核心:你不再写台词,你在写视觉决策。
什么时候仍然需要完整脚本
不是所有内容都适合抛弃脚本。以下三类内容仍然建议先写逐字稿:口播类知识视频、需要精确表达的产品说明、以及涉及数据或法律表述的品牌内容。区别在于,这类视频的脚本主要服务于听觉,画面只是辅助。把声音和画面拆成两条独立的生产线,反而更容易做。
把一句话变成镜头表:概念拆解的四要素
一个能撑起短视频的创意,通常包含四个要素:主体、目标、阻碍、转折。缺少阻碍的创意很难产生张力,缺少转折的创意很难让人看到最后。
以"职场新人第一次做汇报"为例:主体是新人,目标是让老板认可方案,阻碍是投影仪出故障、心跳加速,转折是他放下 PPT 直接口述,反而打动了全场。这四个要素拆完,镜头自然就出来了:颤抖的手、屏幕上闪动的报错、同事交换眼神、他合上电脑的动作、老板微微点头的特写。
三秒钩子的设计方法
前 3 秒决定观众是否留下。可用的钩子类型大致有五种:
- 视觉反差:极静的画面里突然出现高速运动。
- 疑问开场:画面里出现一个明显异常,但不给出解释。
- 结果前置:先把最终结果放出来,再倒叙解释过程。
- 人物直视:主体直视镜头,建立对话感。
- 文字冲击:屏幕上的一句短句,配合极简画面。
钩子镜头不要复杂。一个动作、一个光线变化、一个表情就够了。生成模型在镜头信息密度低的时候,画面稳定性最高。
分镜表的字段建议
一张好用的分镜表至少要有这些列:镜号、时长、景别、主体动作、环境、光线、情绪、音频提示、备注。前八列是生成依据,第九列是剪辑依据。用表格软件或在线文档维护都可以,关键是在生成之前把表填完,而不是边生成边想。
按镜头类型选工具,而不是只用一个模型
市面上可供选择的生成工具已经很多,各有擅长方向。用一个模型打全场是最常见的效率陷阱。更实用的策略是:按镜头类型分配工具。
- 环境空镜与氛围镜头:文生视频类工具表现稳定,适合日出、雨夜、街道、室内光线变化这类没有复杂人物动作的镜头。
- 人物近景与情绪镜头:优先考虑对人物面部处理更细腻的工具,同时尽量用一张参考图锁定形象。
- 产品特写与细节镜头:图生视频更可控,把产品照片作为首帧,描述镜头运动和光线变化即可。
- 动作与物理场景:需要关注模型对重力、碰撞、布料和液体的处理能力,通常要多次重试。
- 需要精确文字或口型的内容:把声音单独生产,画面用口型驱动或干脆改用数字人方案。
选型时值得对比的六个维度
- 单次生成时长:多数工具单段输出在 5 秒上下,超过之后画面容易漂移。
- 运动幅度容忍度:动作越大,画面越容易崩。
- 首帧控制能力:能否用图片锁定起始画面,直接决定一致性上限。
- 风格稳定性:跨镜头能否保持同一套色彩与质感。
- 生成速度与排队时间:影响你的试错节奏。
- 授权与商用条款:涉及商业项目时,这一条优先级最高。
建议长期维护"2 个主力 + 1 个备用"的组合。主力负责 80% 的常规镜头,备用工具在主力连续失败时接手,避免整个项目卡死。
提示词写法:把电影语言翻译成模型能听的句子
提示词不是越长越好,而是要信息结构清晰。推荐一个可复用的顺序:
主体 + 动作 + 环境 + 景别 + 机位 + 光线 + 风格 + 画质
例如:"一位穿灰色针织衫的女性坐在木桌前,缓慢抬起右手端起白色咖啡杯,背景是虚化的窗户和绿植,中近景,略高于视平线,右侧自然光,柔和暖调,写实纪录片风格,清晰锐利"。
景别与机位常用词表
- 景别:大远景、远景、全景、中景、中近景、近景、特写、大特写。
- 机位高度:俯拍、平视、仰拍、鸟瞰、地面视角。
- 机位运动:固定、缓慢推近、缓慢拉远、横移、环绕、跟随、手持、摇臂上升。
- 镜头属性:广角、标准、长焦、微距、浅景深、低角度透视。
光线与色彩的写法
光线描述比风格词更能决定画面质感。可用组合包括:清晨侧逆光、正午硬光、窗户散射光、单侧柔光箱、霓虹混合光、烛光暖调、阴天冷调。色彩上可以指定主色调与对比关系,比如"青橙对比""低饱和米色调""高对比黑白"。
运动的正确描述方式
一个镜头只描述一种主要运动。"镜头缓慢推近,同时人物转身并走出画面"这种双重运动会让模型在两个目标之间摇摆,结果往往是两者都做不好。如果确实需要复合运动,拆成两个镜头,让剪辑来完成衔接。
提示词常见错误
- 堆砌形容词:"绝美、震撼、史诗、顶级画质"对模型没有可执行含义。
- 一句话塞进多个场景:模型只认一个画面,多场景会被平均掉。
- 缺少否定约束:必要时明确排除"不要多余手指、不要文字水印、不要快速切换"。
- 忽略画幅:竖屏内容从一开始就要按竖屏构图描述,后期裁切会损失构图空间。
一致性:让同一个人、同一件产品出现在多个镜头
一致性是 AI 短片最大的技术门槛。观众可以接受画面不够精致,但很难接受主角在第三个镜头里换了张脸。
四个可落地的控制手段
- 角色设定卡:用一段固定文字描述角色的年龄、发型、发色、服装、配饰、气质,每次生成都原样复制。
- 首帧锁定:先用图像工具生成一张角色定妆照,后续每个镜头都以它为起始参考。
- 提示词骨架复用:保留描述主体与风格的部分,只替换动作与环境。
- 风格参考统一:全片使用同一组色彩与质感关键词,剪辑阶段再做一次统一调色。
换工具时的重新校准
不同工具对同一段提示词的理解差异很大。换工具时不要直接沿用旧提示词,而是先用同一个角色做三到五次小测试,观察它的默认构图、默认光线和默认质感,再决定把哪些描述留给工具"自动补全",哪些必须手动写死。
后期能补救到哪一步
轻微的面部差异可以通过统一调色、统一磨皮和局部替换来掩盖;超过一定程度的差异很难挽救。与其在后期花两个小时修一个镜头,不如回到生成阶段重做两次。
音频:决定完播率的隐性变量
画面决定观众是否点击,声音决定观众是否看完。很多创作者把 90% 的精力放在画面上,最后随便配一首音乐,成片观感立刻掉一个档次。
音乐先行的做法
对节奏感强的短视频,建议先定音乐再生成画面。选好一段带明确段落结构的音乐,标出高潮点、鼓点、段落切换点,然后按这些时间点去设计镜头长度。这样剪出来的片子天然卡点,不需要在剪辑台上反复微调。
人声与配音
口播内容有三种方案:真人录制、语音合成、以及不出现人声只用字幕。真人录制的亲和力最强,语音合成适合需要长期稳定输出的账号。使用声音合成时要注意授权范围,不要模仿特定真人的声音,也不要用他人的录音做未授权的克隆。
音效的四个使用位置
- 转场点:一声轻击或气流声,帮助观众感知镜头切换。
- 动作强调:杯子放下的轻响、脚步落地、纸张翻动。
- 氛围铺底:咖啡馆的环境人声、街道远处的车流。
- 情绪反转:低频嗡鸣或突然的静音。
音效不需要多,一条 30 秒的短片里,五到八个关键音效就足够。
字幕与安全区
竖屏字幕建议放在画面下方三分之一区域,避开平台界面遮挡的位置。字号宁大勿小,一行不超过十二个字。AI 生成的画面里如果出现文字,通常是乱码,需要在剪辑阶段用贴片字幕覆盖。
剪辑与后期:把片段拼成有节奏的短片
生成阶段结束,你通常会得到比成片多三到五倍的素材。剪辑的任务就是从这些素材里挑出节奏。
五个阶段的顺序
- 粗剪:按分镜表顺序把可用片段铺上时间轴,先不管细节。
- 精剪:删掉多余帧,调整每段时长,让动作衔接自然。
- 音频:铺音乐、对齐卡点、加音效、处理人声。
- 调色:统一全片色彩与曝光,压制各片段之间的差异。
- 输出与封面:确认分辨率、码率、首帧封面。
剪辑软件的选择
手机端可用剪映、CapCut 一类工具,上手快,字幕和卡点功能完善;桌面端可选 Premiere、DaVinci Resolve、Final Cut,调色与多轨音频更强。如果你打算长期做内容,建议早点迁移到桌面端,素材管理和版本控制的效率差距会越来越明显。
节奏的三个技巧
- 镜头长度递减:开场镜头可以长一些,越往后镜头越短,制造加速感。
- 动作衔接:上一个镜头结束的动作与下一个镜头开始的动作用同一方向,观众会感到流畅。
- 声音先行:让下一个镜头的声音提前一两帧进入,切换会变得顺滑。
输出规格建议
竖屏内容常用 1080×1920,码率在 8 到 15 Mbps 之间。如果平台会二次压缩,适当提高码率能保留更多细节。首帧封面要单独挑一张信息最清楚的画面,不要用过渡帧。
批量生产:把一次成功变成可复用的流水线
单条爆款靠运气,稳定产出靠流程。当你能稳定做出三条及格线以上的短片,就该考虑把它变成流水线。
素材库与命名规范
建立三层结构:项目文件夹 / 镜头素材 / 音频与字体。命名建议采用"项目名-镜号-版本号"的格式,比如 coffee-shop-s03-v2。版本号不要用"最终版""最终版2"这类命名,三个月后你自己都分不清。
提示词模板化
把提示词拆成可替换的模块:角色模块、场景模块、光线模块、风格模块、画质模块。日常创作时只改角色与场景两个模块,其余保持不变。这样既节省时间,也天然保持了跨视频的视觉统一。
批量生成与排队
生成任务通常需要排队。合理安排方式是:集中在同一时段提交一批镜头,等待期间去做剪辑、写文案、准备下一条视频的镜头表,而不是守着一个任务刷新。把"等待"变成并行工作时间,是提升日产量的关键。
版本管理与 A/B 测试
同一份创意做两个版本:一个版本三条镜头,一个版本五条镜头;或者两个不同的开场钩子。发布后对比完播率和互动数据,保留表现更好的那种结构。测试时一次只改一个变量,否则数据无法解释。
常见问题排查清单
生成结果不理想时,按顺序排查通常比随机重试更快。
- 画面整体抖动或扭曲:运动幅度过大,降低动作强度,或把镜头改成固定机位。
- 人脸变形:镜头太远导致脸部像素不足,改成中近景或近景;同时补上参考图。
- 手指与肢体异常:避免手部特写,或让手部处于画面边缘、被物体遮挡。
- 画面出现乱码文字:在提示词里排除文字元素,后期用贴片覆盖。
- 动作不连贯:把长动作拆成两段,分别生成再剪辑衔接。
- 风格前后不一致:检查每段提示词的风格关键词是否完全相同,通常差异来自这里。
- 生成速度异常慢:检查单段时长是否过长、分辨率是否过高,适当降低规格测试。
- 画面过曝或灰暗:光线描述过于笼统,改成具体的"窗户散射光"或"黄昏侧逆光"。
常见问题 FAQ
需要多强的设备才能做 AI 短视频?
如果全部使用云端生成工具,一台普通笔记本甚至平板就够。真正吃性能的是本地视频生成与调色,这类工作才需要独立显卡和较大内存。建议先用云端方案跑通流程,再决定是否升级硬件。
零基础大概多久能上手?
如果每天投入一小时,通常一周能掌握提示词基本写法,两周能完成第一条结构完整的短片,一个月左右能形成自己的模板库。瓶颈往往不是工具,而是镜头语言的分辨能力——多看、多拆解别人的片子,比多学工具更快。
生成的内容可以商用吗?
取决于所用工具的服务条款。商用项目要逐条确认授权范围、是否允许用于广告、是否需要标注来源。涉及真实人物肖像、品牌标识和音乐时,还要额外取得权利。这一部分建议提前确认,不要等到发布前才处理。
一条 30 秒短片大概要花多少时间?
熟练之后,从创意到成片通常在 3 到 6 小时之间:镜头表 30 分钟,生成与筛选 1 到 2 小时,剪辑与音频 1 到 2 小时,输出与封面 20 分钟。第一次做会慢很多,主要时间消耗在反复重试上。
一定要真人出镜吗?
不一定。纯画面加字幕的形式在很多品类里表现很好,尤其是知识、旅行、美食和产品展示。需要建立信任感的品类,真人出镜或固定的数字人形象仍然更有优势。
怎么避免生成内容看起来同质化?
三个方向:换视角(多数人用平视,你用俯拍或地面视角)、换节奏(多数人快剪,你用长镜头)、换细节(加入具体的地点、时间、物件,而不是抽象概念)。同质化通常来自提示词过于通用,而不是工具本身。
生成失败率高怎么办?
先降低单镜头复杂度:一个主体、一个动作、一种光。再固定画幅与风格描述。最后把重试次数限制在三次以内,超过三次就改描述方式,而不是反复按同一个提示词重试。
应该同时学多个生成工具吗?
不建议一开始就铺开。先用一个工具把完整流程跑通,建立起镜头表、提示词模板和剪辑习惯,再根据实际遇到的能力缺口去补充第二个工具。工具越多,流程越容易碎。
怎么判断一条视频有没有做对?
看三个数:前 3 秒的留存、平均观看时长、以及完整观看比例。如果前 3 秒流失严重,问题在钩子;如果中段掉得快,问题在节奏;如果最后 20% 掉得快,问题在结尾没有给出足够的收束感。
把流程变成习惯,而不是把工具变成负担
AI 视频创作真正改变的不是"能不能做出来",而是"做多少次才能做对"。当你把创意拆成镜头表、把镜头分配给合适的工具、把提示词模板化、把音频和剪辑当成独立流程来对待,单条视频的质量波动会明显收窄。
建议从今天开始做一件小事:选一个你喜欢的 15 秒短片,逐镜头拆解它的景别、机位、光线和时长,写成一张表格。拆解五条之后,你会发现自己的镜头表写得越来越快,生成时的重试次数越来越少。工具会不断更新,但"把想法翻译成镜头"这项能力,会一直有用。


