很多人第一次接触 AI 视频生成,都会被几秒钟的演示片震住:一个人物在雨中回头,镜头缓慢推进,光影像是电影摄影机拍出来的。于是立刻动手,输入一段描述,等待结果,然后发现出来的画面人物脸变了三次、手指数不清、运动像在融化。问题不在工具不行,而在于把“生成一段视频”和“做出一支短片”当成了同一件事。
一支短片需要的是结构:有开场、有转折、有落点;有稳定的角色和时间线;有可听的声音和可读的字幕。AI 工具只是把其中几个环节的速度压缩了,并没有把导演的工作取消。本文按实际操作顺序,把第一支短片的完整流程拆开讲清楚——从概念、脚本、分镜,到提示词、生成、筛选、声音、剪辑,再到常见错误和一套可以反复使用的检查清单。读完你应该能在一天到一周的周期内,做出第一支可以公开分享的作品,而不是一堆零散的好看片段。
现在开始做第一支AI短片的现实条件
过去做一支两分钟的叙事短片,最低配置也需要演员、场地、灯光、录音和后期,周期以周计算。AI 视频工具改变的不是“拍摄”这件事本身,而是把某些原本必须实拍的镜头变成了可生成、可重做、可无限尝试的素材。这意味着试错成本从“再约一次场地”变成了“再跑一次生成”。
生成质量的变化带来了什么
当前主流视频生成模型在三个方向上进步明显:一是运动的物理合理性,人物走路、物体掉落、镜头横移不再频繁断裂;二是对提示词的理解,尤其是对镜头语言、光线方向、材质质感的响应;三是时长与分辨率,单段可生成的长度足够覆盖一个完整动作单元,不再只能做“动图式”的几秒。
对创作者来说,真正的价值不是“能生成”,而是“能重生成”。同一个镜头你可以拿到五个版本,挑出最好的那一个,这在实拍中几乎不可能。
时间结构和成本结构都变了
实拍的成本主要在场地、人员和设备;AI 制作的成本主要在时间——你花在写提示词、筛选素材、拼接镜头上的时间。这个差别决定了工作方式:不要追求一次生成成功,而要把每个镜头拆到足够小,让失败变成一次快速重试。
一位独立创作者常见的错误是把十分钟的剧本直接丢给工具,期待它产出成片。更合理的做法是先把剧本压成 12 到 20 个镜头,每个镜头 3 到 8 秒,逐段生成,最后在剪辑软件里组装。
谁最适合现在动手
- 完全没有拍摄资源,但有清晰故事想法的个人创作者;
- 需要大量概念验证和风格测试的广告、电商、品牌内容团队;
- 想低成本试拍分镜的独立导演和编剧;
- 需要稳定产出的短视频运营者。
如果你属于以上任何一种,第一支短片的合理目标不是“惊艳全网”,而是“完整跑通一次流程,并留下可复用的模板”。
开拍前的三件事:目标、时长、画幅
在打开任何工具之前,先把三件事写在一张纸上。这三件事决定了后面每一个技术选择。
目标:你要的是叙事、氛围还是产品展示
叙事型短片需要角色和情绪曲线,处理难度最高;氛围型短片(城市夜景、雨、霓虹、慢镜头)几乎不依赖角色一致性,是新手最理想的第一支作品;产品展示型短片需要材质和光线的准确,对静帧到视频的转换要求高。
如果你第一次做,建议选氛围型或“一个有动作的小情境”,例如:一个女孩在天台看日出,风吹起她的外套,她转身走下楼梯。这类内容镜头少、情绪明确、不依赖对白。
时长与画幅
- 时长:第一支控制在 30 到 60 秒。超过 90 秒会显著增加一致性和节奏控制的难度。
- 画幅:竖屏 9:16 适合短视频平台,横屏 16:9 适合叙事和影像感,方形 1:1 适合展示。画幅要在生成前确定,不要后期裁切,否则构图和运动方向会被破坏。
- 帧率:生成通常输出固定帧率,剪辑时保持统一,不要在同一时间线里混用不同帧率的素材,否则会出现卡顿感。
素材预算与迭代上限
给自己定一个上限:每个镜头最多重做 N 次,超过就改提示词或换思路。没有上限的迭代是新手最大的时间黑洞。一个可执行的规则是:每个镜头生成 3 到 5 个版本,选出最好的一个,如果全部不合格,说明提示词结构有问题,而不是模型不行。
工具链配置:文本、图像、视频、音频、剪辑
AI 短片制作不是“一个工具搞定”,而是几个环节各司其职。理解每个环节的工具类型,比记住某个具体产品更重要,因为工具会变,环节不会。
文本与分镜环节
你需要一个能把想法整理成结构化文字的助手:生成故事梗概、三幕节拍、分镜表、镜头描述。分镜表建议包含五列:镜号、画面描述、景别与运动、时长、声音需求。这个表格后来会成为你在视频工具里的作业清单。
静帧与首帧环节
绝大多数视频生成模型支持“图生视频”。这意味着先做出一张满意的静帧,再让它动起来,成功率远高于纯文字生成。静帧工具包括 Midjourney、Stable Diffusion 系列、Flux 系列等。静帧阶段是控制画面风格、构图、服装、光线的最佳时机,也是成本最低的调整点。
视频生成环节
主流选择包括 Sora 类的通用模型、Kling 系列、Runway、Luma、Pika、Veo 等。它们各有所长:有的擅长真实人物与复杂运动,有的擅长动漫风格与镜头调度,有的对中文提示词理解更好。实用原则是:同一个镜头用两个模型各跑一次,对比后再决定这支片子主要用哪个。
音频环节
配音可以用 ElevenLabs 或同类语音合成工具;配乐可以用 Suno、Udio 等生成,也可以使用免版税音乐库;音效(风声、脚步、门响、雨声)建议使用素材库,因为合成音效的可信度仍然不如真实录音。
剪辑与合成环节
CapCut、DaVinci Resolve、Premiere Pro 都可以。建议选择你熟悉的那个。剪辑阶段要做的事:统一时长节奏、处理转场、加字幕、调色、混音。不要指望在生成阶段解决剪辑才能解决的问题。
从一句话到分镜脚本:完整工作流
这一节给出可以直接照做的流程。整套流程大约需要 4 到 8 小时,取决于镜头数量。
第一步:写一句话概念
格式建议:谁 + 在哪里 + 遇到什么 + 最后的情绪落点。例如:“一个夜班归来的护士在天桥上看到日出,决定给自己放一天假。”一句话概念决定了整支片子的调性,也决定了后面选什么风格。
第二步:拆三幕节拍
把一句话扩展成三个节拍:建立(环境与人物)、变化(发生一件事)、落点(情绪收束)。每个节拍分配 2 到 6 个镜头。比如:
- 建立:天桥全景、脚步特写、城市夜色;
- 变化:她停下、抬头、天边泛白;
- 落点:阳光扫过她的脸、她微笑、转身走向地铁口。
第三步:写分镜表
给每个镜头写清四件事:景别(远景/中景/近景/特写)、镜头运动(固定/推/拉/摇/跟)、主体动作、光线时段。这四项决定了提示词的主体结构。不要写“画面很美”这类无法执行的描述。
第四步:静帧转动态
先为每个镜头生成 1 到 2 张满意的静帧,确认角色长相、服装、色调一致。然后用图生视频,给每个静帧配一段描述运动的短提示词,例如“镜头缓慢向前推进,人物轻微转头,风吹动衣角”。
第五步:生成与组装
批量生成,统一筛选,把挑出来的片段按分镜顺序拖入时间线。此时先不加音乐,只对画面节奏。画面节奏顺了,再加声音。
提示词工程:把画面拆成可控变量
提示词不是“写得越长越好”,而是“变量越清楚越好”。一段有效的视频提示词通常包含五个层次。
主体与动作
先说清楚画面里是谁、在做什么。用可观察的动作代替抽象情绪:“她缓慢抬头”比“她感到希望”更可执行。如果人物有特定外观,把发型、服装、年龄感写清楚,并在所有镜头中保持一致。
镜头语言
明确景别和运动:特写、中景、全景;固定机位、缓慢推镜、横向摇摄、跟随拍摄。镜头运动是 AI 视频最容易被忽略却最能提升“电影感”的变量。一个固定机位的近景,往往比一个混乱的复杂运动更有质感。
光线与时段
写清楚光源方向和时段:清晨侧逆光、夜晚霓虹反射、阴天柔和散射光、室内暖色台灯。光线决定了画面的情绪,也决定了模型是否容易生成稳定结果——极端光线(强烈逆光、纯黑背景)更容易出错。
材质与环境细节
加入材质描述可以让画面更可信:湿漉漉的柏油路、起球的针织外套、磨损的皮鞋、玻璃上的水汽。环境细节也在提示词里起到“锚点”作用,帮助模型稳定场景。
负面描述与常见崩坏
多数工具支持负面提示词或排除描述。常用的排除项包括:多余的手指、扭曲的面部、文字水印、画面抖动、人物变形、过度锐化。注意不要把所有可能的错误都堆进去,负面项过多会稀释主体描述。
一个可直接改写的示例:
中景,年轻女性站在人行天桥上,穿深色外套,缓慢抬头看向远处;固定机位,轻微手持晃动;清晨蓝调时段,天空泛白,远处城市灯光仍在;湿冷空气,呼吸可见;电影感,浅景深,自然肤色。
这个结构可以套用到几乎所有镜头,只需要替换主体、动作、景别和光线。
一致性难题:角色、场景与道具的连续性
观众对短片的容忍度很大程度上取决于一致性。人物脸在镜头之间变化,观众会立刻出戏。解决一致性靠的不是模型,而是流程。
建立角色卡
为每个主要角色准备一张“角色卡”:一张正面清晰图像、一段固定外观描述、一份服装清单。所有后续静帧都以这张图像为参考生成。如果工具支持角色参考或图生图,一定打开。
用首尾帧控制镜头衔接
首尾帧是解决连贯性的利器:上一个镜头的最后一帧,作为下一个镜头的第一帧参考,让运动和光线自然延续。跨场景时,用一个共同的视觉锚点(同一盏路灯、同一件外套、同一段走廊)把两场戏连起来。
场景锚点与道具连续性
给每个场景定义三个固定元素:一个主光源、一个主色、一个标志物。例如天台场景是“远处写字楼灯光 + 冷蓝色调 + 生锈的栏杆”。道具也一样:如果角色手里有一杯咖啡,那么它在下一个镜头里不应该消失,除非你刻意让观众看到它被放下。
什么时候可以放弃一致性
如果短片是氛围型或抽象风格,可以主动放弃严格一致性,改用统一的色调、颗粒和镜头运动来制造整体感。这是一种策略选择,不是偷懒。
生成—筛选—重做:迭代节奏与质量控制
新手常犯的错误是把生成当成单次抽奖,老手把它当成一轮轮筛矿。节奏比运气重要。
批量生成,集中筛选
一次为同一个镜头生成多个版本,然后一次性全部看完。不要在生成和观看之间来回切换,那会消耗大量注意力。筛选时用三个标准:动作是否自然、画面是否稳定、情绪是否符合分镜表。
判断问题出在哪一层
- 画面丑陋、风格不对:问题在静帧或风格提示词,重做静帧;
- 画面漂亮但运动诡异:问题在运动描述,缩短动作幅度,改为更简单的运动;
- 人物脸变化:问题在参考图或多镜头一致性,回到角色卡;
- 整段不连贯:问题在分镜设计,重新检查镜头之间的逻辑。
什么时候换模型,什么时候换提示词
如果同一个提示词在两个不同模型上都失败,问题在提示词;如果同一提示词在 A 模型上很好、在 B 模型上很差,是模型风格差异,按镜头类型分配模型。建议在项目开始时做一次“模型测试”:用三个不同镜头分别在两到三个模型上生成,记录结果,然后为整支片子定一个主力模型。
保存你的提示词库
把成功的提示词按类型存档:人物特写、城市空镜、手部动作、雨景、夜景横移。到第二支短片时,你会发现一半的工作已经有了起点。
声音设计与后期合成
画面完成度只占成片体验的一半。声音是让 AI 画面“可信”的关键,也是最容易被跳过的一步。
配音与旁白
如果短片有旁白,先写文字,再考虑语音合成。语音要留气口,不要每句都满速读完。合成语音最大的问题是节奏平,解决方法是拆句、加停顿、调整语速,而不是换音色。
音乐
音乐决定情绪走向。选音乐时先问自己:这支片子需要一个上升的情绪,还是一个平静的收束?把音乐放在时间线上听一遍画面,如果画面节奏和音乐不匹配,先改画面剪辑点,不要强行拉伸音乐。
音效
环境音是低成本高回报的投入。街景加车流和远处人声,室内加空间混响,天台加风声。音效不需要精确,只需要存在,它能显著减少画面的“空”感。
剪辑节奏
- 开场 3 秒内给出一个明确的视觉信息;
- 中段每个镜头停留时间根据信息量变化,一般 2 到 5 秒;
- 结尾留出 1 到 2 秒的静止或渐暗;
- 转场优先使用动作衔接和同色衔接,少用花哨特效。
调色、字幕与导出
统一色调,避免不同镜头色温跳跃。字幕保持同一字体和位置,字号以手机竖屏观看清晰为准。导出时选择适合平台的码率和分辨率,不要用最高码率上传,平台会自动压缩。
常见错误与排查清单
以下问题几乎每个新手都会遇到,提前知道可以省下大量时间。
- 镜头太长。 单段生成时间越长,崩坏概率越高。把一个 10 秒的想法拆成两个 5 秒镜头,成功率会明显提升。
- 提示词堆砌形容词。 “史诗级、超震撼、电影级”对模型几乎没有信息量。改成具体的景别、光线和动作。
- 忽略静帧阶段。 直接在文字生成里反复尝试,等于放弃了对构图和风格的控制权。
- 同一支片子混用过多风格。 三个模型三种质感,观众会感觉像拼贴。定一个主力模型。
- 不写分镜直接生成。 结果就是素材好看但没有叙事。分镜表是节省时间最多的工具。
- 后期才想起来画幅问题。 竖屏素材裁成横屏会损失构图。
- 音乐盖过一切。 音乐太满会削弱画面细节和音效的空间感。
- 忘记保存项目文件。 生成的历史版本、提示词、静帧都要归档,否则第二支短片要从零开始。
建立一张开工检查表
每次开始新项目前过一遍:画幅定了吗?主力模型选了吗?角色卡做了吗?分镜表写了吗?每个镜头的时长写了吗?音效清单列了吗?导出参数确认了吗?这七个问题全部回答完,再开始生成。
FAQ:第一支AI短片最常见的疑问
完全没有剪辑经验,能做出第一支短片吗?
可以,但建议先做 30 秒以内、无对白的氛围短片。用简单的剪辑软件,只做剪切、加音乐、加字幕三件事,先把流程跑通,再逐步增加复杂度。
应该先写脚本还是先试生成?
先写一句话概念和三幕节拍,然后立刻用一个镜头做风格测试。风格确定后再写完整分镜表。完全按脚本走容易在技术上撞墙,完全靠试生成则会失去叙事方向。
为什么我的人物每个镜头都不一样?
通常是因为没有角色参考图,或者每个镜头都用纯文字重新生成。解决方法是先做一张满意的角色图,后续所有镜头都基于它生成,并保持外观描述文字完全一致。
一个镜头应该生成多长?
3 到 6 秒是最稳定的区间。需要更长的连续动作时,拆成两个镜头,用首尾帧或动作衔接把它们连起来。
中文提示词和英文提示词哪个效果更好?
没有统一答案。部分模型对中文场景和中文语义理解更好,部分模型对英文电影术语响应更准确。实用做法是同一个镜头两种语言各试一次,比较后再决定。
需要多少素材才能剪出一支 60 秒的片子?
按每个镜头 2 到 5 秒计算,大约需要 15 到 25 个可用片段,加上备用素材,实际生成量通常是最终使用量的三到五倍。
音乐和音效可以用生成的吗?
可以,但建议混合使用:音乐用生成工具或免版税曲库,环境音效优先用真实录音素材,可信度更高。
怎么判断一支短片算“完成”了?
当你不再想改结构,只想改细节时,就可以导出发布。第一支片子的目标是把流程走完并留下模板,而不是达到完美。
做完第一支之后应该练什么?
建议第二支专注一件事:要么练角色一致性,要么练镜头运动,要么练声音设计。一次只提升一个维度,进步最快。
AI 短片能用于商业项目吗?
需要查看所使用工具的服务条款,确认生成内容的商用许可范围,并注意人物肖像、品牌标识和音乐版权。发布前保留素材来源和生成记录是稳妥做法。
从零到精通不是一条直线。真正的分界线在于你是否把这套流程变成可重复的系统:概念、分镜、静帧、生成、筛选、声音、剪辑、归档。跑通一次之后,你会发现第二支短片的制作时间可能只有第一支的三分之一,而质量反而更高。现在最有效的下一步,就是选一个你熟悉的场景,写一句话概念,然后开始做第一个 5 秒镜头。



