从脚本到成片:用 AI 工具链做一部能看的短剧
短剧是当下流量密码,但传统剧组动辄几万的成本让个人创作者望而却步。AI 把制作门槛打到了地板价——只要你会打字,就能完成从剧本到配音、从画面到剪辑的完整流程。这篇教程我带你走一遍真实可落地的 AI 短剧工作流,全程用免费或低成本工具,最终产出 1080P 竖屏成片。
第一步:用 AI 写分镜脚本,别让 AI 自由发挥
很多人让 ChatGPT 直接写短剧脚本,结果出来的是流水账。短剧的核心是 “每 3 秒一个钩子,每 30 秒一次反转” ,你需要给 AI 明确的格式约束。
我实测好用的提示词模板如下,直接复制到 Claude 或 GPT-4o:
你是短剧编剧。请根据以下设定输出分镜脚本:
剧名:《重生之我在AI公司当客服》
风格:逆袭爽剧,节奏快,每集60-90秒
人物:林晚(女主,前期懦弱后期黑化)、王总(反派,油腻上司)
要求:
1. 按表格输出:镜号 | 景别 | 画面描述 | 台词 | 音效/配乐建议
2. 每集至少6个镜头,第3个镜头必须有冲突点
3. 台词口语化,单句不超过20字
4. 画面描述要具体到人物动作和环境元素,方便后续AI生图
现在先写第1集。
拿到表格后,别直接用。你要手动改几个地方:把“画面描述”里所有抽象词(如“悲伤地”“愤怒地”)替换成可视觉化的动作(如“攥紧拳头,指节发白”“把文件摔在桌上,咖啡溅出”)。因为后续 AI 生图工具对情绪词的理解远不如动作词。
第二步:用 AI 生成分镜图,关键在“垫图”和“锁风格”
有了分镜脚本,下一步是把文字变成画面。这里我推荐两条路线:
| 工具 | 优势 | 劣势 | 适合场景 |
|---|---|---|---|
| Midjourney | 画质最高,人物一致性可控 | 付费,需科学上网 | 预算充足、追求质感 |
| 即梦/可灵 | 国内直连,支持图生视频 | 人物一致性稍弱 | 快速出片、测试创意 |
核心难点是角色一致性。短剧要同一个角色出现在多个镜头,AI 每次生成的都不一样就废了。
我的做法是“垫图 + 描述锁定”:
- 先用 Midjourney 生成主角正面照,得到一张满意的图,存为
linwan.png。 - 后续生成每个镜头时,把这张图作为垫图(MJ 的
--iw 2参数或即梦的上传参考图功能)。 - 同时在提示词里固定写“same character as reference image, wearing [固定服装描述]”。
以即梦为例,分镜图的提示词写法:
上传参考图:linwan.png
画面描述:女主林晚坐在办公桌前,穿白色衬衫(与参考图同款),低头看手机,周围是凌乱的工位,背后有"XX科技"logo墙。镜头中景,平视角度,室内冷色调灯光。
负面词:变形的手,多余的肢体,模糊脸,低分辨率
每个镜头生成 2-3 张备选,选最贴近剧本描述的那张。这个步骤最花时间,但值得——后面视频生成的质量上限全看分镜图。
第三步:图生视频,让静态画面“动”起来
现在你手里有一套分镜图,接下来用可灵或 Runway 做图生视频。
可灵的操作要点:
- 上传分镜图,提示词写清楚运动方式,不要写情绪,写“镜头缓慢推近”“人物从椅子上站起”“风吹动她的头发”。
- 时长选 5 秒(免费额度内),分辨率选 1080P 竖屏(9:16)。
- 运动幅度别太大,AI 视频容易形变,人物小幅动作 + 镜头缓慢移动最稳。
以分镜 2 为例:
上传图:分镜2.png
提示词:镜头固定,女主缓缓抬头,眼睛从无神变为锐利,嘴角微微上扬,背景工位同事走动模糊,景深变化。
生成后检查:如果人物脸部变形,重抽或裁剪画面只保留上半身。别追求一次成功,一个 5 秒镜头抽 3-5 次很正常。
第四步:AI 配音与口型同步
短剧台词量大,配音是关键。我用过一圈后,推荐这两个组合:
- 配音:用 ElevenLabs 或剪映的“文本朗读”,选“解说男声/女声”类型,语速调至 1.1-1.2 倍(短剧节奏快)。
- 口型同步:如果你用的是 Midjourney 生成的大头特写,需要让嘴型对上。剪映的“图文成片”功能弱,推荐用 HeyGen 或 SadTalker(开源)做音频驱动口型。
注意:不是所有镜头都需要对口型。全景、背影、手部特写、人物低头玩手机这些镜头,直接加配音即可,观众不会觉得违和。只有正脸说话的中景和近景需要口型同步,这样能省下大量处理时间。
配音文件导出为 WAV 格式,后面剪辑时对齐。
第五步:剪辑合成——剪映是效率之王
把 AI 生成的视频片段导入剪映,按分镜顺序排列。我的剪辑流程如下:
- 粗剪:按分镜表顺序拖入片段,每段长度控制在 3-5 秒,多余部分裁剪掉。
- 配音对齐:将配音文件拖入音频轨道,手动微调每个片段的位置,让嘴型与台词对上。
- 加音效:短剧必须有背景音乐和拟音。剪映素材库搜“紧张鼓点”“反转音效”“玻璃破碎”,在冲突点、反转点叠加。音量控制在 -15dB 到 -20dB,别盖过配音。
- 加字幕:剪映的“智能字幕”识别准确率不错,识别后手动改错别字。字体选“思源黑体 Bold”,描边加阴影,字号 8%-10% 屏幕高度。
- 调色:短剧要网感,滤镜选“清透”或“东京”,强度 60%,对比度 +10,饱和度 +5。
关于转场:别用花哨转场,短剧节奏快,直接硬切或叠化 0.2 秒最舒服。花哨转场会让人出戏。
第六步:批量生产与避坑指南
单个 60 秒短剧,熟练后 2-3 小时能完成。但如果你想日更,必须建立“生产线”:
- 素材库:把常用场景(办公室、街道、车内)、人物表情(惊讶、愤怒、偷笑)分类存放,后续新剧直接调用。
- 模板工程:在剪映里把片头、字幕样式、音效轨道存为模板,新剧只换素材。
- 批量生成脚本:用 Claude 的 API 写个脚本,一次生成 10 集的分镜脚本,存成 JSON 文件,后续逐集制作。
最后几个坑帮你踩过了,注意规避:
- AI 生成的手部特写:手指数量经常出错,尽量别用特写镜头,或后期裁剪掉手部。
- 人物穿帮:同一角色在不同镜头里衣服不同,开拍前把服装描述固定写进提示词。
- 配音情绪平淡:AI 配音的爆发力不足,遇到嘶吼、哭泣的台词,用剪映“声音变调”或叠加两层配音(一层正常一层低语)增强层次。
- 版权问题:AI 生成的画面和音乐,商用前确认平台授权条款。剪映素材库的商用素材要开会员,别用免费素材做商业项目。
这套流程跑通后,你就能稳定输出 AI 短剧了。工具会更新,但“分镜脚本 → 垫图锁风格 → 图生视频 → 对口型 → 精剪”这条链路短期内不会变。先拿一集练手,跑通后再优化效率。
评论(0)
暂无评论,快来抢沙发吧~