讲 AI 漫剧的文章,大多停在「有哪些工具」。但真正卡住人的从来不是选哪个工具,而是这几件事:角色做到第 3 集换了一张脸、动作一写大画面就糊、配音和口型永远差半拍。
这篇不列工具榜单,只讲一条我们自己出片时跑通的流程:从剧本到成片,五步,每步写清楚要产出什么、最容易翻车的地方在哪。
先看全局:五步流水线
| 步骤 | 这步要产出的东西 | 最容易翻车的地方 |
|---|---|---|
| 1 剧本与分镜 | 分镜表(景别 / 画面 / 台词 / 时长) | 全是中景,成片像配图朗读 |
| 2 角色与场景定妆 | 角色参考图(脸、服装、风格固定) | 换个镜头就换人 |
| 3 图生视频 | 每个镜头的动态片段 | 动作写太大,画面崩 |
| 4 配音与口型 | 台词音轨 + BGM | 音画对不上 |
| 5 剪辑包装 | 成片 | 节奏拖、字幕在手机上看不清 |
顺序别乱。第 2 步是生死线——一致性在这一步定完,后面所有画面都以它为输入。
第 1 步:先把「拍什么」定死(剧本 + 分镜表)
剧本可以交给通用对话模型起稿,但别让它一次性写完整剧本,中段逻辑最容易崩。做法是拆三层:先给设定让它出大纲 → 你确认走向 → 再逐集展开台词。
真正的关键不是剧本,是分镜表。把每集拆成若干镜头,每行写清四件事:景别、画面内容、台词、时长。这一步省下来的时间,后面会加倍还给你。
坑在哪:模型默认会给你一堆"中景、两人对话",做出来就是配图朗读。解决办法很土但有效——在提示里强制分配景别:每集至少安排一个远景建立场景、若干近景走情绪、一两个特写给细节。
工具上,通用对话模型就够用,可以看 AI 写作分类 里挑顺手的。这一步不要追求"文采",追求"能拍"。
第 2 步:角色定妆——一致性在这一步定生死
这一步决定观众会不会出戏。
做法:先给每个主角做一组角色设定图——正面、侧面、半身,服装配色固定下来。生成有两条路:
- 要可控:本地跑 ComfyUI 或 Stable Diffusion,固定模型 + LoRA,出图最稳定,也方便后面复现。
- 要省事:即梦 这类中文友好的在线工具,上手快,适合先把流程跑通。
三样必须固定:参考图、风格词、随机种子。任意一样变了,脸就跟着变。
坑在哪:别指望靠"文字描述角色"来保持一致——文字描述每次都会漂移。正确做法是:第 2 步出的图,就是后续所有画面的输入,而不是参考。角色卡建好,这一步才算完。
第 3 步:图生视频——让画面动起来
输入是上一步的角色图 / 场景图,输出是每个镜头的短片段。
工具选择:可灵AI、Vidu、海螺 AI、Runway Gen-4、腾讯混元视频。国内可直连的优先试前几个,省去网络折腾。
写动作的三条经验:
- 一次只写一个动作。"他转身走向窗边"没问题;"他转身走向窗边拿起杯子喝了一口然后回头笑"一定糊。
- 运镜用最基础的词:推、拉、摇、固定。复杂运镜描述,模型基本接不住。
- 幅度宁小勿大。小幅点头、眨眼、手指动作的成功率,远高于大幅跑跳打斗。
坑在哪:一个镜头一次生成不达意是常态,多抽几次比反复改提示词更省时间。但同一镜头抽卡时必须保持参考图和种子不变,否则抽出来的是另一个人。
第 4 步:配音——先有声音,再配画面
顺序很重要:先定音轨,再让画面去迁就音频。反过来做,口型永远对不上。
配音工具:剪映配音、讯飞配音、魔音工坊、Fish Audio、ElevenLabs(英文表现更强)。角色的声线要一集一定,写进角色卡,别临场换。
口型处理分两种:
BGM 可以进 AI 音频分类 找,Suno、Udio 这类生成配乐的工具都在里面。注意商用授权条款,尤其是要发到有收益的平台时。
第 5 步:剪辑包装
剪辑工具:Opus Clip(长片转短视频切片)、Descript(改文稿等于改片,适合口播类)、Kapwing(在线协作剪辑)。
包装三件事:
- 字幕:字号和描边要保证手机竖屏可读,别用默认样式直接导。
- 转场:少即是多,硬切最稳。花哨转场只会暴露素材质量。
- BGM 音量:压到人声之下,这是新手最常犯的错。
坑在哪:别指望在这一步救前面的活。画面垮了就回去重新抽卡,转场和特效遮不住。
五个最常见的翻车点
| 症状 | 根因 | 怎么绕 |
|---|---|---|
| 角色换脸 | 参考图 / 种子不固定 | 全流程固定参考图 + 种子,建角色卡 |
| 画面糊、肢体畸形 | 动作幅度过大 | 拆动作、写小幅 |
| 口型不同步 | 先做画面后配音 | 先音后画 |
| 看着像 PPT | 分镜全是中景 | 分镜表强制分配景别 |
| 成片节奏拖 | 单个镜头太长 | 镜头切短,靠剪辑点推进 |
时间和成本:说点实在的
时间主要花在两处:画面抽卡重试和音画对齐,剧本反而不是大头。
成本取决于生成时长和重试次数。本地部署(ComfyUI + 开源模型)适合量大、要控成本的场景;在线工具适合先跑通流程、验证方向。
别按"一条片子多少钱"估算,按"一个镜头平均要抽几次"估算,心理预期会准很多。
走通之后
下一步是把角色卡、风格词、分镜模板沉淀成你自己的"配方"。第一部最慢,第二部开始会快很多——因为最贵的那部分(角色一致性方案)已经定型了。
提示:各工具的能力、额度与价格迭代很快,本文讲的是流程与判断,具体功能以官方最新说明为准。

