100
可以。你这次真正有价值的不是“终于跑出一条视频”,而是已经踩过一遍 选题 → 剧本 → 角色 → 生图 → 图生视频 → 本地模型 → 剪辑 → 发布 的完整链路。
我建议把这次当作你的 AI 漫剧 EP00 / 技术验证项目。以后每做一集,都可以拿下面这套 SOP 对照,避免重新踩坑。
AI 漫剧第一次完整实践复盘
一、先明确我们最后想做的东西
目标并不是:
学会 ComfyUI / 学会某个 AI 模型。
而是:
一个人能够稳定做出有剧情、有角色、有镜头语言的 AI 短剧。
所以整个流程应该是:
故事 → 剧本 → 分镜 → 角色资产 → 关键帧 → 视频 → 声音 → 剪辑 → 成片
而不是:
下载模型 → 调参数 → 抽卡 → 再下载模型 → 再调参数。
这是这次最重要的一条经验。
01|选题:先证明“故事成立”
我们最后选择的核心机制其实很好:
一句随口说的话,被现实用意想不到的方式兑现。
第一集:
聚餐时男主吹牛:
“我要是能中一百万,我嘎吧一下就死在这儿。”他随后假装中奖、装死,朋友发现被骗。
晚上回家,却真的在路边捡到一包一百万。
男主想起自己说的话:
“等等……我说的是中一百万。”
“这是捡的。”
“应该……不算吧?”
心跳停止。
黑屏。
为什么这个方向值得继续?
它有四个很适合 AI 短剧的特点:
日常场景 + 简单规则 + 前后呼应 + 强结尾。
观众不用理解复杂世界观。
前面一句:
“中一百万我就死。”
就是规则。
后面一包钱,就是兑现。
最后:
“捡的不算吧?”
既是台词,也是悬念。
而且天然适合系列化:
《说啥来啥》
以后每一集换一句话就可以继续扩展。
02|第一大教训:写剧本时就要考虑“AI 能不能拍”
传统写剧本可以写:
男主突然倒下,朋友冲过去扶他,其中一个人伸手探鼻息,另一个人拿手机查看中奖信息……
AI 视频不能这么想。
因为这里同时出现:
- 多人物
- 大幅身体运动
- 手部交互
- 人与人接触
- 手机
- 屏幕文字
- 精确动作顺序
全部都是当前生成模型容易翻车的东西。
我们实际就遇到了:
躺下变形、人物复制、朋友长歪、探鼻息手指异常、男主明明装死却突然笑、复杂动作无法按顺序完成。
所以以后剧本阶段就要问:
这个动作一定要正面拍出来吗?
例如“探鼻息”,完全可以变成:
朋友蹲下 → 切朋友紧张脸 → 环境突然安静 → 男主突然睁眼。
观众自然知道朋友刚刚检查过他。
AI 漫剧的重要原则
能用剪辑表达的,就不要逼模型表演。
03|不要让一个 AI 镜头承担完整事件
这是我们这次踩得很深的坑。
最开始容易产生一种想法:
给一张图,让模型生成“走过去 → 发现包 → 停下 → 蹲下 → 打开 → 震惊”。
理论上 Prompt 能写。
实际上越往后越容易崩。
正确方法是拆:
镜头 A
走路。
镜头 B
发现东西,停下。
镜头 C
手扒开树叶,看到包。
镜头 D
打开包。
镜头 E
人民币特写。
镜头 F
震惊脸。
最终剪辑让观众感觉:
他走过去发现并打开了包。
但实际上没有任何一条 AI 视频真正完成了整套动作。
这句话以后可以直接写进 SOP:
AI 负责 1~3 秒可信动作,剪辑负责完整行为。
04|角色:先建立“母图”,不要每个镜头重新造人
这次角色一致性也经历了一些绕路。
一开始我们尝试:
- 人物参考
- Kontext
- USO
- 不同角度
- 不同姿势
- 不同构图
结果发现:
身份一致 ≠ 画面一致。
尤其当要求从:
正面站立
直接变成:
躺在地上 / 大幅改变机位 / 多人物互动
Kontext 这种编辑路线很容易复制人物或者改变结构。
后来逐渐形成了更正确的方法:
Character Bible / 母图
先确定:
- 年龄
- 发型
- 脸型
- 衣服
- 身材
- 气质
- 主要表情
- 主色调
比如目前男主最核心的识别元素已经很简单:
年轻东亚男性
短黑发
灰色 T 恤
黑色裤子
普通、干净、邻家感
反而比搞复杂服装更容易保持。
以后角色生产应该变成
角色母图
↓
角色参考图 / 多角度
↓
独立生成每个关键构图
↓
必要时再做身份修正
而不是:
Shot01 → 编辑成 Shot02 → 编辑成 Shot03 → 编辑成 Shot04……
因为误差会一代一代累积。
05|生图:先把电影拍成“静态电影”
这是这次后半段开始明显变顺的地方。
例如捡钱这一段,我们最终有了:
- 草丛里的黑包
- 第一视角伸手
- 蹲下打开包
- 包里人民币
- 男主震惊
- 拿起人民币
- 站起来按胸口
这些静态关键帧本身已经能够讲故事。
这非常重要。
以后判断一集能不能进入视频阶段,可以用一个很简单的标准:
把所有关键帧按顺序摆出来,不看 Prompt、不看剧本,我能不能看懂发生了什么?
如果静态分镜都看不懂,
不要开始图生视频。
继续修图。
06|生图时,连续性比“单张惊艳”重要
这是下一集应该明显加强的地方。
单看一张图可能很好看,但连续播放就会出现:
- 包的位置改变
- 拉链改变
- 钱突然变多
- 钱的摆放改变
- 人物左右手交换
- 衣服颜色漂
- 路灯方向改变
- 草丛结构改变
- 镜头突然跨轴
所以以后生成连续镜头之前,要建立一个简单的:
Continuity Sheet
比如这一场:
人物
灰 T / 黑裤 / 白鞋。
道具
黑色旅行包。
钱
红色人民币 100 元纸币、成捆。
环境
夜晚住宅街道 / 左侧绿篱 / 暖色路灯。
光线
人物主要受暖色路灯照明。
位置
包始终靠近绿篱和路沿。
这样 Prompt 可以变,但这些东西不变。
07|道具连续性尤其重要
我们这次一个很典型的问题就是:
人民币突然变美元。
这不是小问题。
因为“100 万人民币”本身就是剧情核心道具。
所以以后凡是剧情关键物品:
- 钱
- 手机
- 戒指
- 武器
- 信
- 照片
- 特殊物件
都应该和角色一样:
把它当成一个需要保持一致性的“角色”。
尤其是钱。
不要只写:
money / cash
应该明确:
red Chinese RMB 100-yuan banknotes
而且最保险的办法不是靠 Prompt 一直提醒模型。
而是:
关键道具尽量在静态图阶段就正确。
图生视频只让它产生小运动。
08|不是所有图片都值得生成视频
这是后期非常重要的成本意识。
我们最后三张:
- 震惊看钱
- 拿钱确认
- 按胸口
一开始很容易想:
三张全部图生视频。
实际上第二张完全可以:
静帧 + 轻微推镜 + 钱币摩擦音
0.5~0.8 秒过去。
观众不会在乎它是不是 AI 视频。
判断一张图需不需要视频化
问:
这个镜头的运动本身有没有叙事价值?
有:
表情变化、回头、走路、停下、意识到危险。
生成视频。
没有:
钱的特写、手机画面、包、环境建立镜头。
很多时候静帧完全够。
这样一集原本可能需要生成 20 条视频,
最后可能只需要 8~12 条真正重要的动态镜头。
09|图生视频:小动作明显比大动作可靠
H3 后来能用,一个重要原因不是突然模型变强了。
而是我们给它的任务变简单了。
例如:
男主站着,手放胸口,眼神稍微变化。
很好。
而:
男主走过去、蹲下、打开包、拿钱、站起来、震惊。
非常危险。
以后 Prompt 中优先使用:
- slowly
- subtly
- slight
- restrained
- small natural movement
- realistic blinking
- subtle breathing
减少:
- suddenly runs
- dramatically falls
- quickly turns around
- grabs
- jumps
- complex interaction
特别是真人电影感。
动作越克制,往往越像真人。
10|Prompt 不是越长越好
这次我们的 Prompt 后面越来越成熟,其实结构已经可以固定下来。
视频 Prompt 模板
① 谁 + 在哪里
A young East Asian man stands on a quiet residential street at night.
② 当前动作
One hand rests lightly on his chest.
③ 唯一主要表演
His expression gradually changes from relief to uncertainty.
④ 微动作
subtle eye movement
slight eyebrow tension
natural blinking
restrained breathing
⑤ 锁定连续性
Keep the same face, hairstyle, clothing, environment and lighting.
⑥ 关键道具
The banknotes remain red Chinese RMB 100-yuan banknotes.
⑦ 明确禁止模型乱演
No collapsing.
No screaming.
No exaggerated fear.
No large body movement.
⑧ 摄影
stable cinematic camera
subtle handheld micro-movement
shallow depth of field
realistic night lighting
这个结构以后基本可以复用。
11|本地模型最大的坑:不要为了“跑起来”无限折腾
这一部分应该是这次最痛苦的技术经验。😂
我们先后碰过:
- Kontext MPS Float8 不支持
- AppleSilicon-FP8
- USO
- Wan 2.2
- H3
- NVFP4 text encoder
- GGUF
- 错误 GGUF
- MPS OOM
- 黑视频
- 0.00 秒假输出
- 帧数问题
- 内存压力
很容易进入:
模型工程师模式。
然后一晚上过去,没有增加一个故事镜头。
以后一定要给技术实验设止损。
例如:
一个新模型最多给 2~3 次测试机会。
如果还是:
- 严重闪烁
- 人脸崩
- 场景漂移
- 无法稳定输出
就暂停。
不是证明:
“我一定要让 Wan 在 Mac 上生成完美视频。”
我们的任务是:
把 EP01 做出来。
12|这次 Wan 2.2 给我们的教训
Wan 2.2 5B 最大优势:
小、能跑、免费、本地。
但实际测试:
- 背景变化严重
- 色彩漂
- 蓝紫色异常
- 时序稳定性不够
所以及时停掉是正确决定。
最大的错误会是:
再调 30 个参数看看。
如果模型基础能力和目标不匹配,参数优化收益很低。
13|H3:重,但最终证明 48GB Mac 能跑
H3 是这次最有价值的技术验证。
一开始看起来几乎不可能:
33B 左右模型 + 48GB Apple Silicon。
但最终通过:
- INT8 H3 DiT
- GGUF Qwen3-VL text encoder
- AppleSilicon-FP8
- Turbo LoRA
- 合理尺寸
- 8 steps
- 56 frames
成功生成。
而且一次大约:
267 秒左右
已经进入:
“慢,但是能实际生产”
的范围。
这和“技术上能启动”完全不同。
14|H3 最大技术坑:模型能装进硬盘 ≠ 能装进内存
我们碰到最关键的报错:
MPS backend out of memory
37.xx GiB / 37.44 GiB
而且不是采样过程中炸。
是:
H3 模型加载/反量化阶段就炸。
因此降低:
640×352 → 更低分辨率
未必能解决这个阶段的问题。
这次最大的技术理解是:
模型权重内存和生成分辨率/帧数内存不是完全一回事。
以后看到 OOM,要先判断:
是模型加载时 OOM?
还是:
Sampling 时 OOM?
不要条件反射先降分辨率。
15|不要轻易解除 MPS 内存保护
系统提示过:
PYTORCH_MPS_HIGH_WATERMARK_RATIO=0.0
可以取消限制。
但你当时坚持:
我不想解除限制。
这是一个很好的决定。
因为我们的目标不是跑 benchmark。
这是你日常使用的 Mac。
最后事实也证明:
不解除安全限制,也可以找到能工作的配置。
所以以后原则:
优先量化、卸载、降低模型驻留、降低生成负载。
解除系统保护属于最后手段,而不是第一步。
16|不要随便下载“名字差不多”的 GGUF
这个坑我们也踩得很实。
最初下载了错误来源的 Qwen3VL GGUF:
文件名看起来对。
结果:
incompatible with llama.cpp
后来才换成真正经过 H3 + ComfyUI-GGUF 验证的:
qwen3vl-32B-MiniMax-H3-Q4_K_M.gguf
然后日志终于:
loaded completely
教训
大模型生态里:
模型名称一样 ≠ 文件格式、tensor layout、loader 兼容性一样。
以后下载:
- 先确认目标 workflow。
- 确认 loader。
- 确认有人在同平台跑通。
- 最好确认 exact filename。
- 再下载十几 GB。
否则下载成本非常高。
17|不要看到报错就同时改五个参数
这是调试最容易犯的错误。
正确方式应该像硬件调试一样:
一次只改变一个变量。
例如:
第一次:
换 text encoder。
成功以后确认:
GGUF 已经 load completely。
那么之后 OOM:
就已经不是 text encoder 格式问题。
不要重新怀疑所有东西。
同样,后来发现:
56 帧正常。
那就把:
length = 56
锁死。
不要每一轮同时改:
- Prompt
- 分辨率
- 帧数
- steps
- scheduler
- LoRA
- seed
否则最后根本不知道为什么成功。
18|“黑视频”和“秒出视频”本身就是调试信号
我们遇到一个很有意思的问题:
正常生成:
267 秒 / 300 多秒。
异常任务:
0.00s / 0.01s
这时候不用看视频就应该知道:
它根本没有正常执行完整生成过程。
所以以后任务队列的执行时间本身也是诊断信息。
对于 H3:
几分钟 = 至少真的算了。
0.01 秒 = workflow/cache/latent/输出链路明显异常。
后来发现 56 帧恢复正常,这类经验以后都应该记录。
19|画幅:不要因为模型方便就忘了最终平台
我们中途一直在:
640×352
这是接近 16<9>9> 的横向低分辨率测试尺寸。
它适合:
- Mac 本地测试
- 快速验证
- 节约内存
但你的主要发布平台是:
- 抖音
- 小红书
- B站
如果以后真正做抖音剧情,
最终应该从分镜阶段就考虑 9<16>16>。
否则横屏拍完再裁:
人脸没了、包没了、构图没了。
下一集可以采用:
测试阶段低分辨率 → 构图按竖屏安全区设计 → 最终关键镜头再提高质量。
不要最后才解决画幅。
20|AI 视频不是最终画质,后期才是
你后来感觉:
“本地还是可以的。”
这个判断其实比较准确。
H3 本地输出未必达到顶级在线视频模型水平,但它最大的意义是:
我们可以大量试错。
真正成片时:
- AI 原视频
- 剪辑
- 声音
- 调色
- 降噪
- 适当锐化
- 节奏
- 字幕
- 必要时局部高质量重生成
最终效果会比裸看 ComfyUI 输出好很多。
所以不能用:
暂停一帧放大 400%
来判断一条 AI 漫剧能不能用。
应该放进时间线里判断:
观众看这一秒会不会出戏?
21|声音是我们下一阶段最大的短板
这次生成视频全部无声。
但真正做剧情:
声音至少占一半。
尤其这个故事。
如果没有声音:
男主按胸口。
很普通。
如果有:
咚。
咚。
饭桌声音从记忆里传回来:
“我要是中一百万……”
现实环境声降低。
男主:
“这是……捡的。”
咚。
“应该不算吧?”
咚……
……
黑屏。
同一个画面,戏剧性完全不同。
所以下一次学习重点已经不应该继续下载视频模型。
而应该进入:
对白 + 环境声 + Foley + 音乐 + 混音。
22|不要追求每个镜头完美
这是第一次做 AI 漫剧最容易掉进去的坑。
某条视频:
手有一点问题。
再抽。
脸有一点软。
再抽。
背景灯动了一下。
再抽。
最后一晚上只做了一个镜头。
以后应该把镜头分级:
A 级:Hero Shot
剧情关键镜头。
比如:
- 说出诅咒
- 打开一百万
- 最终意识到规则生效
值得重做。
B 级:叙事镜头
走路、发现东西、朋友反应。
能用就过。
C 级:连接镜头
包、钱、街景、手、手机。
甚至:
静帧 + 音效就能过。
这样才能真正做到周更甚至更高频率。
23|这次我们做对了什么
虽然踩了很多坑,但有几件事其实非常重要。
第一,没有因为第一批画面不好就放弃故事。
第二,发现某个技术路线不行以后,最终还是会停下来换方法,而不是无限死磕。
第三,开始学会用:
镜头拆分
而不是要求 AI 一镜到底。
第四,后半段已经开始考虑:
连续性、人民币、人物衣服、灯光、位置。
第五,最重要的是:
真的发出去了。
这意味着它已经不是“学 AI 视频”。
而是完成了:
Idea → Production → Publish
闭环。
这个价值比某一张图是不是 9.5 分重要得多。
24|下一集应该采用的正式 SOP
经过这次踩坑,我建议以后固定成下面这条生产线:
① 一句话创意
先确定:
普通人 + 普通场景 + 异常规则 + 代价。
↓
② 60 秒剧本
先写:
开场钩子 → 建立规则 → 第一次误导 → 真正兑现 → 反转/悬念。
↓
③ Shot List
控制在:
12~20 个有效镜头。
↓
④ AI 可拍性检查
逐镜标:
简单 / 中等 / 高风险。
高风险镜头提前拆。
↓
⑤ Character Bible
角色母图锁定。
↓
⑥ Continuity Sheet
锁:
人物、服装、环境、时间、道具、光线。
↓
⑦ 全部关键帧
先把整集做成“静态电影”。
↓
⑧ 静态粗剪
把图片扔进 PR。
先验证:
故事节奏到底成立不成立。
这是下一集我非常建议新增的一步。
↓
⑨ 只挑需要运动的图做 I2V
不是所有图都生成视频。
↓
⑩ 本地 H3 批量生成
普通镜头:
本地解决。
↓
⑪ Hero Shot 精修
真的特别差而又特别重要:
才考虑更好的模型/付费生成。
↓
⑫ 声音
对白 → Foley → 环境 → 心跳/特殊声音 → BGM。
↓
⑬ 剪辑
只保留 AI 视频最好看的那 0.5~3 秒。
↓
⑭ 调色 / 字幕 / 音频
统一“电影感”。
↓
⑮ 导出 → 发布 → 数据复盘
看:
3 秒留存
完播
评论在讨论剧情还是 AI
哪个镜头流失
然后再决定下一集怎么改。
25|把这次踩坑压缩成 10 条铁律
以后开新项目之前可以先看一遍:
- 先故事,后模型。
- 先做完整静态分镜,再做视频。
- 一个 AI 镜头只承担一个主要动作。
- 复杂动作交给剪辑,不要逼模型一镜完成。
- 角色、服装、道具、环境都要做连续性管理。
- 关键道具必须在生图阶段就正确。
- 不是每张图都需要变成视频。
- 技术测试最多几轮,失败就止损,不掉进模型黑洞。
- 先完成整集,再精修 Hero Shot。
- 发布完成的 80 分作品,比硬盘里一个 98 分镜头有价值。
我觉得下一阶段应该改变学习重心
我们现在已经证明了一件非常关键的事情:
你的 Mac 确实可以本地生成可用于短剧的 AI 视频。
所以短期内我不建议继续折腾:
新模型、新节点、新量化、新工作流……
除非现有 H3 明确做不到某个关键镜头。
下一阶段真正值得学的是:
「怎么把 AI 素材导演成一部片」
也就是:
剧本 30% → 分镜 25% → 声音 20% → 剪辑节奏 15% → AI 技术 10%
技术比例反而应该开始下降。
因为这次最大的提升空间,已经不是“能不能生成”。
而是:
同样这批生成能力,怎么让观众忘记这是几段 AI 视频拼出来的,而开始关心——他捡了这一百万以后,到底会不会死。
做到这一点,才真正从“玩本地 AI 视频”跨到“做 AI 漫剧”。
支持与分享
如果这篇文章对你有帮助,欢迎分享给更多人或打赏支持!













