100

5078 字
25 分钟
100

可以。你这次真正有价值的不是“终于跑出一条视频”,而是已经踩过一遍 选题 → 剧本 → 角色 → 生图 → 图生视频 → 本地模型 → 剪辑 → 发布 的完整链路。

我建议把这次当作你的 AI 漫剧 EP00 / 技术验证项目。以后每做一集,都可以拿下面这套 SOP 对照,避免重新踩坑。

AI 漫剧第一次完整实践复盘#

一、先明确我们最后想做的东西#

目标并不是:

学会 ComfyUI / 学会某个 AI 模型。

而是:

一个人能够稳定做出有剧情、有角色、有镜头语言的 AI 短剧。

所以整个流程应该是:

故事 → 剧本 → 分镜 → 角色资产 → 关键帧 → 视频 → 声音 → 剪辑 → 成片

而不是:

下载模型 → 调参数 → 抽卡 → 再下载模型 → 再调参数。

这是这次最重要的一条经验。


01|选题:先证明“故事成立”#

我们最后选择的核心机制其实很好:

一句随口说的话,被现实用意想不到的方式兑现。

第一集:

聚餐时男主吹牛:
“我要是能中一百万,我嘎吧一下就死在这儿。”

他随后假装中奖、装死,朋友发现被骗。

晚上回家,却真的在路边捡到一包一百万。

男主想起自己说的话:

“等等……我说的是中一百万。”

“这是捡的。”

“应该……不算吧?”

心跳停止。

黑屏。

为什么这个方向值得继续?#

它有四个很适合 AI 短剧的特点:

日常场景 + 简单规则 + 前后呼应 + 强结尾。

观众不用理解复杂世界观。

前面一句:

“中一百万我就死。”

就是规则。

后面一包钱,就是兑现。

最后:

“捡的不算吧?”

既是台词,也是悬念。

而且天然适合系列化:

《说啥来啥》

以后每一集换一句话就可以继续扩展。


02|第一大教训:写剧本时就要考虑“AI 能不能拍”#

传统写剧本可以写:

男主突然倒下,朋友冲过去扶他,其中一个人伸手探鼻息,另一个人拿手机查看中奖信息……

AI 视频不能这么想。

因为这里同时出现:

  • 多人物
  • 大幅身体运动
  • 手部交互
  • 人与人接触
  • 手机
  • 屏幕文字
  • 精确动作顺序

全部都是当前生成模型容易翻车的东西。

我们实际就遇到了:

躺下变形、人物复制、朋友长歪、探鼻息手指异常、男主明明装死却突然笑、复杂动作无法按顺序完成。

所以以后剧本阶段就要问:

这个动作一定要正面拍出来吗?

例如“探鼻息”,完全可以变成:

朋友蹲下 → 切朋友紧张脸 → 环境突然安静 → 男主突然睁眼。

观众自然知道朋友刚刚检查过他。

AI 漫剧的重要原则#

能用剪辑表达的,就不要逼模型表演。


03|不要让一个 AI 镜头承担完整事件#

这是我们这次踩得很深的坑。

最开始容易产生一种想法:

给一张图,让模型生成“走过去 → 发现包 → 停下 → 蹲下 → 打开 → 震惊”。

理论上 Prompt 能写。

实际上越往后越容易崩。

正确方法是拆:

镜头 A

走路。

镜头 B

发现东西,停下。

镜头 C

手扒开树叶,看到包。

镜头 D

打开包。

镜头 E

人民币特写。

镜头 F

震惊脸。

最终剪辑让观众感觉:

他走过去发现并打开了包。

但实际上没有任何一条 AI 视频真正完成了整套动作。

这句话以后可以直接写进 SOP:

AI 负责 1~3 秒可信动作,剪辑负责完整行为。


04|角色:先建立“母图”,不要每个镜头重新造人#

这次角色一致性也经历了一些绕路。

一开始我们尝试:

  • 人物参考
  • Kontext
  • USO
  • 不同角度
  • 不同姿势
  • 不同构图

结果发现:

身份一致 ≠ 画面一致。

尤其当要求从:

正面站立

直接变成:

躺在地上 / 大幅改变机位 / 多人物互动

Kontext 这种编辑路线很容易复制人物或者改变结构。

后来逐渐形成了更正确的方法:

Character Bible / 母图#

先确定:

  • 年龄
  • 发型
  • 脸型
  • 衣服
  • 身材
  • 气质
  • 主要表情
  • 主色调

比如目前男主最核心的识别元素已经很简单:

年轻东亚男性
短黑发
灰色 T 恤
黑色裤子
普通、干净、邻家感

反而比搞复杂服装更容易保持。

以后角色生产应该变成#

角色母图

↓

角色参考图 / 多角度

↓

独立生成每个关键构图

↓

必要时再做身份修正

而不是:

Shot01 → 编辑成 Shot02 → 编辑成 Shot03 → 编辑成 Shot04……

因为误差会一代一代累积。


05|生图:先把电影拍成“静态电影”#

这是这次后半段开始明显变顺的地方。

例如捡钱这一段,我们最终有了:

  • 草丛里的黑包
  • 第一视角伸手
  • 蹲下打开包
  • 包里人民币
  • 男主震惊
  • 拿起人民币
  • 站起来按胸口

这些静态关键帧本身已经能够讲故事。

这非常重要。

以后判断一集能不能进入视频阶段,可以用一个很简单的标准:

把所有关键帧按顺序摆出来,不看 Prompt、不看剧本,我能不能看懂发生了什么?

如果静态分镜都看不懂,

不要开始图生视频。

继续修图。


06|生图时,连续性比“单张惊艳”重要#

这是下一集应该明显加强的地方。

单看一张图可能很好看,但连续播放就会出现:

  • 包的位置改变
  • 拉链改变
  • 钱突然变多
  • 钱的摆放改变
  • 人物左右手交换
  • 衣服颜色漂
  • 路灯方向改变
  • 草丛结构改变
  • 镜头突然跨轴

所以以后生成连续镜头之前,要建立一个简单的:

Continuity Sheet#

比如这一场:

人物

灰 T / 黑裤 / 白鞋。

道具

黑色旅行包。

钱

红色人民币 100 元纸币、成捆。

环境

夜晚住宅街道 / 左侧绿篱 / 暖色路灯。

光线

人物主要受暖色路灯照明。

位置

包始终靠近绿篱和路沿。

这样 Prompt 可以变,但这些东西不变。


07|道具连续性尤其重要#

我们这次一个很典型的问题就是:

人民币突然变美元。

这不是小问题。

因为“100 万人民币”本身就是剧情核心道具。

所以以后凡是剧情关键物品:

  • 钱
  • 手机
  • 戒指
  • 武器
  • 信
  • 照片
  • 特殊物件

都应该和角色一样:

把它当成一个需要保持一致性的“角色”。

尤其是钱。

不要只写:

money / cash

应该明确:

red Chinese RMB 100-yuan banknotes

而且最保险的办法不是靠 Prompt 一直提醒模型。

而是:

关键道具尽量在静态图阶段就正确。

图生视频只让它产生小运动。


08|不是所有图片都值得生成视频#

这是后期非常重要的成本意识。

我们最后三张:

  1. 震惊看钱
  2. 拿钱确认
  3. 按胸口

一开始很容易想:

三张全部图生视频。

实际上第二张完全可以:

静帧 + 轻微推镜 + 钱币摩擦音

0.5~0.8 秒过去。

观众不会在乎它是不是 AI 视频。

判断一张图需不需要视频化#

问:

这个镜头的运动本身有没有叙事价值?

有:

表情变化、回头、走路、停下、意识到危险。

生成视频。

没有:

钱的特写、手机画面、包、环境建立镜头。

很多时候静帧完全够。

这样一集原本可能需要生成 20 条视频,

最后可能只需要 8~12 条真正重要的动态镜头。


09|图生视频:小动作明显比大动作可靠#

H3 后来能用,一个重要原因不是突然模型变强了。

而是我们给它的任务变简单了。

例如:

男主站着,手放胸口,眼神稍微变化。

很好。

而:

男主走过去、蹲下、打开包、拿钱、站起来、震惊。

非常危险。

以后 Prompt 中优先使用:

  • slowly
  • subtly
  • slight
  • restrained
  • small natural movement
  • realistic blinking
  • subtle breathing

减少:

  • suddenly runs
  • dramatically falls
  • quickly turns around
  • grabs
  • jumps
  • complex interaction

特别是真人电影感。

动作越克制,往往越像真人。


10|Prompt 不是越长越好#

这次我们的 Prompt 后面越来越成熟,其实结构已经可以固定下来。

视频 Prompt 模板#

① 谁 + 在哪里#

A young East Asian man stands on a quiet residential street at night.

② 当前动作#

One hand rests lightly on his chest.

③ 唯一主要表演#

His expression gradually changes from relief to uncertainty.

④ 微动作#

subtle eye movement
slight eyebrow tension
natural blinking
restrained breathing

⑤ 锁定连续性#

Keep the same face, hairstyle, clothing, environment and lighting.

⑥ 关键道具#

The banknotes remain red Chinese RMB 100-yuan banknotes.

⑦ 明确禁止模型乱演#

No collapsing.
No screaming.
No exaggerated fear.
No large body movement.

⑧ 摄影#

stable cinematic camera
subtle handheld micro-movement
shallow depth of field
realistic night lighting

这个结构以后基本可以复用。


11|本地模型最大的坑:不要为了“跑起来”无限折腾#

这一部分应该是这次最痛苦的技术经验。😂

我们先后碰过:

  • Kontext MPS Float8 不支持
  • AppleSilicon-FP8
  • USO
  • Wan 2.2
  • H3
  • NVFP4 text encoder
  • GGUF
  • 错误 GGUF
  • MPS OOM
  • 黑视频
  • 0.00 秒假输出
  • 帧数问题
  • 内存压力

很容易进入:

模型工程师模式。

然后一晚上过去,没有增加一个故事镜头。

以后一定要给技术实验设止损。

例如:

一个新模型最多给 2~3 次测试机会。

如果还是:

  • 严重闪烁
  • 人脸崩
  • 场景漂移
  • 无法稳定输出

就暂停。

不是证明:

“我一定要让 Wan 在 Mac 上生成完美视频。”

我们的任务是:

把 EP01 做出来。


12|这次 Wan 2.2 给我们的教训#

Wan 2.2 5B 最大优势:

小、能跑、免费、本地。

但实际测试:

  • 背景变化严重
  • 色彩漂
  • 蓝紫色异常
  • 时序稳定性不够

所以及时停掉是正确决定。

最大的错误会是:

再调 30 个参数看看。

如果模型基础能力和目标不匹配,参数优化收益很低。


13|H3:重,但最终证明 48GB Mac 能跑#

H3 是这次最有价值的技术验证。

一开始看起来几乎不可能:

33B 左右模型 + 48GB Apple Silicon。

但最终通过:

  • INT8 H3 DiT
  • GGUF Qwen3-VL text encoder
  • AppleSilicon-FP8
  • Turbo LoRA
  • 合理尺寸
  • 8 steps
  • 56 frames

成功生成。

而且一次大约:

267 秒左右

已经进入:

“慢,但是能实际生产”

的范围。

这和“技术上能启动”完全不同。


14|H3 最大技术坑:模型能装进硬盘 ≠ 能装进内存#

我们碰到最关键的报错:

MPS backend out of memory
37.xx GiB / 37.44 GiB

而且不是采样过程中炸。

是:

H3 模型加载/反量化阶段就炸。

因此降低:

640×352 → 更低分辨率

未必能解决这个阶段的问题。

这次最大的技术理解是:

模型权重内存和生成分辨率/帧数内存不是完全一回事。

以后看到 OOM,要先判断:

是模型加载时 OOM?

还是:

Sampling 时 OOM?

不要条件反射先降分辨率。


15|不要轻易解除 MPS 内存保护#

系统提示过:

PYTORCH_MPS_HIGH_WATERMARK_RATIO=0.0

可以取消限制。

但你当时坚持:

我不想解除限制。

这是一个很好的决定。

因为我们的目标不是跑 benchmark。

这是你日常使用的 Mac。

最后事实也证明:

不解除安全限制,也可以找到能工作的配置。

所以以后原则:

优先量化、卸载、降低模型驻留、降低生成负载。

解除系统保护属于最后手段,而不是第一步。


16|不要随便下载“名字差不多”的 GGUF#

这个坑我们也踩得很实。

最初下载了错误来源的 Qwen3VL GGUF:

文件名看起来对。

结果:

incompatible with llama.cpp

后来才换成真正经过 H3 + ComfyUI-GGUF 验证的:

qwen3vl-32B-MiniMax-H3-Q4_K_M.gguf

然后日志终于:

loaded completely

教训#

大模型生态里:

模型名称一样 ≠ 文件格式、tensor layout、loader 兼容性一样。

以后下载:

  1. 先确认目标 workflow。
  2. 确认 loader。
  3. 确认有人在同平台跑通。
  4. 最好确认 exact filename。
  5. 再下载十几 GB。

否则下载成本非常高。


17|不要看到报错就同时改五个参数#

这是调试最容易犯的错误。

正确方式应该像硬件调试一样:

一次只改变一个变量。

例如:

第一次:

换 text encoder。

成功以后确认:

GGUF 已经 load completely。

那么之后 OOM:

就已经不是 text encoder 格式问题。

不要重新怀疑所有东西。

同样,后来发现:

56 帧正常。

那就把:

length = 56

锁死。

不要每一轮同时改:

  • Prompt
  • 分辨率
  • 帧数
  • steps
  • scheduler
  • LoRA
  • seed

否则最后根本不知道为什么成功。


18|“黑视频”和“秒出视频”本身就是调试信号#

我们遇到一个很有意思的问题:

正常生成:

267 秒 / 300 多秒。

异常任务:

0.00s / 0.01s

这时候不用看视频就应该知道:

它根本没有正常执行完整生成过程。

所以以后任务队列的执行时间本身也是诊断信息。

对于 H3:

几分钟 = 至少真的算了。

0.01 秒 = workflow/cache/latent/输出链路明显异常。

后来发现 56 帧恢复正常,这类经验以后都应该记录。


19|画幅:不要因为模型方便就忘了最终平台#

我们中途一直在:

640×352

这是接近 16<9> 的横向低分辨率测试尺寸。

它适合:

  • Mac 本地测试
  • 快速验证
  • 节约内存

但你的主要发布平台是:

  • 抖音
  • 小红书
  • B站

如果以后真正做抖音剧情,

最终应该从分镜阶段就考虑 9<16>。

否则横屏拍完再裁:

人脸没了、包没了、构图没了。

下一集可以采用:

测试阶段低分辨率 → 构图按竖屏安全区设计 → 最终关键镜头再提高质量。

不要最后才解决画幅。


20|AI 视频不是最终画质,后期才是#

你后来感觉:

“本地还是可以的。”

这个判断其实比较准确。

H3 本地输出未必达到顶级在线视频模型水平,但它最大的意义是:

我们可以大量试错。

真正成片时:

  • AI 原视频
  • 剪辑
  • 声音
  • 调色
  • 降噪
  • 适当锐化
  • 节奏
  • 字幕
  • 必要时局部高质量重生成

最终效果会比裸看 ComfyUI 输出好很多。

所以不能用:

暂停一帧放大 400%

来判断一条 AI 漫剧能不能用。

应该放进时间线里判断:

观众看这一秒会不会出戏?


21|声音是我们下一阶段最大的短板#

这次生成视频全部无声。

但真正做剧情:

声音至少占一半。

尤其这个故事。

如果没有声音:

男主按胸口。

很普通。

如果有:

咚。

咚。

饭桌声音从记忆里传回来:

“我要是中一百万……”

现实环境声降低。

男主:

“这是……捡的。”

咚。

“应该不算吧?”

咚……

……

黑屏。

同一个画面,戏剧性完全不同。

所以下一次学习重点已经不应该继续下载视频模型。

而应该进入:

对白 + 环境声 + Foley + 音乐 + 混音。


22|不要追求每个镜头完美#

这是第一次做 AI 漫剧最容易掉进去的坑。

某条视频:

手有一点问题。

再抽。

脸有一点软。

再抽。

背景灯动了一下。

再抽。

最后一晚上只做了一个镜头。

以后应该把镜头分级:

A 级:Hero Shot#

剧情关键镜头。

比如:

  • 说出诅咒
  • 打开一百万
  • 最终意识到规则生效

值得重做。

B 级:叙事镜头#

走路、发现东西、朋友反应。

能用就过。

C 级:连接镜头#

包、钱、街景、手、手机。

甚至:

静帧 + 音效就能过。

这样才能真正做到周更甚至更高频率。


23|这次我们做对了什么#

虽然踩了很多坑,但有几件事其实非常重要。

第一,没有因为第一批画面不好就放弃故事。

第二,发现某个技术路线不行以后,最终还是会停下来换方法,而不是无限死磕。

第三,开始学会用:

镜头拆分

而不是要求 AI 一镜到底。

第四,后半段已经开始考虑:

连续性、人民币、人物衣服、灯光、位置。

第五,最重要的是:

真的发出去了。

这意味着它已经不是“学 AI 视频”。

而是完成了:

Idea → Production → Publish

闭环。

这个价值比某一张图是不是 9.5 分重要得多。


24|下一集应该采用的正式 SOP#

经过这次踩坑,我建议以后固定成下面这条生产线:

① 一句话创意

先确定:

普通人 + 普通场景 + 异常规则 + 代价。

↓

② 60 秒剧本

先写:

开场钩子 → 建立规则 → 第一次误导 → 真正兑现 → 反转/悬念。

↓

③ Shot List

控制在:

12~20 个有效镜头。

↓

④ AI 可拍性检查

逐镜标:

简单 / 中等 / 高风险。

高风险镜头提前拆。

↓

⑤ Character Bible

角色母图锁定。

↓

⑥ Continuity Sheet

锁:

人物、服装、环境、时间、道具、光线。

↓

⑦ 全部关键帧

先把整集做成“静态电影”。

↓

⑧ 静态粗剪

把图片扔进 PR。

先验证:

故事节奏到底成立不成立。

这是下一集我非常建议新增的一步。

↓

⑨ 只挑需要运动的图做 I2V

不是所有图都生成视频。

↓

⑩ 本地 H3 批量生成

普通镜头:

本地解决。

↓

⑪ Hero Shot 精修

真的特别差而又特别重要:

才考虑更好的模型/付费生成。

↓

⑫ 声音

对白 → Foley → 环境 → 心跳/特殊声音 → BGM。

↓

⑬ 剪辑

只保留 AI 视频最好看的那 0.5~3 秒。

↓

⑭ 调色 / 字幕 / 音频

统一“电影感”。

↓

⑮ 导出 → 发布 → 数据复盘

看:

3 秒留存
完播
评论在讨论剧情还是 AI
哪个镜头流失

然后再决定下一集怎么改。


25|把这次踩坑压缩成 10 条铁律#

以后开新项目之前可以先看一遍:

  1. 先故事,后模型。
  2. 先做完整静态分镜,再做视频。
  3. 一个 AI 镜头只承担一个主要动作。
  4. 复杂动作交给剪辑,不要逼模型一镜完成。
  5. 角色、服装、道具、环境都要做连续性管理。
  6. 关键道具必须在生图阶段就正确。
  7. 不是每张图都需要变成视频。
  8. 技术测试最多几轮,失败就止损,不掉进模型黑洞。
  9. 先完成整集,再精修 Hero Shot。
  10. 发布完成的 80 分作品,比硬盘里一个 98 分镜头有价值。

我觉得下一阶段应该改变学习重心#

我们现在已经证明了一件非常关键的事情:

你的 Mac 确实可以本地生成可用于短剧的 AI 视频。

所以短期内我不建议继续折腾:

新模型、新节点、新量化、新工作流……

除非现有 H3 明确做不到某个关键镜头。

下一阶段真正值得学的是:

「怎么把 AI 素材导演成一部片」

也就是:

剧本 30% → 分镜 25% → 声音 20% → 剪辑节奏 15% → AI 技术 10%

技术比例反而应该开始下降。

因为这次最大的提升空间,已经不是“能不能生成”。

而是:

同样这批生成能力,怎么让观众忘记这是几段 AI 视频拼出来的,而开始关心——他捡了这一百万以后,到底会不会死。

做到这一点,才真正从“玩本地 AI 视频”跨到“做 AI 漫剧”。

支持与分享

如果这篇文章对你有帮助,欢迎分享给更多人或打赏支持!

打赏
Profile Image of the Author
Lyz
流水不争先,争的是滔滔不绝。
公告
欢迎四方来客,八方来财!
分类
标签
最新动态
站点统计
文章
131
分类
13
标签
43
总字数
232,077
运行时长
0 天
最后活动
0 天前
站点信息
构建平台
Vercel
博客版本
Firefly v6.15.6
文章许可
CC BY-NC-SA 4.0
1
AI 漫剧第一次完整实践复盘
一、先明确我们最后想做的东西
2
01|选题:先证明“故事成立”
为什么这个方向值得继续?
3
02|第一大教训:写剧本时就要考虑“AI 能不能拍”
AI 漫剧的重要原则
4
03|不要让一个 AI 镜头承担完整事件
5
04|角色:先建立“母图”,不要每个镜头重新造人
Character Bible / 母图
以后角色生产应该变成
6
05|生图:先把电影拍成“静态电影”
7
06|生图时,连续性比“单张惊艳”重要
Continuity Sheet
8
07|道具连续性尤其重要
9
08|不是所有图片都值得生成视频
判断一张图需不需要视频化
10
09|图生视频:小动作明显比大动作可靠
11
10|Prompt 不是越长越好
视频 Prompt 模板
① 谁 + 在哪里
② 当前动作
③ 唯一主要表演
④ 微动作
⑤ 锁定连续性
⑥ 关键道具
⑦ 明确禁止模型乱演
⑧ 摄影
12
11|本地模型最大的坑:不要为了“跑起来”无限折腾
13
12|这次 Wan 2.2 给我们的教训
14
13|H3:重,但最终证明 48GB Mac 能跑
15
14|H3 最大技术坑:模型能装进硬盘 ≠ 能装进内存
16
15|不要轻易解除 MPS 内存保护
17
16|不要随便下载“名字差不多”的 GGUF
教训
18
17|不要看到报错就同时改五个参数
19
18|“黑视频”和“秒出视频”本身就是调试信号
20
19|画幅:不要因为模型方便就忘了最终平台
21
20|AI 视频不是最终画质,后期才是
22
21|声音是我们下一阶段最大的短板
23
22|不要追求每个镜头完美
A 级:Hero Shot
B 级:叙事镜头
C 级:连接镜头
24
23|这次我们做对了什么
25
24|下一集应该采用的正式 SOP
26
25|把这次踩坑压缩成 10 条铁律
我觉得下一阶段应该改变学习重心