Minimax-H3的Lora训练AI-Toolkit和Comfy测试
使用 AI Toolkit 训练 H3 视频模型 LoRA,涵盖角色 / 风格 / 编辑 / 概念四种类型,支持图片训练和视频(参考生视频)训练。图片训练速度很快(约 1.98 it/s),1000 步左右角色特征已基本还原。
与用 Musubi Tuner 训练 H3 的方式不同,本教程使用 AI Toolkit,更适合新手上手。
# 1. 部署 GPU 实例(推荐 48G/4090 或 32G/5090)
# 2. 打开 Jupyter Lab,复制启动指令粘贴运行
# 3. 打开 AI Toolkit(内置 ComfyUI 可直接测试 LoRA 效果)
| 类型 | 说明 | 数据准备 |
|---|---|---|
| 角色 LoRA | 还原特定角色特征 | 角色图片即可,打标时不描述外观特征 |
| 风格 LoRA | 学习某种整体画风 | 至少 300~500 张同风格图片 |
| 编辑 LoRA | 对视频/图片做特定变换(如转真人、变身肌肉男) | 需要 Control(原始图)+ Target(目标图)成对素材,不需要打标,用 Default Caption |
| 概念 LoRA | 训练更复杂的抽象概念(如某种运镜风格的 MV 感) | 视频素材,训练难度较高,需要认真打标 |
💡 社区反馈:训练图生视频/文生视频时,只用图片训练效果往往比带视频训练更好,可以优先尝试纯图片训练。
这是本教程新增的核心内容:训练支持参考图/参考视频的多参数 LoRA。
| 设置项 | 说明 |
|---|---|
| Training Adapter | 默认 v1,推荐改为 v2(更新、效果更好),也可选 Seek 版本;如果输入的是视频(转视频任务),需要选择支持 static+video 的 Adapter 版本,且不能用 Constrain Guidance,需改用 Adopt,并关闭 Guidance Loss |
| D-OPSD | 效果最好(带教师模型指导训练),但速度会慢 5 倍以上(比如 20 秒/迭代变成 100 秒/迭代),追求极致效果再开 |
| Level Floating | 保持开启;精度用 100% 还是 50% 看显卡,爆显存就调高 |
| 精度(8bit/FP4/BF16) | 默认即可,显存充裕可以改用更高精度 |
| LoRA Rank | 16 或 32 均可 |
| 保存数量 | 建议保留 10 个检查点,方便回退挑选 |
| 训练步数 | 建议设 5000 起步 |
| 优化器 | 推荐 Automagic(自适应学习率),8bit 更省显存 |
| 分辨率 | 默认 768,可改 1024 但更占显存 |
| Frame Count | 图片训练务必设为 1,并关闭 Number Frame 相关选项 |