优云智算
控制台
立即注册

Minimax-H3的Lora训练AI - Toolkit和Comfy云端

Minimax-H3的Lora训练AI-Toolkit和Comfy测试

镜像大小
60 GB
当前版本
v2.0
累计部署
162
累计运行
1,080 h
最近更新
2026-09-18

运行环境

框架版本
PyTorch-2.9
CUDA版本
13
应用
JupyterLab: 8888
支持卡型
RTX40系RTX50系
+4

MiniMax H3 LoRA 训练 — AI Toolkit(云端)

使用 AI Toolkit 训练 H3 视频模型 LoRA,涵盖角色 / 风格 / 编辑 / 概念四种类型,支持图片训练和视频(参考生视频)训练。图片训练速度很快(约 1.98 it/s),1000 步左右角色特征已基本还原。

与用 Musubi Tuner 训练 H3 的方式不同,本教程使用 AI Toolkit,更适合新手上手。

环境要求

  • GPU:推荐 48G 的 409032G 的 5090
  • ⚠️ 不推荐 24G 显卡:采样阶段显存会飙升,大概率直接爆显存
  • 显存占用参考:图片训练 16G~32G,视频训练更高

快速开始(云端)

# 1. 部署 GPU 实例(推荐 48G/4090 或 32G/5090)
# 2. 打开 Jupyter Lab,复制启动指令粘贴运行
# 3. 打开 AI Toolkit(内置 ComfyUI 可直接测试 LoRA 效果)

第一步:想清楚要训练哪种 LoRA

类型说明数据准备
角色 LoRA还原特定角色特征角色图片即可,打标时不描述外观特征
风格 LoRA学习某种整体画风至少 300~500 张同风格图片
编辑 LoRA对视频/图片做特定变换(如转真人、变身肌肉男)需要 Control(原始图)+ Target(目标图)成对素材,不需要打标,用 Default Caption
概念 LoRA训练更复杂的抽象概念(如某种运镜风格的 MV 感)视频素材,训练难度较高,需要认真打标

💡 社区反馈:训练图生视频/文生视频时,只用图片训练效果往往比带视频训练更好,可以优先尝试纯图片训练。

参考生视频(Refer to Video / 多参考)训练

这是本教程新增的核心内容:训练支持参考图/参考视频的多参数 LoRA。

数据集准备

  • 准备 Control(原始/输入)和 Target(目标/期望输出)两组一一对应的素材
  • 如果场景较复杂(比如两种不同风格都要覆盖),可以分别准备多组 Control/Target
  • 在 AI Toolkit 的 Dataset 页面直接上传比新建文件夹后上传更快

关键设置

设置项说明
Training Adapter默认 v1,推荐改为 v2(更新、效果更好),也可选 Seek 版本;如果输入的是视频(转视频任务),需要选择支持 static+video 的 Adapter 版本,且不能用 Constrain Guidance,需改用 Adopt,并关闭 Guidance Loss
D-OPSD效果最好(带教师模型指导训练),但速度会慢 5 倍以上(比如 20 秒/迭代变成 100 秒/迭代),追求极致效果再开
Level Floating保持开启;精度用 100% 还是 50% 看显卡,爆显存就调高
精度(8bit/FP4/BF16)默认即可,显存充裕可以改用更高精度
LoRA Rank16 或 32 均可
保存数量建议保留 10 个检查点,方便回退挑选
训练步数建议设 5000 起步
优化器推荐 Automagic(自适应学习率),8bit 更省显存
分辨率默认 768,可改 1024 但更占显存
Frame Count图片训练务必设为 1,并关闭 Number Frame 相关选项

视频帧数格式(重要)

  • 视频训练素材帧数必须符合 17n + 5(模型底层限制),比如 22 帧、73 帧
  • AI Toolkit 提供 Auto Frame Count:帧数不匹配时会自动向下取整到合规帧数,但更推荐自己提前把素材按帧数分类好(如 141 帧、158 帧一组),避免依赖自动纠正

打标建议

  • 编辑 LoRA 不需要打标,用 Default Caption 即可
  • 概念/风格 LoRA 需要认真打标,推荐两种自动化方式:
    • 官方提示词 Skill:把 Skill 文件拖给支持的 AI 编程工具,让其按规范生成描述,但需额外提醒"不要生成图片",稍显麻烦
    • Google Antigravity(Gemini 3.8 Flash):可直接读取文件夹批量打标,识别精度高,免费额度也比较宽裕,是更推荐的方式
  • ⚠️ 视频较长时,AI 打标容易因上下文过长出现张冠李戴(把不同视频内容搞混),务必人工抽查校对,避免编造画面里不存在的内容影响 LoRA 效果
  • 简单训练任务(比如普通角色 LoRA)不需要这么复杂,直接用图片训练即可

显存与速度参考

  • H20 上 1000 步跑得很快;4090(48G)大约 18~20 it/s 左右
  • 显存不足时:调高 Level Floating 精度百分比、降低分辨率、关闭 D-OPSD

采样设置

  • 建议保留 2~4 个采样项即可,不用太多
  • 采样提示词需要和实际训练任务对应替换(如转真人任务要用对应视频做参考)
  • 转真人类编辑 LoRA 采样时如果素材本身偏"网红/cosplay 感",训练越往后效果会越明显偏向这种风格,属于正常现象,可根据素材配比调整

小结

  • 先确定 LoRA 类型(角色/风格/编辑/概念),数据准备方式完全不同
  • 编辑类任务记得用 Control/Target 成对素材,不用打标
  • 视频训练注意帧数格式(17n+5),能自己分类素材最好,别完全依赖 Auto Frame Count
  • 打标优先用 Antigravity 之类的自动化工具,但一定要人工校对准确性
  • 追求效果可开 D-OPSD,但要接受慢 5 倍以上的代价
0 个镜像 · 被使用 162
版本日志
v2.0最新
2026-09-18
v1.0
2026-08-16
评分
0.0
暂无评分
我的评分
未评分
Minimax-H3的Lora训练AI - Toolkit和Comfy云端一键部署 | 优云智算