音频生成
音频生成适合制作视频旁白、产品口播、通知播报或故事朗读。支持选择音色、调整语速和情绪,以及使用授权录音克隆音色。生成的音频可作为视频创作的参考素材。
开始前
登录优云智算控制台 并进入 MiniMax H3 模块,确认可用积分足够。需要克隆音色时,准备本人或已获授权的清晰人声录音。
输入文字并选择音色
- 在左侧选择 音频,在输入框填写要朗读的文字,最多 2000 个字符,包含标点和空白。
- 单击底部音色按钮,进入 音色库。试听并选择 官方 音色,或在 我的克隆 中选择已保存的音色。
- 按需选择中文、英文、日文、西班牙语或阿拉伯语,并在 0.5~2.0 倍范围内调整语速。


克隆自己的音色
在 音色库 → 我的克隆 中,单击 克隆我的音色,按页面提示上传参考录音、填写音色名称并保存。保存后,在 我的克隆 中选择该音色。
上传前请检查参考录音:支持 WAV、MP3、FLAC、OGG、M4A;单个文件不超过 15 MiB;时长为 0.5~15 秒;文件扩展名应与实际格式一致。建议只保留一位说话人的清晰人声,避免背景音乐和明显噪声。

设置情绪与读音
单击情绪设置按钮,选择情绪模式:
| 模式 | 用途 |
|---|---|
| 自动判断 | 根据文本内容判断情绪 |
| 跟随原音 | 参考所选音色的原始情绪 |
| 自定义描述 | 用文字描述情绪,如“平静、舒缓” |
| 精细控制 | 分别调整各项情绪参数 |
情绪强度 调整情绪的表现程度,不用于调节音量。需要检查效果时,先生成一段短文本;此类生成任务同样消耗积分。

遇到多音字、品牌名或专有名词读错时,单击 发音设置,添加词语及期望读音。例如,将正文中的“4090”设置为“四零九零”。保存后,系统在生成时应用读音规则;同一个词只能设置一种读法。

生成与下载
- 核对正文、音色、语言、情绪、语速和预计积分,单击 生成语音。
- 在 最近生成 试听结果。查询完整记录时,进入 任务 → 音频任务。
- 任务完成后,下载 WAV 文件。生成的音频也会保存在 资产 中。
音频须与图片或视频一起用于视频生成的全能参考,不能单独作为视频参考素材。操作方法参见任务与资产管理。
音频按正文中的计费字符数计算积分,汉字、字母和数字计费,标点和空白不计费。输入长度上限与计费字符数不同:标点和空白虽然不计费,仍占用 2000 字符的输入限额。提交任务前,页面会显示预计积分。详情参见积分与计费。
请及时下载需要保留的音频。通过程序创建和查询语音任务,参见IndexTTS 2.5 文生语音 API 。
Last updated on