---
title: MiniMax-H3-Turbo
canonical_url: "https://www.modelscope.ai/models/Wuli-Art/MiniMax-H3-Turbo"
md_url: "https://www.modelscope.ai/models/Wuli-Art/MiniMax-H3-Turbo.md"
repository: Wuli-Art/MiniMax-H3-Turbo
last_updated: 2026-10-10
license: other
pipeline_tag: text-to-video-synthesis
tasks:
  - text-to-video-synthesis
base_model:
  - MiniMaxAI/MiniMax-H3
base_model_relation: finetune
parameters: 41.1B
tensor_type:
  - BF16
  - F32
library_name:
  - safetensors
downloads: 39
stars: 0
tags:
  - audio-video
  - minimax-h3
  - turbo
---

# MiniMax-H3-Turbo

> MiniMax-H3-Turbo - An open-source model by Wuli-Art on ModelScope. MiniMax-H3-Turbo 是 Wuli 团队基于 MiniMax-H3 推出的少步数音视频生成模型，提供 Turbo 4-step、6-step 和 8-step 三种配置，支持文本生成视频、首帧生成视频，以及视频与音频联合输出。

Wuli-Art/MiniMax-H3-Turbo is a 41.1B-parameter text-to-video-synthesis model on ModelScope. licensed under other. derived from MiniMaxAI/MiniMax-H3.

- **Repository**: Wuli-Art/MiniMax-H3-Turbo
- **License**: other
- **Tasks**: text-to-video-synthesis
- **Parameters**: 41.1B
- **Base model**: MiniMaxAI/MiniMax-H3
- **Tags**: audio-video, minimax-h3, turbo
- **Downloads**: 39
- **Stars**: 0
- **Last updated**: 2026-10-10

Source: https://www.modelscope.ai/models/Wuli-Art/MiniMax-H3-Turbo

---

# MiniMax-H3-Turbo

MiniMax-H3-Turbo 是 Wuli 团队基于 MiniMax-H3 推出的少步数音视频生成模型，提供 **Turbo 4-step、6-step 和 8-step** 三种配置，支持文本生成视频、首帧生成视频，以及视频与音频联合输出。

本仓库提供三种配置的权重与 `run_fl2va.py` 推理脚本。下文从魔搭下载模型和基础组件，再通过本地路径运行推理。

## 效果对比

[![MiniMax-H3 音视频效果对比：点击进入完整演示](https://cdn.wuli.art/image/minimax-h3-comparison-20261009-0ff4412f/assets/model-card-demo-preview-17a3f8ce4b65.jpg)](https://cdn.wuli.art/image/minimax-h3-comparison-20261009-0ff4412f/index.html)

[**打开效果对比演示 →**](https://cdn.wuli.art/image/minimax-h3-comparison-20261009-0ff4412f/index.html)

演示包含 **9 组案例、11 种配置、99 段视频**，可对比 Wuli 的 4、6、8 步结果，以及 Larry v4、LightX2V、FlashGen、DMAD、PAI 和原版 MiniMax-H3 的 50 步结果。支持同步播放、步数筛选、双视频并排查看和音频切换。

## 版本与文件

| 配置 | 仓库目录 | 权重形式 | 所需基础组件 |
| --- | --- | --- | --- |
| Turbo 4-step | `turbo-4step/` | 紧凑适配器，包含骨干 LoRA 和融合的视频、音频输出投影 | 官方 transformer 与公共组件 |
| Turbo 6-step | `turbo-6step/` | 完整 Diffusers 格式 transformer | 公共组件 |
| Turbo 8-step | `turbo-8step/` | 完整 Diffusers 格式 transformer | 公共组件 |

公共组件包括文本编码器、tokenizer、processor、视频 VAE、音频 VAE 和调度器，来自魔搭上的官方基础模型 [MiniMax/MiniMax-H3](https://www.modelscope.cn/models/MiniMax/MiniMax-H3)。选择一种配置即可开始，无需一次下载全部 Turbo 权重。

## 快速开始：8 步文生视频

### 1. 准备环境

使用 Python 3.10 或更高版本，并先安装与显卡驱动兼容的 CUDA 版 PyTorch。推理脚本已在 Diffusers 0.40.0 和 huggingface_hub 1.27.0 环境下测试。

```bash
pip install modelscope-hub "diffusers==0.40.0" "huggingface_hub==1.27.0" transformers accelerate peft safetensors av pillow
```

### 2. 从魔搭下载脚本和权重

以下命令在同一工作目录执行，下载 8 步权重和推理脚本到 `MiniMax-H3-Turbo/`：

```bash
ms-hub download Wuli-Art/MiniMax-H3-Turbo \
  --include "run_fl2va.py" "turbo-8step/*" \
  --local-dir ./MiniMax-H3-Turbo
```

接着下载基础模型的公共组件到 `MiniMax-H3/`。6 步和 8 步使用自己的 transformer，因此这里仅下载其余组件：

```bash
ms-hub download MiniMax/MiniMax-H3 \
  --include "model_index.json" "modular_model_index.json" \
    "text_encoder/*" "tokenizer/*" "processor/*" \
    "vae/*" "audio_vae/*" "scheduler/*" "audio_scheduler/*" \
  --local-dir ./MiniMax-H3
```

下载命令支持断点续传，详见 [ModelScope Hub 官方文档](https://github.com/modelscope/modelscope_hub)。如访问受限仓库或下载时提示需要认证，可先运行 `ms-hub login`，使用具有相应访问权限的魔搭账号登录。

### 3. 运行推理

```bash
cd MiniMax-H3-Turbo

python run_fl2va.py \
  --steps 8 \
  --model ./turbo-8step \
  --components ../MiniMax-H3 \
  --prompt "A paper airplane glides through a bright classroom." \
  --seed 42 \
  --output output-8step.mp4
```

输出为一个包含 **H.264 视频与 AAC 音频**的 MP4 文件。示例通过 `--model` 指定 Turbo 权重，通过 `--components` 指定基础组件，二者均从已下载的本地目录加载。

## 切换到 4 步或 6 步

以下命令继续在 `MiniMax-H3-Turbo/` 目录执行。

### Turbo 4-step

下载 4 步适配器，并为基础模型补齐官方 transformer：

```bash
ms-hub download Wuli-Art/MiniMax-H3-Turbo \
  --include "turbo-4step/*" --local-dir .

ms-hub download MiniMax/MiniMax-H3 \
  --include "transformer/*" --local-dir ../MiniMax-H3

python run_fl2va.py \
  --steps 4 \
  --model ./turbo-4step \
  --components ../MiniMax-H3 \
  --prompt "A paper airplane glides through a bright classroom." \
  --seed 42 \
  --output output-4step.mp4
```

4 步的 `--model` 也支持直接传入适配器 safetensors 文件，或包含 `turbo-4step/` 的仓库根目录。

### Turbo 6-step

```bash
ms-hub download Wuli-Art/MiniMax-H3-Turbo \
  --include "turbo-6step/*" --local-dir .

python run_fl2va.py \
  --steps 6 \
  --model ./turbo-6step \
  --components ../MiniMax-H3 \
  --prompt "A paper airplane glides through a bright classroom." \
  --seed 42 \
  --output output-6step.mp4
```

## 首帧生成视频

在文生视频命令中添加 `--image` 即可使用首帧条件。以下示例使用 6 步配置，将输入图像 `first_frame.png` 放在当前目录：

```bash
python run_fl2va.py \
  --steps 6 \
  --model ./turbo-6step \
  --components ../MiniMax-H3 \
  --image first_frame.png \
  --height 768 --width 1344 \
  --prompt "The scene in the first frame comes to life." \
  --output first-frame-6step.mp4
```

也可使用 `--last-image` 提供末帧条件。`--height` 与 `--width` 需要成对设置。

## 常用参数

| 参数 | 说明 |
| --- | --- |
| `--steps` | 选择 4、6 或 8 步配置，默认 8；需与下载的权重对应 |
| `--model` | 本地 Turbo 权重路径；6 步、8 步传入包含 `transformer/` 的版本目录 |
| `--components` | 本地基础模型目录；4 步还需包含官方 `transformer/` |
| `--prompt` | 描述画面、动作和声音的提示词，必填 |
| `--seed` | 随机种子，默认 42 |
| `--num-frames` | 输出帧数，默认 124；脚本按 24 fps 编码 |
| `--image` / `--last-image` | 首帧与末帧图像路径 |
| `--output` | 输出 MP4 路径 |

本页示例均显式设置 `--model` 和 `--components`。省略它们会使用脚本默认的在线模型来源。仅在遇到 `CUDNN_STATUS_SUBLIBRARY_LOADING_FAILED` 时，可尝试增加 `--disable-cudnn`。

## 许可协议

本模型遵循 **MiniMax-H3 Community License Agreement**。使用与分发时请遵守[许可协议](https://www.modelscope.cn/models/MiniMax/MiniMax-H3/file/view/master/LICENSE)及基础模型的相关要求。

## 致谢

感谢 **Alibaba RTP-Compression Team**、**Alibaba Wuli Team**、**姜柏** 和 **冯笑** 的支持与贡献。
