Image-Text-to-Video
Diffusers
Safetensors
text-to-video
image-to-video
video-to-video
text-to-audio-video
image-to-audio-video
image-text-to-audio-video
video-to-audio-video
audio-to-audio-video
audio-video-generation
multimodal
synchronized-audio-video
reference-to-audio-video
Instructions to use MiniMaxAI/MiniMax-H3 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Diffusers
How to use MiniMaxAI/MiniMax-H3 with Diffusers:
pip install -U diffusers transformers accelerate
import torch from diffusers import DiffusionPipeline # switch to "mps" for apple devices pipe = DiffusionPipeline.from_pretrained("MiniMaxAI/MiniMax-H3", dtype=torch.bfloat16, device_map="cuda") prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k" image = pipe(prompt).images[0] - Notebooks
- Google Colab
- Kaggle
| { | |
| "_class_name": "MiniMaxH3Pipeline", | |
| "_diffusers_version": "0.32.2", | |
| "text_encoder": [ | |
| "transformers", | |
| "MiniMaxH3Qwen3VLHFEncoder" | |
| ], | |
| "tokenizer": [ | |
| "transformers", | |
| "Qwen2TokenizerFast" | |
| ], | |
| "video_vae": [ | |
| "diffusers", | |
| "MiniMaxH3VideoVAE" | |
| ], | |
| "audio_vae": [ | |
| "diffusers", | |
| "MiniMaxH3AudioVAE" | |
| ], | |
| "scheduler": null, | |
| "transformer": [ | |
| "diffusers", | |
| "MiniMaxH3DiTModel" | |
| ], | |
| "processor": [ | |
| "transformers", | |
| "Qwen3VLProcessor" | |
| ], | |
| "_minimax_h3": { | |
| "schema_version": 1, | |
| "partition": "ref2va", | |
| "tasks": [ | |
| "ref2va" | |
| ], | |
| "task_aliases": {}, | |
| "sigma_shift_scales": { | |
| "video": 12.0, | |
| "audio": 3.0 | |
| } | |
| } | |
| } | |