AD_MiniMax_guide
MiniMax H3 ref-to-video, but you name your references in the prompt
- clip
- vae
- audio_vae
- media
- media_1
- media_2
- media_3
- media_4
- media_5
- media_6
- media_7
- media_8
- media_9
- media_10
- media_11
- media_12
- media_13
- media_14
- media_15
- media_16
- media_17
- media_18
- media_19
- media_20
- media_21
- media_22
- media_23
- media_24
- media_25
- media_26
- media_27
- media_28
- media_29
- media_30
- media_31
- media_32
- media_33
- media_34
- media_35
- media_36
- media_37
- media_38
- media_39
- media_40
- media_41
- media_42
- media_43
- media_44
- media_45
- media_46
- media_47
- media_48
- media_49
- media_50
- media_51
- media_52
- media_53
- media_54
- media_55
- media_56
- media_57
- media_58
- media_59
- media_60
- media_61
- media_62
- media_63
- media_64
- positive
- latent
- trim_frames
- text
MiniMax H3 is the open-weight multimodal video model that took r/StableDiffusion by storm in mid-2026, and this is the pack's flagship way of driving it. AD_MiniMax_guide is a reference-to-video conditioning node: you give it a prompt plus up to fifteen media references - images, videos, even audio clips - and it bakes all of that into a single CONDITIONING plus a starting LATENT. It's the newest node in the pack (added 2026-08-08), and the author calls it "a simple and efficient way of working." That's not marketing; it genuinely is.
The neat part is how the references work. You don't have to remember which socket is which reference. You write tags in the prompt itself - <Picture 1>, <Video 2>, <Audio 1>, plus [Shot 1] for shots and <Subject 1> for character consistency - and the node swaps them for the actual media you plugged into the corresponding slots. Chinese aliases work too (图片, 视频, 音频), since the author's home turf is the Chinese ComfyUI scene.
How it works
It's a big wrapper around ComfyUI's native MiniMax H3 support. Each media slot is sniffed for its type (a tensor is an image, a waveform payload is audio, a video component is a video), then resized and encoded: images get VAE-encoded after scaling to the canvas (or aligned to the H3 2048 short edge in "max" mode), videos get resampled to 24 fps and VAE-encoded with their frame count snapped to the H3 17k + 5 grid, and audio gets encoded through the audio_vae at its native 32 kHz. The references are attached to the conditioning via minimax_refs, and the resolved prompt text comes back out as a third output so you can see exactly what was sent.
The length input is where the H3 quirk lives: it's in frames at 24 fps, and the tooltip tells you it auto-snaps to the 17k+5 grid - 124 ≈ 5s. That's why you'll see weird-but-correct values like 124, 141, 158.
Inputs and outputs
The required inputs mirror what an H3 encode needs: clip, vae, audio_vae, prompt (multiline, and the tags go here), width/height (multiples of 32), length (frames, 5 to 3600, snapped to the grid), and ref_image_size (match scales references to the canvas area, max aligns the 2048 short edge - better identity, slower).
Then the media zoo: media accepts IMAGE, VIDEO, AUDIO or even a STRING (if you feed it a string it becomes the prompt), and media_1 through media_15 each accept IMAGE, VIDEO, or AUDIO. There's a matching media_type_1..15 string input you can use to force a type when the sniffer is ambiguous, though usually you can leave it empty.
Outputs: positive (CONDITIONING), latent (LATENT), and text - the resolved prompt with tags expanded. The conditioning feeds your sampler; the latent is your starting point.
Installing it
It lives in ComfyUI-Apt_Preset, so install the pack (Manager → search "ComfyUI-Apt_Preset", or git clone https://github.com/cardenluo/ComfyUI-Apt_Preset into custom_nodes), then run install.bat or pip install -r requirements.txt and restart. Load the actual H3 model with the pack's sum_load_MiniMaxH3 loader, which hands you the clip, VAEs, and a context in one go.
Gotchas
- It needs a recent ComfyUI with native H3 support. The code imports from
comfy_extras.nodes_minimax_h3; on an older build it raises "This ComfyUI build does not provide MiniMax H3 support." Update ComfyUI before you debug anything else. - Slot limits are enforced: max 9 images, 3 videos, 3 audio clips across all fifteen slots. Exceed it and you get an explicit error.
- Reference videos need at least 5 frames (~0.2s at 24 fps) and get their count snapped down to the grid.
- H3 is a big multimodal model - this is not a 4 GB VRAM hobby. Bring a real GPU.
Inputs (137)
| Name | Type | Default | Description |
|---|---|---|---|
| prompt | STRING | — | |
| width | INT | 51232–4096 | — |
| height | INT | 76832–4096 | — |
| length | INT | 1245–3600 | 帧数(24 fps),自动 snap 到 17k+5 网格(124 ≈ 5s) |
| ref_image_size | COMBO | match | 'match' 缩放到画布面积;'max' 对齐 2048 短边(身份更好但更慢) |
| clipopt | CLIP | — | |
| vaeopt | VAE | — | |
| audio_vaeopt | VAE | — | |
| mediaopt | IMAGE,VIDEO,AUDIO,LATENT,STRING | — | |
| media_1opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_1opt | STRING | — | |
| media_2opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_2opt | STRING | — | |
| media_3opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_3opt | STRING | — | |
| media_4opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_4opt | STRING | — | |
| media_5opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_5opt | STRING | — | |
| media_6opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_6opt | STRING | — | |
| media_7opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_7opt | STRING | — | |
| media_8opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_8opt | STRING | — | |
| media_9opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_9opt | STRING | — | |
| media_10opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_10opt | STRING | — | |
| media_11opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_11opt | STRING | — | |
| media_12opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_12opt | STRING | — | |
| media_13opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_13opt | STRING | — | |
| media_14opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_14opt | STRING | — | |
| media_15opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_15opt | STRING | — | |
| media_16opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_16opt | STRING | — | |
| media_17opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_17opt | STRING | — | |
| media_18opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_18opt | STRING | — | |
| media_19opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_19opt | STRING | — | |
| media_20opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_20opt | STRING | — | |
| media_21opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_21opt | STRING | — | |
| media_22opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_22opt | STRING | — | |
| media_23opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_23opt | STRING | — | |
| media_24opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_24opt | STRING | — | |
| media_25opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_25opt | STRING | — | |
| media_26opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_26opt | STRING | — | |
| media_27opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_27opt | STRING | — | |
| media_28opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_28opt | STRING | — | |
| media_29opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_29opt | STRING | — | |
| media_30opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_30opt | STRING | — | |
| media_31opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_31opt | STRING | — | |
| media_32opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_32opt | STRING | — | |
| media_33opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_33opt | STRING | — | |
| media_34opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_34opt | STRING | — | |
| media_35opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_35opt | STRING | — | |
| media_36opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_36opt | STRING | — | |
| media_37opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_37opt | STRING | — | |
| media_38opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_38opt | STRING | — | |
| media_39opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_39opt | STRING | — | |
| media_40opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_40opt | STRING | — | |
| media_41opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_41opt | STRING | — | |
| media_42opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_42opt | STRING | — | |
| media_43opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_43opt | STRING | — | |
| media_44opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_44opt | STRING | — | |
| media_45opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_45opt | STRING | — | |
| media_46opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_46opt | STRING | — | |
| media_47opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_47opt | STRING | — | |
| media_48opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_48opt | STRING | — | |
| media_49opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_49opt | STRING | — | |
| media_50opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_50opt | STRING | — | |
| media_51opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_51opt | STRING | — | |
| media_52opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_52opt | STRING | — | |
| media_53opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_53opt | STRING | — | |
| media_54opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_54opt | STRING | — | |
| media_55opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_55opt | STRING | — | |
| media_56opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_56opt | STRING | — | |
| media_57opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_57opt | STRING | — | |
| media_58opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_58opt | STRING | — | |
| media_59opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_59opt | STRING | — | |
| media_60opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_60opt | STRING | — | |
| media_61opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_61opt | STRING | — | |
| media_62opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_62opt | STRING | — | |
| media_63opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_63opt | STRING | — | |
| media_64opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_64opt | STRING | — |
Outputs (4)
| Name | Type | Description |
|---|---|---|
| positive | CONDITIONING | — |
| latent | LATENT | — |
| trim_frames | INT | — |
| text | STRING | — |