AD_MinMax_Ref2_generate
H3 video from up to 64 references — the node for identity you can't afford to lose
- context
- model
- media
- media_1
- media_2
- media_3
- media_4
- media_5
- media_6
- media_7
- media_8
- media_9
- media_10
- media_11
- media_12
- media_13
- media_14
- media_15
- media_16
- media_17
- media_18
- media_19
- media_20
- media_21
- media_22
- media_23
- media_24
- media_25
- media_26
- media_27
- media_28
- media_29
- media_30
- media_31
- media_32
- media_33
- media_34
- media_35
- media_36
- media_37
- media_38
- media_39
- media_40
- media_41
- media_42
- media_43
- media_44
- media_45
- media_46
- media_47
- media_48
- media_49
- media_50
- media_51
- media_52
- media_53
- media_54
- media_55
- media_56
- media_57
- media_58
- media_59
- media_60
- media_61
- media_62
- media_63
- media_64
- stage_info_data1
- stage_data
- context
- segment_video
- merged_video
- text
The FL2 generate node is great at one specific trick: anchor the start and end frame. AD_MinMax_Ref2_generate is the one you grab when "start and end" isn't enough - it's the Ref2VA sampler, meaning the whole video can lean on reference media, and the node gives you up to 64 reference slots to prove it. It's the same staged, self-merging pipeline as FL2, but the conditioning model is different: instead of a first/last image pair, you feed it images, videos, even audio, and H3 treats them as the thing the target clip should conform to. This is your character-consistency and video-to-video workhorse.
How it works
Same stage mechanics: stage_prompts is a JSON list, one prompt per stage; length snaps to the 17k+5 grid (124 ≈ 5s at 24 fps, per the author's own tooltip); and when the last stage fires you get merged_video out. The references come in through media plus media_1…64, each with a matching media_type_N string that tells the node what it's looking at. Unlike FL2, this node's media ports accept IMAGE, VIDEO, AUDIO, and LATENT - audio references are genuinely useful here because H3 generates native synchronized audio.
Two inputs are worth calling out before anything else:
ref_image_size-matchscales references to your canvas area (fast, good enough for most shots);maxaligns to a 2048 short edge for better identity but slower. When the whole point of your shot is a recognizable face,maxis usually the difference between "close enough" and "that's her."single_long_video_split/single_long_audio_split- for the long-reference workflow. Flip one on, feed a single long video (or audio) in, and the node splits it by stage; its embedded audio drives H3 during generation, while the final merge reuses the original continuous soundtrack. That's how you do a whole-scene remake with one source clip instead of juggling dozens of slices.
Then the standard second-pass trio (second_pass_mode → None/refine/latent_scale, with refine_model/refine_denoise/refine_steps or latent_model/latent_scale/split_step), which works exactly like the FL2 node.
Outputs and wiring
denoise_latent1 (current stage latent), segment_video (this stage's clip), merged_video (all stages, stitched on the last run), text. Decode merged_video at the end and you're done - that's the whole pipeline.
Install and the practical gotchas
Install via ComfyUI Manager (search "ComfyUI-Apt_Preset") or clone + install.bat. You need the MiniMax H3 weights and a ComfyUI build with H3 support; without it you'll get a "does not provide MiniMax H3 support" runtime error, which is a ComfyUI-version problem, not yours. The latent_scale path additionally wants the H3 3D upscaler in ComfyUI/models/latent_upscale_models - the dropdown placeholder shows you the path. And the standing H3 caveat: the open weights' community license excludes the US, EU, UK and South Korea, so check your region before building a workflow around this node.
Inputs (147)
| Name | Type | Default | Description |
|---|---|---|---|
| prompt | STRING | — | |
| width | INT | 51232–4096 | — |
| height | INT | 76832–4096 | — |
| single_stage_time | INT | 52–15 | 每个分段的时长(秒) |
| ref_image_size | COMBO | match | 'match' 自动将参考图和参考视频限制到目标画布面积;'max' 保留官方高分辨率参考策略(细节更多但更慢、更占内存) |
| fps | FLOAT | 241–120 | — |
| motion_context | COMBO | guide 22 frames | 续接方案:Guide22/39帧适合转场、native39帧适合场景比较一致的情况。 |
| Auto_split_ref | COMBO | None | 长素材自动分段:长视频参考、长音频驱动+音频锁定。 |
| one_pass_sample | BOOLEAN | true | 执行一次采样。关闭时,不进行采样。 |
| seed | INT | 00–18446744073709550000 | — |
| stage_prompts | STRING | [] | — |
| contextopt | RUN_CONTEXT | — | |
| modelopt | MODEL | — | |
| mediaopt | IMAGE,VIDEO,AUDIO,LATENT,STRING | — | |
| media_1opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_1opt | STRING | — | |
| media_2opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_2opt | STRING | — | |
| media_3opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_3opt | STRING | — | |
| media_4opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_4opt | STRING | — | |
| media_5opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_5opt | STRING | — | |
| media_6opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_6opt | STRING | — | |
| media_7opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_7opt | STRING | — | |
| media_8opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_8opt | STRING | — | |
| media_9opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_9opt | STRING | — | |
| media_10opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_10opt | STRING | — | |
| media_11opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_11opt | STRING | — | |
| media_12opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_12opt | STRING | — | |
| media_13opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_13opt | STRING | — | |
| media_14opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_14opt | STRING | — | |
| media_15opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_15opt | STRING | — | |
| media_16opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_16opt | STRING | — | |
| media_17opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_17opt | STRING | — | |
| media_18opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_18opt | STRING | — | |
| media_19opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_19opt | STRING | — | |
| media_20opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_20opt | STRING | — | |
| media_21opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_21opt | STRING | — | |
| media_22opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_22opt | STRING | — | |
| media_23opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_23opt | STRING | — | |
| media_24opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_24opt | STRING | — | |
| media_25opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_25opt | STRING | — | |
| media_26opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_26opt | STRING | — | |
| media_27opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_27opt | STRING | — | |
| media_28opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_28opt | STRING | — | |
| media_29opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_29opt | STRING | — | |
| media_30opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_30opt | STRING | — | |
| media_31opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_31opt | STRING | — | |
| media_32opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_32opt | STRING | — | |
| media_33opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_33opt | STRING | — | |
| media_34opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_34opt | STRING | — | |
| media_35opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_35opt | STRING | — | |
| media_36opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_36opt | STRING | — | |
| media_37opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_37opt | STRING | — | |
| media_38opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_38opt | STRING | — | |
| media_39opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_39opt | STRING | — | |
| media_40opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_40opt | STRING | — | |
| media_41opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_41opt | STRING | — | |
| media_42opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_42opt | STRING | — | |
| media_43opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_43opt | STRING | — | |
| media_44opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_44opt | STRING | — | |
| media_45opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_45opt | STRING | — | |
| media_46opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_46opt | STRING | — | |
| media_47opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_47opt | STRING | — | |
| media_48opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_48opt | STRING | — | |
| media_49opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_49opt | STRING | — | |
| media_50opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_50opt | STRING | — | |
| media_51opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_51opt | STRING | — | |
| media_52opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_52opt | STRING | — | |
| media_53opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_53opt | STRING | — | |
| media_54opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_54opt | STRING | — | |
| media_55opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_55opt | STRING | — | |
| media_56opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_56opt | STRING | — | |
| media_57opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_57opt | STRING | — | |
| media_58opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_58opt | STRING | — | |
| media_59opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_59opt | STRING | — | |
| media_60opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_60opt | STRING | — | |
| media_61opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_61opt | STRING | — | |
| media_62opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_62opt | STRING | — | |
| media_63opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_63opt | STRING | — | |
| media_64opt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| media_type_64opt | STRING | — | |
| stage_info_data1opt | FLOW_STAGE_INFO | — | |
| stage_dataopt | IMAGE,VIDEO,AUDIO,LATENT | — | |
| sampling_profileopt | COMBO | auto | 模型内部QKV/MLP 分块:token分块+层内算子分块 |
| VAE_TILEopt | COMBO | default | 只解决VAE 编码、解码阶段的爆显存,不解决主要采样显存 |
| latent_sample_tileopt | COMBO | None:不分块 | 采样画面分块:2|128 建议配置,2表示分块数量,128表示重叠数量。分块越小,重叠越小,采样速度越快。 |
Outputs (4)
| Name | Type | Description |
|---|---|---|
| context | RUN_CONTEXT | — |
| segment_video | VIDEO | — |
| merged_video | VIDEO | — |
| text | STRING | — |