Nodes/ComfyUI-Apt_Preset/AD_MinMax_Ref2
ComfyUI Node

AD_MinMax_Ref2

Images, clips and audio in one prompt

By cardenluo·Created 2 years ago·Updated about 15 hours ago· 334
AD_MinMax_Ref2
  • context
  • model
  • media
  • media_1
  • media_2
  • media_3
  • media_4
  • media_5
  • media_6
  • media_7
  • media_8
  • media_9
  • media_10
  • media_11
  • media_12
  • media_13
  • media_14
  • media_15
  • media_16
  • media_17
  • media_18
  • media_19
  • media_20
  • media_21
  • media_22
  • media_23
  • media_24
  • media_25
  • media_26
  • media_27
  • media_28
  • media_29
  • media_30
  • media_31
  • media_32
  • media_33
  • media_34
  • media_35
  • media_36
  • media_37
  • media_38
  • media_39
  • media_40
  • media_41
  • media_42
  • media_43
  • media_44
  • media_45
  • media_46
  • media_47
  • media_48
  • media_49
  • media_50
  • media_51
  • media_52
  • media_53
  • media_54
  • media_55
  • media_56
  • media_57
  • media_58
  • media_59
  • media_60
  • media_61
  • media_62
  • media_63
  • media_64
  • stage_info_data1
  • stage_data
  • context
  • model
  • length
  • text
prompt
width512
height768
single_stage_time5.0
ref_image_sizematch
motion_contextguide 22 frames
reference_media_modedefault
stage_prompts[]
media_type_1
media_type_2
media_type_3
media_type_4
media_type_5
media_type_6
media_type_7
media_type_8
media_type_9
media_type_10
media_type_11
media_type_12
media_type_13
media_type_14
media_type_15
media_type_16
media_type_17
media_type_18
media_type_19
media_type_20
media_type_21
media_type_22
media_type_23
media_type_24
media_type_25
media_type_26
media_type_27
media_type_28
media_type_29
media_type_30
media_type_31
media_type_32
media_type_33
media_type_34
media_type_35
media_type_36
media_type_37
media_type_38
media_type_39
media_type_40
media_type_41
media_type_42
media_type_43
media_type_44
media_type_45
media_type_46
media_type_47
media_type_48
media_type_49
media_type_50
media_type_51
media_type_52
media_type_53
media_type_54
media_type_55
media_type_56
media_type_57
media_type_58
media_type_59
media_type_60
media_type_61
media_type_62
media_type_63
media_type_64

This is the workhorse of the pack's MiniMax H3 stack: AD_MinMax_Ref2 generates a video from a text prompt plus up to sixteen media inputs - images for identity and style, reference videos for motion, audio clips for soundtrack matching - all numbered and referenced from inside the prompt itself. If AD_MinMax_FL2 is the first/last-keyframe specialist, this one is the generalist: same H3 backbone, but reference-driven rather than keyframe-pinned.

The "Ref2" in the name and the README's update log point at the same thing - this is the reference-guided ("Ref2VA") mode of MiniMax H3, where the model attends to your reference media rather than treating it as hard frames. That's a subtle but real distinction: a reference video can influence motion, but it won't pin the start or end frame the way FL2's keyframes do. Pick Ref2 when you want identity/consistency, pick FL2 when you want literal endpoints.

The media inputs, and the prompt magic

You get media plus media_1 through media_16, each accepting image, video, audio, or latent. The slick part: you can reference them from the prompt text. The node parses tags like <Picture 1>, <Video 2> or <Audio 1> (it also accepts looser forms like @v3 or [img 2], and even Chinese tags - the author's own prompt scheduler) and injects the right media into the H3 tokenizer at the right position. So a prompt can read: "the man from <Picture 1> dances like <Video 2>, with <Audio 1> as the beat." That ordering matters - the media inputs are ordered virtual inputs, and their order in the prompt drives what the model attends to where.

The hard limits (enforced, with clear errors): 9 images, 3 videos, 3 audio clips, and a single context latent. media_type_N lets you override the detected type if the auto-detection ever guesses wrong, but you'll rarely touch it.

The few inputs you actually set

  • context (RUN_CONTEXT) - required. Carries the H3 model, CLIP, VAE and audio VAE. The node raises a specific error listing whichever of clip/vae/audio_vae are missing.
  • prompt - your scene description with the media tags.
  • length - frames at 24fps, auto-snapped to H3's 17k+5 grid (124 ≈ 5s).
  • ref_image_size ("match" default, "max") - how reference images get scaled before encoding. match scales to the canvas area (fast, default); max aligns to the 2048 short edge, which the tooltip says gives better identity but runs slower. For face-critical work, max is the one you'd reach for.
  • seed - standard, with control_after_generate.

Outputs: context (with the sampled latent carried forward), video, and text (the fully-resolved prompt after tag substitution - handy for debugging what the model actually saw).

The chaining trick

This is where the pack earns its keep. If you don't connect a media latent, the node pulls the previous sampler's latent out of the RUN_CONTEXT and feeds it forward as context. That's how you get multi-shot consistency: run one shot, chain the context into the next AD_MinMax_Ref2, and the character stays put. It's the same pattern the pack's flow_stage system formalizes into a whole staged-video loop (see AD_MinMax_Ref2_mul for the multi-stage version). Just remember the context bus's one failure mode - a stale context silently carries an old latent - so if a character suddenly changes identity between shots, check what's actually in the context wire.

Installing it

Part of cardenluo/ComfyUI-Apt_Preset. ComfyUI Manager → search "Apt_Preset", or:

cd ComfyUI/custom_nodes
git clone https://github.com/cardenluo/ComfyUI-Apt_Preset
pip install -r requirements.txt   # or install.bat on Windows

Restart, then load an H3 model via the pack's universal loader. You need a ComfyUI build with native comfy_extras.nodes_minimax_h3 - otherwise it dies with "This ComfyUI build does not provide MiniMax H3 support." The pack's optional deps (GGUF, Advanced-ControlNet, nunchaku, Apt_File resources) are only for other nodes in the suite.

CategoryApt_Preset/AD

Inputs (141)

NameTypeDefaultDescription
promptSTRING
widthINT51232–4096
heightINT76832–4096
single_stage_timeFLOAT5.02–15当前分段时长(秒),支持一位小数
ref_image_sizeCOMBOmatch'match' 自动将参考图和参考视频限制到目标画布面积;'max' 保留官方高分辨率参考策略(细节更多但更慢、更占内存)
motion_contextCOMBOguide 22 frames续接方案:Guide22/39帧使用条件引导;native soft 39使用动态重绘并保持AV网格精确对齐。
reference_media_modeCOMBOdefault长素材可自动分段;提示词连续引用同一组音频时沿时间轴继续,引用中断后再次出现则从头开始。
stage_promptsSTRING[]
contextoptRUN_CONTEXT
modeloptMODEL
mediaoptIMAGE,VIDEO,AUDIO,LATENT,STRING
media_1optIMAGE,VIDEO,AUDIO,LATENT
media_type_1optSTRING
media_2optIMAGE,VIDEO,AUDIO,LATENT
media_type_2optSTRING
media_3optIMAGE,VIDEO,AUDIO,LATENT
media_type_3optSTRING
media_4optIMAGE,VIDEO,AUDIO,LATENT
media_type_4optSTRING
media_5optIMAGE,VIDEO,AUDIO,LATENT
media_type_5optSTRING
media_6optIMAGE,VIDEO,AUDIO,LATENT
media_type_6optSTRING
media_7optIMAGE,VIDEO,AUDIO,LATENT
media_type_7optSTRING
media_8optIMAGE,VIDEO,AUDIO,LATENT
media_type_8optSTRING
media_9optIMAGE,VIDEO,AUDIO,LATENT
media_type_9optSTRING
media_10optIMAGE,VIDEO,AUDIO,LATENT
media_type_10optSTRING
media_11optIMAGE,VIDEO,AUDIO,LATENT
media_type_11optSTRING
media_12optIMAGE,VIDEO,AUDIO,LATENT
media_type_12optSTRING
media_13optIMAGE,VIDEO,AUDIO,LATENT
media_type_13optSTRING
media_14optIMAGE,VIDEO,AUDIO,LATENT
media_type_14optSTRING
media_15optIMAGE,VIDEO,AUDIO,LATENT
media_type_15optSTRING
media_16optIMAGE,VIDEO,AUDIO,LATENT
media_type_16optSTRING
media_17optIMAGE,VIDEO,AUDIO,LATENT
media_type_17optSTRING
media_18optIMAGE,VIDEO,AUDIO,LATENT
media_type_18optSTRING
media_19optIMAGE,VIDEO,AUDIO,LATENT
media_type_19optSTRING
media_20optIMAGE,VIDEO,AUDIO,LATENT
media_type_20optSTRING
media_21optIMAGE,VIDEO,AUDIO,LATENT
media_type_21optSTRING
media_22optIMAGE,VIDEO,AUDIO,LATENT
media_type_22optSTRING
media_23optIMAGE,VIDEO,AUDIO,LATENT
media_type_23optSTRING
media_24optIMAGE,VIDEO,AUDIO,LATENT
media_type_24optSTRING
media_25optIMAGE,VIDEO,AUDIO,LATENT
media_type_25optSTRING
media_26optIMAGE,VIDEO,AUDIO,LATENT
media_type_26optSTRING
media_27optIMAGE,VIDEO,AUDIO,LATENT
media_type_27optSTRING
media_28optIMAGE,VIDEO,AUDIO,LATENT
media_type_28optSTRING
media_29optIMAGE,VIDEO,AUDIO,LATENT
media_type_29optSTRING
media_30optIMAGE,VIDEO,AUDIO,LATENT
media_type_30optSTRING
media_31optIMAGE,VIDEO,AUDIO,LATENT
media_type_31optSTRING
media_32optIMAGE,VIDEO,AUDIO,LATENT
media_type_32optSTRING
media_33optIMAGE,VIDEO,AUDIO,LATENT
media_type_33optSTRING
media_34optIMAGE,VIDEO,AUDIO,LATENT
media_type_34optSTRING
media_35optIMAGE,VIDEO,AUDIO,LATENT
media_type_35optSTRING
media_36optIMAGE,VIDEO,AUDIO,LATENT
media_type_36optSTRING
media_37optIMAGE,VIDEO,AUDIO,LATENT
media_type_37optSTRING
media_38optIMAGE,VIDEO,AUDIO,LATENT
media_type_38optSTRING
media_39optIMAGE,VIDEO,AUDIO,LATENT
media_type_39optSTRING
media_40optIMAGE,VIDEO,AUDIO,LATENT
media_type_40optSTRING
media_41optIMAGE,VIDEO,AUDIO,LATENT
media_type_41optSTRING
media_42optIMAGE,VIDEO,AUDIO,LATENT
media_type_42optSTRING
media_43optIMAGE,VIDEO,AUDIO,LATENT
media_type_43optSTRING
media_44optIMAGE,VIDEO,AUDIO,LATENT
media_type_44optSTRING
media_45optIMAGE,VIDEO,AUDIO,LATENT
media_type_45optSTRING
media_46optIMAGE,VIDEO,AUDIO,LATENT
media_type_46optSTRING
media_47optIMAGE,VIDEO,AUDIO,LATENT
media_type_47optSTRING
media_48optIMAGE,VIDEO,AUDIO,LATENT
media_type_48optSTRING
media_49optIMAGE,VIDEO,AUDIO,LATENT
media_type_49optSTRING
media_50optIMAGE,VIDEO,AUDIO,LATENT
media_type_50optSTRING
media_51optIMAGE,VIDEO,AUDIO,LATENT
media_type_51optSTRING
media_52optIMAGE,VIDEO,AUDIO,LATENT
media_type_52optSTRING
media_53optIMAGE,VIDEO,AUDIO,LATENT
media_type_53optSTRING
media_54optIMAGE,VIDEO,AUDIO,LATENT
media_type_54optSTRING
media_55optIMAGE,VIDEO,AUDIO,LATENT
media_type_55optSTRING
media_56optIMAGE,VIDEO,AUDIO,LATENT
media_type_56optSTRING
media_57optIMAGE,VIDEO,AUDIO,LATENT
media_type_57optSTRING
media_58optIMAGE,VIDEO,AUDIO,LATENT
media_type_58optSTRING
media_59optIMAGE,VIDEO,AUDIO,LATENT
media_type_59optSTRING
media_60optIMAGE,VIDEO,AUDIO,LATENT
media_type_60optSTRING
media_61optIMAGE,VIDEO,AUDIO,LATENT
media_type_61optSTRING
media_62optIMAGE,VIDEO,AUDIO,LATENT
media_type_62optSTRING
media_63optIMAGE,VIDEO,AUDIO,LATENT
media_type_63optSTRING
media_64optIMAGE,VIDEO,AUDIO,LATENT
media_type_64optSTRING
stage_info_data1optFLOW_STAGE_INFO
stage_dataoptIMAGE,VIDEO,AUDIO,LATENT

Outputs (4)

NameTypeDescription
contextRUN_CONTEXT
modelMODEL
lengthINT
textSTRING