Nodes/HunyuanVideo-1.5 nodes/HunyuanVideo Vision Encode
ComfyUI Node

HunyuanVideo Vision Encode

A ComfyUI node in HunyuanVideoWrapper1.5 with 8 inputs and 1 output.

By yuanyuan-spec·Created 9 months ago·Updated 8 months ago· 27
HunyuanVideo Vision Encode
  • vision_encoder
  • hyvid_cfg
  • latents_dict
  • reference_image
  • vision_states
target_dtypebfloat16
enable_offloadingtrue
vision_num_semantic_tokens729
vision_states_dim1152
CategoryHunyuanVideoWrapper1.5

Inputs (8)

NameTypeDefaultDescription
vision_encoderHYVID15VISIONENCODER
hyvid_cfgHYVID15CFG
latents_dictHYVID15LATENTSDICT
target_dtypeCOMBObfloat169 options: float32, float64, float16, bfloat16, uint8, int8, +3
enable_offloadingoptBOOLEANtrue
reference_imageoptIMAGE
vision_num_semantic_tokensoptINT729
vision_states_dimoptINT1152

Outputs (1)

NameTypeDescription
vision_statesHYVID15VISIONSTATES