Nodes/comfyui-zimage-vl/Load CLIP with Visual
ComfyUI Node

Load CLIP with Visual

Load Qwen3-4B language model + Qwen3-VL visual encoder for Z-Image VL conditioning.

By yaofeng·Created 2 months ago·Updated 2 months ago· 0
Load CLIP with Visual
    • vl_model
    lm_name
    visual_name
    Categoryloaders

    Inputs (2)

    NameTypeDefaultDescription
    lm_nameCOMBOQwen3-4B language model safetensors (qwen_3_4b.safetensors)
    visual_nameCOMBOQwen3-VL visual encoder safetensors (qwen_3_vl_visual.safetensors)

    Outputs (1)

    NameTypeDescription
    vl_modelZIMAGE_VL_MODELVLM model wrapper for CLIP Text Image Encode