Nodes/Qwen2.5-VL GGUF Nodes/🖼️ Image/Video Analysis (Transformers)
ComfyUI Node

🖼️ Image/Video Analysis (Transformers)

A ComfyUI node in 🤖 GGUF-VLM/🖼️ Vision Models with 13 inputs and 1 output.

By walke2019·Created 9 months ago·Updated 8 months ago· 29
🖼️ Image/Video Analysis (Transformers)
  • model_config
  • video
  • image_1
  • image_2
  • image_3
  • context
promptDescribe these images.
max_tokens512
temperature0.70
top_p0.80
top_k20
repetition_penalty1.20
seed0
system_prompt
Category🤖 GGUF-VLM/🖼️ Vision Models

Inputs (13)

NameTypeDefaultDescription
model_configTRANSFORMERS_MODEL
promptSTRINGDescribe these images.用户提示词
max_tokensINT512128–256000最大生成 token 数
temperatureFLOAT0.700–2生成温度,控制输出的随机性(Qwen3-VL 推荐: 0.7)
top_pFLOAT0.800–1Nucleus sampling 参数(Qwen3-VL 推荐: 0.8)
top_kINT200–100Top-k sampling 参数(Qwen3-VL 推荐: 20)
repetition_penaltyFLOAT1.201–2重复惩罚(推荐: 1.2,防止重复生成)
seedINT00–18446744073709550000随机种子,用于可重复的生成结果
videooptIMAGE视频帧序列或单张图像
image_1optIMAGE图像 1
image_2optIMAGE图像 2
image_3optIMAGE图像 3
system_promptoptSTRING系统提示词(可选)

Outputs (1)

NameTypeDescription
contextSTRING