ComfyUI Node
🖼️ Image/Video Analysis (Transformers)
A ComfyUI node in 🤖 GGUF-VLM/🖼️ Vision Models with 13 inputs and 1 output.
🖼️ Image/Video Analysis (Transformers)
- model_config
- video
- image_1
- image_2
- image_3
- context
◄promptDescribe these images.►
◄max_tokens512►
◄temperature0.70►
◄top_p0.80►
◄top_k20►
◄repetition_penalty1.20►
◄seed0►
◄system_prompt►
Category🤖 GGUF-VLM/🖼️ Vision Models
Inputs (13)
| Name | Type | Default | Description |
|---|---|---|---|
| model_config | TRANSFORMERS_MODEL | — | |
| prompt | STRING | Describe these images. | 用户提示词 |
| max_tokens | INT | 512128–256000 | 最大生成 token 数 |
| temperature | FLOAT | 0.700–2 | 生成温度,控制输出的随机性(Qwen3-VL 推荐: 0.7) |
| top_p | FLOAT | 0.800–1 | Nucleus sampling 参数(Qwen3-VL 推荐: 0.8) |
| top_k | INT | 200–100 | Top-k sampling 参数(Qwen3-VL 推荐: 20) |
| repetition_penalty | FLOAT | 1.201–2 | 重复惩罚(推荐: 1.2,防止重复生成) |
| seed | INT | 00–18446744073709550000 | 随机种子,用于可重复的生成结果 |
| videoopt | IMAGE | 视频帧序列或单张图像 | |
| image_1opt | IMAGE | 图像 1 | |
| image_2opt | IMAGE | 图像 2 | |
| image_3opt | IMAGE | 图像 3 | |
| system_promptopt | STRING | 系统提示词(可选) |
Outputs (1)
| Name | Type | Description |
|---|---|---|
| context | STRING | — |