Nodes/ComfyUI-easygoing-nodes/Model Scale Qwen Image
ComfyUI Node

Model Scale Qwen Image

Scale a 60-block Qwen-Image model one transformer block at a time

By easygoing0114·Created 12 months ago·Updated 5 days ago· 5
Model Scale Qwen Image
  • model
  • MODEL
pos_embeds.1.00
img_in.1.00
txt_norm.1.00
txt_in.1.00
time_text_embed.1.00
transformer_blocks.0.1.00
transformer_blocks.1.1.00
transformer_blocks.2.1.00
transformer_blocks.3.1.00
transformer_blocks.4.1.00
transformer_blocks.5.1.00
transformer_blocks.6.1.00
transformer_blocks.7.1.00
transformer_blocks.8.1.00
transformer_blocks.9.1.00
transformer_blocks.10.1.00
transformer_blocks.11.1.00
transformer_blocks.12.1.00
transformer_blocks.13.1.00
transformer_blocks.14.1.00
transformer_blocks.15.1.00
transformer_blocks.16.1.00
transformer_blocks.17.1.00
transformer_blocks.18.1.00
transformer_blocks.19.1.00
transformer_blocks.20.1.00
transformer_blocks.21.1.00
transformer_blocks.22.1.00
transformer_blocks.23.1.00
transformer_blocks.24.1.00
transformer_blocks.25.1.00
transformer_blocks.26.1.00
transformer_blocks.27.1.00
transformer_blocks.28.1.00
transformer_blocks.29.1.00
transformer_blocks.30.1.00
transformer_blocks.31.1.00
transformer_blocks.32.1.00
transformer_blocks.33.1.00
transformer_blocks.34.1.00
transformer_blocks.35.1.00
transformer_blocks.36.1.00
transformer_blocks.37.1.00
transformer_blocks.38.1.00
transformer_blocks.39.1.00
transformer_blocks.40.1.00
transformer_blocks.41.1.00
transformer_blocks.42.1.00
transformer_blocks.43.1.00
transformer_blocks.44.1.00
transformer_blocks.45.1.00
transformer_blocks.46.1.00
transformer_blocks.47.1.00
transformer_blocks.48.1.00
transformer_blocks.49.1.00
transformer_blocks.50.1.00
transformer_blocks.51.1.00
transformer_blocks.52.1.00
transformer_blocks.53.1.00
transformer_blocks.54.1.00
transformer_blocks.55.1.00
transformer_blocks.56.1.00
transformer_blocks.57.1.00
transformer_blocks.58.1.00
transformer_blocks.59.1.00
proj_out.1.00

Qwen-Image is Alibaba's 20B Apache-2.0 MMDiT - the model whose Edit line became the community's default instruction editor and whose text rendering is genuinely best-in-class, especially for Chinese. Model Scale Qwen Image is the per-block scaler for it, built around the one number that defines the architecture: 60 transformer blocks. That's a big stack, and it's the reason this node feels overwhelming at first glance - the entire middle of the widget list is transformer_blocks.0 through transformer_blocks.59.

The mechanism is the pack's standard one: clone the model, match each weight to the longest widget prefix, scale by weight × scale. 1.0 = untouched, 0.0 = zeroed, above 1.0 amplified, everything defaulted to 1.0. model in, single MODEL out.

The inputs that matter

  • img_in., txt_in., txt_norm. - the image and text input paths. txt_in is where the prompt enters, and since Qwen-Image's whole selling point is following complex text, it's the most interesting knob for prompt-adherence experiments.
  • time_text_embed. - the fused timestep/text conditioning projection.
  • pos_embeds. - positional embeddings. Leave this alone; scaling position embeddings usually just degrades spatial consistency.
  • transformer_blocks.0transformer_blocks.59 - the 60 blocks. The early ones carry semantic fusion, the later ones output detail. There's no per-sub-component split here - it's one slider per block, which is already granular enough for a 20B model.
  • proj_out. - the final projection to latent space.

What's worth trying

Qwen-Image's Edit line is where the family really won, and if you're scaling the base generation model, the two sane experiments are: boost the early blocks' prompt-following (0.6–0.9 on late blocks to loosen the render, or 1.1–1.2 on early ones to tighten adherence), and probe where text rendering lives by scaling bands of blocks and checking glyph quality. Because the model is so large, small bands of blocks - a third at a time - are the way to get signal without a combinatorial explosion. The effect is live in the graph: save the workflow, or use the pack's save-with-original pair to persist a scaled Qwen-Image you actually like.

Install

Search Easygoing in the ComfyUI Manager, or:

cd ComfyUI/custom_nodes
git clone https://github.com/easygoing0114/ComfyUI-easygoing-nodes.git

Restart ComfyUI. No pip extras; requires a current ComfyUI with the V3 node API.

Where people get burned

VRAM is the whole game with Qwen-Image. The 20B model plus its clone is heavy, so expect the scaler to sit comfortably only on 24GB-class cards; on 16GB you'll want to work with a quantized load. And remember the widget count isn't the feature - 60 sliders all defaulting to 1.0 mean the node does nothing until you deliberately move one. Change one block or one band at a time, sample against the unmodified model, and let the comparison be your guide.

Categoryadvanced/model_merging/model_specific

Inputs (67)

NameTypeDefaultDescription
modelMODEL
pos_embeds.FLOAT1.000–2
img_in.FLOAT1.000–2
txt_norm.FLOAT1.000–2
txt_in.FLOAT1.000–2
time_text_embed.FLOAT1.000–2
transformer_blocks.0.FLOAT1.000–2
transformer_blocks.1.FLOAT1.000–2
transformer_blocks.2.FLOAT1.000–2
transformer_blocks.3.FLOAT1.000–2
transformer_blocks.4.FLOAT1.000–2
transformer_blocks.5.FLOAT1.000–2
transformer_blocks.6.FLOAT1.000–2
transformer_blocks.7.FLOAT1.000–2
transformer_blocks.8.FLOAT1.000–2
transformer_blocks.9.FLOAT1.000–2
transformer_blocks.10.FLOAT1.000–2
transformer_blocks.11.FLOAT1.000–2
transformer_blocks.12.FLOAT1.000–2
transformer_blocks.13.FLOAT1.000–2
transformer_blocks.14.FLOAT1.000–2
transformer_blocks.15.FLOAT1.000–2
transformer_blocks.16.FLOAT1.000–2
transformer_blocks.17.FLOAT1.000–2
transformer_blocks.18.FLOAT1.000–2
transformer_blocks.19.FLOAT1.000–2
transformer_blocks.20.FLOAT1.000–2
transformer_blocks.21.FLOAT1.000–2
transformer_blocks.22.FLOAT1.000–2
transformer_blocks.23.FLOAT1.000–2
transformer_blocks.24.FLOAT1.000–2
transformer_blocks.25.FLOAT1.000–2
transformer_blocks.26.FLOAT1.000–2
transformer_blocks.27.FLOAT1.000–2
transformer_blocks.28.FLOAT1.000–2
transformer_blocks.29.FLOAT1.000–2
transformer_blocks.30.FLOAT1.000–2
transformer_blocks.31.FLOAT1.000–2
transformer_blocks.32.FLOAT1.000–2
transformer_blocks.33.FLOAT1.000–2
transformer_blocks.34.FLOAT1.000–2
transformer_blocks.35.FLOAT1.000–2
transformer_blocks.36.FLOAT1.000–2
transformer_blocks.37.FLOAT1.000–2
transformer_blocks.38.FLOAT1.000–2
transformer_blocks.39.FLOAT1.000–2
transformer_blocks.40.FLOAT1.000–2
transformer_blocks.41.FLOAT1.000–2
transformer_blocks.42.FLOAT1.000–2
transformer_blocks.43.FLOAT1.000–2
transformer_blocks.44.FLOAT1.000–2
transformer_blocks.45.FLOAT1.000–2
transformer_blocks.46.FLOAT1.000–2
transformer_blocks.47.FLOAT1.000–2
transformer_blocks.48.FLOAT1.000–2
transformer_blocks.49.FLOAT1.000–2
transformer_blocks.50.FLOAT1.000–2
transformer_blocks.51.FLOAT1.000–2
transformer_blocks.52.FLOAT1.000–2
transformer_blocks.53.FLOAT1.000–2
transformer_blocks.54.FLOAT1.000–2
transformer_blocks.55.FLOAT1.000–2
transformer_blocks.56.FLOAT1.000–2
transformer_blocks.57.FLOAT1.000–2
transformer_blocks.58.FLOAT1.000–2
transformer_blocks.59.FLOAT1.000–2
proj_out.FLOAT1.000–2

Outputs (1)

NameTypeDescription
MODELMODEL