🎵Music3音乐提示词生成@炮老师的小课堂
Write a complete Music 3 brief and lyrics with a local model
- 🎼 音乐描述
- 📝 歌词
- 🌐 全局音乐信息
- 🎙️ 人声细节
- 🧱 编曲结构
- 📑 音乐结构分析
- 📄 语言模型完整响应
- ℹ️ 处理信息
MiniMax Music 3 expects a structured music description - genre, tempo, emotion arc, instrumentation, vocal style - and if you've ever stared at that Text Encode node with nothing to say, this node is the fix. DapaoLocalMusic3CaptionPromptNode ("Music3音乐提示词生成") writes the whole thing locally: a structured music description plus complete lyrics, with no API call. The first two outputs (🎼 音乐描述 and 📝 歌词) are designed to wire directly into the official Music3 Text Encode node.
It's another of the pack's seven API-tool ports: original was a dapaoAPI node, the local version keeps the prompt assembly and swaps the API client for a llama.cpp payload on your GGUF. Same output contract, zero cloud.
What you can specify
The required inputs are a music producer's checklist, almost all defaulting to 自动识别 so you can also just type a sentence and let the model decide:
📝 原始音乐需求- your idea. The default is a perfectly good example: "温暖的原声流行歌曲,亲密女声,副歌逐步扩张并在结尾温柔收束."🎼 主风格and🧬 融合风格- 20 style slots from 东亚现代流行 through 现代R&B, 电影感抒情, 电子合成器氛围, 爵士摇摆, 金属重型摇滚, 国风民乐…🎯 使用场景- 流媒体完整歌曲, 影视剧情/片尾曲, 电影或游戏配乐, 品牌广告, 短视频背景音乐, 现场舞台…⏳ 目标曲长,💫 情绪弧(克制铺陈→温暖释放→余韵收束 and friends),⏱️ 速度(60–180 BPM bands),🎹 调性倾向,🎚️ 拍号/律动,🥁 核心律动,🎙️ 人声配置,📈 人声音域,🗣️ 人声音色,🎤 演唱方式,👥 和声/伴唱,🎻 核心乐器编制,🧱 歌曲结构,🎛️ 制作质感,🌌 空间与混响,🔥 编曲密度,🚫 排除项.- Output language: English (Music 3 recommended), Chinese, or bilingual.
📏 输出详略(180–250 / 250–450 / 450–650 words).
The lyrics logic
The optional 📝 歌词 / 🔗 外部歌词 inputs are where it gets clever: provide lyrics and the node keeps them verbatim - no rewriting, no "improving." Leave them empty and the LLM writes lyrics from scratch. The author's framing ("有歌词时原样保留") is exactly right for a model that's sensitive to word changes. ➕ 补充约束 adds extra guardrails.
Inputs and outputs in practice
The eight outputs mirror the Music 3 contract: 🎼 音乐描述, 📝 歌词 (both → official Text Encode), plus 🌐 全局音乐信息, 🎙️ 人声细节, 🧱 编曲结构, 📑 音乐结构分析, 📄 语言模型完整响应, and ℹ️ 处理信息. The 📦 输出格式 control exists only for old-workflow compatibility - the current version always outputs the wire-ready description and lyrics, per its tooltip.
Where people get burned
The token budget. Music descriptions with full lyrics hit the default 📝 最大输出令牌 of 4096 quickly; if the lyrics get truncated mid-song, raise it. And note 🎲 随机种 is only a ComfyUI cache control, not sent to the LLM - if a re-roll comes back identical, flip 每次重新生成 style behavior by clearing cache or changing the seed on the model side, not this one.
Installing it
Standard pack install:
cd ComfyUI/custom_nodes
git clone https://github.com/paolaoshi/ComfyUI-llama_Dapao
then requirements + restart. Pack-wide gotcha: llama-cpp-python pinned to the JamePeng fork at 0.3.47+ (stock PyPI 0.3.35 fails on Qwen3.8 GGUFs), NVIDIA users overlay a GPU wheel from the JamePeng releases, models in ComfyUI/models/LLM/. A text GGUF is enough here unless you're feeding reference images.
Inputs (64)
| Name | Type | Default | Description |
|---|---|---|---|
| 🤖本地模型文件 | COMBO | 0 options: | |
| 🔌本地对话处理器 | COMBO | Qwen3.8 | 22 options: None, LLaVA-1.5, LLaVA-1.6, Moondream2, nanoLLaVA, llama3-Vision-Alpha, +16 |
| 🖼️本地mmproj文件 | COMBO | None | 1 options: None |
| 📐本地上下文长度 | INT | 8192512–131072 | — |
| 💾本地显存限制(GB) | FLOAT | -1.0-1–999 | 这是LLM可使用的显存预算,不是预留空间。-1=尝试全部放入GPU,最快但可能因显存不足失败;填写数值=只将部分模型层放入GPU,其余使用系统内存。参考起点:8GB显卡填6,12GB填10,16GB填13,24GB填20,32GB填24-28。请为ComfyUI、mmproj和上下文缓存保留约2GB。 |
| 🔢图像最小token | INT | 2561–4096 | — |
| 🔢图像最大token | INT | 13441–8192 | — |
| 🧠本地思考模式 | BOOLEAN | false | — |
| 🧠Qwen3.8推理强度 | COMBO | 关闭 | 5 options: 关闭, 自动, 低, 中等, 高 |
| 📝 原始音乐需求 | STRING | 温暖的原声流行歌曲,亲密女声,副歌逐步扩张并在结尾温柔收束。 | — |
| 🎼 主风格 | COMBO | 自动识别 | 20 options: 自动识别, 东亚现代流行|C-pop/J-pop与电子、R&B、说唱融合, 东亚抒情与国风|华语/日系抒情、原声或管弦, 现代R&B与Neo-Soul, 灵魂、蓝调与福音, 电影感流行抒情, +14 |
| 🧬 融合风格 | COMBO | 无 | 21 options: 无, 自动识别, 东亚现代流行|C-pop/J-pop与电子、R&B、说唱融合, 东亚抒情与国风|华语/日系抒情、原声或管弦, 现代R&B与Neo-Soul, 灵魂、蓝调与福音, +15 |
| 🎯 使用场景 | COMBO | 自动识别 | 11 options: 自动识别, 流媒体完整歌曲, 影视剧情/片尾曲, 电影或游戏配乐, 品牌广告/产品短片, 短视频背景音乐, +5 |
| ⏳ 目标曲长 | COMBO | 自动识别 | 7 options: 自动识别, 30–60秒, 1–2分钟, 2–3分钟, 3–4分钟, 4–5分钟, +1 |
| 💫 情绪弧 | COMBO | 自动识别 | 11 options: 自动识别, 克制铺陈 → 温暖释放 → 余韵收束, 脆弱低语 → 渐强 → 宣言式高潮, 平静神秘 → 紧张堆叠 → 史诗爆发, 忧伤回望 → 希望抬升 → 治愈落地, 明亮轻快 → 律动推进 → 庆祝式收尾, +5 |
| ⏱️ 速度 | COMBO | 自动识别 | 8 options: 自动识别, 慢速|60–78 BPM, 中慢|79–96 BPM, 中速|97–115 BPM, 中快|116–132 BPM, 快速|133–155 BPM, +2 |
| 🎹 调性倾向 | COMBO | 自动识别/不指定 | 10 options: 自动识别/不指定, 明亮大调倾向, 忧郁小调倾向, 大小调转换, 五声音阶/国风调式, 布鲁斯调式, +4 |
| 🎚️ 拍号/律动 | COMBO | 自动识别 | 7 options: 自动识别, 4/4, 3/4, 6/8, 12/8, 自由节拍/无固定律动, +1 |
| 🥁 核心律动 | COMBO | 自动识别 | 12 options: 自动识别, 平稳流行律动, 半拍/半速重心, Swing摇摆律动, Shuffle切分律动, 四拍踩底舞曲律动, +6 |
| 🎙️ 人声配置 | COMBO | 自动识别 | 13 options: 自动识别, 纯器乐|禁止人声与歌词, 单人女声, 单人男声, 中性/不限定性别单人声, 男女对唱, +7 |
| 📈 人声音域 | COMBO | 自动识别 | 10 options: 自动识别, 低沉低音区, 温暖中低音区, 自然中音区, 明亮中高音区, 高音区与假声, +4 |
| 🗣️ 人声音色 | COMBO | 自动识别 | 12 options: 自动识别, 清澈明亮, 温暖柔和, 气声亲密, 醇厚磁性, 沙哑颗粒感, +6 |
| 🎤 演唱方式 | COMBO | 自动识别 | 12 options: 自动识别, 叙述式、克制, 细腻气声、贴耳, 抒情渐强、宽阔副歌, 强力真声与高音爆发, R&B转音与即兴Ad-lib, +6 |
| 👥 和声/伴唱 | COMBO | 自动识别 | 10 options: 自动识别, 无伴唱、单主唱, 副歌轻量叠唱, 贴近三度/六度和声, 宽阔多轨和声墙, 领唱与群体呼应, +4 |
| 🎻 核心乐器编制 | COMBO | 自动识别 | 17 options: 自动识别, 钢琴 + 弦乐 + 克制鼓组, 指弹木吉他 + 轻鼓 + 温暖贝斯, Rhodes电钢琴 + 圆润贝斯 + R&B鼓组, 合成器Pad + 琶音 + 电子鼓, 失真电吉他 + 贝斯 + 现场鼓组, +11 |
| 🧱 歌曲结构 | COMBO | 自动识别 | 10 options: 自动识别, Intro → Verse → Pre-Chorus → Chorus → Verse → Chorus → Bridge → Final Chorus → Outro, Intro → Verse → Chorus → Verse → Chorus → Outro, Intro → Verse → Pre-Chorus → Chorus → Post-Chorus → Bridge → Final Chorus → Outro, Intro → Build → Drop → Breakdown → Final Drop → Outro, Intro → Rap Verse → Hook → Rap Verse → Hook → Bridge → Final Hook → Outro, +4 |
| 🎛️ 制作质感 | COMBO | 自动识别 | 12 options: 自动识别, 自然有机、动态呼吸, 现代流行、清晰宽阔, 温暖复古、磁带/黑胶质感, 电影化宽动态与空间层次, 俱乐部级紧实低频与冲击力, +6 |
| 🌌 空间与混响 | COMBO | 自动识别 | 9 options: 自动识别, 亲密近场、主唱居中, 适度宽声场、清晰层次, 大空间厅堂混响, 电影化深景与环绕感, 俱乐部直接、有力且紧实, +3 |
| 🔥 编曲密度 | COMBO | 自动识别 | 8 options: 自动识别, 极简留白, 由疏到密逐步堆叠, 中等密度、层次清晰, 副歌宽阔、主歌克制, 持续高能密集, +2 |
| 🚫 排除项 | COMBO | 无 | 11 options: 无, 禁止人声, 禁止说唱, 禁止电子鼓与808, 禁止失真吉他, 禁止合唱团, +5 |
| 🌐 输出语言 | COMBO | 英文(Music 3推荐) | 3 options: 英文(Music 3推荐), 中文, 双语:英文为主、中文注释 |
| 📏 输出详略 | COMBO | 标准|250–450词 | 4 options: 精简|180–250词, 标准|250–450词, 详细|450–650词, 自定义 |
| 📦 输出格式 | COMBO | 结构化文本 | 旧工作流兼容控件;当前始终输出可直连Music3的音乐描述与原始歌词。 |
| 🌡️ 温度 | FLOAT | 0.350–2 | — |
| 📝 最大输出令牌 | INT | 4096512–16384 | — |
| 🎲 Top_P | FLOAT | 1.000–1 | — |
| 🎲 随机种 | INT | 00–18446744073709550000 | 只控制ComfyUI缓存,不发送给LLM。 |
| ⌛ 请求超时 | INT | 30030–1200 | — |
| 🔗 外部音乐需求opt | STRING | 连接任意STRING节点;存在时与本节点的原始音乐需求合并。 | |
| 📝 歌词opt | STRING | — | |
| 🔗 外部歌词opt | STRING | 可连接歌词文本;存在时与本节点歌词合并并原样输出。没有任何歌词输入时由LLM自动生成。 | |
| ➕ 补充约束opt | STRING | — | |
| ✍️ 自定义主风格opt | STRING | — | |
| ✍️ 自定义融合风格opt | STRING | — | |
| ✍️ 自定义使用场景opt | STRING | — | |
| ✍️ 自定义目标曲长opt | STRING | — | |
| ✍️ 自定义情绪弧opt | STRING | — | |
| ✍️ 自定义速度opt | STRING | — | |
| ✍️ 自定义调性倾向opt | STRING | — | |
| ✍️ 自定义拍号/律动opt | STRING | — | |
| ✍️ 自定义核心律动opt | STRING | — | |
| ✍️ 自定义人声配置opt | STRING | — | |
| ✍️ 自定义人声音域opt | STRING | — | |
| ✍️ 自定义人声音色opt | STRING | — | |
| ✍️ 自定义演唱方式opt | STRING | — | |
| ✍️ 自定义和声/伴唱opt | STRING | — | |
| ✍️ 自定义乐器编制opt | STRING | — | |
| ✍️ 自定义歌曲结构opt | STRING | — | |
| ✍️ 自定义制作质感opt | STRING | — | |
| ✍️ 自定义空间与混响opt | STRING | — | |
| ✍️ 自定义编曲密度opt | STRING | — | |
| ✍️ 自定义排除项opt | STRING | — | |
| ✍️ 自定义输出详略opt | STRING | — | |
| 🚫 出错时跳过opt | BOOLEAN | false | — |
Outputs (8)
| Name | Type | Description |
|---|---|---|
| 🎼 音乐描述 | STRING | — |
| 📝 歌词 | STRING | — |
| 🌐 全局音乐信息 | STRING | — |
| 🎙️ 人声细节 | STRING | — |
| 🧱 编曲结构 | STRING | — |
| 📑 音乐结构分析 | STRING | — |
| 📄 语言模型完整响应 | STRING | — |
| ℹ️ 处理信息 | STRING | — |