Nodes/ComfyUI-llama_Dapao/🎵Music3音乐提示词生成@炮老师的小课堂
ComfyUI Node

🎵Music3音乐提示词生成@炮老师的小课堂

Write a complete Music 3 brief and lyrics with a local model

By paolaoshi·Created 4 months ago·Updated 2 days ago· 44
🎵Music3音乐提示词生成@炮老师的小课堂
    • 🎼 音乐描述
    • 📝 歌词
    • 🌐 全局音乐信息
    • 🎙️ 人声细节
    • 🧱 编曲结构
    • 📑 音乐结构分析
    • 📄 语言模型完整响应
    • ℹ️ 处理信息
    🤖本地模型文件
    🔌本地对话处理器Qwen3.8
    🖼️本地mmproj文件None
    📐本地上下文长度8192
    💾本地显存限制(GB)-1.0
    🔢图像最小token256
    🔢图像最大token1344
    🧠本地思考模式false
    🧠Qwen3.8推理强度关闭
    📝 原始音乐需求温暖的原声流行歌曲,亲密女声,副歌逐步扩张并在结尾温柔收束。
    🎼 主风格自动识别
    🧬 融合风格
    🎯 使用场景自动识别
    ⏳ 目标曲长自动识别
    💫 情绪弧自动识别
    ⏱️ 速度自动识别
    🎹 调性倾向自动识别/不指定
    🎚️ 拍号/律动自动识别
    🥁 核心律动自动识别
    🎙️ 人声配置自动识别
    📈 人声音域自动识别
    🗣️ 人声音色自动识别
    🎤 演唱方式自动识别
    👥 和声/伴唱自动识别
    🎻 核心乐器编制自动识别
    🧱 歌曲结构自动识别
    🎛️ 制作质感自动识别
    🌌 空间与混响自动识别
    🔥 编曲密度自动识别
    🚫 排除项
    🌐 输出语言英文(Music 3推荐)
    📏 输出详略标准|250–450词
    📦 输出格式结构化文本
    🌡️ 温度0.35
    📝 最大输出令牌4096
    🎲 Top_P1.00
    🎲 随机种0
    ⌛ 请求超时300
    🔗 外部音乐需求
    📝 歌词
    🔗 外部歌词
    ➕ 补充约束
    ✍️ 自定义主风格
    ✍️ 自定义融合风格
    ✍️ 自定义使用场景
    ✍️ 自定义目标曲长
    ✍️ 自定义情绪弧
    ✍️ 自定义速度
    ✍️ 自定义调性倾向
    ✍️ 自定义拍号/律动
    ✍️ 自定义核心律动
    ✍️ 自定义人声配置
    ✍️ 自定义人声音域
    ✍️ 自定义人声音色
    ✍️ 自定义演唱方式
    ✍️ 自定义和声/伴唱
    ✍️ 自定义乐器编制
    ✍️ 自定义歌曲结构
    ✍️ 自定义制作质感
    ✍️ 自定义空间与混响
    ✍️ 自定义编曲密度
    ✍️ 自定义排除项
    ✍️ 自定义输出详略
    🚫 出错时跳过false

    MiniMax Music 3 expects a structured music description - genre, tempo, emotion arc, instrumentation, vocal style - and if you've ever stared at that Text Encode node with nothing to say, this node is the fix. DapaoLocalMusic3CaptionPromptNode ("Music3音乐提示词生成") writes the whole thing locally: a structured music description plus complete lyrics, with no API call. The first two outputs (🎼 音乐描述 and 📝 歌词) are designed to wire directly into the official Music3 Text Encode node.

    It's another of the pack's seven API-tool ports: original was a dapaoAPI node, the local version keeps the prompt assembly and swaps the API client for a llama.cpp payload on your GGUF. Same output contract, zero cloud.

    What you can specify

    The required inputs are a music producer's checklist, almost all defaulting to 自动识别 so you can also just type a sentence and let the model decide:

    • 📝 原始音乐需求 - your idea. The default is a perfectly good example: "温暖的原声流行歌曲,亲密女声,副歌逐步扩张并在结尾温柔收束."
    • 🎼 主风格 and 🧬 融合风格 - 20 style slots from 东亚现代流行 through 现代R&B, 电影感抒情, 电子合成器氛围, 爵士摇摆, 金属重型摇滚, 国风民乐…
    • 🎯 使用场景 - 流媒体完整歌曲, 影视剧情/片尾曲, 电影或游戏配乐, 品牌广告, 短视频背景音乐, 现场舞台…
    • ⏳ 目标曲长, 💫 情绪弧 (克制铺陈→温暖释放→余韵收束 and friends), ⏱️ 速度 (60–180 BPM bands), 🎹 调性倾向, 🎚️ 拍号/律动, 🥁 核心律动, 🎙️ 人声配置, 📈 人声音域, 🗣️ 人声音色, 🎤 演唱方式, 👥 和声/伴唱, 🎻 核心乐器编制, 🧱 歌曲结构, 🎛️ 制作质感, 🌌 空间与混响, 🔥 编曲密度, 🚫 排除项.
    • Output language: English (Music 3 recommended), Chinese, or bilingual. 📏 输出详略 (180–250 / 250–450 / 450–650 words).

    The lyrics logic

    The optional 📝 歌词 / 🔗 外部歌词 inputs are where it gets clever: provide lyrics and the node keeps them verbatim - no rewriting, no "improving." Leave them empty and the LLM writes lyrics from scratch. The author's framing ("有歌词时原样保留") is exactly right for a model that's sensitive to word changes. ➕ 补充约束 adds extra guardrails.

    Inputs and outputs in practice

    The eight outputs mirror the Music 3 contract: 🎼 音乐描述, 📝 歌词 (both → official Text Encode), plus 🌐 全局音乐信息, 🎙️ 人声细节, 🧱 编曲结构, 📑 音乐结构分析, 📄 语言模型完整响应, and ℹ️ 处理信息. The 📦 输出格式 control exists only for old-workflow compatibility - the current version always outputs the wire-ready description and lyrics, per its tooltip.

    Where people get burned

    The token budget. Music descriptions with full lyrics hit the default 📝 最大输出令牌 of 4096 quickly; if the lyrics get truncated mid-song, raise it. And note 🎲 随机种 is only a ComfyUI cache control, not sent to the LLM - if a re-roll comes back identical, flip 每次重新生成 style behavior by clearing cache or changing the seed on the model side, not this one.

    Installing it

    Standard pack install:

    cd ComfyUI/custom_nodes
    git clone https://github.com/paolaoshi/ComfyUI-llama_Dapao
    

    then requirements + restart. Pack-wide gotcha: llama-cpp-python pinned to the JamePeng fork at 0.3.47+ (stock PyPI 0.3.35 fails on Qwen3.8 GGUFs), NVIDIA users overlay a GPU wheel from the JamePeng releases, models in ComfyUI/models/LLM/. A text GGUF is enough here unless you're feeding reference images.

    Category🍭大炮-llama-cpp

    Inputs (64)

    NameTypeDefaultDescription
    🤖本地模型文件COMBO0 options:
    🔌本地对话处理器COMBOQwen3.822 options: None, LLaVA-1.5, LLaVA-1.6, Moondream2, nanoLLaVA, llama3-Vision-Alpha, +16
    🖼️本地mmproj文件COMBONone1 options: None
    📐本地上下文长度INT8192512–131072
    💾本地显存限制(GB)FLOAT-1.0-1–999这是LLM可使用的显存预算,不是预留空间。-1=尝试全部放入GPU,最快但可能因显存不足失败;填写数值=只将部分模型层放入GPU,其余使用系统内存。参考起点:8GB显卡填6,12GB填10,16GB填13,24GB填20,32GB填24-28。请为ComfyUI、mmproj和上下文缓存保留约2GB。
    🔢图像最小tokenINT2561–4096
    🔢图像最大tokenINT13441–8192
    🧠本地思考模式BOOLEANfalse
    🧠Qwen3.8推理强度COMBO关闭5 options: 关闭, 自动, 低, 中等, 高
    📝 原始音乐需求STRING温暖的原声流行歌曲,亲密女声,副歌逐步扩张并在结尾温柔收束。
    🎼 主风格COMBO自动识别20 options: 自动识别, 东亚现代流行|C-pop/J-pop与电子、R&B、说唱融合, 东亚抒情与国风|华语/日系抒情、原声或管弦, 现代R&B与Neo-Soul, 灵魂、蓝调与福音, 电影感流行抒情, +14
    🧬 融合风格COMBO21 options: 无, 自动识别, 东亚现代流行|C-pop/J-pop与电子、R&B、说唱融合, 东亚抒情与国风|华语/日系抒情、原声或管弦, 现代R&B与Neo-Soul, 灵魂、蓝调与福音, +15
    🎯 使用场景COMBO自动识别11 options: 自动识别, 流媒体完整歌曲, 影视剧情/片尾曲, 电影或游戏配乐, 品牌广告/产品短片, 短视频背景音乐, +5
    ⏳ 目标曲长COMBO自动识别7 options: 自动识别, 30–60秒, 1–2分钟, 2–3分钟, 3–4分钟, 4–5分钟, +1
    💫 情绪弧COMBO自动识别11 options: 自动识别, 克制铺陈 → 温暖释放 → 余韵收束, 脆弱低语 → 渐强 → 宣言式高潮, 平静神秘 → 紧张堆叠 → 史诗爆发, 忧伤回望 → 希望抬升 → 治愈落地, 明亮轻快 → 律动推进 → 庆祝式收尾, +5
    ⏱️ 速度COMBO自动识别8 options: 自动识别, 慢速|60–78 BPM, 中慢|79–96 BPM, 中速|97–115 BPM, 中快|116–132 BPM, 快速|133–155 BPM, +2
    🎹 调性倾向COMBO自动识别/不指定10 options: 自动识别/不指定, 明亮大调倾向, 忧郁小调倾向, 大小调转换, 五声音阶/国风调式, 布鲁斯调式, +4
    🎚️ 拍号/律动COMBO自动识别7 options: 自动识别, 4/4, 3/4, 6/8, 12/8, 自由节拍/无固定律动, +1
    🥁 核心律动COMBO自动识别12 options: 自动识别, 平稳流行律动, 半拍/半速重心, Swing摇摆律动, Shuffle切分律动, 四拍踩底舞曲律动, +6
    🎙️ 人声配置COMBO自动识别13 options: 自动识别, 纯器乐|禁止人声与歌词, 单人女声, 单人男声, 中性/不限定性别单人声, 男女对唱, +7
    📈 人声音域COMBO自动识别10 options: 自动识别, 低沉低音区, 温暖中低音区, 自然中音区, 明亮中高音区, 高音区与假声, +4
    🗣️ 人声音色COMBO自动识别12 options: 自动识别, 清澈明亮, 温暖柔和, 气声亲密, 醇厚磁性, 沙哑颗粒感, +6
    🎤 演唱方式COMBO自动识别12 options: 自动识别, 叙述式、克制, 细腻气声、贴耳, 抒情渐强、宽阔副歌, 强力真声与高音爆发, R&B转音与即兴Ad-lib, +6
    👥 和声/伴唱COMBO自动识别10 options: 自动识别, 无伴唱、单主唱, 副歌轻量叠唱, 贴近三度/六度和声, 宽阔多轨和声墙, 领唱与群体呼应, +4
    🎻 核心乐器编制COMBO自动识别17 options: 自动识别, 钢琴 + 弦乐 + 克制鼓组, 指弹木吉他 + 轻鼓 + 温暖贝斯, Rhodes电钢琴 + 圆润贝斯 + R&B鼓组, 合成器Pad + 琶音 + 电子鼓, 失真电吉他 + 贝斯 + 现场鼓组, +11
    🧱 歌曲结构COMBO自动识别10 options: 自动识别, Intro → Verse → Pre-Chorus → Chorus → Verse → Chorus → Bridge → Final Chorus → Outro, Intro → Verse → Chorus → Verse → Chorus → Outro, Intro → Verse → Pre-Chorus → Chorus → Post-Chorus → Bridge → Final Chorus → Outro, Intro → Build → Drop → Breakdown → Final Drop → Outro, Intro → Rap Verse → Hook → Rap Verse → Hook → Bridge → Final Hook → Outro, +4
    🎛️ 制作质感COMBO自动识别12 options: 自动识别, 自然有机、动态呼吸, 现代流行、清晰宽阔, 温暖复古、磁带/黑胶质感, 电影化宽动态与空间层次, 俱乐部级紧实低频与冲击力, +6
    🌌 空间与混响COMBO自动识别9 options: 自动识别, 亲密近场、主唱居中, 适度宽声场、清晰层次, 大空间厅堂混响, 电影化深景与环绕感, 俱乐部直接、有力且紧实, +3
    🔥 编曲密度COMBO自动识别8 options: 自动识别, 极简留白, 由疏到密逐步堆叠, 中等密度、层次清晰, 副歌宽阔、主歌克制, 持续高能密集, +2
    🚫 排除项COMBO11 options: 无, 禁止人声, 禁止说唱, 禁止电子鼓与808, 禁止失真吉他, 禁止合唱团, +5
    🌐 输出语言COMBO英文(Music 3推荐)3 options: 英文(Music 3推荐), 中文, 双语:英文为主、中文注释
    📏 输出详略COMBO标准|250–450词4 options: 精简|180–250词, 标准|250–450词, 详细|450–650词, 自定义
    📦 输出格式COMBO结构化文本旧工作流兼容控件;当前始终输出可直连Music3的音乐描述与原始歌词。
    🌡️ 温度FLOAT0.350–2
    📝 最大输出令牌INT4096512–16384
    🎲 Top_PFLOAT1.000–1
    🎲 随机种INT00–18446744073709550000只控制ComfyUI缓存,不发送给LLM。
    ⌛ 请求超时INT30030–1200
    🔗 外部音乐需求optSTRING连接任意STRING节点;存在时与本节点的原始音乐需求合并。
    📝 歌词optSTRING
    🔗 外部歌词optSTRING可连接歌词文本;存在时与本节点歌词合并并原样输出。没有任何歌词输入时由LLM自动生成。
    ➕ 补充约束optSTRING
    ✍️ 自定义主风格optSTRING
    ✍️ 自定义融合风格optSTRING
    ✍️ 自定义使用场景optSTRING
    ✍️ 自定义目标曲长optSTRING
    ✍️ 自定义情绪弧optSTRING
    ✍️ 自定义速度optSTRING
    ✍️ 自定义调性倾向optSTRING
    ✍️ 自定义拍号/律动optSTRING
    ✍️ 自定义核心律动optSTRING
    ✍️ 自定义人声配置optSTRING
    ✍️ 自定义人声音域optSTRING
    ✍️ 自定义人声音色optSTRING
    ✍️ 自定义演唱方式optSTRING
    ✍️ 自定义和声/伴唱optSTRING
    ✍️ 自定义乐器编制optSTRING
    ✍️ 自定义歌曲结构optSTRING
    ✍️ 自定义制作质感optSTRING
    ✍️ 自定义空间与混响optSTRING
    ✍️ 自定义编曲密度optSTRING
    ✍️ 自定义排除项optSTRING
    ✍️ 自定义输出详略optSTRING
    🚫 出错时跳过optBOOLEANfalse

    Outputs (8)

    NameTypeDescription
    🎼 音乐描述STRING
    📝 歌词STRING
    🌐 全局音乐信息STRING
    🎙️ 人声细节STRING
    🧱 编曲结构STRING
    📑 音乐结构分析STRING
    📄 语言模型完整响应STRING
    ℹ️ 处理信息STRING