Skip to main content
音乐阶段 (Music Stage)

音乐阶段 (Music Stage) · 截图待补

这个节点是做什么的

画布上显示为 Music Stage(节点 id:ComfyTV.AudioStage)。你在 main_prompt 里写流派、情绪、乐器、BPM 等 tags,可选填 lyrics 歌词,设置时长,点 ▶ 运行,得到一段 COMFYTV_AUDIO 音乐快照。 内置 workflow ACE-Step v1 Song 走 ACE-Step 3.5B:lyrics 留空 = 纯器乐;填写歌词 = 带人声演唱。 这不是 TTS(文字转语音)。要念旁白、对白请用 Speech Stage

适用场景

  • 生成背景音乐、Lo-fi、电子、爵士等器乐(lyrics 留空)。
  • 写歌词 + tags,生成带人声的 demo 歌曲。
  • 为 Video Stage IA2V 准备驱动音轨(接 audio 输入)。
  • 为 Timeline 或 Audio Extract 链提供原始音轨。

工作原理(为什么 ComfyTV 这样设计)

  • Stage 只跑 workflows/audio/ 子 workflow,不 Queue 整图。
  • 快照:音频 URL(如 FLAC)写入项目;下游 Demux、Extract 读快照。
  • ComfyTV 把 tags → ACE-Step TextEncodeAceStepAudio.tags,lyrics → .lyrics,duration → EmptyAceStepLatentAudio.seconds
ComfyUI 原生没有「念稿」TTS;Stable Audio / ACE-Step 类节点做的是音乐生成,因此 ComfyTV 把「音乐」和「语音」拆成两个 stage。

类型说明(COMFYTV_AUDIO vs ComfyUI 原生)

术语提示COMFYTV_* 是 ComfyTV 保存在项目里的结果引用;ComfyUI 原生的 IMAGE/VIDEO/AUDIO运行时才在内存里的数据,二者不能直接连线,需用 Bridge 转换。
如何转换:
  • 原生 → ComfyTV:→ ComfyTV Audio
  • ComfyTV → 原生:← ComfyTV Audio
详见 bridges.zh.md

Music Stage vs Speech Stage(必读)

界面与参数说明

workflow

workflows/audio/ 中的 backend。内置:
  • ACE-Step v1 Songace-step-v1-song.json)— tags + 可选 lyrics + 时长。
说明:workflows/audio/README.zh.md
模型:ace_step_v1_3.5b.safetensorsmodels/checkpoints/(见 models.zh.md)。

main_prompt(风格 tags)

自由关键词,描述流派、情绪、乐器、速度。 示例lo-fi, jazz piano, rainy night, 90bpm, soft female vocals 误区:把整段旁白写在这里——那是 Speech Stage 的用法;Music Stage 的 prompt 是音乐描述,不是朗读稿。

duration_s(时长)

生成音频秒数,滑块 1–240,默认 30

lyrics(歌词)

  • 留空:纯器乐 / 无人声。
  • 有内容:song 模式,ACE-Step 按歌词生成演唱(语言与 tags 一致为佳)。
多行歌词直接粘贴即可。

自定义参数(custom_params)

侧栏可绑 seed 等 workflow 参数。

输出说明

新手一步一步

  1. ProjectAdd Node → ComfyTV → Generate → Music Stage
  2. workflowACE-Step v1 Song
  3. main_promptcinematic orchestral, epic, 120bpm, no vocals(纯器乐示例)。
  4. lyrics 留空,duration_s30
  5. 确认 ace_step_v1_3.5b.safetensors 已放入 checkpoints(见 models 文档)。
  6. ▶ 运行,节点上播放预览。
  7. 若要驱动视频:拖 Video Stage,workflow IA2V,Music audio → Video audio,再接一张人物图到 images
带人声歌曲:在 lyrics 写歌词,main_prompt 写 pop, upbeat, female vocal 等风格 tags → Run。

完整教程(推荐阅读)

本页只说明这一个节点的参数与用法。端到端流程与多节点串联,请见 GitHub 上的 ComfyTV 用户指南

仓库与工作流

常见问题

Q:生成的像有人在说话而不是唱歌?
A:检查是否误用 Speech Stage;Music Stage 的 main_prompt 应是音乐 tags,人声靠 lyrics + song workflow。
Q:Run 报错找不到模型?
A:下载 ACE-Step checkpoint 到 models/checkpoints/,重启 ComfyUI。
Q:audio 连不上 Video Stage?
A:确认两边都是 COMFYTV_AUDIO;原生 AUDIO 需先 → ComfyTV Audio Bridge。
Q:想要念稿配音?
A:用 Speech Stage(Kokoro TTS 等),不是本节点。

相关节点

  • Speech Stage——TTS 配音(不要与 Music Stage 混淆)。
  • Video Stage (IA2V)——消费 audio 驱动画面。
  • Audio Extract Vocal / Bg Stage——从混合音频分离人声或伴奏。
  • Director Timeline Stage——多轨时间线。
  • Bridge → / ← ComfyTV Audio——原生互通。
  • Project——项目上下文。