语音阶段 (Speech Stage) · 截图待补
这个节点是做什么的
Speech Stage 是 ComfyTV 的文本转语音 (TTS) 节点。在 main_prompt 里写要念出来的全文(旁白、对白、播报稿),选择 TTS workflow,点 ▶ 运行,得到COMFYTV_AUDIO 语音快照。
本 stage 是模型无关设计:界面只暴露大多数 TTS 引擎都通用的参数(文本、音色、语言、语速、可选参考音频)。各引擎特有选项放在侧栏 Custom Params 里,通过 preset JSON 绑定。
不要把 Speech Stage 当 Music Stage 用:这里没有「流派 / BPM tags」,main_prompt 就是朗读稿。
适用场景
- 短视频旁白、广告配音、角色对白。
- Storyboard 里写了 dialogue 字段,复制到 Speech Stage 批量出音。
- 为 Video Stage IA2V 提供口型驱动音轨(Speech audio → Video audio)。
- 声音克隆:接 reference_audio + reference_text(F5-TTS、GPT-SoVITS 等 workflow)。
工作原理(为什么 ComfyTV 这样设计)
- Stage 只跑
workflows/speech/子图。 - 快照:MP3/FLAC URL 写入项目;Video IA2V、Timeline 直接读快照。
- ComfyUI 原生没有 TTS(ACE-Step 只做音乐),Speech 依赖自定义节点(如 Kokoro)。
类型说明(COMFYTV_AUDIO vs ComfyUI 原生)
术语提示:COMFYTV_*是 ComfyTV 保存在项目里的结果引用;ComfyUI 原生的IMAGE/VIDEO/AUDIO是运行时才在内存里的数据,二者不能直接连线,需用 Bridge 转换。
如何转换:
- 原生 → ComfyTV:→ ComfyTV Audio
- ComfyTV → 原生:← ComfyTV Audio
Speech Stage vs Music Stage(必读)
界面与参数说明
workflow
workflows/speech/ 中的 TTS backend。
内置:Kokoro TTS(kokoro-tts.json)
- Kokoro-82M,ONNX + CPU,轻量快速,适合跑通整条链。
- 需安装自定义节点:
main_prompt(朗读稿)
要念出来的完整文本。可以多句、多段;不是音乐 tags。 示例:各位观众,欢迎收看今天的节目。接下来,我们将带您走进赛博朋克风格的未来都市。
voice(预设音色)
命名说话人 id,供 Kokoro、Bark、ElevenLabs 等预设音色模型使用。Kokoro 通过 预设默认af_sarah 等。
从 reference_audio 克隆时可留空(取决于 workflow 是否支持克隆)。
language(语言)
多语言 TTS 的语言名。Auto = 交给 workflow/模型默认(Kokoro 会回退 English)。 Kokoro 必须使用其支持的名称之一,例如English、Mandarin Chinese、Japanese、French 等——与下拉列表一致。
误区:选 Auto 时期望中文朗读,但 Kokoro 可能仍用 English——中文请显式选 Mandarin Chinese。
speed(语速)
1.0 为自然语速,范围 0.5–2.0。
reference_text(参考稿)
参考音频的文字稿;F5-TTS / GPT-SoVITS 克隆时通常必填。支持自动转写的引擎可留空。reference_audio(参考音频)
可选COMFYTV_AUDIO,用于声音克隆。接 Music/Speech 上游或 Load Audio from Asset。预设方案里用 upstream_audio:value 绑定到克隆节点。
Kokoro 不支持克隆,这两项对 Kokoro workflow 无效。
自定义参数(custom_params)
侧栏绑定引擎特有参数(如 Kokoro 以外的 seed、speaker embedding 等)。输出说明
新手一步一步
- 安装 Kokoro 节点(见上),放 Project + Speech Stage。
- workflow → Kokoro TTS。
- main_prompt 输入一段中文旁白(2–3 句即可)。
- language →
Mandarin Chinese(中文朗读时勿用 Auto)。 - voice 可留空(用 预设默认),speed
1.0。 - 点 ▶ 运行,节点上播放语音预览。
- 需要对口型视频:接 Video Stage,选 IA2V,Speech audio → Video audio,人物图 → images。
完整教程(推荐阅读)
本页只说明这一个节点的参数与用法。端到端流程与多节点串联,请见 GitHub 上的 ComfyTV 用户指南:
仓库与工作流
常见问题
Q:念出来是英文,但我写的是中文?A:Kokoro 下 language 选
Mandarin Chinese,不要依赖 Auto。
Q:和 Music Stage 选哪个?A:念稿 → Speech;做 BGM 或歌曲 → Music Stage。 Q:Run 报错找不到 Kokoro?
A:安装
comfyui-kokoro 和 kokoro-onnx,重启 ComfyUI。
Q:reference_audio 没效果?A:Kokoro 不支持克隆;换 F5-TTS 等 workflow 并正确 预设方案绑定。
相关节点
- Music Stage (Audio Stage)——歌曲/器乐,不是 TTS。
- Video Stage (IA2V)——用 Speech 的 audio 驱动画面。
- Storyboard Stage——分镜里的 dialogue 可抄到 Speech main_prompt。
- Load Audio from Asset——挑选已有配音。
- Bridge → / ← ComfyTV Audio——原生互通。
- Project——项目上下文。