开源 AI 语音工作室——克隆任意声音,听写进任意应用,给 Agent 装上你拥有的声音
更新于 2026-08-10
← 返回汇总ElevenLabs + WisprFlow 的开源替代,一台本地应用全搞定
两个云厂商各占语音 I/O 循环的一半——ElevenLabs 管输出、WisprFlow 管输入。Voicebox 两个都做,用内置本地 LLM 做润色与人格,整条语音栈跑在本机:模型、声音数据、采集内容永不离机。
零样本克隆(几秒参考音频)+ 50+ 预设声(Kokoro/Qwen CustomVoice);8 种后期效果(Spotify pedalboard);词级时间戳字幕;多轨 Stories 编辑器;全局听写热键;REST API + 内置 MCP server。
高质量 TTS 但托管在云上——声音克隆、输入采集、人格化全被厂商锁死,隐私外流
系统级听写,但没有 TTS 输出能力,采集数据在云端处理
两条链路无法闭环:没人能把「我克隆的声音」接进 Agent,也没人把「听写→TTS」串成一个本地循环
声音是生物特征,云端处理意味着你的声音与录音永久留在第三方
| 引擎 | 语言 | 特点 |
|---|---|---|
| Qwen3-TTS (0.6B/1.7B) | 10 | 高质量多语克隆,指令式发音("说慢点""小声") |
| Qwen CustomVoice | 10 | 9 个预设声,自然语言控制,无需参考音频 |
| LuxTTS | 英语 | 轻量(~1GB 显存),48kHz 输出,CPU 150x 实时 |
| Chatterbox Multilingual | 23 | 最广语言覆盖(阿拉伯/芬兰/希腊/印地/斯瓦希里…) |
| Chatterbox Turbo | 英语 | 快,350M,支持 [laugh]/[sigh] 副语言情感标签 |
| HumeAI TADA (1B/3B) | 10 | 700s+ 连贯音频,文本-声学双对齐 |
| Kokoro | 8 | 50 个精选预设声,82M 超小模型,CPU 快 |
多引擎按次切换;加新引擎有 step-by-step 指南 + 专用 agent skill 可自主集成。
任意应用按住热键说话松手——macOS 通过辅助功能把转写直接注入聚焦输入框,剪贴板原子保存/恢复。可选 LLM 清理口头语。
一次工具调用 voicebox.speak,任意 MCP 感知 Agent 用你克隆的声音说话;每 Agent 可绑不同声音,说话时浮窗显示状态
给声音档案挂人格描述,内置 Qwen3 LLM 本地重写——Compose 即兴台词、Speak in character 角色化改写,Agent 也可经 MCP 调用
# REST:生成 / 说话 / 转写 / 列表 curl -X POST http://127.0.0.1:17493/speak \ -H "Content-Type: application/json" \ -H "X-Voicebox-Client-Id: my-script" \ -d '{"text": "Deploy complete.", "profile": "Morgan"}' # Claude Code 一行接入 MCP claude mcp add voicebox --transport http \ --url http://127.0.0.1:17493/mcp \ --header "X-Voicebox-Client-Id: claude-code"
四个工具:speak / transcribe / list_captures / list_profiles。HTTP + stdio 双传输;每 Agent 声音绑定 + last_seen_at 确认安装。用 personality: true 走「文本 → 人格 LLM → TTS」流水线。
# 桌面端:官网下载 DMG/MSI(macOS/Windows)或 docker compose up # 开发环境 git clone https://github.com/jamiepine/voicebox.git cd voicebox just setup # Python venv + 全部依赖 just dev # 启动后端 + 桌面应用
仓库自带 .mcp.json,在 checkout 里跑 Claude Code 自动拾取 Voicebox MCP 工具。技术栈:Tauri (Rust) + React + Python FastAPI。
开发循环语音化:口述问题、听到克隆声的回答;每 Agent 绑定不同声音
多轨 Stories 编辑器做对话/播客/叙事,TTS 23 语言 + 效果链调音
用自己原来的声音(克隆)说话——README 点名的应用场景
人格化角色台词,Compose 即兴生成 + 角色化改写
声音是生物特征,全本地处理不离开机器
REST API 把语音 I/O 接进任意脚本/工作流
「输入+输出+人格」单应用闭环是正确的位置——云端厂商各占一半时,本地闭环既是隐私卖点也是差异化。若引擎矩阵持续扩展(Parakeet/Qwen3-ASR 路线图)+ MCP 生态(ACP/A2A)接通,可成为 Agent 语音 I/O 的默认本地层。
多引擎架构 + agent skill 自动集成,新 TTS 模型可低成本纳入
speak 工具已接 MCP,ACP/A2A 暴露后覆盖面扩大
Windows/Linux 自动粘贴路线图完成后,三端体验对齐
本地确定性规则模拟 Voicebox 的多引擎选择——按语言覆盖、质量、速度、显存、情感标签、克隆需求六维需求,从 7 个真实引擎里推荐最佳匹配,附引擎实力卡片与一句话理由。零 LLM、零网络。
语言/质量/速度/显存/情感标签/克隆,即点即出
7 引擎按 README 数据排序打分,理由透明
[laugh] 只有 Chatterbox Turbo 认——不踩 README 明示的坑