项目详情

Voicebox

开源 AI 语音工作室——克隆任意声音,听写进任意应用,给 Agent 装上你拥有的声音

GitHub 地址 MIT Tauri (Rust)Local-FirstMCP

更新于 2026-08-10

← 返回汇总
项目速览

一句话定位

ElevenLabs + WisprFlow 的开源替代,一台本地应用全搞定

两个云厂商各占语音 I/O 循环的一半——ElevenLabs 管输出、WisprFlow 管输入。Voicebox 两个都做,用内置本地 LLM 做润色与人格,整条语音栈跑在本机:模型、声音数据、采集内容永不离机。

项目速览

核心数据

7
TTS 引擎
23
语言
50+
预设声音
4
MCP 工具

零样本克隆(几秒参考音频)+ 50+ 预设声(Kokoro/Qwen CustomVoice);8 种后期效果(Spotify pedalboard);词级时间戳字幕;多轨 Stories 编辑器;全局听写热键;REST API + 内置 MCP server。

为什么存在

语音 I/O 循环的断裂

ElevenLabs:只做输出

高质量 TTS 但托管在云上——声音克隆、输入采集、人格化全被厂商锁死,隐私外流

WisprFlow:只做输入

系统级听写,但没有 TTS 输出能力,采集数据在云端处理

中间断层

两条链路无法闭环:没人能把「我克隆的声音」接进 Agent,也没人把「听写→TTS」串成一个本地循环

隐私代价

声音是生物特征,云端处理意味着你的声音与录音永久留在第三方

核心能力

7 个 TTS 引擎矩阵

引擎语言特点
Qwen3-TTS (0.6B/1.7B)10高质量多语克隆,指令式发音("说慢点""小声")
Qwen CustomVoice109 个预设声,自然语言控制,无需参考音频
LuxTTS英语轻量(~1GB 显存),48kHz 输出,CPU 150x 实时
Chatterbox Multilingual23最广语言覆盖(阿拉伯/芬兰/希腊/印地/斯瓦希里…)
Chatterbox Turbo英语快,350M,支持 [laugh]/[sigh] 副语言情感标签
HumeAI TADA (1B/3B)10700s+ 连贯音频,文本-声学双对齐
Kokoro850 个精选预设声,82M 超小模型,CPU 快

多引擎按次切换;加新引擎有 step-by-step 指南 + 专用 agent skill 可自主集成。

闭环

语音输入 → 输出闭环

全局听写(输入)

任意应用按住热键说话松手——macOS 通过辅助功能把转写直接注入聚焦输入框,剪贴板原子保存/恢复。可选 LLM 清理口头语。

Agent 语音(输出)

一次工具调用 voicebox.speak,任意 MCP 感知 Agent 用你克隆的声音说话;每 Agent 可绑不同声音,说话时浮窗显示状态

语音人格(桥)

给声音档案挂人格描述,内置 Qwen3 LLM 本地重写——Compose 即兴台词、Speak in character 角色化改写,Agent 也可经 MCP 调用

工程细节

隐藏的实力

集成

API-First + MCP

# REST:生成 / 说话 / 转写 / 列表
curl -X POST http://127.0.0.1:17493/speak \
  -H "Content-Type: application/json" \
  -H "X-Voicebox-Client-Id: my-script" \
  -d '{"text": "Deploy complete.", "profile": "Morgan"}'

# Claude Code 一行接入 MCP
claude mcp add voicebox --transport http \
  --url http://127.0.0.1:17493/mcp \
  --header "X-Voicebox-Client-Id: claude-code"

四个工具:speak / transcribe / list_captures / list_profiles。HTTP + stdio 双传输;每 Agent 声音绑定 + last_seen_at 确认安装。用 personality: true 走「文本 → 人格 LLM → TTS」流水线。

快速上手

起步

# 桌面端:官网下载 DMG/MSI(macOS/Windows)或
docker compose up

# 开发环境
git clone https://github.com/jamiepine/voicebox.git
cd voicebox
just setup   # Python venv + 全部依赖
just dev     # 启动后端 + 桌面应用

仓库自带 .mcp.json,在 checkout 里跑 Claude Code 自动拾取 Voicebox MCP 工具。技术栈:Tauri (Rust) + React + Python FastAPI。

适用场景

谁适合用

Agent 开发者

开发循环语音化:口述问题、听到克隆声的回答;每 Agent 绑定不同声音

创作者 / 播客

多轨 Stories 编辑器做对话/播客/叙事,TTS 23 语言 + 效果链调音

语音障碍人群

用自己原来的声音(克隆)说话——README 点名的应用场景

游戏 / 交互角色

人格化角色台词,Compose 即兴生成 + 角色化改写

隐私敏感者

声音是生物特征,全本地处理不离开机器

内容自动化

REST API 把语音 I/O 接进任意脚本/工作流

风险提示

需要警惕

潜力评估

未来空间

「输入+输出+人格」单应用闭环是正确的位置——云端厂商各占一半时,本地闭环既是隐私卖点也是差异化。若引擎矩阵持续扩展(Parakeet/Qwen3-ASR 路线图)+ MCP 生态(ACP/A2A)接通,可成为 Agent 语音 I/O 的默认本地层。


引擎即插即用

多引擎架构 + agent skill 自动集成,新 TTS 模型可低成本纳入

MCP/ACP/A2A

speak 工具已接 MCP,ACP/A2A 暴露后覆盖面扩大

跨平台补齐

Windows/Linux 自动粘贴路线图完成后,三端体验对齐


上一个
AI Website Cloner
下一个
Penpot
在线体验

Playground:TTS 引擎推荐器

本地确定性规则模拟 Voicebox 的多引擎选择——按语言覆盖、质量、速度、显存、情感标签、克隆需求六维需求,从 7 个真实引擎里推荐最佳匹配,附引擎实力卡片与一句话理由。零 LLM、零网络。

🎙️ 打开 Playground
六维需求输入

语言/质量/速度/显存/情感标签/克隆,即点即出

引擎实力卡

7 引擎按 README 数据排序打分,理由透明

能力标签速查

[laugh] 只有 Chatterbox Turbo 认——不踩 README 明示的坑

1 / 15