零样本声音克隆:给一段参考音频,用 Flow Matching 生成任意文本的同款嗓音
更新于 2026-08-04
← 返回汇总开源零样本 TTS 的新标杆
上海交大 X-LANCE 实验室 2024 年 10 月开源的 TTS 系统。用 Diffusion Transformer + Flow Matching 训练,无需微调即可克隆任意说话人音色(只需几秒参考音频)。中英双语,质量接近商用产品(ElevenLabs 级)。适合做语音助手、有声书、视频配音、多语言内容本地化的开发者和研究者。
VITS/Tacotron 需几小时目标人录音 + 微调,部署成本高。
ElevenLabs 按字符收费,数据上传云端,隐私与成本都成问题。
早期零样本 TTS 念长文本易崩、情感平淡、韵律机械。
从「文本 + 参考音频」到「合成语音」,F5-TTS 走的是端到端路线,无独立的时长预测/声学/声码器多阶段:
F5-TTS 的核心网络 = Diffusion Transformer 主干 + ConvNeXt V2 前处理,论文称这是它能「faster trained and inference」的关键。
关键技巧:参考音频的 Mel 直接作为条件,和目标文本一起喂给 DiT。网络在大规模双语数据(Emilia ZH-EN)上学会「读参考 Mel 提取音色 → 套用到新文本」。
# 简化伪代码:推理时的一次调用 from f5_tts import infer_process, load_model model = load_model("F5-TTS") # 预训练权重 # 给一段参考音频 + 它的文本 + 想要合成的新文本 audio = infer_process( ref_audio="sample.wav", # 3-10 秒目标嗓音 ref_text="这段话的转写", # 参考音频对应文本 gen_text="用这个嗓音念的任意新文本", model=model ) # → 输出:同款音色念 gen_text,无需任何微调
参考音频和文本的配对很关键:文本越准,音色/韵律还原越好。错误转写会导致韵律漂移。
| 部署模式 | 硬件 | RTF | 延迟 | 说明 |
|---|---|---|---|---|
| Client-Server | L20 GPU ×2 并发 | 0.0394 | 253ms | 生产可用,实时 |
| Offline TRT-LLM | L20 GPU | 0.0402 | — | TensorRT 加速,批处理 |
| Offline PyTorch | L20 GPU | 0.1467 | — | 原始未优化,3.7× 慢 |
RTF(Real-Time Factor)= 合成耗时 / 音频时长。RTF 0.04 意味着生成 1 秒音频只需 40ms,远超实时。TRT-LLM 部署把 PyTorch 原生速度提升 ~3.7 倍。
pip install f5-tts
# 启动 Gradio 网页
f5-tts_infer-gradio
最快,适合只想试用
git clone SWivid/F5-TTS cd F5-TTS pip install -e .
可微调自己的数据
docker run --gpus=all \ -p 7860:7860 \ ghcr.io/swivid/f5-tts
环境隔离,生产友好
支持 NVIDIA / AMD ROCm / Intel XPU / Apple Silicon 全平台。Apple Silicon 走 MPS,速度尚可但不及独显。
| 项目 | 路线 | 零样本 | 特点 |
|---|---|---|---|
| F5-TTS | Flow Matching + DiT | ✅ 强 | 质量/速度平衡佳,生态活跃 |
| GPT-SoVITS | AR + VITS | ✅ | 中文社区最大,少样本微调强 |
| XTTS-v2 (Coqui) | GPT + 扩散 | ✅ | 多语言(17 种),但 Coqui 已停摆 |
| CosyVoice (阿里) | LM + Flow Matching | ✅ | 同代竞品,中文情感控制强 |
| StyleTTS 2 | 扩散 + 对抗 | ⚠️ 弱 | 速度快但克隆需少量数据 |
| Parler-TTS | 文本条件扩散 | ❌ | 用文字描述音色,无需参考音频 |
Flow Matching 已成为生成模型新范式(Sora/语音/蛋白质都用它),F5-TTS 占据了开源 TTS 的技术制高点。v1 模型 + TRT-LLM 部署方案显示其向生产级演进。15k stars + 上交大背景,是中文开源 TTS 最值得跟踪的项目之一。若多语言和情感控制继续增强,有望成为开源界的 ElevenLabs。