项目详情

VibeVoice

微软开源的前沿语音 AI 模型族:60 分钟长音频一次过

GitHub 地址 MIT Python ICLR 2026 Oral

更新于 2026-07-24

← 返回汇总
项目速览

一句话定位

超低帧率语音 tokenizer + next-token diffusion,长音频一把梭

微软开源的前沿语音 AI 模型族,涵盖 ASR(语音转文字)与 TTS(文字转语音)。核心创新是连续语音 tokenizer(声学+语义),在 7.5 Hz 超低帧率下高效保真。采用 next-token diffusion 框架——LLM 理解文本上下文与对话流,扩散头生成高保真声学细节。

项目速览

核心数据

51k
GitHub Stars
60
分钟单次处理
50+
支持语言
7.5
Hz 帧率

TTS 论文获 ICLR 2026 Oral · ASR 已集成进 Transformers 与 Azure AI Foundry

模型族全景

四个模型,覆盖双向

模型任务参数亮点
VibeVoice-ASR-7B语音转文字7B60 分钟单次处理 · 说话人分离 · 热词
VibeVoice-ASR-BitNet语音转文字(CPU)—异构量化 I8_S+I2_S,4.62GB→1.58GB,实时推理
VibeVoice-TTS-1.5B文字转语音1.5B90 分钟长生成 · 4 说话人 · 已下架
VibeVoice-Realtime-0.5B实时流式 TTS0.5B~300ms 首音延迟 · 流式文本输入
核心创新

7.5Hz 超低帧率 tokenizer

为什么帧率关键

传统语音模型帧率动辄 50-100Hz,长音频 token 数爆炸,算力与显存翻倍。VibeVoice 把帧率压到 7.5Hz——每秒仅 7.5 个 token。

双 tokenizer 设计

声学 tokenizer保音频保真度,语义 tokenizer抓语义。两者协同在超低帧率下既不丢信息又大幅降低计算量,为 60 分钟长上下文铺路。

核心创新

Next-token Diffusion 框架

文本/对话输入→ LLM 理解上下文→ 扩散头生成声学→ 高保真语音
ASR 深度

长音频三大杀器

60 分钟单次过

常规 ASR 切短块丢全局上下文。VibeVoice ASR 在 64K token 内吃下 60 分钟连续音频,全程说话人追踪与语义连贯一致。

结构化输出

联合完成 ASR + 说话人分离 + 时间戳,输出 Who(谁)/ When(何时)/ What(说了啥)结构化转录。

自定义热词

用户喂入专有名词、技术术语、背景信息,引导识别,显著提升领域内容的准确率。

ASR 深度

边缘部署:BitNet CPU 引擎

2026-07 发布 VibeVoice-ASR-BitNet,通过异构量化把模型塞进纯 CPU 实时推理。

4.62→1.58
GB 压缩(I8_S+I2_S)
RTF<1
实时推理(CPU)
VibeASR.cpp
独立推理引擎
TTS 深度

长生成 + 多说话人

90 分钟单次生成

单次合成最长 90 分钟对话/单人语音,全程说话人一致、语义连贯。

最多 4 个说话人

单段对话支持 4 个不同说话人,自然轮次切换,跨长对话保持一致性。中英等多语言。

⚠ 注:TTS 代码因发现被滥用,微软已于 2025-09 从仓库移除,当前仓库聚焦 ASR 与 Realtime。

生态集成

已接入主流平台

快速上手

Transformers 直接调用 ASR

# ASR 已进 Transformers(2026-03 起)
from transformers import AutoModelForCausalLM, AutoProcessor

model = AutoModelForCausalLM.from_pretrained("microsoft/VibeVoice-ASR")
processor = AutoProcessor.from_pretrained("microsoft/VibeVoice-ASR")

# 输入最长 60 分钟音频 → 输出 Who/When/What 结构化转录
# 支持自定义热词、50+ 语言

Realtime TTS 可在 Colab 直接跑 · CPU 边缘部署用 VibeASR.cpp

适用场景

适合谁用

风险提示

需要警惕

潜力评估

未来空间

7.5Hz tokenizer + next-token diffusion 是语音建模范式突破。ASR 已进 Transformers 主线,BitNet 让边缘落地可行。51k stars 证明社区认可。随长音频/多语言需求增长,是开源语音 AI 第一梯队。


上一个
Speech To Speech
下一个
Project AIRI
1 / 15