微软开源的前沿语音 AI 模型族:60 分钟长音频一次过
更新于 2026-07-24
← 返回汇总超低帧率语音 tokenizer + next-token diffusion,长音频一把梭
微软开源的前沿语音 AI 模型族,涵盖 ASR(语音转文字)与 TTS(文字转语音)。核心创新是连续语音 tokenizer(声学+语义),在 7.5 Hz 超低帧率下高效保真。采用 next-token diffusion 框架——LLM 理解文本上下文与对话流,扩散头生成高保真声学细节。
TTS 论文获 ICLR 2026 Oral · ASR 已集成进 Transformers 与 Azure AI Foundry
| 模型 | 任务 | 参数 | 亮点 |
|---|---|---|---|
VibeVoice-ASR-7B | 语音转文字 | 7B | 60 分钟单次处理 · 说话人分离 · 热词 |
VibeVoice-ASR-BitNet | 语音转文字(CPU) | — | 异构量化 I8_S+I2_S,4.62GB→1.58GB,实时推理 |
VibeVoice-TTS-1.5B | 文字转语音 | 1.5B | 90 分钟长生成 · 4 说话人 · 已下架 |
VibeVoice-Realtime-0.5B | 实时流式 TTS | 0.5B | ~300ms 首音延迟 · 流式文本输入 |
传统语音模型帧率动辄 50-100Hz,长音频 token 数爆炸,算力与显存翻倍。VibeVoice 把帧率压到 7.5Hz——每秒仅 7.5 个 token。
声学 tokenizer保音频保真度,语义 tokenizer抓语义。两者协同在超低帧率下既不丢信息又大幅降低计算量,为 60 分钟长上下文铺路。
常规 ASR 切短块丢全局上下文。VibeVoice ASR 在 64K token 内吃下 60 分钟连续音频,全程说话人追踪与语义连贯一致。
联合完成 ASR + 说话人分离 + 时间戳,输出 Who(谁)/ When(何时)/ What(说了啥)结构化转录。
用户喂入专有名词、技术术语、背景信息,引导识别,显著提升领域内容的准确率。
2026-07 发布 VibeVoice-ASR-BitNet,通过异构量化把模型塞进纯 CPU 实时推理。
单次合成最长 90 分钟对话/单人语音,全程说话人一致、语义连贯。
单段对话支持 4 个不同说话人,自然轮次切换,跨长对话保持一致性。中英等多语言。
⚠ 注:TTS 代码因发现被滥用,微软已于 2025-09 从仓库移除,当前仓库聚焦 ASR 与 Realtime。
transformers 调用vllm-asr 文档finetuning-asr/ 可自定义训练# ASR 已进 Transformers(2026-03 起) from transformers import AutoModelForCausalLM, AutoProcessor model = AutoModelForCausalLM.from_pretrained("microsoft/VibeVoice-ASR") processor = AutoProcessor.from_pretrained("microsoft/VibeVoice-ASR") # 输入最长 60 分钟音频 → 输出 Who/When/What 结构化转录 # 支持自定义热词、50+ 语言
Realtime TTS 可在 Colab 直接跑 · CPU 边缘部署用 VibeASR.cpp
7.5Hz tokenizer + next-token diffusion 是语音建模范式突破。ASR 已进 Transformers 主线,BitNet 让边缘落地可行。51k stars 证明社区认可。随长音频/多语言需求增长,是开源语音 AI 第一梯队。