VibeVoice LogoVibeVoice

免费在线体验 • 无需登录

VibeVoice AI:将文本转换为 90 分钟多讲者播客

VibeVoice AI 是微软的开源长篇多讲者文本转语音框架。生成数小时的自然对话,支持最多四个讲者,英文或中文,完全本地控制。

聆听 VibeVoice AI 的实际效果

🎭

上下文感知表达

自发情感与歌唱

自然情感反应和自发的歌唱融合

🎙️

多讲者播客

3-4人对话

专业播客风格的讨论,带有背景音乐

🌐

跨语言语音

英语 ↔ 中文

在单个对话中无缝切换语言

长篇对话

45-90分钟会话

持续对话,保持讲者身份一致性

🔄

自然轮流发言

对话流程

真实的停顿、打断和对话节奏

🎵

表达性韵律

情感细节

丰富的韵律模式和上下文表达

🔴

实时音频示例

来自微软研究演示的真实VibeVoice输出

🎭自发情感与歌唱

Spontaneous Argument Scene

Natural emotional escalation between two speakers with realistic dialogue dynamics

00:00.000
00:00.000

📝Transcript

No transcript available

"See You Again" - Spontaneous Singing

Conversation naturally flowing into singing, showcasing VibeVoice's musical capabilities

00:00.000
00:00.000

📝Transcript

No transcript available

🌐跨语言示例

Chinese to English Transition

Seamless language switching demonstrating VibeVoice's bilingual capabilities

00:00.000
00:00.000

📝Transcript

No transcript available

所有音频示例都在消费级GPU上生成,完全未经编辑。
从生成音频中提取的时间戳和转录可能包含细微错误。

VibeVoice AI 核心功能

探索是什么让 VibeVoice AI 成为最先进的长篇内容开源 TTS 框架

长篇对话式合成

在 64K token 上下文中生成最长 90 分钟的连续音频。在长时间跨度内保持连贯的对话流程和自然的轮流发言,非常适合播客和有声书。
🎭

多讲者对话支持

原生支持在一次对话中最多4个不同的讲者。角色标识符确保在整个过程中保持一致的音色和讲者特有的特征。
🧠

下一token扩散框架

统一的方法,大语言模型预测隐藏状态,扩散头将其精炼为声学特征。提高语音真实性和长篇稳定性。
🗜️

超低帧率分词器

革命性的7.5 Hz语音分词k器可将音频压缩高达3200倍。在保持感知保真度的同时大幅降低计算成本。
🔀

混合音频表示

并行的声学和语义分词器平衡音色保持与语言意义。σ-VAE用于韵律,ASR目标用于内容准确性。
🎯

压缩后仍保持卓越质量

在PESQ、STOI和UTMOS基准测试中取得最高分数。在保持自然音色和清晰度的同时,超越Encodec、DAC和其他基线。
🏆

业界领先性能

在真实感和丰富性方面,人类评估分数高于 ElevenLabs v3 Alpha 和 Google Gemini 2.5 Pro。在英文和中文中证明了可靠性。
📏

灵活的长度适应

针对长篇优化但也能很好地泛化到短发言。在所有内容长度下都具有低词错率和高讲者相似性。
⚖️

可扩展的模型变体

VibeVoice-1.5B注重效率(90分钟),VibeVoice-7B注重质量(45分钟)。选择性能和资源使用之间的完美平衡。
🔓

开源且适合研究

MIT许可,在GitHub和Hugging Face上提供预训练权重。完全本地控制,广泛的文档和以研究为导向的设计。

VibeVoice AI 工作原理

使 VibeVoice AI 90 分钟多讲者合成成为可能的下一token扩散管道

文本分词器LLM扩散解码器音频

使用超压缩语音token的下一token扩散管道

1
📝

输入准备

多讲者脚本处理

用户提供带有讲者角色标识符(讲者A、讲者B)和可选声音提示的文本脚本。系统在整个长对话中保持一致的声音特征。

基于角色的讲者识别 • 声音提示条件化 • 长上下文准备

2
🔀

混合表示编码

双分词q器架构

两个并行的分词器协同工作:声学分词器将音频压缩到7.5 Hz(捕获音色和韵律),而语义分词器学习与文本含义一致的内容级特征。

σ-VAE 声学分词器 • ASR 训练的语义分词器 • 3200倍压缩比

3
🧠

使用LLM进行上下文建模

Qwen2.5 语言理解

大语言模型(1.5B 或 7B 参数)解释对话流程,预测隐藏状态,并确保在长达 90 分钟的语音生成中保持连贯性。

64K token上下文窗口 • 多说话人对话建模 • 长篇叙事连贯性

4
🌊

Token级扩散精炼

下一token扩散过程

对于每个序列步骤,扩散头使用无分类器引导和 DPM-Solver++ 等快速采样器,迭代地将高斯噪音精炼为清洁的声学特征。

无分类器引导 • DPM-Solver++采样 • 逐token精炼

5
🎵

解码为波形

高质量音频重建

预测的声学特征通过解码器,重建具有自然声音的波形音频,带有流畅的多讲者对话流程,没有拼接伪像。

神经声码器重建 • 连续波形生成 • 多讲者声音一致性

6
🎧

质量保证

超越基准的输出

最终音频在PESQ、STOI和UTMOS指标上取得顶级分数,同时在整个生成过程中保持自然韵律、讲者一致性和对话流程。

PESQ/STOI/UTMOS优化 • 讲者相似性保持 • 韵律自然性

💡

VibeVoice 关键创新:下一Token扩散

与将文本和音频建模分离的传统TTS不同,VibeVoice使用统一的下一token扩散方法。这使其能够扩展到长对话、多讲者和双语输出,同时由于超压缩token(7.5 Hz对比典型的40-50 Hz)而保持高效。

VibeVoice AI 真实世界应用

探索 VibeVoice AI 如何改变各行业的内容创作

🎙️

播客原型化

内容创作

创作者可以快速将书面脚本转换为90分钟的多讲者播客草稿,无需预订录音室或雇佣配音演员。非常适合在最终制作之前试验节目格式、对话节奏和嘉宾互动。

主要优势

快速原型经济高效的测试格式实验

草稿节目 • 测试对话流程 • 实验讲者动态

📚

有声书朗读

出版

作者和出版商可以为每个故事生成最多四种不同声音的多角色有声书录音。与传统的单人朗读不同,每个角色在整本书中都拥有自己一致的声音。

主要优势

多角色声音一致性朗读成本降低

角色对话 • 故事朗读 • 跨章节声音一致性

🎓

教育内容与培训

教育

教师和课程设计师可以将文本课程转化为教授和学生之间引人入胜的口语对话。使电子学习材料更加生动和易于获取,特别对听觉学习者有益。

主要优势

互动学习听觉无障碍引人入胜的内容

讲座对话 • 问答环节 • 互动学习场景

🌏

语言学习与双语内容

教育

凭借原生的英文和中文支持,为语言练习、听力理解和沉浸式学习创建双语对话。直接从文本脚本生成教师和学生之间的角色扮演对话。

主要优势

双语支持沉浸式练习自然发音

语言练习 • 听力理解 • 文化对话交流

🎮

游戏开发与互动故事

娱乐

游戏设计师在早期叙事设计阶段可以快速原型化多个角色之间的游戏对话。无需专业配音演员即可测试节奏、语调和情感传达,加速创作过程。

主要优势

快速原型叙事测试角色开发

角色对话 • 叙事节奏 • 情感语调测试

可访问性与辅助技术

可访问性

将长文档、文章或报告转换为自然的对话式音频。使内容更容易被视觉障碍用户或任何喜欢听而不是阅读长篇材料的人所消费。

主要优势

视觉无障碍音频偏好内容消费

文档转换 • 文章朗读 • 报告无障碍

⚠️

VibeVoice 研究优先,负责任使用

VibeVoice主要用于研究和创意实验。虽然技术上MIT许可,但我们建议仅用于非商业原型化、学术研究和明确披露的AI生成内容。

研究与原型化
创意实验
必须披露AI生成内容

VibeVoice AI 限制:了解边界

了解 VibeVoice AI 当前的限制有助于设定合适的期望

🌍

语言范围

medium 影响

VibeVoice目前针对英文和中文进行了优化。虽然它可能产生其他语言的输出,但结果可能不稳定或难以理解。跨语言泛化显示出希望,但仍属实验性。

影响

非英文/中文应用应被视为实验性

以英中语训练为主 • 多语言数据有限 • 跨语言转移属实验性

🗣️

重叠语音

high 影响

系统不支持同时发言者。所有对话都假设轮流发言,这在辩论、小组讨论或经常有打断的自然群体对话中限制了真实性。

影响

无法模拟带有打断的真实多方对话

仅支持顺序生成 • 无同时语音建模 • 轮流式架构

🎵

背景声音与非语音音频

medium 影响

专门设计用于语音合成,不包含背景噪音、音乐或音效。偶尔可能出现微弱的“背景音乐”等伪像,这是由于训练数据导致的不可控噪音,而非功能特性。

影响

无法为生成的音频添加氛围或音景

仅语音训练 • 不可控背景伪像 • 无环境音频建模

计算成本

high 影响

尽管超低速率分词q器非常高效,但长篇幅合成仍然需要大量计算。生成数十分钟的内容需要强大的GPU(7-24GB显存)和大量运行时间,使实时部署不现实。

影响

实用需要高端硬件

需要7-24GB显存 • 非实时生成 • GPU密集型处理

⚠️

滥用风险

critical 影响

如同所有高质量的语音合成技术,VibeVoice 可能被用于深度伪造、身份冒充、欺骗或虚假信息。研究团队明确警告不要将其用于欺骗性或有害应用,并要求披露AI生成的内容。

影响

存在有害滥用的潜在风险,需要负责任的部署

高保真合成 • 身份欺骗风险 • 需要道德保障

🔬

仅限研究的建议

critical 影响

官方指导强调仅用于研发,不直接用于商业部署。在用于语音助手或商业有声书等生产应用之前,需要进一步的测试、保障措施和开发。

影响

在没有额外保障措施的情况下,尚未准备好商业生产

研究阶段技术 • 需要安全测试 • 需要生产强化

🔧VibeVoice 额外技术考量

由于训练数据分布,男性声音可能比女性声音听起来更加机械化
歌唱和音乐性较弱,因为没有明确训练
长输出需要更长的生成时间;流式传输功能正在开发中
与专门的单讲者模型相比,韵律和情感控制有限
🚨

VibeVoice 负责任使用免责声明

该技术仅供研究用途。用户必须披露AI生成的内容,避免欺骗性应用,并实施适当的安全措施。商业部署需要额外的测试、安全措施和道德审查。创作者对滥用不负责任。

自己运行 VibeVoice AI

VibeVoice AI 硬件指导和快速命令

VibeVoice 硬件要求
  • 1.5B → ~7–10GB VRAM (≈90 min)
  • Large → ~18–24GB VRAM (≈45 min, more natural voices)
VibeVoice 设置
docker run --gpus all --rm -it nvcr.io/nvidia/pytorch:24.07-py3
git clone https://github.com/microsoft/VibeVoice.git
cd VibeVoice && pip install -e .
python demo/gradio_demo.py --model_path microsoft/VibeVoice-1.5B --share

模型:VibeVoice-1.5B、VibeVoice-Large(Hugging Face)

VibeVoice 路线图
  • 流式 0.5B 低延迟变体
  • 改善的多语言稳定性
  • 情感与韵律控制
  • VibePod 端到端播客工具
  • 安全性、水印、负责任使用指南

VibeVoice AI 常见问题解答

有效使用 VibeVoice AI 所需了解的一切

🎯
功能特性

VibeVoice 能生成多长的语音?

1.5B 模型支持最长 90 分钟的连续音频,而 7B 模型支持大约 45 分钟,具有更高的自然性和更丰富的韵律。两者都在整个生成过程中保持连贯的对话。
👥
功能特性

一个音频中可以包含多少个讲者?

VibeVoice原生支持最多四个不同的讲者。每个讲者可以分配文本脚本和可选声音提示,以在整个对话中保持一致的音色和角色身份。
🌍
语言

VibeVoice支持哪些语言?

VibeVoice主要针对英文和中文进行训练,在这些语言中提供最佳质量。其他语言可能产生不稳定或难以理解的输出,因为跨语言能力仍属实验性。
🎵
技术

VibeVoice会生成背景音乐或音效吗?

不会。VibeVoice严格来说是一个语音合成系统。偶尔可能会出现由于训练数据导致的微弱类似音乐的伪像,但这些不是可控制的功能,应该被视为非预期的噪音。
💻
硬件

VibeVoice能在消费级硬件上运行吗?

可以,但要求取决于模型大小: • 1.5B 模型:约7-10GB显存(RTX 3060/3070) • 7B 模型:约18-24GB显存(RTX 3090/4090) 生成速度比商业服务慢,特别是对于长音频。
💼
使用

我可以在商业项目中使用VibeVoice吗?

VibeVoice使用MIT许可证,技术上是宽松的。然而,研究团队明确建议仅用于研发,因为存在滥用风险。商业部署应包含强有力的保障措施和披露做法。
🗣️
技术

VibeVoice支持重叠语音吗?

目前不支持。所有生成的对话都假设讲者按顺序轮流发言。在当前架构中,没有建模如打断或同时群体对话等重叠对话。
⚖️
对比

VibeVoice 与 ElevenLabs 或 Google TTS 相比如何?

VibeVoice是开源的,本地运行,专门针对长篇多讲者内容。商业服务提供更一致的质量、实时速度和更广泛的语言支持,但是闭源且基于订阅。
🎶
问题排除

为什么有时会出现背景音乐?

模型可以重现其数据集中的训练伪像。背景音乐是一个已知但不可控制的伪像,偶尔会出现。这不是一个功能,无法控制或消除。
🏃
问题排除

为什么中文有时听起来急促或不稳定?

中文生成可以通过使用英文标点符号来改善节奏,或切换到具有更好韵律控制和跨语言稳定性的7B大模型来改善。
⏱️
性能

音频生成需要多长时间?

在 12GB 消费级 GPU 上,生成几分钟的音频可能需要几分钟的处理时间。由于计算复杂性,非常长的输出(30+分钟)需要成比例地更长的处理时间。
🎧
质量

如何提高生成音频的质量?

为获得最佳结果:使用清晰、标点符号完善的脚本;一致地指定讲者角色;使用 7B 模型以获得更高质量;确保充足的显存。英文内容通常比其他语言产生更稳定的结果。

VibeVoice 快速参考

模型对比

1.5B: 90 min, 7-10GB
7B: 45 min, 18-24GB

支持的语言

✅ 英语(原生支持)
✅ 中文(原生支持)
⚠️ 其他语言(实验性)

主要特性

最多4个讲者
长篇上下文
开源 (MIT)

最适合

研究与原型化
多讲者内容
本地部署
由微软研究院构建 • 开源 (MIT)。生成的声音可能不总是真实的或适合模仿。请务必披露AI生成的内容。