NVIDIA发布NemotronLabs VoiceChat 11B 实现全双工对话与实时工具调用
•6 阅读•4分钟•前沿
NVIDIA全双工语音Nemotron工具调用VoiceChat 11B
•6 阅读•4分钟•前沿
关键亮点
- 全双工实时对话:模型在一次通话中同时完成听觉理解与语音生成,实现 448 ms 平滑换句,用户可在对方发声时随时插话。
- 实时工具调用:通过侧边通道输出脚本,支持在对话进行时调用外部 API,且配备“等待中”语句避免沉默。
- 开源与研究许可:权重与 NGC 容器均已公开,采用 permissive OpenMDW‑1.1 许可,但仅限研究用途。
- 硬件需求:单卡 80 GB 显存(A100、H100、RTX 6000 Pro、B200)即可部署,适配 x86_64 Linux 环境。
- 性能排行:在 VoiceBench 与 Full‑Duplex‑Bench 1.0 中分别位列开放模型第二,展现出竞争力的换句时延与工具选择准确率。
技术架构
NemotronLabs VoiceChat 11B 采用 Hybrid Mamba/Transformer 结构,由三大已有组件与一条新输出通道拼接而成:
- Fast Conformer 编码器(来自 Nemotron‑Speech‑Streaming‑En‑0.6b),持续捕获 16 kHz 音频流并生成音频 token。
- Nemotron Nano v2 LLM,接收音频 token 并预测文本 token,承担语言理解与决策。
- TTS 解码器与 Codec,将文本 token 转为 22.05 kHz 音频码,生成自然语音。
- 工具调用侧通道:在模型生成触发调用的文本时,同时输出脚本块,由外部系统执行并返回结果,期间模型播放预设的 “on‑hold” 语句。
训练数据约 55 万小时音频,覆盖真实语音与合成语料,基于 SALM‑Duplex 与 Audio Flamingo 3 构建,提升了跨轮次的连贯性与鲁棒性。
性能评估
- Full‑Duplex‑Bench 1.0:平滑换句时延 448 ms,换句成功率 (TOR) 0.82;用户中断换句 TOR 1.00(480 ms)。
- 工具调用基准:单工具调用成功率 58.5%,多工具 62.5%,并行调用最高 27.5%;但出现 89.6% 的无关输出,需要进一步过滤。
- 局限性:音频上下文上限约 2 分钟,连续多轮后易出现不可恢复的乱码;在工具调用期间用户无法中断,且一次会话最多支持 5 种工具。
适用场景与局限
| 场景 | 价值 | 注意点 |
|---|---|---|
| 客服中心 | 实时接听与信息查询,降低人工成本 | 需自行部署 GPU,且对工具调用的可靠性进行监控 |
| 车载语音助理 | 驾驶中可打断对话,提升安全性 | 对车载硬件算力要求较高 |
| 零售点餐 / 驾驶舱 | 支持点餐、查询订单等即时服务 | 受限于工具并发能力 |
| 游戏 NPC 对话 | 角色可随时插话,提升沉浸感 | 需自行实现脚本库与安全过滤 |
业界影响
NemotronLabs VoiceChat 11B 首次在开放模型中实现 全双工 + 工具调用,打破了传统 ASR‑LLM‑TTS 串联架构的瓶颈,为低时延语音交互提供了新范式。虽然仍处于研究阶段,且缺少托管 API,但其开源姿态为创业公司、科研团队以及高校提供了可直接实验的基线,预计将在语音客服、车载系统以及交互式游戏等细分领域催生新一轮创新。未来若 NVIDIA 能推出托管服务或进一步优化工具并发,将有望加速全双工语音 AI 的商业化落地。
本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。