NVIDIA发布NemotronLabs VoiceChat 11B 实现全双工对话与实时工具调用

6 阅读4分钟前沿

关键亮点

  • 全双工实时对话:模型在一次通话中同时完成听觉理解与语音生成,实现 448 ms 平滑换句,用户可在对方发声时随时插话。
  • 实时工具调用:通过侧边通道输出脚本,支持在对话进行时调用外部 API,且配备“等待中”语句避免沉默。
  • 开源与研究许可:权重与 NGC 容器均已公开,采用 permissive OpenMDW‑1.1 许可,但仅限研究用途。
  • 硬件需求:单卡 80 GB 显存(A100、H100、RTX 6000 Pro、B200)即可部署,适配 x86_64 Linux 环境。
  • 性能排行:在 VoiceBench 与 Full‑Duplex‑Bench 1.0 中分别位列开放模型第二,展现出竞争力的换句时延与工具选择准确率。

技术架构

NemotronLabs VoiceChat 11B 采用 Hybrid Mamba/Transformer 结构,由三大已有组件与一条新输出通道拼接而成:

  1. Fast Conformer 编码器(来自 Nemotron‑Speech‑Streaming‑En‑0.6b),持续捕获 16 kHz 音频流并生成音频 token。
  2. Nemotron Nano v2 LLM,接收音频 token 并预测文本 token,承担语言理解与决策。
  3. TTS 解码器与 Codec,将文本 token 转为 22.05 kHz 音频码,生成自然语音。
  4. 工具调用侧通道:在模型生成触发调用的文本时,同时输出脚本块,由外部系统执行并返回结果,期间模型播放预设的 “on‑hold” 语句。

训练数据约 55 万小时音频,覆盖真实语音与合成语料,基于 SALM‑Duplex 与 Audio Flamingo 3 构建,提升了跨轮次的连贯性与鲁棒性。

性能评估

  • Full‑Duplex‑Bench 1.0:平滑换句时延 448 ms,换句成功率 (TOR) 0.82;用户中断换句 TOR 1.00(480 ms)。
  • 工具调用基准:单工具调用成功率 58.5%,多工具 62.5%,并行调用最高 27.5%;但出现 89.6% 的无关输出,需要进一步过滤。
  • 局限性:音频上下文上限约 2 分钟,连续多轮后易出现不可恢复的乱码;在工具调用期间用户无法中断,且一次会话最多支持 5 种工具。

适用场景与局限

场景价值注意点
客服中心实时接听与信息查询,降低人工成本需自行部署 GPU,且对工具调用的可靠性进行监控
车载语音助理驾驶中可打断对话,提升安全性对车载硬件算力要求较高
零售点餐 / 驾驶舱支持点餐、查询订单等即时服务受限于工具并发能力
游戏 NPC 对话角色可随时插话,提升沉浸感需自行实现脚本库与安全过滤

业界影响

NemotronLabs VoiceChat 11B 首次在开放模型中实现 全双工 + 工具调用,打破了传统 ASR‑LLM‑TTS 串联架构的瓶颈,为低时延语音交互提供了新范式。虽然仍处于研究阶段,且缺少托管 API,但其开源姿态为创业公司、科研团队以及高校提供了可直接实验的基线,预计将在语音客服、车载系统以及交互式游戏等细分领域催生新一轮创新。未来若 NVIDIA 能推出托管服务或进一步优化工具并发,将有望加速全双工语音 AI 的商业化落地。

本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。