PolyAI发布Dialog‑RSN‑1 实现音频原生对话并达至亚秒级响应

4 阅读3分钟前沿

背景与意义

随着语音交互在客服、金融和医疗等行业的渗透,传统的“识别‑转写‑生成”三段式流水线已暴露出时延高、语调信息丢失等痛点。PolyAI 通过推出 Dialog‑RSN‑1,尝试将整条通话链路压缩至单一音频原生模型,旨在兼顾实时性与可控性,为大规模呼叫中心提供更灵活的 AI 助手。

技术亮点

  • 音频原生输入:模型直接接受原始通话波形,仅在输入侧感知音频,避免了传统 ASR 预处理导致的语气、停顿信息丢失。
  • 转接决策内置:模型首个输出标记为 EMPTYONGOINGCOMPLETE,实时判断是否继续聆听或开始回复,实现自然的轮转控制。
  • 功能调用融合:在生成回复的同时,模型可触发函数调用(如查询订单、开通服务),实现端到端的业务处理。
  • 可控 TTS:文本到语音(TTS)模块保持独立,输出语音可通过外部声线库自由切换,满足品牌化需求。
  • 请求式推理:不同于全双工常驻流,Dialog‑RSN‑1 采用按需调用方式,仅在 VAD 检测到说话且转接信号确定后才激活 GPU,显著降低算力占用。

性能与部署案例

PolyAI 在公开基准 Dialog‑Eval 上对多家行业客户进行评测,取得以下关键指标:

  • 响应时延:在 A100 GPU 上实现 <300ms 的端到端响应,比传统 Cascaded 流方案快约 37%。
  • 业务成功率:在一家餐饮连锁的预订场景中,完成率提升 11%;在保险理赔呼叫中,整体时延下降 37%
  • 语言覆盖:首发仅支持英语,后续计划以 Raven 3.5 为后备方案支撑多语言。

这些数据表明,Dialog‑RSN‑1 已在超过 2,000 条实时通话(涵盖餐饮、保险、金融、医疗、酒店、零售、通信、旅行和公用事业等)中实现稳健部署。

市场定位与前景

PolyAI 在 2025 年底完成 8600 万美元 的 D 轮融资,累计服务 100+ 家大型企业,拥有 2,000+ 条活跃部署。Dialog‑RSN‑1 目前仅面向其平台客户开放,未提供公开权重或公共 API,体现出公司对企业级安全与算力成本的严格把控。

从行业视角看,音频原生大模型将成为呼叫中心 AI 的下一个竞争高地:既能保留通话细粒度信息,又能在保持品牌化声线的前提下实现函数化业务处理。随着算力成本下降和更高效的缓存预填技术成熟,预计未来会有更多厂商推出类似的 请求式音频模型,从而推动整个语音 AI 生态向低时延、可控化方向演进。

结语

Dialog‑RSN‑1 的发布标志着从“文字‑先行”向“声音‑原生”转型的关键一步。PolyAI 通过技术创新与企业级落地的双轮驱动,为行业提供了可复制的实时语音对话方案,也为后续的多语言、多模态扩展奠定了坚实基础。未来,随着更多数据与模型的开放,音频原生大模型有望在更广泛的消费场景中发挥作用。

本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。