热闻岛
返回全网热点

英伟达首款开源全双工语音模型VoiceChat 11B正式发布

2小时前0 阅读
英伟达首款开源全双工语音模型VoiceChat 11B正式发布配图
在实时人工智能语音交互赛道上,硬件与技术巨头英伟达(NVIDIA)迎来全新突破。公司近日正式推出了旗下 首款 开源端到端全双工语音对话模型NemotronLabs VoiceChat11B,标志着其在语音生成与理解的底层架构上迈出了重要一步。 与以往需要串联语音识别(ASR)、大语言模型(LLM)以及语音合成(TTS)的传统分步架构不同,该模型通过一个统一的

在实时人工智能语音交互赛道上,硬件与技术巨头英伟达(NVIDIA)迎来全新突破。公司近日正式推出了旗下 首款 开源端到端全双工语音对话模型NemotronLabs VoiceChat11B,标志着其在语音生成与理解的底层架构上迈出了重要一步。

与以往需要串联语音识别(ASR)、大语言模型(LLM)以及语音合成(TTS)的传统分步架构不同,该模型通过一个统一的网络直接完成流式语音理解与生成。这一技术路径不仅彻底消除了多模型编排带来的繁琐交接,还大幅压缩了响应延迟。实测数据显示,其平滑轮换延迟低至448毫秒,且具备边听边说的全双工交互能力。当用户在中途插话时,智能体能够迅速让出话语权,展现出 极高 的流畅度。

值得一提的是,作为首个在对话持续进行时支持工具调用的开源全双工模型,VoiceChat11B 创新性地引入了独立的输出通道与预置的“保持”话术机制。在处理复杂的外部 API 请求时,系统可以通过侧通道自动触发操作员定义的过渡台词,有效避免了等待期间可能出现的长时间静默,让语音智能体的工程化落地变得更加顺畅。

不过,从实际部署角度来看,该模型目前仍处于试点阶段。由于其需要单张至少配备80GB 显存的高性能 GPU 才能高效运行,且官方将其标注为“仅限研究用途”,目前尚未提供成熟的托管 API。业内人士指出,尽管在长上下文及多轮对话的极端场景下仍存在一些局限性,但其开放的权重与容器设计,依然为联络中心、汽车座舱、零售点餐以及智能无障碍辅助等领域的开发者提供了全新的探索方向。

要点速读

在实时人工智能语音交互赛道上,硬件与技术巨头英伟达(NVIDIA)迎来全新突破。公司近日正式推出了旗下 首款 开源端到端

  • 在实时人工智能语音交互赛道上,硬件与技术巨头英伟达(NVIDIA)迎来全新突破
  • 公司近日正式推出了旗下 首款 开源端到端
  • 更多细节仍在持续更新中