热闻岛
返回全网热点

腾讯混元 Hy ASR3.0 预览版发布:从"听清"到"听懂",方言词错率压到 3%

1天前7 阅读
腾讯混元 Hy ASR3.0 预览版发布:从"听清"到"听懂",方言词错率压到 3%配图
腾讯混元正式推出新一代语音识别模型 Hy ASR3.0 Preview,标志着语音识别技术从"逐字转写"迈入"理解语境"的新阶段。该模型基于 最新 一代大语言模型 Hy3 构建,融合高精度语音识别与深度语义理解能力,核心目标直指一个质变——让 AI 不再只是听清每个字,而是真正听懂你说的话。 方言覆盖十大片区,长音频场景优势突出 在识别广度上,Hy ASR3

腾讯混元正式推出新一代语音识别模型 Hy ASR3.0 Preview,标志着语音识别技术从"逐字转写"迈入"理解语境"的新阶段。该模型基于 最新 一代大语言模型 Hy3 构建,融合高精度语音识别与深度语义理解能力,核心目标直指一个质变——让 AI 不再只是听清每个字,而是真正听懂你说的话。

方言覆盖十大片区,长音频场景优势突出

在识别广度上,Hy ASR3.0 Preview 不要求标准普通话,方言识别覆盖粤语、吴语等 10 大方言片区和 20 余个二级小片区。开源评测集数据显示,该模型多语种词错误率(WER)控制在 3% 左右,其中中文普通话 3.34%、英语 2.62%、粤语 3.12%,整体准确度已接近行业 天花板 。

结合 Hy3 的语言理解能力,模型能够结合上下文语境精准捕捉用户意图,自动消除歧义并智能纠错同音词。在转写难度较高的会议纪要、访谈长音频等场景中,这一"先理解再转写"的思路优势尤为明显——传统逐字听写遇到同音歧义往往束手无策,而 Hy ASR3.0 能根据语义逻辑自动选择正确用词。

MoE 架构打底,千万小时级数据联合训练

技术层面,模型采用兼顾效率与性能的 MoE 架构,基座升级至 Hy3。混元团队自研了无监督语音 Encoder,通过数千万小时级无监督语音数据训练,从复杂音频中提取高质量声学表征——Encoder 负责"听得好",Hy3 负责"理解对"。

在数据策略上,团队对语音 Encoder 和大语言模型进行联合训练,引入数千万小时级多来源语音数据,并通过多阶段能力注入,使模型具备上下文感知、复杂场景适应和方言识别能力。后训练环节则围绕通用识别、上下文理解和复杂场景鲁棒性构建高质量 SFT 方案,覆盖上下文 Context、专业名词、不同声学环境及多样人群语音,并引入多阶段强化学习针对复杂长尾场景持续优化。

目前,Hy ASR3.0 Preview 已上线腾讯云官网对外开放 API,可广泛应用于智能客服、内容理解和语音搜索等领域。腾讯旗下 AI 助手"元宝"已完成首发接入,用户可通过语音输入体验方言识别、上下文智能纠错和复杂环境稳定转写等功能且免费开放,WorkBuddy 等产品也在陆续接入中。当语音识别从"听字"进化到"听懂",人与 AI 的交互方式正在被重新定义。

要点速读

腾讯混元正式推出新一代语音识别模型 Hy ASR3.0 Preview,标志着语音识别技术从"逐字转写"迈入"理解语境"

  • 腾讯混元正式推出新一代语音识别模型 Hy ASR3.0 Preview,标志着语音识别技术从"逐字转写"迈入"理解语境"
  • 更多细节仍在持续更新中
  • 更多细节仍在持续更新中