快科技8月4日消息,今日,腾讯混元正式发布新一代语音识别模型Hy ASR 3.0 Preview,目前已上线腾讯云官网并对外提供API服务,可应用于智能客服、内容理解、语音搜索等场景。
腾讯元宝深度参与模型共研,并已完成首发接入,用户打开元宝长按说话,即可体验方言识别、上下文智能纠错以及复杂环境稳定转写等能力,相关功能免费开放。
与此同时,WorkBuddy等腾讯产品也在陆续接入。
(资料图)
据腾讯介绍,Hy ASR 3.0 Preview基于新一代大语言模型Hy3的语言理解能力,将高精度语音识别与深度语义理解相结合,在通用识别、上下文感知、复杂场景稳定性和方言覆盖等方面实现升级。
评测数据显示,在开源测试集中,Hy ASR 3.0 Preview的多语种词错误率均控制在3%左右。
其中,中文普通话WER为3.34%,英语WER为2.62%,粤语WER为3.12%。
在自建评测集中,该模型在通用语音、方言、上下文理解、专业词汇以及高噪声、耳语等复杂声学场景中,也保持了较低的词错误率。
从实际使用体验来看,Hy ASR 3.0 Preview重点提升了四项能力。
首先是通用识别准确率进一步提升,可覆盖普通话、方言以及中英文混说等场景,减少错字、漏字和长音频识别偏差。
其次,模型支持结合Context上下文理解用户语境,可对同音词进行智能纠错,降低因上下文缺失导致的语义误判。
针对专业场景,Hy ASR 3.0 Preview支持热词注入增强,可快速识别品牌名称、产品名称、人名和行业术语,减少企业在模型适配和词库维护方面的成本。
此外,腾讯还针对高噪声、耳语和低声说话等场景进行了专项优化,使模型在复杂环境下仍能保持较为稳定的转写效果。
技术层面,Hy ASR 3.0 Preview采用兼顾效率和性能的MoE架构,并将基座模型升级至Hy3,进一步增强语言理解、上下文建模和语义推理能力。
语音侧则采用腾讯自研的无监督语音Encoder,通过数千万小时无监督语音数据进行训练,从复杂音频中提取高质量声学特征。
为进一步提升语音建模和理解能力,混元团队还对语音Encoder与大语言模型进行联合训练,引入数千万小时、多来源语音数据,覆盖多种方言、口音和声学环境,并通过高质量数据管线完成精细化标注。
上一篇:黑龙江连发两条预警 局地累计降水量将超100毫米 每日消息
下一篇:最后一页
新华财经北京8月3日电(王泽君) 7月31日,新华·山东港口·金联创
上海最短的马路,长度只有2米,你知道在哪里吗,上海,路牌,虹口区,海南
金吾财讯|小米集团-W(01810)早盘走弱,现价27 800港元,跌幅3 41%。
安全第一,乔治找到在长沙追车的两位男孩,为头盔和车签名,头盔,电动车
皇马挽留维尼修斯最后一招,穆帅主动示好:欲打破僵局OR撇清干系,皇马,
X 关闭
X 关闭
四川广安市48小时内将新改建一个800张床位的方舱医院 记者从今日(19日)中午召开的广安市疫情防控发布会上获悉,广安市应急指挥部决[+更多]
河南:6月底前实现“场所码”全覆盖 “场所码”是流调的关键,是落实常态化疫情防控的重要举措。记者从河南省新冠肺炎疫情防控指挥[+更多]
中新网上海5月19日电 (陈静 朱虹 丁国莲)记者19日获悉,中国学者的最新研究解释,证实了糖尿病的卵母细胞起源,揭示了糖尿病代际遗[+更多]
中新社合肥5月19日电 题:虚拟人走红“Z世代”:未来虚拟人懂情感有温度 中新社记者 张俊 俏皮可爱的虚拟人形象、顺畅自然的肢[+更多]