依图科技发布语音开放平台联袂微软华为撬动语音市场

来源：依图科技

2018/12/11 17:02:5137156

　　【中国安防展览网品牌专栏】12月11日，人工智能公司依图科技公布了在中文语音识别技术上的新突破。在大的中文开源数据库AISHELL-2中，依图短语音听写的字错率(CER)仅为3.71%，原业内者约20%，大幅刷新现有纪录。依图还联合微软Azure推出依图语音开放平台，并携手华为发布“智能语音联合解决方案”，将依图的语音识别技术提供给广泛的第三方应用，共同推动智能语音行业的进步。

　　依图创新官吕昊博士

　　语音识别技术远未成熟，技术透明度差

　　近年来，深度学习的爆发驱动了语音识别技术的高速发展，但相较于人脸识别在准确率方面的高增速来说，语音识别的发展仍较为缓慢。尽管一些机构已宣传达到了人类水平，但大多数情况下都来自安静、近场等受限场景。对于电话、语音节目、远场等更复杂场景，则需要针对性地开发不同模型，但实际应用中的不确定性，使理想和现实仍有较大差距，导致应用场景难以得到更大突破。

　　对语音识别来说，语速、语态、语气、口音等都会显著影响识别的准确率。一般认为，字错率在低于3%时不会影响可读性，而超过15%则毫无可读性。这两个数据可认为是语音识别的两条红线，而在不同场景下，不同算法的表现可能会有很大差异。在中文语音识别技术领域，汉语的博大精深带来的同音不同意等问题，更对语音识别的处理难度带来极大挑战，显著影响终的使用体验。

　　依图创新官吕昊表示，“语音识别技术经历了漫长的发展进化，但至今都只能在受限的场景下才能达到较好的使用效果。我们认为，核心技术的突破，依然是当前破局中文语音识别发展的关键。在语音识别领域，依图科技是一名新生，但立志推动行业创新与发展，做世界好的中文普通话语音识别技术。”

　　讯飞依图BAT各家算法差异巨大，讯飞依图位列阵营

　　依图此次推出的中文语音识别算法，与业内原有者相比，不仅大幅提升了识别准确率，且在单个算法模型上，有极为出色的多场景适用性表现。在业内近期公开的AISHELL-2的三个测试子集，以及来自第三方的近场口音测试集、近场安静聊天测试集、语音节目测试集、电话测试集、远场测试集中，依图均处于业界水平，且字错率几乎全部在15%以下。其中，在AISHELL2-2018A-EVAL数据集中，依图的识别准确率高达96.29%，字错率(CER)仅为3.71%，原业内者约20%。通过“听写大会”微信小程序，让用户可以直观感受到语音识别技术的真实表现，在业界也属，公开透明的体验各类算法的水平差异。

　　AISHELL-2是AISHELL Foundation和希尔贝壳宣布的开源数据库，数据规模达1000小时，是目前大的中文开源数据库。它由1991名来自中国不同口音区域的发言人参与录制，经过专业语音校对人员转写标注，通过了严格质量检验，数据库文本正确率在96%以上，录音文本涉及唤醒词、语音控制词、智能家居、无人驾驶、工业生产等12个领域。

　　听写大会小程序

　　中文语音识别机器和人还有差距，产业发展任重道远

　　基于在语音识别领域的技术突破，依图与微软也宣布进一步深化合作伙伴关系，联合推出依图语音开放平台。该平台将基于微软Azure云，将行业的语音识别技术能力开放给广泛的第三方应用，并携手为广大用户和客户提供更全面的服务及更好的体验。在联合发布语音开放平台之后，依图与微软还将在智能语音领域展开更深层次的合作，共建AI生态。

　　依图还携手华为联合发布“智能语音联合解决方案”，该方案基于依图语音开放平台及华为全栈全场景昇腾(Ascend)系列芯片和面向数据中心侧的Atlas 300 AI加速卡，将双方强大的技术研发能力与生态服务能力深度结合，形成软硬件一体化的联合解决方案。借助该解决方案，第三方应用可进一步提升开发效率，从业界的语音技术中受益。

　　语音识别是AI理解世界重要的组成部分，也是人人交互、人机交互重要的入口。此次依图科技在语音识别技术方面的突破，不仅意味着依图涉足语音识别领域便已经跻身中文语音识别阵营，同时也说明语音识别在技术层面还有足够的进化空间，远远没有达到“超越人类”。依图预计，在未来6个月到12个月，语音识别技术的算法性能将呈指数级增长，更多的场景将被解锁，为行业应用带来更大的价值。

智慧城市网

依图科技发布语音开放平台联袂微软华为撬动语音市场

上一篇：重庆国能奥特莱斯里除了Gucci 还有捷顺智慧停车机密

下一篇：深信服＋中国移动 5G时代续写合作新篇章

相关资讯：

上一篇：重庆国能奥特莱斯里 除了Gucci 还有捷顺智慧停车机密

下一篇：深信服＋中国移动 5G时代续写合作新篇章

相关资讯：

上一篇：重庆国能奥特莱斯里除了Gucci 还有捷顺智慧停车机密