国内智能语音识别产业的增长，可能源于三大技术突破.doc

ID：27904653

大小：399.00 KB

页数：7页

时间：2018-12-06

资源描述：

《国内智能语音识别产业的增长，可能源于三大技术突破.doc》由会员上传分享，免费在线阅读，更多相关内容在学术论文-天天文库。

1、国内智能语音识别产业的增长，可能源于三大技术突破　　据行业预测，中国智能语音产业规模将达到101.4亿元。而智能语音产业的快速发展，将带动智能家居、智能汽车以及智能穿戴设备等相关领域市场规模增长上千亿元。　　智能语音市场规模得以如此神速扩张，并且应用到多个领域，这必然离不开智能语音技术的不断突破。那么，我们当前的语音技术达到了什么地步？换句话说，能够实现什么样的人机互动效果呢？　　以欧拉蜜团队为代表，我们一起来看看这些年国内智能语音行业的技术突破。　　　　技术门槛高，首先得保证语音识别准确率　　中国的语音识别研

2、究起始于1958年，由中国科学院声学所利用电子管电路识别10个元音。虽然与国外语音识别研究起步时间同步，但由于当时条件的限制，随后一段时间内技术的进展较为缓慢。　　最初，我国语音技术的研究一直以学术界为主，随后才有企业逐渐涉足这个领域。由于语音识别技术准入门槛高、人才稀缺，经过多年研究与探索，一些国内企业终于在这个行业冒头，形成了“一超多强”的局面。　　欧拉蜜团队在智能语音方面的研究已达5年。初期，欧拉蜜以设计出一个中文理解能力超越Siri的智能语音助理为目标，开始投入人工智能相关研究领域，而长远的目标则是致力

3、于提供全方位的人机交互解决方案。　　这5年里，欧拉蜜攻破了不少技术难关。首先要解决的，就是语音识别的精准度。　　语音人机交互面临着多重技术难题。例如，人声距离不能过远、发音要标准、环境要安静、不能持续对话、不能被打断……　　　　（欧拉蜜开发套件拾音测试视频截图）　　欧拉蜜团队重点解决了这些语音识别方面的问题。目前，欧拉蜜的人声识别准确度高达90%，并且可实现超远距离识别（最远可准确识别距离8米的人声）。　　同时，欧拉蜜团队研发了具有强抗噪能力的语音识别技术与核心算法，包括语音活性检测（VoiceAcTIvity

4、DetecTIon

5、SpeechAcTIvityDetecTIon），回声消除算法（AcousticEchoCancellation），噪声处理算法（NoiseReduction&Cancellation），混响处理算法（Reverberation）等多项专利技术。　　欧拉蜜还为企业用户提供深度定制服务，比如对儿童声音、嘈杂环境声音进行训练，可达到特殊要求下的语音识别高准确度。　　难点在于自然语言语义理解和处理　　“能穿多少穿多少”，这句话的意思，到底是要你“多穿”呢，还是要你“少穿”呢。同样的，中文语境下，类

6、似的歧义句还不在少数。　　例如，“中国队大败德国队”，不知是中国赢了德国，还是德国赢了中国;“小王跟我请了假”，不知是小王向我请了假，还是小王和我都请了假……那么，在这种歧义的语境下，我们需要更多的信息来明确原句的意思。　　比较常见的NLP/NLU现有技术与方案有这么几种。一是基于关键词和简单规则，但这样误抓率高、歧义多，无法精准抓取参数;二是基于ASR语法的扩展，但这种方式描述能力有限，可扩展性较低;三是基于统计的句法分析算法，这种算法准确率与性能不够高，且不易处理上下文问题;最后呢，是处理语法扩展的编程，但

7、这种程序复杂度很高。　　那么，欧拉蜜是怎么解决这个问题的呢？　　欧拉蜜团队自主研发的语法描述语言（SyntaxLanguage），可用灵活的规则来描述说法。同时，依托可全文检索的结构化知识库，辅助确定语法参数的合法性，消除歧义。　　欧拉蜜采用了结合规则和统计的有机算法、时间和数字识别技术、以编译器技术动态解析和匹配规则，能够实现多维度的上下文支持能力，准确理解用户的表达意图。　　　　（上图为欧拉蜜语音助手截图）　　例如，当用户连续输入“今天上海的天气”，“北京呢”，“买一张去那里的机票”。经过算法处理以及数据库

8、检索，欧拉蜜能够结合上下文，准确将“北京呢”理解为“北京今天的天气如何”，并给出当天北京的天气状况。　　同样的，欧拉蜜也能获取最后一句中的“那里”指代的是“北京”，并为用户反馈当地去北京的机票信息。　　以视觉行为侦测技术为辅助的语音人机交互　　如果人机交互可以更加“智能”，那么它应该拥有哪些能力呢？欧拉蜜团队进一步改进了语音机器人的唤醒功能，使人机交互更加流畅。　　市面上主流的智能音响，目前使用的都是语音唤醒。由于智能音响没有屏幕，一切功能都是通过语音来操控，唤醒功能也不例外。往往会用一句唤醒话术（通常是产品的

9、名称）来作为启动标志，当人们对着智能音响说出这句话时，智能音响就会进行答复并开始接收你传递给它的信息。　　你可能会说，语音唤醒已经很方便了，难道还能有什么改进余地吗？　　试想一下，日常生活中，当我们想要对另一人说话时常常会面向他，这时候，不需要叫对方的名字，对方也知道我们正在与他对话。如果机器也能做到这样，那么“语音唤醒”都可以省略掉了。　　　　（欧拉蜜人脸与视线追踪视频截图）　　欧拉

当前文档最多预览五页，下载文档查看全文

侵权申诉



1 1 2 3 4 5 / 7



此文档下载收益归作者所有

当前文档最多预览五页，下载文档查看全文

温馨提示：
1. 部分包含数学公式或PPT动画的文件，查看预览时可能会显示错乱或异常，文件下载后无此问题，请放心下载。
2. 本文档由用户上传，版权归属用户，天天文库负责整理代发布。如果您对本文档版权有争议请及时联系客服。
3. 下载前请仔细阅读文档内容，确认文档内容符合您的需求后进行下载，若出现内容与标题不符可向本站投诉处理。
4. 下载文档时可能由于网络波动等原因无法下载或下载错误，付费完成后未能成功下载的用户请联系客服处理。

国内智能语音识别产业的增长，可能源于三大技术突破.doc

国内智能语音识别产业的增长，可能源于三大技术突破.doc

相关文章

相关标签