三大技术突破，助力国内智能语音产业规模飞速增长-电子工程世界

分享到: 微博; QQ; 微信; LinkedIn

据行业预测，中国智能语音产业规模将达到101.4亿元。而智能语音产业的快速发展，将带动智能家居、智能汽车以及智能穿戴设备等相关领域市场规模增长上千亿元。

智能语音市场规模得以如此神速扩张，并且应用到多个领域，这必然离不开智能语音技术的不断突破。那么，我们当前的语音技术达到了什么地步？换句话说，能够实现什么样的人机互动效果呢？

以欧拉蜜团队为代表，我们一起来看看这些年国内智能语音行业的技术突破。

技术门槛高，首先得保证语音识别准确率

中国的语音识别研究起始于1958年，由中国科学院声学所利用电子管电路识别10个元音。虽然与国外语音识别研究起步时间同步，但由于当时条件的限制，随后一段时间内技术的进展较为缓慢。

最初，我国语音技术的研究一直以学术界为主，随后才有企业逐渐涉足这个领域。由于语音识别技术准入门槛高、人才稀缺，经过多年研究与探索，一些国内企业终于在这个行业冒头，形成了“一超多强”的局面。

欧拉蜜团队在智能语音方面的研究已达5年。初期，欧拉蜜以设计出一个中文理解能力超越Siri 的智能语音助理为目标，开始投入人工智能相关研究领域，而长远的目标则是致力于提供全方位的人机交互解决方案。

这5年里，欧拉蜜攻破了不少技术难关。首先要解决的，就是语音识别的精准度。

语音人机交互面临着多重技术难题。例如，人声距离不能过远、发音要标准、环境要安静、不能持续对话、不能被打断……

（欧拉蜜开发套件拾音测试视频截图）

欧拉蜜团队重点解决了这些语音识别方面的问题。目前，欧拉蜜的人声识别准确度高达90%，并且可实现超远距离识别（最远可准确识别距离8米的人声）。

同时，欧拉蜜团队研发了具有强抗噪能力的语音识别技术与核心算法，包括语音活性检测（Voice Activity Detection | Speech Activity Detection），回声消除算法（AcousticEcho Cancellation ），噪声处理算法（Noise Reduction & Cancellation），混响处理算法（Reverberation）等多项专利技术。

欧拉蜜还为企业用户提供深度定制服务，比如对儿童声音、嘈杂环境声音进行训练，可达到特殊要求下的语音识别高准确度。

难点在于自然语言语义理解和处理

“能穿多少穿多少”，这句话的意思，到底是要你“多穿”呢，还是要你“少穿”呢。同样的，中文语境下，类似的歧义句还不在少数。

例如，“中国队大败德国队”，不知是中国赢了德国，还是德国赢了中国；“小王跟我请了假”，不知是小王向我请了假，还是小王和我都请了假……那么，在这种歧义的语境下，我们需要更多的信息来明确原句的意思。

比较常见的 NLP/NLU 现有技术与方案有这么几种。一是基于关键词和简单规则，但这样误抓率高、歧义多，无法精准抓取参数；二是基于ASR语法的扩展，但这种方式描述能力有限，可扩展性较低；三是基于统计的句法分析算法，这种算法准确率与性能不够高，且不易处理上下文问题；最后呢，是处理语法扩展的编程，但这种程序复杂度很高。

那么，欧拉蜜是怎么解决这个问题的呢？

欧拉蜜团队自主研发的语法描述语言（Syntax Language），可用灵活的规则来描述说法。同时，依托可全文检索的结构化知识库，辅助确定语法参数的合法性，消除歧义。

欧拉蜜采用了结合规则和统计的有机算法、时间和数字识别技术、以编译器技术动态解析和匹配规则，能够实现多维度的上下文支持能力，准确理解用户的表达意图。

（上图为欧拉蜜语音助手截图）

例如，当用户连续输入“今天上海的天气”，“北京呢”，“买一张去那里的机票”。经过算法处理以及数据库检索，欧拉蜜能够结合上下文，准确将“北京呢”理解为“北京今天的天气如何”，并给出当天北京的天气状况。

同样的，欧拉蜜也能获取最后一句中的“那里”指代的是“北京”，并为用户反馈当地去北京的机票信息。

以视觉行为侦测技术为辅助的语音人机交互

如果人机交互可以更加“智能”，那么它应该拥有哪些能力呢？欧拉蜜团队进一步改进了语音机器人的唤醒功能，使人机交互更加流畅。

市面上主流的智能音响，目前使用的都是语音唤醒。由于智能音响没有屏幕，一切功能都是通过语音来操控，唤醒功能也不例外。往往会用一句唤醒话术（通常是产品的名称）来作为启动标志，当人们对着智能音响说出这句话时，智能音响就会进行答复并开始接收你传递给它的信息。

你可能会说，语音唤醒已经很方便了，难道还能有什么改进余地吗？

试想一下，日常生活中，当我们想要对另一人说话时常常会面向他，这时候，不需要叫对方的名字，对方也知道我们正在与他对话。如果机器也能做到这样，那么“语音唤醒”都可以省略掉了。

（欧拉蜜人脸与视线追踪视频截图）

欧拉蜜正是想赋予语音机器人这样“人性化”的功能。因此，欧拉蜜团队使用声源定位并结合视线检测（Eye Gaze Detection）技术，来帮助机器人确认用户的说话对象。这样一来，机器人们除了知道你在说话，还能够判断出你是否是在跟它说话，并自动唤醒。

关键字：智能语音引用地址：三大技术突破，助力国内智能语音产业规模飞速增长

上一篇：智能语音涉足众多应用领域欧拉蜜布局全领域发展战略
下一篇：移动AI翻译官：深度学习推理突破赋力科大讯飞语音应用

推荐阅读最新更新时间：2024-03-30 23:52

TCL旗舰电视搭载DuerOS，百度用开放态度构建智能语音生态

国际舞台再现中国人工智能身影。IFA2017（柏林国际电子消费品展览会）开幕期间，搭载百度对话式人工智能系统DuerOS的TCL最新旗舰电视X／C／P三大系列新品－－X6 XESS私人影院、C5都市蓝调电视、P6超清薄电视发布，向全球消费者展示出中国制造的硬实力，以及最先进的AI技术软实力，中国品牌正在由“中国制造”向“中国智造”实现华丽转身。据了解，搭载DuerOS的TCL最新旗舰电视，能够实现语音搜影片、语音系统控制、语音切换电视界面、语音播放控制、常用信息搜索等功能。双方此次合作，是人工智能时代在智能家居场景中的强强联合，将为用户带来“动口不动手”的智能交互体验，为智能家居领域开拓更加丰富的市场。自今年1月面世以

[嵌入式]

启英泰伦解析生态赋能的智能语音“芯”生活

Research and Markets研究预测，全球智能语音市场将持续快速增长，今年市场规模将达到191.7亿美元。智能语音交互作为AI应用中最为成熟的方向之一，也是人工智能领域关注的重点，而高性能、低成本的芯片和模组是其大规模落地的关键。在智能语音赛道上，有太多的玩家，尽管各家发力点不尽相同，但构建“生态”已成为行业共识。 5月22日（周五）上午10点，集微公开课第十五期将邀请到成都启英泰伦科技有限公司技术支持总监孙振奎，带来以《生态赋能，语音引领美好“芯”生活》为主题的精彩演讲。集微直播间自开播以来获得了大量来自行业的关注与好评，其中“集微公开课”栏目联合行业头部企业，通过线上直播的方式分享精彩主题内容，同时设立直播

[手机便携]

智能语音助手技术的未来可能在车载系统

家用智能音箱的语音助手技术如亚马逊Alex、Siri和谷歌助手等，其未来更大的市场应用前景可能在汽车行业。据语音科技出版物Voicebot.ai的一份最新调研报告称，美国有770万成年司机驾驶汽车时每月至少使用一次使用车载语音助手，而家用智能音箱的用户相比仅有457万。据这份报告,造成此类情况的原因有几个：美国拥有汽车的人数远比拥有智能音箱的用户数多。汽车研发并推出语音控制导航系统较早,而家用智能音箱产品发展时间不到5年(亚马逊Alexa技术诞生于2004年),前者发展的时间超过后者10年。车载场景可能是语音技术应用的最佳场景,因为交规不允许(或者应该尽量避免)人们在驾驶过程中使用触控屏。

[汽车电子]

<font color='red'>智能语音</font>助手技术的未来可能在车载系统

大联大品佳集团推出基于新唐科技的智能语音识别解决方案

大联大控股宣布，其旗下品佳推出基于新唐科技（Nuvoton）ISD9160+Cyberon算法的语音识别方案，此方案可支持20条本地的语音命令，还可外挂SPI Flash存储声音数据，实现语音唤醒、语音识别、语音播放、MCU控制等功能。图示1-大联大品佳推出基于Nvuoton ISD9160 +Cyberon算法的语音识别方案示意图新唐的ISD9160是以语音/音频系统单芯片（SoC）ChipCorder®，Cortex™-M0为基础，能为需要语音/音频功能的应用提供强大而又成本低廉的解决方案。其高度整合式架构32位Cortex™-M0处理器、2.4至5.5V的宽广运作电压、I²S数字音频接口、1瓦喇叭驱动器、内建

[家用电子]

大联大品佳集团推出基于新唐科技的<font color='red'>智能语音</font>识别解决方案

混战智能语音交互技术谷歌、亚马逊、百度等都看向了汽车中控台

图片来自“123rf.com.cn” CES似乎已经“人走茶凉”了。但在此期间，这场全球科技盛会还是为关注者提供了不少新的话题与思考。这个时代已然被冠以“智能”之名。新概念固然科技感十足，但这些高大上的技术理念该如何被应用才更加重要。从2017年的CES开始，就有不少企业把智能语音交互技术落地在了汽车上。时年，智能汽车的概念风靡一时，科技范儿的企业层出不穷，力求从各方面把汽车变聪明。那么，作为底层技术之一，CES上亮相的企业对智能语音交互在汽车上的应用贡献了哪些新产品。擅长阅读理解的飞鱼2.0 （汽车智能交互系统飞鱼2.0展示界面） CES上，科大讯飞展出了其在2017年底发布的汽车智能交互系统——飞

[汽车电子]

时擎科技发布基于RISC-V的DSA架构端侧智能语音芯片AT820

日前，在第二届滴水湖RISC-V论坛上，时擎科技总裁于欣介绍了公司新推出的RISC-V指令架构的芯片AT820。于欣表示，时擎科技作为国内最早参与RISC-V研发的团队之一，公司也随着RISC-V产业的发展而壮大。于欣表示，随着5G和IoT时代的到来，芯片市场总容量很大，但是由于碎片化的存在，很难有通用的解决方案。时擎科技希望寻找不同场景下的共同点来切入。这里面有三个认知，首先是算法+芯片形成了面向应用场景的完整解决方案。其次，定制化的芯片可以充分满足差异化场景的需求。第三则是需要有足够大的市场满足投资回报。基于这三点，时擎科技认为DSA架构的处理器/芯片，是能够解决碎片化有效途径之一。时擎科技也提供了三大产品主

[嵌入式]

基于ADPCM算法的汽车智能语音报警系统

　　为了防止汽车发生交通事故，当汽车智能检测装置探测到前方有危险时，必须向驾驶员发出警告信息。语音报警向驾驶员明确提示危险，以便驾驶员能及时准确地采取措施。因此，本文提出数字语音处理技术，先将各种状况的报警信息进行数字化采集、存储，遇到危险时，将判断危险类型并自动选择播放存储的报警信息。由于语音信息量大，直接存储需占用庞大的存储空间，为此，本文采用FPGA实现ADPCM(Adaptive Differential Pulse CodeModulation，自适应差分脉冲编码调制)编解码器设计，对语音信息进行压缩存储.从而使存储信息量增大了一倍。　　 2 系统结构及原理　　本系统设计是以单片机和FPGA为核心。单片机控制系统

[汽车电子]

基于ADPCM算法的汽车<font color='red'>智能语音</font>报警系统

语音识别芯片助力开关控制器智能语音化

01左中括号前言左中括号上矩形很多厂家的思维总停留在，智能家居必须联网的，要通过手机对家里的电器进行控制。无论是远程或者在家，这确实极大的方便了用户，在体验上也有良好的效果。因此这些厂家提出的概念总围绕这网络，而作为网络它必须有一个可以实际操作的硬件，而这个载体，语音智能开关厂家，他们定义在了智能音箱或者路由器身上… 一直以来，众多企业将智能音箱当做智能家居和物联网的入口，原因在于具有语音交互和内容服务优势的智能音箱，只需要一句话就能完成各项操作。特别是随着5G到来，智能家居的互联互通已经成为无可避免的趋势，语音交互作为人类自然、直接的交流方式之一，也让智能音箱迅速收到大量用户的青睐。但无论如何，这些模式都是网络。因为

[嵌入式]