历史上的今天
返回首页

历史上的今天

今天是:2025年01月30日(星期四)

2018年01月30日 | 三大技术突破,助力国内智能语音产业规模飞速增长

2018-01-30

据行业预测,中国智能语音产业规模将达到101.4亿元。而智能语音产业的快速发展,将带动智能家居、智能汽车以及智能穿戴设备等相关领域市场规模增长上千亿元。

 

智能语音市场规模得以如此神速扩张,并且应用到多个领域,这必然离不开智能语音技术的不断突破。那么,我们当前的语音技术达到了什么地步?换句话说,能够实现什么样的人机互动效果呢?

 

以欧拉蜜团队为代表,我们一起来看看这些年国内智能语音行业的技术突破。

blob.png?imageView2/2/w/550

 

技术门槛高,首先得保证语音识别准确率

 

中国的语音识别研究起始于1958年,由中国科学院声学所利用电子管电路识别10个元音。虽然与国外语音识别研究起步时间同步,但由于当时条件的限制,随后一段时间内技术的进展较为缓慢。

 

最初,我国语音技术的研究一直以学术界为主,随后才有企业逐渐涉足这个领域。由于语音识别技术准入门槛高、人才稀缺,经过多年研究与探索,一些国内企业终于在这个行业冒头,形成了“一超多强”的局面。

 

欧拉蜜团队在智能语音方面的研究已达5年。初期,欧拉蜜以设计出一个中文理解能力超越Siri 的智能语音助理为目标,开始投入人工智能相关研究领域,而长远的目标则是致力于提供全方位的人机交互解决方案。

 

这5年里,欧拉蜜攻破了不少技术难关。首先要解决的,就是语音识别的精准度。

 

语音人机交互面临着多重技术难题。例如,人声距离不能过远、发音要标准、环境要安静、不能持续对话、不能被打断……

 

blob.png?imageView2/2/w/550

(欧拉蜜开发套件拾音测试视频截图)

 

欧拉蜜团队重点解决了这些语音识别方面的问题。目前,欧拉蜜的人声识别准确度高达90%,并且可实现超远距离识别(最远可准确识别距离8米的人声)。

 

同时,欧拉蜜团队研发了具有强抗噪能力的语音识别技术与核心算法,包括语音活性检测(Voice Activity Detection | Speech Activity Detection),回声消除算法(AcousticEcho Cancellation ),噪声处理算法(Noise Reduction & Cancellation),混响处理算法(Reverberation)等多项专利技术。

 

欧拉蜜还为企业用户提供深度定制服务,比如对儿童声音、嘈杂环境声音进行训练,可达到特殊要求下的语音识别高准确度。

 

难点在于自然语言语义理解和处理

“能穿多少穿多少”,这句话的意思,到底是要你“多穿”呢,还是要你“少穿”呢。同样的,中文语境下,类似的歧义句还不在少数。

 

例如,“中国队大败德国队”,不知是中国赢了德国,还是德国赢了中国;“小王跟我请了假”,不知是小王向我请了假,还是小王和我都请了假……那么,在这种歧义的语境下,我们需要更多的信息来明确原句的意思。

 

比较常见的 NLP/NLU 现有技术与方案有这么几种。一是基于关键词和简单规则,但这样误抓率高、歧义多,无法精准抓取参数;二是基于ASR语法的扩展,但这种方式描述能力有限,可扩展性较低;三是基于统计的句法分析算法,这种算法准确率与性能不够高,且不易处理上下文问题;最后呢,是处理语法扩展的编程,但这种程序复杂度很高。

 

那么,欧拉蜜是怎么解决这个问题的呢?

 

欧拉蜜团队自主研发的语法描述语言(Syntax Language),可用灵活的规则来描述说法。同时,依托可全文检索的结构化知识库,辅助确定语法参数的合法性,消除歧义。

 

欧拉蜜采用了结合规则和统计的有机算法、时间和数字识别技术、以编译器技术动态解析和匹配规则,能够实现多维度的上下文支持能力,准确理解用户的表达意图。

 

blob.png?imageView2/2/w/550

(上图为欧拉蜜语音助手截图)

 

例如,当用户连续输入“今天上海的天气”,“北京呢”,“买一张去那里的机票”。经过算法处理以及数据库检索,欧拉蜜能够结合上下文,准确将“北京呢”理解为“北京今天的天气如何”,并给出当天北京的天气状况。

 

同样的,欧拉蜜也能获取最后一句中的“那里”指代的是“北京”,并为用户反馈当地去北京的机票信息。

 

以视觉行为侦测技术为辅助的语音人机交互

 

如果人机交互可以更加“智能”,那么它应该拥有哪些能力呢?欧拉蜜团队进一步改进了语音机器人的唤醒功能,使人机交互更加流畅。

 

市面上主流的智能音响,目前使用的都是语音唤醒。由于智能音响没有屏幕,一切功能都是通过语音来操控,唤醒功能也不例外。往往会用一句唤醒话术(通常是产品的名称)来作为启动标志,当人们对着智能音响说出这句话时,智能音响就会进行答复并开始接收你传递给它的信息。

 

你可能会说,语音唤醒已经很方便了,难道还能有什么改进余地吗?

 

试想一下,日常生活中,当我们想要对另一人说话时常常会面向他,这时候,不需要叫对方的名字,对方也知道我们正在与他对话。如果机器也能做到这样,那么“语音唤醒”都可以省略掉了。

 

blob.png?imageView2/2/w/550

(欧拉蜜人脸与视线追踪视频截图)

 

欧拉蜜正是想赋予语音机器人这样“人性化”的功能。因此,欧拉蜜团队使用声源定位并结合视线检测(Eye Gaze Detection)技术,来帮助机器人确认用户的说话对象。这样一来,机器人们除了知道你在说话,还能够判断出你是否是在跟它说话,并自动唤醒。


推荐阅读

史海拾趣

动运科技(DONGWOON)公司的发展小趣事

随着技术的不断成熟和市场的逐步扩大,动运科技开始将目光投向国际市场。公司先后在深圳、上海、美国、日本和台湾等地设立了研发或分公司与办事处,形成了全球化的研发和销售网络。通过与全球知名企业的合作,动运科技的产品逐渐进入了智能手机、LED照明、物联网等多个领域,并取得了显著的业绩。

HSMC公司的发展小趣事

HSMC的发展离不开巨额的资金投入。公司项目总投资额达到约200亿美元(另一说法为1280亿元人民币),这一庞大的投资规模使得HSMC能够迅速构建起先进的生产设施。项目规划包括建设14纳米及7纳米以下节点的逻辑工艺生产线,以及晶圆级先进封装生产线。这些生产线预计月产能可达数万片,为市场提供高质量的芯片产品。

Ho Chien Electronics Group Inc公司的发展小趣事

武汉弘芯半导体制造有限公司(HSMC)于2017年11月在武汉市东西湖区临空港经济技术开发区正式成立。公司自成立之初便立下了宏伟的愿景——成为全球领先的CIDM(委托代工与芯片设计整合制造)晶圆厂之一。HSMC汇聚了来自全球半导体晶圆研发与制造领域的顶尖专家团队,致力于集成电路产业先进晶圆与封装制造技术的自主化,为我国电子科技业与芯片设计业贡献力量。

Gamma Microelectronics ( APM )公司的发展小趣事

G24i的成立可以追溯到2006年,它自称是世界上首家生产商业化应用等级DSSC的公司。公司的技术根基源自瑞士洛桑联邦理工学院的M. Gratzel团队,该团队是DSSC技术的先驱。G24i由美国Kanorka Technologies公司投资,而Kanorka则得到了美国军方的资助。这一强大的技术背景为G24i的商业化之路奠定了坚实的基础。公司成立后不久,便致力于将实验室级别的DSSC技术推向市场,开启了其商业化探索的征程。

Dow-Key Microwave Corporation公司的发展小趣事

1945年,第二次世界大战结束后不久,Dow-Key Microwave Corporation在美国成立。公司创始人凭借对射频和微波技术的深刻理解和市场需求的敏锐洞察,决定专注于射频微波开关的制造。在初创阶段,公司面临资金短缺、技术挑战和市场接受度不高等问题。然而,创始人及其团队凭借不懈的努力和创新的精神,逐渐克服了这些困难,为公司的发展奠定了坚实的基础。

上海国芯(Gcore)公司的发展小趣事
结合其他传感器(如红外传感器、雷达传感器等)实现更全面的安全监控。

问答坊 | AI 解惑

网络收音机狂想

现在的网络收音机,是由电台将节目内容制成流数据放在网络上供用户边加载边收听,虽然与实际信号的同步已经比较好了,延迟并不严重,免去了调谐这一步,似乎很方便。但同时也失去了更多乐趣,操作实物收音机,发现并接收节目,可能会意外找到一些偏 ...…

查看全部问答>

下载的时候金币不够了怎么办

今天下载DXP的教程资料,下了前三部分没有金币了,回复了一下,发现赠送了2枚金币,又下载了第四部分;又回复了一下发现金币未增…

查看全部问答>

S3C6410的DRAM控制器

我们在项目中更换了DRAM,所以需要重新配置S3C6410的DRAM控制器,结果发现S3C6410中的DRAM控制器还是挺复杂的。   S3C6410支持两个DRAM片选,可以分别接最大256MB的内存,该处理器用的DRAM控制器是来自ARM的PrimeCell Dynamic Memory Contro ...…

查看全部问答>

求书!定散分~~~~~~~

求以下二本书: 书名:嵌入式实时操作系统μC/OSII (第2版) (美) Jean J.Labrosse著 邵贝贝等译 责任编辑 王瑛 ISBN 7-81077-290-2 开本:787×1092 1/16 字数: 979千字 定价:79.00元 2003年5月第1版 2003年5月第1次印刷 购买 ...…

查看全部问答>

TSP实现问题?

现要作一个TSP包,但是再win ce下导不进去了 那位高人知道作TSP包的过程,有代码更好了…

查看全部问答>

问MTK标准开发包内MMI_TEXT.h文件问题

此文件内的_MMI_TEXT_ID_E枚举变量内, 定义的ID顺序改变会影响最终编译结果。 但是,我没有发现特殊用法,都是当作标准枚举变量使用的。。 有做过MTK的高手解答下吗…

查看全部问答>

关于DIY数控电源的键盘(包括编码器)程序接口 讨论

原理图感觉有点不对啊 ENTER按键怎么和编码器的5脚连起来了??   显示部分已经有框架了,就等测试了   现在考虑一下输入部分的软件接口问题 是用一个函数来取得输入呢还是使用一个全局变量来取得 1.函数方式 Uint6 getInpu ...…

查看全部问答>

请高手指点! msp430fg4619实时时钟RTC的问题!

我用的是MSP430FG4619,我试了TI给的RTC的sample code,但是一点反应都没有 RTC是不是一定要用ACLK?我没有装外部32KHZ晶体,只用内部时钟可以吗? 这是我的code #include   //----------------------------------------------------- ...…

查看全部问答>

Mbed开始支持美信的MAXWSNENV

Mbed开始支持美信的MAXWSNENV,主要特点有: 提供方便的BLE平台板载温度、湿度、光照、气压传感器低功率可以延长电池使用时间mbed 中间层接口提供快速开发板载按钮开关和三彩色LED https://developer.mbed.org/platforms/MAXWSNENV/ …

查看全部问答>