教学文库网 - 权威文档分享云平台
您的当前位置:首页 > 精品文档 > 高等教育 >

嵌入式语音识别系统的研究和实现 - 方敏(3)

来源:网络收集 时间:2026-09-13
导读: 们 的工作和生活,而人与这些智能化终端之间的自然快捷稳定可靠的交互方式有助于提高人机交 互的效率,增强人对智能化设备的控制。作为人机交互最自然的方式,语音技术的研究近几十年 来取得了长足的进展,其中语音识别

的工作和生活,而人与这些智能化终端之间的自然快捷稳定可靠的交互方式有助于提高人机交

互的效率,增强人对智能化设备的控制。作为人机交互最自然的方式,语音技术的研究近几十年

来取得了长足的进展,其中语音识别由于其重要性和研究的难度更成为研究的热点[1,8]。 嵌入式语音识别系统是指应用各种先进的微处理器在板级或是芯片级用软件或硬件实现 73

①收稿日期:2003-08-01

基金项目:863计划重点资助项目(2002AA118020);北京市自然科学基金资助项目(4022010) 作者简介:方敏(1980—),男,硕士研究生,研究方向为嵌入式语音识别技术. 本满足我们识别算法的要求;价格相当便宜,这对于该系统的商业化应 用极具吸引力;功耗低。

其他硬件部件:外扩了1片512K的SRAM,提供程序运行所需的临时空间;1片2M的

FLASH(SST39VF160)存放程序代码及模型等数据;一个CODEC语音输入输出接口(16位ADC/

DAC);1片TI公司的TLC320AD50,用于采集语音数据。 4 实验和评估结果分析 4.1 压缩模型性能测试

表1 压缩模型性能测试结果 模型压缩比模型大小(KB)识别率 1∶1 325 85.98% 7.8∶1 41.47 85.67% 11.4∶1 28.47 85.79% 14.8∶1 21.97 85.06% 16.4∶1 19.87 85.67% 17.4∶1 18.72 84.42%

首先以系统1为BASELINE,我们测试了声学模 型压缩对系统识别率的影响。测试环境描述如下: 词表大小为298词,词长为2~6个字,平均为3个 字;测试集采用实验室采集的孤立词测试集,共2960 个孤立词,由24个说话人(14男,10女)采集得到。 测试结果如表1所示,其中BASELINE采用未经压缩 的模型(大小为325KB),系统识别率为85.98%。压 缩比为原模型与压缩后模型的大小比。

测试结果表明:该声学模型压缩算法能够在压缩比达到11∶1的情况下,基本保持系统在 采用CDHMM模型的识别率。当模型压缩的更小时会对系统识别率有较大影响。因此在系统

2中选用压缩比为11.4∶1的模型。

4.2 非特定人语音识别系统在嵌入式平台上的评估结果

需要说明的是,用于算法评估的嵌入式平台都是针对语音识别算法设计的,算法的改进,

总是用资源更有限的硬件平台来实际验证之。系统1对资源的要求比较高,因此我们选择和 设计了TMS320C5409 DSP嵌入式平台。系统2对资源的要求比系统1小得多,因此我们设计

了基于TMS320C5402 DSP的嵌入式平台来实现和评估。TMS320C5402和TMS320C5409 DSP的

表2 系统在嵌入式平台上的评估结果 评估指标 评估平台

DSP5409 DSP5402 ARM 前端耗时0.31 0.31 1.5 搜索耗时1.6 0.30 1.2

消耗片上RAM64KB 32KB无

消耗片外RAM339KB 64KB 192KB 消耗FLASH365KB 64KB 167KB CACHE无无8KB

处理器速度可以根据需要在10~100MIPS 之间选择。通过测试系统在不同处理器速 度下的运行情况,发现当处理器速度降低 到30MIPS时,语音识别前端仍能实时运 行,而搜索引擎的运行为1.3倍实时,在可 接受的范围内,因此又选用了主频为

50MHz(相当于45MIPS)的基于ARM内核的 S3C4510B ARM嵌入式平台,以验证评估结 果,同时作为算法进一步优化的平台。表2 给出了三次评估的最终结果。 4.3 实验结果分析

1)系统2相对于系统1在速度和资源消耗方面的优势说明,系统的改进和优化是合理有 效的;在资源有限的嵌入式平台上,完全有可能实现高性能的非特定人语音识别系统,这为将 来在嵌入式平台上实现更为复杂的语音识别技术,如关键词检测等,奠定了基础。

2)从ARM平台的评估结果中,发现如下两个问题,一是ARM的处理速度比预想的要慢一 倍左右,这说明,为语音识别系统选择CPU的时候,处理器的MIPS指标不能成为衡量其数据 77

处理速度的唯一指标;二是开发环境为ARM生成的可执行代码为109KB,而同样的代码在 TMS320C54X的开发环境下生成的可执行代码仅22KB,是前者的1/5,经分析,认为这是由于 ARM采用了精简指令集的体系结构的缘故。 5 结论和展望

嵌入式语音识别系统具有广阔的市场应用前景。本文介绍的非特定人语音识别系统,相 对于特定人孤立词语音识别系统具有多方面的优点,因此成为嵌入式语音识别系统研究和实 现的主要着眼点。该系统的BASELINE是在LVCSR的基础上简化的,采用未压缩的模型,并在

TMS320C5409DSP平台实现。为了使系统更适合于嵌入式应用,对BASELINE进行了模型的压

缩和数据结构的优化,并在TMS320C5402DSP平台实现。系统改进后在ARM平台实现,也能 基本满足实时性要求,且成本下降很多。通过这几种平台的系统测试,发现对BASELINE系统 进行模型的压缩、数据结构的精简和代码优化之后,能大大降低系统实现平台的资源配置要 求。同时,根据不同平台的自身特点(如DSP平台具有较强的信号处理能力,ARM平台具有缓 冲机制等),对代码进行必要的优化。此项研究对于语音识别嵌入式模块的开发,对于今后研

制嵌入式语音识别API及语音识别片上系统(SOC)具有很好的参考意义。

目前系统已在各个平台上实现并进行了综合评估,今后进一步的工作是:在语音识别算法 方面,为了增强系统的环境鲁棒性,需要研究计算量和存储空间消耗都比较少的噪声消除或补 偿算法、可靠的集外词和噪声的拒识算法等;在嵌入式平台方面,研发语音识别前端的专用处 理模块,使其能执行更为复杂的语音信号前端处理算法。 参 考 文 献:

[1] Lawrence Rabiner,Biing-Hwang Juang.语音识别基本原理(影印版)[M].北京:清华大学出版社,1999.

[2] 杨行峻,迟惠生.语音信号数字处理[M].西安:电子工业出版社,1995.

[3] 高升.语境相关的声学模型和搜索策略的研究[D].中国科学院图书馆:中国科学院自动化研究所博士 学位论文,2001.

[4] 高升,徐波,黄泰翼.基于决策树的汉语三音子模型[J].声学学报,2000,25(6).

[5] 马龙.汉语命令词识别,关键词检测的研究与应用[D].中国科学院图书馆:中国科学院自动化研究所

硕士学位论文,2002.

[6] 易克初,田斌,付强.语音信号处理[M].北京:国防工业出版社,2000.

[7] 丁国宏,李成荣,徐波.非特定人孤立词语音识别系统在定点DSP上的应用[A].第六届全国人机语音

通讯会议[C],2001.

[8] B.H.Juang.The past,present and future of speech processing[J].IEEE Signal Processing Magzine,May,1998.

[9] [英]Steve Furber著,田泽等译.ARMSoc体系结构

…… 此处隐藏:1547字,全部文档内容请下载后查看。喜欢就下载吧 ……
嵌入式语音识别系统的研究和实现 - 方敏(3).doc 将本文的Word文档下载到电脑,方便复制、编辑、收藏和打印
本文链接:https://www.jiaowen.net/wendang/604673.html(转载请注明文章来源)
Copyright © 2020-2025 教文网 版权所有
声明 :本网站尊重并保护知识产权,根据《信息网络传播权保护条例》,如果我们转载的作品侵犯了您的权利,请在一个月内通知我们,我们会及时删除。
客服QQ:78024566 邮箱:78024566@qq.com
苏ICP备19068818号-2
Top
× 游客快捷下载通道(下载后可以自由复制和排版)
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
注:下载文档有可能出现无法下载或内容有问题,请联系客服协助您处理。
× 常见问题(客服时间:周一到周五 9:30-18:00)