嵌入式语音识别系统的研究和实现 - 方敏(3)
们
的工作和生活,而人与这些智能化终端之间的自然快捷稳定可靠的交互方式有助于提高人机交
互的效率,增强人对智能化设备的控制。作为人机交互最自然的方式,语音技术的研究近几十年
来取得了长足的进展,其中语音识别由于其重要性和研究的难度更成为研究的热点[1,8]。 嵌入式语音识别系统是指应用各种先进的微处理器在板级或是芯片级用软件或硬件实现 73
①收稿日期:2003-08-01
基金项目:863计划重点资助项目(2002AA118020);北京市自然科学基金资助项目(4022010) 作者简介:方敏(1980—),男,硕士研究生,研究方向为嵌入式语音识别技术. 本满足我们识别算法的要求;价格相当便宜,这对于该系统的商业化应 用极具吸引力;功耗低。
其他硬件部件:外扩了1片512K的SRAM,提供程序运行所需的临时空间;1片2M的
FLASH(SST39VF160)存放程序代码及模型等数据;一个CODEC语音输入输出接口(16位ADC/
DAC);1片TI公司的TLC320AD50,用于采集语音数据。 4 实验和评估结果分析 4.1 压缩模型性能测试
表1 压缩模型性能测试结果 模型压缩比模型大小(KB)识别率 1∶1 325 85.98% 7.8∶1 41.47 85.67% 11.4∶1 28.47 85.79% 14.8∶1 21.97 85.06% 16.4∶1 19.87 85.67% 17.4∶1 18.72 84.42%
首先以系统1为BASELINE,我们测试了声学模 型压缩对系统识别率的影响。测试环境描述如下: 词表大小为298词,词长为2~6个字,平均为3个 字;测试集采用实验室采集的孤立词测试集,共2960 个孤立词,由24个说话人(14男,10女)采集得到。 测试结果如表1所示,其中BASELINE采用未经压缩 的模型(大小为325KB),系统识别率为85.98%。压 缩比为原模型与压缩后模型的大小比。
测试结果表明:该声学模型压缩算法能够在压缩比达到11∶1的情况下,基本保持系统在 采用CDHMM模型的识别率。当模型压缩的更小时会对系统识别率有较大影响。因此在系统
2中选用压缩比为11.4∶1的模型。
4.2 非特定人语音识别系统在嵌入式平台上的评估结果
需要说明的是,用于算法评估的嵌入式平台都是针对语音识别算法设计的,算法的改进,
总是用资源更有限的硬件平台来实际验证之。系统1对资源的要求比较高,因此我们选择和 设计了TMS320C5409 DSP嵌入式平台。系统2对资源的要求比系统1小得多,因此我们设计
了基于TMS320C5402 DSP的嵌入式平台来实现和评估。TMS320C5402和TMS320C5409 DSP的
表2 系统在嵌入式平台上的评估结果 评估指标 评估平台
DSP5409 DSP5402 ARM 前端耗时0.31 0.31 1.5 搜索耗时1.6 0.30 1.2
消耗片上RAM64KB 32KB无
消耗片外RAM339KB 64KB 192KB 消耗FLASH365KB 64KB 167KB CACHE无无8KB
处理器速度可以根据需要在10~100MIPS 之间选择。通过测试系统在不同处理器速 度下的运行情况,发现当处理器速度降低 到30MIPS时,语音识别前端仍能实时运 行,而搜索引擎的运行为1.3倍实时,在可 接受的范围内,因此又选用了主频为
50MHz(相当于45MIPS)的基于ARM内核的 S3C4510B ARM嵌入式平台,以验证评估结 果,同时作为算法进一步优化的平台。表2 给出了三次评估的最终结果。 4.3 实验结果分析
1)系统2相对于系统1在速度和资源消耗方面的优势说明,系统的改进和优化是合理有 效的;在资源有限的嵌入式平台上,完全有可能实现高性能的非特定人语音识别系统,这为将 来在嵌入式平台上实现更为复杂的语音识别技术,如关键词检测等,奠定了基础。
2)从ARM平台的评估结果中,发现如下两个问题,一是ARM的处理速度比预想的要慢一 倍左右,这说明,为语音识别系统选择CPU的时候,处理器的MIPS指标不能成为衡量其数据 77
处理速度的唯一指标;二是开发环境为ARM生成的可执行代码为109KB,而同样的代码在 TMS320C54X的开发环境下生成的可执行代码仅22KB,是前者的1/5,经分析,认为这是由于 ARM采用了精简指令集的体系结构的缘故。 5 结论和展望
嵌入式语音识别系统具有广阔的市场应用前景。本文介绍的非特定人语音识别系统,相 对于特定人孤立词语音识别系统具有多方面的优点,因此成为嵌入式语音识别系统研究和实 现的主要着眼点。该系统的BASELINE是在LVCSR的基础上简化的,采用未压缩的模型,并在
TMS320C5409DSP平台实现。为了使系统更适合于嵌入式应用,对BASELINE进行了模型的压
缩和数据结构的优化,并在TMS320C5402DSP平台实现。系统改进后在ARM平台实现,也能 基本满足实时性要求,且成本下降很多。通过这几种平台的系统测试,发现对BASELINE系统 进行模型的压缩、数据结构的精简和代码优化之后,能大大降低系统实现平台的资源配置要 求。同时,根据不同平台的自身特点(如DSP平台具有较强的信号处理能力,ARM平台具有缓 冲机制等),对代码进行必要的优化。此项研究对于语音识别嵌入式模块的开发,对于今后研
制嵌入式语音识别API及语音识别片上系统(SOC)具有很好的参考意义。
目前系统已在各个平台上实现并进行了综合评估,今后进一步的工作是:在语音识别算法 方面,为了增强系统的环境鲁棒性,需要研究计算量和存储空间消耗都比较少的噪声消除或补 偿算法、可靠的集外词和噪声的拒识算法等;在嵌入式平台方面,研发语音识别前端的专用处 理模块,使其能执行更为复杂的语音信号前端处理算法。 参 考 文 献:
[1] Lawrence Rabiner,Biing-Hwang Juang.语音识别基本原理(影印版)[M].北京:清华大学出版社,1999.
[2] 杨行峻,迟惠生.语音信号数字处理[M].西安:电子工业出版社,1995.
[3] 高升.语境相关的声学模型和搜索策略的研究[D].中国科学院图书馆:中国科学院自动化研究所博士 学位论文,2001.
[4] 高升,徐波,黄泰翼.基于决策树的汉语三音子模型[J].声学学报,2000,25(6).
[5] 马龙.汉语命令词识别,关键词检测的研究与应用[D].中国科学院图书馆:中国科学院自动化研究所
硕士学位论文,2002.
[6] 易克初,田斌,付强.语音信号处理[M].北京:国防工业出版社,2000.
[7] 丁国宏,李成荣,徐波.非特定人孤立词语音识别系统在定点DSP上的应用[A].第六届全国人机语音
通讯会议[C],2001.
[8] B.H.Juang.The past,present and future of speech processing[J].IEEE Signal Processing Magzine,May,1998.
[9] [英]Steve Furber著,田泽等译.ARMSoc体系结构
…… 此处隐藏:1547字,全部文档内容请下载后查看。喜欢就下载吧 ……相关推荐:
- [高等教育]公司协助某村精准扶贫工作总结.doc
- [高等教育]高二生物知识点总结(全)
- [高等教育]苏教版数学三年级下册《解决问题的策略
- [高等教育]仪器分析课程学习心得
- [高等教育]2017年五邑大学数学与计算科学学院333
- [高等教育]人教版七年级下册语文第四单元测试题(
- [高等教育]2018年秋七年级英语上册Unit7Howmuchar
- [高等教育]2017年八年级下数学教学工作小结
- [高等教育]湖南省怀化市2019届高三统一模拟考试(
- [高等教育]四年级下册科学_基础训练及答案教材
- [高等教育]城郊煤矿西风井管路伸缩器更换施工安全
- [高等教育]昆八中20182019学年度上学期期末考试
- [高等教育]项目部各类人员任命书
- [高等教育]上市公司经营水务产业的模式
- [高等教育]人教版高二化学第一学期第三章水溶液中
- [高等教育]【中考物理第一轮复习资料】四.压强与
- [高等教育]金坑水电站报废改建工程机电设备更新改
- [高等教育]高中生物教学工作计划简易版
- [高等教育]2017年西华大学攀枝花学院(联合办学)44
- [高等教育]最新整理超短爆笑英文小笑话大全
- 优秀教师继续教育学习心得体会
- 阳历到阴历的转换
- 留守儿童教育案例分析
- 华师17春秋学期《玩教具制作与环境布置
- 测速传感器新型安装装置的现场应用
- 人教版小学数学三年级下册第四单元
- 创业个人意向书
- 山东省潍坊市2012年高考仿真试题(三)
- [恒心][好卷速递]四川省成都外国语学校
- 多少人错把好转反应当成了病情加重处理
- 中外广播电视史复习资料整理
- 江苏省扬州市江都区宜陵镇中学2014-201
- 工程造价专业毕业实习报告
- 广西师范学院心理与教育统计
- aympkrq基于 - asp的博客网站设计与开
- 建筑业外出经营相关流程操作(营改增后
- 人治 德治 法治
- [精华篇]常识判断专项训练题库
- 中国共产党为什么要实行民主集中
- 小学数学第三册第一单元试卷(A、B、C




