10.3969/j.issn.1002-137X.2013.09.045
基于分割识别的蒙古语语音关键词检测方法的研究
蒙古文属于黏着语,词根和后缀能够组合成近百万的蒙古文单词.现有的蒙古语大词汇量连续语音识别(LVCSR)系统的发音词典无法包含所有蒙古文单词.同时发音词典较大时,训练语料的稀疏将导致LVCSR系统的性能明显下降.为了解决LVCSR系统中大多数蒙古文单词的识别问题和蒙古语语音关键词检测系统中大量集外词的检测问题,结合蒙古文的构词特点,提出了基于分割识别的蒙古语LVCSR方法,并建立了对应的声学模型和语言模型.最后,将此方法应用到了蒙古语语音关键词检测系统中并在蒙古语语音语料上进行了测试.实验结果表明,基于分割识别的蒙古语LVCSR方法能解决大部分蒙古文单词的识别问题,并将蒙古语语音关键词检测系统的大量集外词转化成了集内词,大幅度提高了检测系统的查准率和召回率.
蒙古语、词干、结尾后缀、关键词检测、集外词、混淆网络
40
TP391.1(计算技术、计算机技术)
国家自然科学基金项目61263037,71163029;内蒙古自然科学基金重大项目2011ZD11
2013-11-11(万方平台首次上网日期,不代表论文的发表时间)
共4页
208-211