基于音素解码的语种识别系统联合自适应算法研究
针对真实环境下的语种识别,信道类型和通话内容等非语种方面因素的不同都会造成测试和训练条件的不匹配,从而影响系统的识别性能.本文以音素识别器后接向量空间模型(Phone recognizer followed by vector space model,PRVSM)为语种识别系统,引入联合自适应算法来解决系统中测试和训练条件的失配问题.研究了三种自适应方法用于系统的不同阶段:1)基于受约束的最大似然线性回归(Constrained maximum likelihood linear regression,CMLLR)的声学模型自适应;2)基于全局N元文法的音位特征向量自适应;3)VSM模型中的支持向量机(Support vector machines,SVM)自适应.在综合采用多种自适应技术后,PRVSM系统的性能有了较大的提高,在NIST LRE 2009测试库上对于30s、10s和3s的测试段,基于不同音素识别器的PRVSM系统的等错误率(Equal error rate,EER)分别相对降低了18%~23%、12%~20%以及5%~9%.
语种识别、音素识别器后接向量空间模型、联合自适应、受约束的最大似然线性回归、支持向量机自适应
38
TN912.34
国家自然科学基金60931160443;61005019
2012-08-27(万方平台首次上网日期,不代表论文的发表时间)
652-658