基于二元背景模型的新词发现

引用

摘要：

该文提出一种基于二元背景模型的新词发现方法。采用前、背景语料二元似然比挑选候选二元组（bigram）;然后根据频率、刚性、条件概率等基于前景语料的统计量,对二元组进行进一步筛选和扩展,以确定新词边界。用该方法提取出的词既包含新词特征,又可以成词。而且该方法充分利用现有背景生语料却无需分词等标注信息,不依赖词典、分词模型和规则,具有良好的扩展性。为了得到更好的发现效果,还讨论了各统计量阈值的选取策略和垃圾元素剔除策略。该方法在网络小说语料上验证了其有效性。

关键词：新词发现、二元组、背景模型、似然比

所属期刊栏目：51

分类号：TP391(计算技术、计算机技术)

在线出版日期：2012-04-21（万方平台首次上网日期，不代表论文的发表时间）

页码：1317-1320

英文信息展示

期刊专题