10.13266/j.issn.0252-3116.2015.11.018
以《汉学引得丛刊》为领域词表的先秦典籍自动分词探讨
[目的/意义]在人文计算兴起这一背景下,为了更加深入和精准地从古代典籍中挖掘出相应的知识,针对先秦文献进行自动分词的探究.[方法/过程]基于《汉学引得丛刊》中的《春秋经传注疏引书引得》制定词汇表,在由《春秋左氏传》和《晏子春秋》所构成的训练和测试语料上,通过条件随机场模型,结合使用统计和人工内省方法确定的特征模板,完成对先秦典籍进行自动分词的探究.[结果/结论]在先秦典籍自动分词的整个流程基础上,得到简单特征模板、内部特征模板和组合特征模板下的自动分词模型,最好的分词模型调和平均值达到97.47%,具有较强的推广和应用价值.在构建自动分词模型的过程中,通过融入内部和外部的特征知识,模型的精确率和召回率得到有效的提升.
人文计算、《汉学引得丛刊》、条件随机场模型、特征模板
G255.1(图书馆学、图书馆事业)
2015-08-31(万方平台首次上网日期,不代表论文的发表时间)
127-133