数字人文视域下面向历史古籍的信息抽取方法研究

引用

摘要：

数字人文旨在采用现代计算机网络技术助力传统人文研究,文言历史古籍是进行历史研究和学习的重要基础,但由于其写作语言为文言文,与现代所用的白话文在语法和词义上均有较大差别,因此不易于阅读和理解.针对上述问题,提出基于预训练模型对历史古籍中的实体和关系等进行知识抽取的方法,从而有效获取历史古籍文本中蕴含的丰富信息.该模型首先采用多级预训练任务代替BERT原有的预训练任务,以充分捕获语义信息,此外在BERT模型的基础上添加了卷积层及句子级聚合等结构,以进一步优化生成的词表示.然后,针对文言文标注数据稀缺的问题,构建了一个面向历史古籍文本标注任务的众包系统,获取高质量、大规模的实体和关系数据,完成文言文知识抽取数据集的构建,评估模型性能,并对模型进行微调.在构建的数据集及GulianNER数据集上的实验证明了提出模型的有效性.

关键词：历史古籍、预训练模型、信息抽取、众包机制

所属期刊栏目：8

分类号：TP391.1(计算技术、计算机技术)

资助基金：科技创新新一代人工智能重大项目;国家自然科学基金

在线出版日期：2022-12-08（万方平台首次上网日期，不代表论文的发表时间）

页数：共14页

页码：26-39

英文信息展示

期刊专题