基于外部ID的中文实体对齐分析——以中国科学院院士Wikidata数据子集为例-期刊-万方数据知识服务平台

搜索

DOI: 10.13666/j.cnki.jnlc.2020.0211

基于外部ID的中文实体对齐分析——以中国科学院院士Wikidata数据子集为例

王瑞云 ¹

贾君枝 ²

1.山西大学经济与管理学院2.中国人民大学信息资源管理学院

在线阅读下载

引用

打印

摘要：本文尝试解决中文学者命名实体与外部知识库的实体对齐短缺的问题.通过SPARQL语义查询抽取维基数据子图——中国科学院院士的知识图谱子图,初步构建国内知识库的中文院士实体与Wikidata实体的对齐以及与外部ID对应的知识库的实体对齐.对院士实体的三个数量型特征对齐的外部ID个数(ids)、不同语种的Wikipedia站点个数(sites)、实体的全部陈述个数(states)与目标分类(有无VIAF实体对齐)的相关分析发现,目标分类与ids特征正向相关最强,直接VIAF实体对齐只存在ids高区的院士,占比偏低.因此,提出利用LC、ISNI等外部ID,应用VIAF对重要来源库的重定向功能,构建间接的VIAF实体对齐的方法.本文为中文知识库进行外部实体对齐提供了可行的初步方案,提出的实验方法显著地提高了较小ids值(1-7)的院士拥有VIAF实体对齐的个数,最终通过实体对齐的VIAF信息集成增加了院士实体的ids数量,丰富了中文学者与外部知识库的实体对齐信息.

关键词：

外部ID Wikidata VIAF 命名实体对齐

机标分类号：

TP311(计算技术、计算机技术)G25(图书馆事业、信息事业)Q963(昆虫遗传学)

资助基金：

国家社会科学基金 ( 18BTQ072 )

在线出版日期：

2020-06-08 （万方平台首次上网日期，不代表论文的发表时间）

页数：

12 ( 102-112,封3 )

英文信息

同项目论文