汉语文本可读性特征体系构建和效度验证

引用

摘要：

本文研究如何利用汉语文本的语言特征对文本的可读性进行分析.首先从汉字、词汇、句法和篇章四个层面出发,构建了一个预测汉语文本可读性的多层面、多维度特征体系,该特征体系包含13个维度共104项指标.然后以12个年级的语文教材语料库为基础,通过建立机器学习模型考察不同层面、不同维度语言特征的预测能力.实验结果显示:汉字、词汇、句法和篇章四个层面中,基于词汇层面特征的模型准确率最高,基于篇章层面特征的模型准确率最低;13个维度中,预测准确率最高的前5个维度依次为汉字熟悉度、汉字多样性、词汇多样性、短语句法结构复杂度和词汇熟悉度.我们还发现,四个层面语言特征对低难度文本的预测能力均最强.

关键词：汉语文本可读性、语言特征、机器学习、效度验证

所属期刊栏目：34

分类号：H319;U115;F272.92

资助基金：国家社会科学基金;教育部人文社会科学研究项目;北京语言大学一流学科团队支持计划

在线出版日期：2020-05-07（万方平台首次上网日期，不代表论文的发表时间）

页数：共17页

页码：81-97

英文信息展示

期刊专题