针对不平衡数据的过采样和随机森林改进算法

引用

摘要：

针对数据不平衡带来的少数类样本识别率低的问题,提出通过加权策略对过采样和随机森林进行改进的算法,从数据预处理和算法两个方面降低数据不平衡对分类器的影响.数据预处理阶段应用合成少数类过采样技术(Synthetic Minority Oversampling Technique,SMOTE)降低数据不平衡度,每个少数类样本根据其相对于剩余样本的欧氏距离分配权重,使每个样本合成不同数量的新样本.算法改进阶段利用Kappa系数评价随机森林中决策树训练后的分类效果,并赋予每棵树相应的权重,使分类能力更好的树在投票阶段有更大的投票权,提高随机森林算法对不平衡数据的整体分类性能.在KEEL数据集上的实验表明,与未改进算法相比,改进后的算法对少数类样本分类准确率和整体样本分类性能有所提升.

关键词：数据不平衡、合成少数类过采样技术(SMOTE)、Kappa系数、随机森林

所属期刊栏目：56

分类号：TP391(计算技术、计算机技术)

在线出版日期：2020-06-10（万方平台首次上网日期，不代表论文的发表时间）

页数：共7页

页码：39-45

英文信息展示

期刊专题