DOI：10.11896/j.issn.1002-137X.2017.06.044

类别严重不均衡应用的在线数据流学习算法

引用

摘要：

集成式数据流挖掘是对存在概念漂移的数据流进行学习的重要方法.对于类别分布严重不均衡的应用,集成式数据流挖掘中数据块的学习方式导致样本数多的类别的分类精度高,样本数少的类别的分类精度低的问题,现有算法无法满足此类应用的需求.针对上述问题,对基于回忆机制的集成式数据流学习算法MAE(Memorizing based Adaptive Ensemble)进行改进,提出面向类别严重不均衡应用的在线数据流学习算法UMAE(Unbalanced data Learning based on MAE).UMAE算法为每个类别设置了一个样本滑动窗口,对于新到达的数据块,其样本依据自身的类别分别进入相应的滑动窗口,最后利用各类别滑动窗口内的样本构建用于在线学习的数据块.与5种典型的数据流挖掘算法的比较结果表明,UMAE算法在满足实时性的同时,不仅整体分类精度高,而且对于样本数很少的小类别的分类精度有大幅度提高;对于异常检测等类别分布严重不均衡的应用,UMAE算法的实用性明显优于其他算法.

关键词：在线学习、数据流挖掘、回忆与遗忘机制、不均衡数据学习

所属期刊栏目：44

分类号：TP181(自动化基础理论)

资助基金：国家自然科学基金61272141,61120106005,61472136;国防科技大学高性能计算国家重点实验室基金201513-02

在线出版日期：2017-07-13（万方平台首次上网日期，不代表论文的发表时间）

页数：共5页

页码：255-259

英文信息展示

期刊专题