基于重采样技术在医学不平衡数据分类中的应用研究期刊界 All Journals 搜尽天下杂志传播学术成果专业期刊搜索期刊信息化学术搜索

基于重采样技术在医学不平衡数据分类中的应用研究

作者姓名：	闫慈田翔华阿拉依·阿汗张伟文曹明芹

作者单位：	新疆医科大学公共卫生学院流行病与卫生统计学教研室;新疆医科大学医学工程技术学院计算机教研室

摘要：	目的以代谢综合征为例,探讨不平衡数据对分类算法的影响,并运用重采样技术对数据进行平衡化处理,比较神经网络、决策树的分类性能。方法采用随机过采样、随机欠采样、混合采样和人工合成数据四种重采样技术,比较数据重采样前后及四种数据重采样间使用神经网络、决策树分类的性能,以F-Measure,G-mean和AUC作为模型评价指标。结果(1)分类算法性能随不平衡数据集不平衡比例的加剧而降低;(2)四种重采样技术中随机过采样后作用于BP神经网络、C4.5决策树分类性能最大。结论分类性能随数据集中患病率的降低而下降。采用随机过采样提高了算法的分类性能。建议在应用分类算法对医学不平衡数据分类前,采用随机过采样技术以提高分类性能。
本文献已被 CNKI 等数据库收录！