论文部分内容阅读
不平衡分类问题的特征是样本集中每类样本个数相差较大,导致分类结果偏向多数类样本,少数类样本被忽视。而在不平衡分类问题中,少数类样本需要更多的关注。本文基于上海曙光医院提供的心衰医疗数据,提出了一个针对心衰病人死亡率预测的框架,为心衰的辅助治疗和诊断提供有效的信息。心衰医疗病例属于典型的不平衡分类问题,心衰病人在总的病人数量中只占少数,在检查中,应尽可能重点关注心衰病例。本文提出的框架采用下采样方法调整样本的比例,使类与类之间的规模平衡;使用主成分分析方法对高维数据进行特征选择;并在采样后的数据集上训