基于决策树的分类方法研究

被引量 : 0次 | 上传用户:zhuchunjiangqq
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
数据挖掘,又称数据库中的知识发现,是指从大型数据库或数据仓库中提取具有潜在应用价值的知识或模式。模式按其作用可分为两类:描述型模式和预测型模式。分类模式是一种重要的预测型模式。挖掘分类模式的方法有多种,如决策树方法、贝叶斯网络、遗传算法、基于关联的分类方法、粗糙集和k-最临近方法等等。 本文研究如何用决策树方法进行分类模式挖掘。文中详细阐述了几种极具代表性的决策树算法:包括使用信息熵原理分割样本集的ID3算法;可以处理连续属性和属性值空缺样本的C4.5算法;依据GINI系数寻找最佳分割并生成二叉决策树的CART算法;将树剪枝融入到建树过程中的PUBLIC算法;在决策树生成过程中加入人工智能和人为干预的基于人机交互的决策树生成方法;以及突破主存容量限制,具有良好的伸缩性和并行性的SLIQ和SPRINT算法。对这些算法的特点作了详细的分析和比较,指出了它们各自的优势和不足。文中对分布式环境下的决策树分类方法进行了描述,提出了分布式ID3算法。该算法在传统的ID3算法的基础上引进了新的数据结构:属性按类别分布表,使得算法具有可伸缩性和并行性。最后着重介绍了作者独立完成的一个决策树分类器。它使用的核心算法为可伸缩的ID3算法,分类器使用Microsoft Visual C++6.0开发。实验结果表明作者开发的分类器可以有效地生成决策树,建树时间随样本集个数呈线性增长,具有可伸缩性。
其他文献
通过对公立医院运营效率评价方法的分析,归纳总结各种方法的缺陷和不足,运用杜邦模型对某公立医院2004~2009年的运营状况进行实证分析,提出相关建议,并对其局限性进行说明,如
本文设计了一种X光信号采集模块。在给出了信号采集模块设计方案基础上,设计了信号采集模块的硬件电路,包括信号调理电路、A/D转换电路,制作了电路板,并进行了实验与调试。本
本文对信息技术和研究性学习整合的改革实验进行了实践总结和理论探讨。在分析国内外普通高中开设信息技术和研究性学习课程的历史背景、现状和存在问题的基础上,提出了通过研
钢铁产品属标准化产品,差异性较小,市场需求弹性不大,我国钢铁行业产业集中度和专业化水平较低。在国际国内钢铁市场严重供过于求的形势下,以“价格战”形式表现出来的低价竞争是
本文主要研究了电力变压器状态监测与故障诊断的现状以及存在的问题,针对目前DGA(油中溶解气体色谱分析法)只能定性分析变压器的故障,不能进行故障定位,而局部放电虽然能够进行
长期以来,黄河宁夏段河道基本处于自然状态,主流摆动频繁,防洪问题突出,影响了当地经济发展和社会的稳定。1998年以来,国家加大投入力度,加强河道治理,但由于缺乏对该段河道的系统研
本论文通过向聚芳醚酮主链中引入苯胺齐聚物链段单元的方法,合成了一种新型的具有电活性的聚芳醚酮材料,使其不仅具有聚苯胺的电化学性质,还具有聚芳醚酮的热稳定性。并根据
<正>(2016年11月22日)同志们:现在,我代表中国共产党内蒙古自治区第九届委员会向大会作报告。自治区第十次党代会,是在我区进入全面建成小康社会决胜阶段和深入学习贯彻党的
北传佛教广泛传播于亚洲的很多国家和地区,其戒律为“三藏”之一,是佛法的根本。戒律在僧团中是至关重要的,佛教的发展必然离不开严持戒律,本文以佛祖制定的戒律为研究对象,分析、