一种基于空间映射及尺度变换的聚类框架

来源 :第五届全国信息检索学术会议CCIR2009 | 被引量 : 0次 | 上传用户:qinzhenxing
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
传统聚类算法通常建立在显式的模型之上,却很少考虑泛化模型以适应不同的数据,由此导致了模型不匹配问题。针对此问题,本文提出了一种基于空间映射(Mapping)及尺度变换(Rescaling)的聚类框架(简称M-R框架)。具体而言,M-R框架首先将语料映射到一组具有良好区分度的方向所构建的坐标系中,以统计各个簇的分布特性,然后根据这些分布特性对各个坐标轴进行尺度变换,以归一化语料中各个类簇的分布。如上两步操作伴随算法迭代执行,直至算法收敛。本文将M-R框架应用到k-means算法及谱聚类算法上以验证其性能,在国际知名评测语料上的实验表明,应用了M-R框架的k-meands及谱聚类在所有语料集上获得了全面的性能提升。
其他文献
随着Web上文档数量的指数型增长,文档摘要起到越来越重要的作用,近年来使用概率主题模型表示多文档摘要问题受到研究者的关注。LDA(LatentDirichlet Allocation)是主题模型中具
会议
期刊
高校BBS论坛信息内容与学校日常工作、校园学生活动密切相关,其信息丰富且更新速度快。但是BBS上各版面的讨论内容并不严格与其版面名称相对应,因而会使信息显得杂乱。聚类技术
会议
蛋白质络合物在很多生物学过程中起到了关键的作用,是深入理解细胞组织原理的基础。随着生物高通量技术的不断发展和广泛应用,蛋白质相互关系的数据量随之不断膨胀,这些数据为蛋
会议
基于统计的领域术语抽取方法近年来得到了广泛的研究。然而领域术语抽取方法与领域相关,并且评价需要大量的人力资源,因此对这些方法进行比较存在着一定的困难。因此本文采用基
会议
仿生模式识别是一种不同于传统模式识别的理论方法,其理论基点是特征空间中同源样本的连续性原理,并通过对同类样本在高维空间中的最佳覆盖来达到认识和区分样本的目的。本文对
会议
提出一种采用树型概要结构的密度网格树流聚类算法DG-Tree(Density and Grid-Tree Algorithm)。该算法利用数据流聚类算法CluStream中的处理框架,把聚类分为微聚类和宏聚类两
会议
本文使用multi-agent的建模思想,以现实为基础建立了一个舆论涌现的仿真模型。该模型主要由个体和媒体以及它们之间的规则组成。个体的属性包括了个体之间的信任度、个体观点
会议
本文通过对呼和浩特市失地农民状况的调查和对失地农民养老保险实施办法的研究,分析了现行办法在引入商业保险运作理念方面的先进性,同时结合呼和浩特市的现状,对现行失地农