摘要
由于对聚类网格之间的相互影响未作出考虑,导致数据聚类算法出现聚类质量差等情况。因此,提出一种基于网格耦合的混合属性大数据聚类算法。通过网格耦合定义相关参量的基础,得到网格耦合过程中网格质心间距,利用网格进行大数据聚类,充分分析各个网格间权重影响情况。该聚类算法分别从在线和离线两个阶段开展:在线阶段更新网格特征向量,并根据属性动态变化划分网格;离线阶段构建无向图,顶点设置为网络中心点,质心距离以及中心点间距作为边构建无相图,根据该图获得最小生成树同时切断该树第r-1最大边,最终获取混合属性大数据的k个聚类,实现混合属性的准确聚类。实验结果表明,该算法在质心调节参数与质心距离取值较适中情况下具有良好聚类效果,且聚类质量与聚类效率较高。
-
单位安徽工业大学工商学院