摘要
为解决传统基于贝叶斯理论的概率模糊聚类(Bayesian Fuzzy Clustering,BFC)算法在处理大规模数据集聚类时的时间开销和存储代价瓶颈,提出基于数据分块的单程自适应加权BFC算法,算法在大规模数据集分块的基础上,设计了基于数据加权的改进BFC算法,用于数据分块内数据聚类,以挑选出对聚类贡献最具代表的标识数据及其自适应权值,在块间迭代聚类过程中,将标识数据及其权值合并到下一数据块中并参与聚类,从而将上一数据块的聚类信息有效地传递到下一数据块中,最后分析算法的收敛性和时间复杂度。实验结果表明,算法在继承传统BFC算法良好聚类性能基础上,减少计算复杂度,有效提高聚类效率,适用于大规模数据集聚类。
-
单位吉林大学; 辽宁对外经贸学院