基于改进K-means算法的微博舆情分析研究

谢修娟; 李香菊; 莫凌飞

摘要

为避免初始聚类中心选取到孤立点容易导致聚类结果陷入局部最优的不足,提出一种基于密度的K-means(聚类算法)初始聚类中心选择方法。该方法首先计算每个数据对象与其它数据对象间的平均相似度,找出平均相似度高于某固定阈值的对象视作核心对象,再从核心对象中选取彼此间最不相似的作为初始聚类中心。通过自构建的新浪微博抓取工具,分别抓取不同类别的数千条数据,经过分词、预处理及权重计算后,用改进的K-means算法对其进行聚类分析,查准/全率较传统的K-means算法要稳定,聚类的平均时间也得到缩短。实验结果表明,改进后的算法在微博聚类中有更高的准确性和稳定性,有利于从大量的微博数据中发现热点舆情。

单位
东南大学; 东南大学成贤学院

收藏分享被引浏览

更新时间：2024-04-24 22:20

基于改进K-means算法的微博舆情分析研究

摘要

产品服务

站内浏览

服务支持

联系方式

科研之友