基于项编码的分布式频繁项集挖掘算法

郑静益; 邓晓衡<sup>*</sup>

doi:10.19734/j.issn.1001-3695.2017.11.0791

摘要

Apriori算法是解决频繁项集挖掘最常用的算法之一,但多轮迭代扫描完整数据集的计算方式,严重影响算法效率且难以并行化处理。随着数据规模的持续增大,这一问题日益严重。针对这一问题,提出了一种基于项编码和Spark计算框架的Apriori并行化处理方法——IEBDA算法,利用项编码完整保存项集信息,在不重复扫描完整数据集的情况下完成频繁项集挖掘,同时利用Spark的广播变量实现并行化处理。与其他分布式Apriori算法在不同规模的数据集上进行性能比较,发现IEBDA算法从第一轮迭代后加速效果明显。结果表明,该算法可以提高大数据环境下多轮迭代的频繁项集挖掘效率。

单位
中南大学

全文

访问全文

收藏分享被引浏览

更新时间：2024-04-11 15:34

基于项编码的分布式频繁项集挖掘算法

摘要

全文

产品服务

站内浏览

服务支持

联系方式

科研之友