摘要
数据信息交流和社交方式在互联网+时代都呈现了新的发展态势,自媒体等新的数据产生方式让大数据时代来临。海量数据在大数据时代需要新的技术手段和方法,对数据存储、处理、检索和计算进行新的设计,尤其在数据挖掘领域,面临很多新的课题和挑战。当前,很多的传统数据挖掘算法只能在数据量较小的情况下适用,在串行的小规模输入数据环境下,算法还能适应。当数据量规模增大甚至呈指数形式增长时,时间复杂度和计算量也同步增长,需要对算法进行适应大数据的改进。云计算和云平台的使用为存储和分析海量数据提供可靠的实现手段,对数据挖掘算法的改进提供了高效的解决方案。文中在Hadoop、MapReduce框架下开展并行的SLIQ算法改进方案,改进算法很好地适应了云平台环境和海量数据,提高了运行效率。
- 单位