摘要

随着信息化时代的快速发展,大数据的价值正逐渐显现,如何利用爬虫技术从网页中采集高质量的海量数据成为大数据技术面临的一个基本问题。文章对深层网页垂直爬虫动态网页的加载、数据块的定位与抽取、数据实体的分析和爬取策略等关键技术进行系统介绍与分析。在此基础上,提出深层网页垂直爬虫所面临的困难与挑战,以及今后的研究方向。