分块布局下的主题型网页的内容抽取

聂卉; 张津华

doi:10.3772/j.issn.1000-0135.2012.01.005

摘要

本篇论文以去除网页噪声,整合网页内容为目标,提出了面向主题型网页,根据网页规划布局抽取网页内容的方法.算法首先分析原始网页的DOM结构生成标签树,再根据标签分类和对应节点的信息对标签树自底向上进行划分,并依据划分块的文字密度,链接密度及图片密度,分类信息块.进一步,提炼网页主题的文本特征向量,采用基于词条空间的文本相似度计算,获取划分块的主题相关度,以主题相关度为量化基准剔除噪声,识别网页主旨内容,重构页面描述.这一算法被应用于面向人才资讯的信息采集项目中,实验表明,算法适用于主题型网页的"去噪"及内容提取,具体应用中有较理想的表现.

单位
中山大学

全文

访问全文

收藏分享被引浏览

更新时间：2023-12-23 17:09

分块布局下的主题型网页的内容抽取

摘要

全文

产品服务

站内浏览

服务支持

联系方式

科研之友