基于统计特征的Quality Phrase挖掘方法

杨欢欢; 赵书良<sup>*</sup>; ***; 武永亮; 田国强

doi:10.16337/j.1004-9037.2020.03.009

摘要

Quality Phrase挖掘是从文本语料库中提取有意义短语的过程,是文档摘要、信息检索等任务的基础。然而现有的无监督短语挖掘方法存在候选短语质量不高、Quality Phrase的特征权重平均分配的问题。本文提出基于统计特征的Quality Phrase挖掘方法,将频繁N-Gram挖掘、多词短语组合性约束及单词短语拼写检查相结合,保证了候选短语的质量;引入公共知识库对候选短语添加类别标签,实现了Quality Phrase特征权重的分配,并考虑特征之间相互影响设置惩罚因子调整权重比例;按照候选短语的特征加权函数得分排序,提取Quality Phrase。实验结果表明,基于统计特征的Quality Phrase挖掘方法明显提高了短语挖掘的精度,与最优的无监督短语挖掘方法相比,精确率、召回率及F1-Score分别提升了5.97%,1.77%和4.02%。

单位
河北师范大学; 河北地质大学

全文

访问全文

收藏分享被引(3) 浏览

更新时间：2024-04-13 15:35

基于统计特征的Quality Phrase挖掘方法

摘要

全文

产品服务

站内浏览

服务支持

联系方式

科研之友