面向学术资源的术语区分能力的测度方法研究

王昊; 唐慧慧; 张海潮; 张进; 张紫玄

摘要

改进索引术语质量的衡量方法可以有效提高IR系统的检索效率,但术语的固有属性易受文档长度影响,难以全面衡量术语质量。对此,本文从术语内在的区分性出发,借鉴词袋模型的基本思想,提出了术语区分能力(term discriminative capacity,TDC)这一理论及3种不同的计算方法。本文还采集了Web of Science的3个子数据库中包含4个著录项的900条记录作为实验数据,来实现TDC的大规模计算,并观察3种算法在实践中的差异。经过实验分析得出,计算术语区分能力的最佳方法为TDC-T,该算法在多个方面表现稳定,且不受DF值的影响,可以作为衡量术语质量的全新指标,记为TDC。但是本研究所选取的A&HCI数据库的记录较少,这或许会造成另两个领域计算结果的失衡。

单位
南京大学

收藏分享被引(9) 浏览

更新时间：2024-04-10 06:16

面向学术资源的术语区分能力的测度方法研究

摘要

产品服务

站内浏览

服务支持

联系方式

科研之友