基于加权语义网的改进文本相似度计算方法

张弛; 张贯虹; 周艳玲<sup>*</sup>

摘要

为了提高特征词权重和文本语义相似度计算的精确性,文章提出了一种基于加权语义网的改进文本相似度计算方法。该方法首先以特征词为节点,以特征词窗口共现原理创建边,以频率-逆文本频率(term frequency-inverse document frequency,TF-IDF)值作为特征词节点的初始权值,融合共现频率和概念语义距离自定义边权重计算方法,构建加权文本语义复杂网络。然后使用语义网络中特征词综合特征指数排名靠前的m个词组成特征向量,利用搬土距离(earth mover’s distance,EMD)衡量两个文本间的语义相似度。最后基于公开数据集对文本进行聚类实验,实验结果表明,在基于F1度量值标准上文章提出的方法要优于传统的文本相似度计算方法。

单位
合肥学院

收藏分享被引浏览

更新时间：2024-04-10 02:10

基于加权语义网的改进文本相似度计算方法

摘要

产品服务

站内浏览

服务支持

联系方式

科研之友