摘要
针对中文问题分类方法中特征向量维数过高导致处理速度过慢的问题,提出一种基于局部鉴别索引和支持向量聚类的中文问题分类方法。首先利用局部鉴别索引算法对原始高维问句数据集进行降维,将其映射到一个低维空间中,然后通过支持向量聚类算法对问句进行分类。在哈工大社会计算与信息检索研究中心的中文问题集上进行实验,实验结果证明了该方法的有效性,大类准确率87.6%,小类准确率72.5%,取得了较好的效果。
-
单位山西职工医学院; 山西省疾病预防控制中心; 太原理工大学