摘要
针对当前大多微博情绪分析算法难以准确描绘不同情绪差异的问题,对中文微博的情绪成分和层次化情绪分类进行研究。预处理消除非情绪信息,引入ICTCLAS分词工具包对文章进行分割,提取形容词、名词和动词等,形成特征,使用卡方测试、词频和点互信息(PMI)对特征进行选择,运用支持向量回归(SVR)和规则集进行分类。数据集采用新浪原始中文微博,不同分组之间的实验结果验证了该方法的有效性,其在多个层次上的F测度等值优于其它同类方法,随机挑选50篇微博进行评判,近一半的结果得到所有评判员的支持。
-
单位天津市职业大学; 电子信息工程学院