中文科技政策文本分类：增强的TextCNN视角

李牧南; 王良; 赖华鹏

doi:10.3969/j.issn.1000-7695.2023.2.020

摘要

近年尽管针对中文本文分类的研究成果不少，但基于深度学习对中文政策等长文本进行自动分类的研究还不多见。为此，借鉴和拓展传统的数据增强方法，提出集成新时代人民日报分词语料库（NEPD）、简单数据增强（EDA）算法、word2vec和文本卷积神经网络（TextCNN）的NEWT新型计算框架；实证部分，基于中国地方政府发布的科技政策文本进行算法校验。实验结果显示，在取词长度分别为500、750和1 000词的情况下，应用NEWT算法对中文科技政策文本进行分类的效果优于RCNN、Bi-LSTM和CapsNet等传统深度学习模型，F1值的平均提升比例超过13%；同时，NEWT在较短取词长度下能够实现全文输入的近似效果，可以部分改善传统深度学习模型在中文长文本自动分类任务中的计算效率。

单位
华南理工大学

全文

访问全文

收藏分享被引浏览

更新时间：2025-03-27 18:14

中文科技政策文本分类：增强的TextCNN视角

摘要

全文

产品服务

站内浏览

服务支持

联系方式

科研之友