摘要

[目的/意义]基于深度学习的中共党史文献命名实体识别,有助于探索与挖掘党史资源的价值,对于构建中共党史领域专业术语库、知识图谱、知识问答系统等应用发挥着基础性作用,为进一步的智慧化的中共党史数字人文研究提供基础支撑。[方法/过程]本研究采用基于Trie树的字符串匹配算法完成实验语料的批量标注任务,利用中文XLNet(Generalized Autoregressive Pretraining for Language Understanding,XLNet)预训练模型嵌入主流BiLSTM-CRF模型中,构建基于XLNet-BiLSTM-CRF的中共党史文献命名实体识别模型。[结果/结论]该模型在命名实体识别中表现优异,其调和平均数F值为0.9535,高于BiLSTM-CRF、BERT-BiLSTM-CRF、BERT-wwmext-BiLSTM-CRF、XLNet-CRF等深度学习模型。研究表明本文提出的方法对于中共党史非结构化文本挖掘工作具有可行性和有效性。