摘要

生物医学领域新增实体数量和类型迅速增加,在预训练词表容量有限的情况下,字符嵌入可以在一定程度上解决未登录词问题,单一的字符级特征提取器所提取字符嵌入的潜在表征有一定局限性.针对此问题,提出一种字符级特征自适应融合的生物医学命名实体模型.首先利用卷积神经网络(CNN)和双向长短期记忆网络(BiLSTM)提取文本的字符向量,训练过程中动态计算文本单词两种字符向量的权重并进行拼接,使得模型在字符粒度上更加充分的利用信息,并加入词性信息和组块分析作为额外特征;将词向量、字符级特征和额外特征拼接后输入到BiLSTM-CRF神经网络模型进行训练.结果表明,所提模型在NCBI-disease和BiocreativeⅡGM语料库上平均F1值达到87.14%和81.04%,有效的提升了生物医学命名实体识别的效果.