摘要
目的针对缺血性脑卒中这一发病率高、预后差的疾病,应用自然语言处理技术从患者出院小结中进行文本数据挖掘,并通过Python编程语言将非结构化的文本数据转换成供后续统计分析的结构化数据库。方法利用缺血性脑卒中患者出院小结资料,构建基于知识增强的语义表示模型(ERNIE)+神经网络+条件随机场的命名实体识别模型,进行疾病、药物、手术、影像学检查、症状5种医疗命名实体的识别,提取实体构建半结构化数据库。为了进一步从半结构化数据库中提取出结构化数据,构建基于ERNIE的孪生文本相似度匹配模型,评价指标为准确率,采用最优模型构建协变量提取器。结果命名实体识别模型总体F1值为90.27%,其中疾病F1值为88.41%,药物F1值为91.03%,影像学检查F1值为87.71%,手术F1值为87.07%,症状F1值为96.59%。文本相似度匹配模型的总体准确率为99.11%。结论通过自然语言处理技术,实现了从完全的非结构化数据到半结构化数据再到结构化数据的构建流程,与人工阅读病历并手动提取病历信息相比,极大提高了数据库构建的效率。
- 单位