基于高斯混合模型的现代汉语构式成分自动标注方法

黄海斌; 常宝宝; 詹卫东<sup>*</sup>

摘要

现代汉语构式成分自动标注作为文本自动标注任务之一,其最大的困难在于,当不存在标注语料作为训练数据时,如何从生语料中挖掘不同类型的构式成分相关的知识并进行标注,特别是面对构式序列在句中的边界难以判断的情况。该文试图借助高斯混合模型聚类方法,结合句中每一个字的位置特征与构式形式本身的语言学特征,融合正则表达式匹配结果信息,挖掘句子中的构式实例序列,并对构式内部成分进行自动标注。相较于仅基于正则表达式匹配和词性匹配的自动标注结果,该方法的F1分别至少提高了17.9%(半凝固型构式)、19.3%(短语型构式)、14.9%(复句型构式)。

单位
北京大学

收藏分享被引浏览

更新时间：2024-04-13 12:40

基于高斯混合模型的现代汉语构式成分自动标注方法

摘要

产品服务

站内浏览

服务支持

联系方式

科研之友