论文理解4

来自SUDA-HLT
LA-share讨论 | 贡献2019年10月24日 (四) 16:50的版本
跳到导航 跳到搜索

《基于症状构成成分的上下位关系自动抽取方法》计算机应用 王婷等 2017.10 华东理工大学

  • 1. 文章专注于医学症状领域,准备构建一个症状上下位关系知识库。
  • 2. 首先症状不仅仅包含名词,还有多种修饰等,所以文章把一个症状切分为8种成分:原子症状词,中心词、修饰词等。
  • 3. 文章的模型有两个:
    • 1) 基于CRF的症状成分标注:
      • 针对无法通过分词、词性标注、启发式规则完全生成成分的症状实体进行分词和成分标注,采用BIE标记法。
      • 采用的特征:字面特征、词性特征
      • 数据:从医疗健康网站和百科网站抽取症状实体,将能够通过分词、词性标注、启发式规则完全生成成分的症状实体的数据随机选取3000条作为训练数据,未能标注完全的数据中选取1000条人工标注作为测试集。
    • 2) 基于多种传统模型(朴素贝叶斯、决策树、AdaBoost、随机森林、Bagging、SVM)的上下位关系分类
      • 由于很多专有名词没有词向量表示,所以文章采用的是基于特征选择的传统模型。
      • 采用的特征:通用特征(字面特征、词长、Jacard相似系数)、症状构成特征(构建了症状成分词典)、词典特征(基于HowNet上下位词典判断其他成分中是否有上下位关系)
      • 数据:从医疗健康网站半结构化数据中抽取上下位关系、同义关系,从非结构化数据中通过句法模式抽取上下位关系和同义关系,负例由随机负采样获得。