“论文理解4”的版本间的差异

来自SUDA-HLT
跳到导航 跳到搜索
(清空页面)
 
第1行: 第1行:
《基于症状构成成分的上下位关系自动抽取方法》计算机应用 王婷等 2017.10 华东理工大学
+
 
* 1. 文章专注于医学症状领域,准备构建一个症状上下位关系知识库。
 
* 2. 首先症状不仅仅包含名词,还有多种修饰等,所以文章把一个症状切分为8种成分:原子症状词,中心词、修饰词等。
 
* 3. 文章的模型有两个:
 
** 1) 基于CRF的症状成分标注:
 
*** 针对无法通过分词、词性标注、启发式规则完全生成成分的症状实体进行分词和成分标注,采用BIE标记法。
 
*** 采用的特征:字面特征、词性特征
 
*** 数据:从医疗健康网站和百科网站抽取症状实体,将能够通过分词、词性标注、启发式规则完全生成成分的症状实体的数据随机选取3000条作为训练数据,未能标注完全的数据中选取1000条人工标注作为测试集。
 
** 2) 基于多种传统模型(朴素贝叶斯、决策树、AdaBoost、随机森林、Bagging、SVM)的上下位关系分类
 
*** 由于很多专有名词没有词向量表示,所以文章采用的是基于特征选择的传统模型。
 
*** 采用的特征:通用特征(字面特征、词长、Jacard相似系数)、症状构成特征(构建了症状成分词典)、词典特征(基于HowNet上下位词典判断其他成分中是否有上下位关系)
 
*** 数据:从医疗健康网站半结构化数据中抽取上下位关系、同义关系,从非结构化数据中通过句法模式抽取上下位关系和同义关系,负例由随机负采样获得。
 

2020年10月26日 (一) 10:27的最新版本