“论文理解8”的版本间的差异

来自SUDA-HLT
跳到导航 跳到搜索
(创建页面,内容为“《开放域命名实体识别及其层次化类别获取》 博士论文 付瑞吉 2014.7 哈工大 * 1. 第四章 基于多信息源的开放域命名实体类...”)
 
(清空页面)
 
第1行: 第1行:
《开放域命名实体识别及其层次化类别获取》 博士论文  付瑞吉  2014.7  哈工大
+
 
* 1. 第四章 基于多信息源的开放域命名实体类别获取
 
** 1) 本章提出了一种为汉语开放式实体获取类别的方法。首先从网页搜索(百度)、在线百科(百度百科和互动百科)、实体核心词三大来源获取实体类别候选(也就是上位词),然后使用传统模型对候选词排序,(人工构造了一些排序特征:类别先验概率、在搜索结果标题中出现的情况、同义词、偏旁部首等),得到排序的类别列表。
 
** 2) 语料:
 
*** 训练集自动构建:从百度百科抽取实体,然后从多信息源获取类别候选,再根据规则(类别来源越多越可能正确、类别先验概率越高越可能正确等)进行排序,首位的为正例,末位的为负例,得到训练集。
 
*** 测试集人工构建:从多领域选取实体词,从多信息源获取类别候选并人工判断。
 
* 2. 第五章 基于词汇分布表示的开放域命名实体类别层次化
 
** 1) 本章提出了一个基于词汇分布表示的命名实体类别层次化的新方法。主要做法是基于聚类的分段映射的方法(线性矩阵)来进行上下位关系分类。
 
** 2) 语料:
 
*** 训练集:通过同义词林抽取上下位关系词对,分为两类:直接上下位和间接上下位,并在后面的实验中分别对其聚类。
 
*** 测试集人工构建:先随机抽取了418个命名实体,基于第四章的方法获取上下位词列表,两两配对得到关系候选集(当然里面有很多非上下位关系),人工标注得到测试集。
 
** 3) 其他:《大词林》是基于同义词林的骨架,用第四、五章的方法,不断将这些命名实体分类标识,添加到《大词林》中。
 

2020年10月26日 (一) 10:27的最新版本