论文理解8
跳到导航
跳到搜索
《开放域命名实体识别及其层次化类别获取》 博士论文 付瑞吉 2014.7 哈工大
- 1. 第四章 基于多信息源的开放域命名实体类别获取
- 1) 本章提出了一种为汉语开放式实体获取类别的方法。首先从网页搜索(百度)、在线百科(百度百科和互动百科)、实体核心词三大来源获取实体类别候选(也就是上位词),然后使用传统模型对候选词排序,(人工构造了一些排序特征:类别先验概率、在搜索结果标题中出现的情况、同义词、偏旁部首等),得到排序的类别列表。
- 2) 语料:
- 训练集自动构建:从百度百科抽取实体,然后从多信息源获取类别候选,再根据规则(类别来源越多越可能正确、类别先验概率越高越可能正确等)进行排序,首位的为正例,末位的为负例,得到训练集。
- 测试集人工构建:从多领域选取实体词,从多信息源获取类别候选并人工判断。
- 2. 第五章 基于词汇分布表示的开放域命名实体类别层次化
- 1) 本章提出了一个基于词汇分布表示的命名实体类别层次化的新方法。主要做法是基于聚类的分段映射的方法(线性矩阵)来进行上下位关系分类。
- 2) 语料:
- 训练集:通过同义词林抽取上下位关系词对,分为两类:直接上下位和间接上下位,并在后面的实验中分别对其聚类。
- 测试集人工构建:先随机抽取了418个命名实体,基于第四章的方法获取上下位词列表,两两配对得到关系候选集(当然里面有很多非上下位关系),人工标注得到测试集。
- 3) 其他:《大词林》是基于同义词林的骨架,用第四、五章的方法,不断将这些命名实体分类标识,添加到《大词林》中。