论文理解8

来自SUDA-HLT
LA-share讨论 | 贡献2019年10月25日 (五) 10:58的版本 (创建页面,内容为“《开放域命名实体识别及其层次化类别获取》 博士论文 付瑞吉 2014.7 哈工大 * 1. 第四章 基于多信息源的开放域命名实体类...”)
(差异) ←上一版本 | 最后版本 (差异) | 下一版本→ (差异)
跳到导航 跳到搜索

《开放域命名实体识别及其层次化类别获取》 博士论文 付瑞吉 2014.7 哈工大

  • 1. 第四章 基于多信息源的开放域命名实体类别获取
    • 1) 本章提出了一种为汉语开放式实体获取类别的方法。首先从网页搜索(百度)、在线百科(百度百科和互动百科)、实体核心词三大来源获取实体类别候选(也就是上位词),然后使用传统模型对候选词排序,(人工构造了一些排序特征:类别先验概率、在搜索结果标题中出现的情况、同义词、偏旁部首等),得到排序的类别列表。
    • 2) 语料:
      • 训练集自动构建:从百度百科抽取实体,然后从多信息源获取类别候选,再根据规则(类别来源越多越可能正确、类别先验概率越高越可能正确等)进行排序,首位的为正例,末位的为负例,得到训练集。
      • 测试集人工构建:从多领域选取实体词,从多信息源获取类别候选并人工判断。
  • 2. 第五章 基于词汇分布表示的开放域命名实体类别层次化
    • 1) 本章提出了一个基于词汇分布表示的命名实体类别层次化的新方法。主要做法是基于聚类的分段映射的方法(线性矩阵)来进行上下位关系分类。
    • 2) 语料:
      • 训练集:通过同义词林抽取上下位关系词对,分为两类:直接上下位和间接上下位,并在后面的实验中分别对其聚类。
      • 测试集人工构建:先随机抽取了418个命名实体,基于第四章的方法获取上下位词列表,两两配对得到关系候选集(当然里面有很多非上下位关系),人工标注得到测试集。
    • 3) 其他:《大词林》是基于同义词林的骨架,用第四、五章的方法,不断将这些命名实体分类标识,添加到《大词林》中。