论文理解7

来自SUDA-HLT
LA-share讨论 | 贡献2019年10月25日 (五) 10:02的版本
跳到导航 跳到搜索

《一种基于语义的上下位关系抽取方法》 计算机应用于软件 陈金栋、肖仰华 2019.2 复旦

  • 1. 文章根据句法模板(其实是分词+词性,并不是真正意义上用到了依存句法)的准确度,分为强句法模板和弱句法模板,将弱句法模板结合下位实体/概念词或上位概念词(相当于进行单向抽取上位词或下位词而不是上下位同时抽取)得到语义模板,设置阈值划分强句法模板和语义模板(由弱句法模板转化而来)。
  • 2. 抽取分为两步:第一步用多种强句法模板抽取上下位词对,第二步利用BootStrapping的方法迭代生成语义模板和上下位词对。同时还做了不同语言设置不同阈值得到较好结果的实验,验证了方法的通用性。
  • 3. trick:在通过模板抽取上下位词对的时候,结合了依存句法的特征。抽取时把模式分为两类,一类是“是一个”这种含有动词的模式,这里采用依存句法的模板去抽取;另一类是“等”这种词对间距离近,不含动词的这类模式,采用句法模板(其实就是我们所说的词法模板)。这个做法也与我们分析的模板性能吻合。
  • 4. 语料:从维基百科约700w中文句子中获取32w上下位关系词对。
  • 5. 评价:按不同领域,每个领域随机抽取50个下位词进行人工评估,计算准确率。
  • 6. 问题:对于句法模板准确率的计算,是通过每个模板抽取得到的300组上下位关系评估得到的,但是这里的准确率远高于我们的实验结果。