“Word-net”的版本间的差异

来自SUDA-HLT
跳到导航 跳到搜索
(清空页面)
 
(未显示同一用户的1个中间版本)
第1行: 第1行:
== 李正华 2019.4.30 ==
 
  
* CPU服务器上建账号、共享数据(8万名词词典;如果需要的话,把我们的百科数据进行筛选,把和8万个名词相关的提出来)
 
* 凯华准备
 
** 倒排服务架起来(可以让本科生帮忙)
 
** 把pattern bootstrapping的方法初步做一下,测试倒排
 
** 专注数据规范、标注、分类模型
 
** pattern方法的几篇经典论文放到wiki上,大家开始读一读,了解概念和目前大家的工作。本科生不需要看太多论文,了解基本方法后,发挥创造力,随便做随便想随便试。
 
*** [[:File: Automatic_Acquisition_of_Hyponyms_on_Large_Text_Corpora(Hearst_92).pdf | Automatic Acquisition of Hyponyms on Large Text Corpora(Hearst 92).pdf]]
 
*** [[:File: 一种基于“是一个”_模式的下位概念获取方法.pdf | 一种基于“是一个” 模式的下位概念获取方法.pdf]]
 
*** [[:File: Learning_syntactic_patterns_for_automatic_hypernym_discovery(Snow_2004).pdf | Learning syntactic patterns for automatic hypernym discovery(Snow 2004).pdf]]
 
*** [[:File: Extraction_of_Hypernymy_Information_from_Text.pdf | Extraction of Hypernymy Information from Text.pdf]]
 
*** [[:File: Hearst_Patterns_Revisited_Automatic_Hypernym_Detection_from_Large_Text_Corpora(acl2018).pdf | Hearst Patterns Revisited Automatic Hypernym Detection from Large Text Corpora(acl2018).pdf]]
 
*** [[:File: On_the_Transitivity_of_Hypernym-HyponymRelations_in_Data-DrivenLexical_Taxonomies_.pdf | On the Transitivity of Hypernym-HyponymRelations in Data-DrivenLexical Taxonomies(AAAI2017).pdf]]
 
 
* 本科生
 
** 从wiki和baike原始文本(毛文本、自由文本)中通过pattern方法来挖掘:比较重要的方向。bootstrapping的思想如下:
 
  1) 设计一些Pattern,从文本中自动抽取候选词对,进而人工标注,判定哪些是真正的上下位关系
 
  2)然后根据已有的上下位词对,在文本数据上跑一遍,扩展pattern集合,人工check,哪些pattern是靠谱的
 
  3)回到步骤1
 
 
** 从baike带有一定结构的文本(半结构化文本)中挖掘
 
** 从baike标签体系挖掘
 
** 从电子词典(如新华词典)中抽取
 
** 从HowNet里面抽取(我们目前有一个非最新版的HowNet,我考虑买一下最新版)
 
** 从同义词词林抽
 
** 从汉语的WordNet抽取(爬网页)
 
** 从英语WordNet抽取(需要翻译,可以往后放)
 
 
 
 
 
* 挖出来的候选,最开始阶段,置信度低的可以人工check一下(尽量),积累数据,凯华基于神经网络的分类模型训练起来。
 
* 我们目前关注8万个名词,但是过程中积累的数据和资源,即使和8万个名词没有关系,也要保留下来,命名好。未来肯定要扩展。
 
* 涉及的数据都不要外传,有版权问题。
 
* 不要影响学业,慢慢做,学到东西,把事做好,节奏慢一点。做科研,有时候在某一些点上有突破就够了,往深的想,和工程项目不同。
 
 
== 李正华 2019.4.5 ==
 
 
=== 陆凯华 ===
 
* 论文阅读
 
** [[:File: 一种基于“是一个”_模式的下位概念获取方法.pdf | 1. 一种基于“是一个” 模式的下位概念获取方法.pdf(2006 计算机科学)]]  [[论文理解1]]
 
** [[:File: 概念空间中上下位关系的意义识别研究_刘磊.pdf | 2. 概念空间中上下位关系的意义识别研究.pdf(2009 计算机学报)]]  [[论文理解2]]
 
** 3. 本体概念间上下位关系抽取研究.pdf(2014.6 微电子学与计算机)  [[论文理解3]]
 
** 4. 基于症状构成成分的上下位关系自动抽取方法.pdf(2017.10 计算机应用) [[论文理解4]]
 
** 5. 结合词向量和BootStrapping的领域实体上下位关系获取和组织.pdf(2018.6 计算机科学)[[论文理解5]]
 
** 6. 基于词模式嵌入的词语上下位关系分类.pdf(2019.1 北大学报) [[论文理解6]]
 
** 7. 一种基于语义的上下位关系抽取方法.pdf(2019.2 计算机应用与软件) [[论文理解7]]
 
* 常用语料:2012和2017nlpcc评测数据
 
* [[:File: 上下位关系规范v1_0.pdf | 上下位规范 ]]
 
* 标注系统准备
 
* 人工标注管理(韩欣艳和杨奕可以协助)
 
* 和组员深入讨论,在具体方法上指导
 
* 继续孙佳伟的工作,做上下位关系分类
 
 
=== 总体规划===
 
 
* 一些注意事项
 
** 人员安排和搭配可以灵活调整
 
** 具体效果取决于大家的聪明才智和投入程度
 
** 代码要简单、可扩展。第一个版本不用、也不可能尽善尽美。以后随着对问题的理解不断深入,不断改进和完善。
 
** 大家要发挥自己的聪明才智,敢于有自己的想法(创新),讨论后,只要感觉有道理都可以花时间去试。
 
 
 
* 1:现代汉语词典、同义词词林、HowNet中的词语及其词性信息汇总起来。(由于有版权问题,只能陆凯华做。处理好的数据就可以项目组一起用了。)
 
 
* 2(a):从网上hanyu.baidu.com baike.baidu.com [http://www.5156edu.com/ 新华词典] 等上面爬取这些词语的解释页面(黄赛豪、章岳)
 
 
* 2(b):对百科数据和wiki数据(可以下载,问一下周厚全)的源文件进行过滤,把不包含这些词语的网页去除(根据字符串匹配即可),速度慢一点也可以(由于有版权问题,只能陆凯华做。处理好的数据就可以项目组一起用了。)
 
 
* 3:对抽取出来的百科和wiki源文件进行正文抽取(陆凯华、章岳、韩欣艳一起做,参考朱运之前的代码,但是要搞清楚,方便以后改进)
 
 
* 4: 对正文进行分词
 
 
* 5: 建立倒排文档,自己设计合适的数据格式,方便使用(章岳、黄赛豪,需要学习一下倒排)
 
 
* 6(a):参考基于pattern的方法(bootstrapping),从词典解释中挖掘可能的上下位词对 (黄赛豪、杨奕)
 
 
* 6(b):研究基于pattern的方法(bootstrapping),从网页正文中挖掘可能的上下位词对 (章岳、韩欣艳)
 
 
* 疑似上下位词对交给标注系统确认
 
 
== 主要工作 ==
 
* 限定词语
 
 
  我们将词语限定在《现代汉语语法信息词典》、同义词林、HowNet和WordNet翻译词四个部分中的名词。对于同义词林、NowNet、WordNet中的词,本身具有一定的上下位关系,可以直接根据规则得到候选上下位词对。《现代汉语语法信息词典》中的词语根据模式匹配得到候选上下位词对。
 
 
* 限定语料
 
 
  我们将语料限定在百度百科和维基百科,我们有百科的源文件,当前需要对数据文件进行倒排索引,方便词语的搜索和模式的识别。
 
 
* 当前工作
 
 
  1.从同义词林和HowNet中获取候选上下位关系词对。
 
  2.从WordNet中获取候选上下位词对并翻译。
 
  3.对百科源网页数据进行解析并实现倒排索引。
 
  4.在标注系统中加载标注上下位关系页面。
 
  5.将孙佳伟师姐的现有词对重新标注筛选。
 
  6.利用筛选后的种子词生成模式集。
 

2020年10月26日 (一) 10:28的最新版本