SUCDT-data-annotation-detailed

来自SUDA-HLT
跳到导航 跳到搜索

局部标注数据:

  • 阿里商品评论数据:10,794句
 *放入数据库数据:共10,904句。2000句 5-15词50%+1万句5-25词20%---》通过和所有已标数据句子相似度阈值0.7比较后剩下1,0824句
 *处理后纯数据:10,794句

  • 北大树库数据:10,785句
 *放入数据库数据:共10,904句。2000句 5-15词50%+1万句5-25词20%---》通过和所有已标数据句子相似度阈值0.7比较后剩下10,904句
 *处理后纯数据:10,785句
  • novel_zx数据:3,249句
 *放入数据库数据:共3,385句。5-25词1000句50%,但弧最多7条+5-40词2385句20%标注---》通过和所有已标数据句子相似度阈值1比较后剩下3,385句
 *处理后纯数据:3,249句
  • dialogue数据:6,904句
*放入数据库数据:共7,130句。所有句子长度4-25词,500句50%+1000句30%+41614句20%---》通过和所有已标数据句子相似度阈值0.5比较后剩下7,130句
*处理后纯数据:6,904句
  • pctb7数据:11,621句
*放入数据库数据:共11674句。所有句子长度5-25词,3000句50%+4500句30%+6500句20%---》通过和所有已标数据句子相似度阈值0.6比较后剩下11,674句
*处理后纯数据:11,621句
  • 哈工大数据:??句
1.局部标注数据
 *放入数据库数据:(1)3000句10-20词50%的标注(2)5,840句5-25词20%的标注
 *处理后纯数据:
  • 阿里内容搜数据:9,043

全标注数据: 1.哈工大数据cdt:(1)放入数据库2000句5-10词数,纯净数据??(2)放入数据库600句5-40词数,纯净数据600句 2.阿里商品评论数据content:放入数据库1200句5-40词数,纯净数据1121句 3.UD_treebank:放入数据库451句不限制词数,纯净数据451句 4.pctb7数据:放入数据库600句5-40词数,纯净数据599句 5.闲鱼xianyu数据:放入数据库625句不限制词数,纯净数据615句