Nlpcc-2019-shared-task-Readme

来自SUDA-HLT
跳到导航 跳到搜索

train_dev_unlabeled_2019.4.2压缩文件

该压缩文件中包括Unlabeled、Train、Dev三个文件夹且所有数据文件为“CoNLL”格式。 1. Unlabeled文件夹:

(1)包括PB-Unlabeled.conll、PC-Unlabeled.conll、ZX-Unlabeled.conll三个文件;
(2)每行第一列为词语索引第四列为词性;

2.Train文件夹: (1)包括BC-Train.conll、PB-Train.conll、PC-Train.conll、ZX-Train.conll四个文件; (2)文件中最后一列为依存弧的概率,如果概率为1,则对应弧的依存关系为人工标注,否则为模型补全; 3.Dev文件夹:包括BC-Dev.conll、PB-Dev.conll、PC-Dev.conll、ZX-Dev.conll四个文件。

文件格式说明

Word Embedding预训练

  • Word Embedding是通过word2vec在Chinese Gigaword V3(约1100万句、自动分词)和目标领域Train/Unlabeled上训练10次迭代得到。
  • Word Embedding文件均采用UTF-8编码。