CCL2021-discussion

来自SUDA-HLT
Zhli讨论 | 贡献2021年2月22日 (一) 11:34的版本 (创建页面,内容为“== 2020.2.22 == * Bert-fine-tune 在base基础上,在所有的unlabeled/labeled data上只用LM-loss去finetune3轮/10轮(给两个fine-tune的bert model,py...”)
(差异) ←上一版本 | 最后版本 (差异) | 下一版本→ (差异)
跳到导航 跳到搜索

2020.2.22

  • Bert-fine-tune
 在base基础上,在所有的unlabeled/labeled data上只用LM-loss去finetune3轮/10轮(给两个fine-tune的bert model,pytorch)。将来我们给基准结果时,也可以给两个有bert-finetune的结果。
  • 预训练word embedding,我们也要提供
 借鉴去年的做法,也重新训练下,帅克
  • CODT-2.0的数据处理
全角转半角
标点符号的处理
proj/non-proj不用管
  • train数据的补全
 在所有train(6个领域,包括BC)合并的train-all数据集上,训练一个supar-crf1o-with-finetune-bert的模型,开发集用dev-all(6个领域)。然后对train-all进行补全。补全的head/label的概率相乘,也放到某一列;如果是人工标注的head,概率写成2.0
 dev和test不补全,没有人工标注的,父亲节点为-1
  • 分成开放和封闭两个track?待定
 封闭:只能用我们提供的有标注和无标注数据、我们提供的word embedding
 开放:用任何数据、资源、工具都可以,只要大家能够通过某种方式公开获取(包括购买)到就可以。
  • 给一些基础的结果(帅克)
 concat:baseline, +bert, +bert-ft-3, +bert-ft-10 (supar)