<?xml version="1.0"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="zh-Hans-CN">
	<id>http://hlt.suda.edu.cn/api.php?action=feedcontributions&amp;feedformat=atom&amp;user=Myzhou</id>
	<title>SUDA-HLT - 用户贡献 [zh-cn]</title>
	<link rel="self" type="application/atom+xml" href="http://hlt.suda.edu.cn/api.php?action=feedcontributions&amp;feedformat=atom&amp;user=Myzhou"/>
	<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php/%E7%89%B9%E6%AE%8A:%E7%94%A8%E6%88%B7%E8%B4%A1%E7%8C%AE/Myzhou"/>
	<updated>2026-09-21T03:46:35Z</updated>
	<subtitle>用户贡献</subtitle>
	<generator>MediaWiki 1.35.2</generator>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=LA-paper-report-talk-etc&amp;diff=4795</id>
		<title>LA-paper-report-talk-etc</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=LA-paper-report-talk-etc&amp;diff=4795"/>
		<updated>2022-05-19T07:55:36Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* Journal/Conference Papers in Chinese */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;请大家按照规则不断完善此页面。包含pdf ppt codes等。论文按年度，先中文、再英文；先期刊、再会议；先录用时间、后发表（开会）时间。尽量用英文吧。&lt;br /&gt;
&lt;br /&gt;
文献格式和内容与内部wiki保持一致（尽量避免重复劳动）&lt;br /&gt;
* pdf ppt等附件都可以放到外网可以访问的地方，放一个地方，避免重复&lt;br /&gt;
* 基金号等信息，这个页面上删掉，不要写&lt;br /&gt;
&lt;br /&gt;
== bib and abstract ==&lt;br /&gt;
&lt;br /&gt;
[http://hlt.suda.edu.cn/index.php/LA-paper-report-talk-bib bib]&lt;br /&gt;
&lt;br /&gt;
摘要和基金信息请看内部wiki&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Talks（报告） ==&lt;br /&gt;
&lt;br /&gt;
* 2021.7.27：《数据标注师资培训》(哈工大大数据集团)&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/videos/2021-07-26-1+X数据标注师资培训.mp4 培训视频] [https://mp.weixin.qq.com/s/T2HS90jrHs-ly8aCbwj-Eg 数据标注师资培训介绍]&lt;br /&gt;
&lt;br /&gt;
* 2021.4.20：《基于树形条件随机场的句法分析》(CCF-NLP走进高校-西湖大学)&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/videos/2021-04-20%2015-28-23.mp4 talk video] [http://hlt.suda.edu.cn/LA/ppt/视频对应-基于treecrf的句法分析-2021-04-20-13-55.pdf ppt(视频对应版)] [http://hlt.suda.edu.cn/LA/ppt/修改错误-基于treecrf的句法分析-2021-04-20-17-45.pdf ppt(修正版)]&lt;br /&gt;
&lt;br /&gt;
* 2021.3：《人工智能与脑机接口》慕课 （15章）[https://hikeweb.zhihuishu.com/studyResource/index?courseId=10431947 .]&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/videos/15-1_nlp.mp4 NLP基础介绍]&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/videos/15-2_labelling.mp4 数据标注简介]　　&lt;br /&gt;
&lt;br /&gt;
* 2020.10：《神经网络》慕课 - 面向自然语言处理的神经网络 （13章）&lt;br /&gt;
** [http://hlt.suda.edu.cn/~zhli/NLP-DL/13.1.mp4 第1节：从离散特征到连续稠密向量表示]&lt;br /&gt;
** [http://hlt.suda.edu.cn/~zhli/NLP-DL/13.2.mp4 第2节：表示学习]&lt;br /&gt;
** [http://hlt.suda.edu.cn/~zhli/NLP-DL/13.3.mp4 第3节：序列标注问题]&lt;br /&gt;
** [http://hlt.suda.edu.cn/~zhli/NLP-DL/13.4.mp4 第4节：句法树解析问题]&lt;br /&gt;
&lt;br /&gt;
* 2020.8.15: I have given a talk on data annotation at AI+EDUCATION SUB-FORUM at AI-EXPO (2020 GLOBAL AI PRODUCT AND APPLICATION EXPO)  &lt;br /&gt;
** [http://hlt.suda.edu.cn/~zhli/20200816_AI_data_annotating.mp4 talk video]&lt;br /&gt;
** [https://www.ai-expo.org.cn/?content/416= AI+教育发展分论坛-全球人工智能产品应用博览会]&lt;br /&gt;
&lt;br /&gt;
* 2019年9月28日句法标注培训（LA组介绍）：&lt;br /&gt;
** [http://hlt.suda.edu.cn/~zhli/2019-9-train/LAGroup.mp4 mp4视频] [http://hlt.suda.edu.cn/~zhli/2019-9-train/zhenghua-2019-9-28-LAGroup.pdf pdf]&lt;br /&gt;
&lt;br /&gt;
== Services ==&lt;br /&gt;
* NLPCC-2022 [http://tcci.ccf.org.cn/conference/2022/oc.php Area Co-Chair (Fundamentals in NLP)]&lt;br /&gt;
* CCL-2022 Evaluation Track [http://www.cips-cl.org/static/CCL2022/en/cclCommittee/comChairs/index.html Co-Chair]&lt;br /&gt;
* CCL-2021 [http://cips-cl.org/static/CCL2021/cclCommittee/areaChairs/index.html Area Chair]&lt;br /&gt;
* EMNLP-2021 Area Chair&lt;br /&gt;
&lt;br /&gt;
== Competition or Shared Tasks == &lt;br /&gt;
&lt;br /&gt;
* 我们组织了两届跨领域句法分析评测：CCL-2021和NLPCC-2019&lt;br /&gt;
&lt;br /&gt;
* 李嘉诚，沈嘉钰，包祖贻，章波，章岳，李辰，李正华. S&amp;amp;A团队CGED-7评测报告（识别，定位，纠正层第一）. 2021年12月. [[文件:S&amp;amp;A团队CGED-7评测报告.pdf]]&lt;br /&gt;
** [http://nlg.cipsc.org.cn/evaluation.html 比赛主页] [https://zhuanlan.zhihu.com/p/444117518 知乎总结]&lt;br /&gt;
&lt;br /&gt;
** 章岳，包祖贻，章波，李辰，李嘉诚，李正华. S&amp;amp;A队CTC2021评测报告（检错、纠错、总分三赛道第一）. 2021年9月.[[文件:S&amp;amp;A-CTC2021评测报告.pdf]]&lt;br /&gt;
** [https://2021aichina.caai.cn/track?id=5 比赛主页] [https://github.com/destwang/CTC2021 github榜单]&lt;br /&gt;
&lt;br /&gt;
== Awards == &lt;br /&gt;
&lt;br /&gt;
* 2021. 章波，江苏省优秀硕士论文（学硕，全省共150个，苏大x个）；同时获江苏省计算机学会优秀硕士论文（全省共xx个，苏大共x个）&lt;br /&gt;
* 2020. NLPCC best paper&lt;br /&gt;
&lt;br /&gt;
== 2022 == &lt;br /&gt;
&lt;br /&gt;
=== Journal/Conference Papers in Chinese ===&lt;br /&gt;
&lt;br /&gt;
* 章岳, 黄赛豪, 陆凯华, 李正华*. 2022年1月 39卷1期 pp126-134.  基于模板的中文上下位关系抽取方法. 计算机应用与软件. [[文件:Hypernym-zhangyue-2022.pdf]]&lt;br /&gt;
* 周仕林, 龚晨*, 李正华, 张民. 基于转移的快速精准的语义依存图分析. 山西大学学报(自然科学版):1-13. [[文件:slzhou_transition_based_sdp.pdf]]&lt;br /&gt;
* 李帅克，李英，李正华*，张民. 基于tri-training的跨领域依存句法分析. 厦门大学学报（自然科学版）[[https://kns.cnki.net/kcms/detail/detail.aspx?dbcode=CAPJ&amp;amp;dbname=CAPJLAST&amp;amp;filename=XDZK20220509009&amp;amp;uniplatform=NZKPT&amp;amp;v=flne8EoBUv7LYNkuiwSttcXiOfGBPAB_0VtzLHktpwsjrP5-NEfM9rivUOARi0ae 知网抢先版链接]]&lt;br /&gt;
* 周明月，龚晨，李正华*，张民. 数据标注方法比较研究：以依存句法树标注为例. 清华大学学报（自然科学版）[[http://jst.tsinghuajournals.com/CN/10.16511/j.cnki.qhdxxb.2022.22.010 电子版]]&lt;br /&gt;
* 等待发表的&lt;br /&gt;
** 彭雪, 李正华, 张民. 2020.4. 基于语言模型微调的跨领域依存句法分析. 计算机应用与软件. 2022-未发表. &lt;br /&gt;
** 浩苹、嘉诚&lt;br /&gt;
&lt;br /&gt;
=== Journal Papers in English ===&lt;br /&gt;
&lt;br /&gt;
* Chen Gong, Zhenghua Li* and Min Zhang. Neural Coupled Sequence Labeling for Heterogeneous Annotation Conversion. IEEE/ACM Transactions on Audio, Speech and Language Processing, 2022, 30:1624-1636.[https://ieeexplore.ieee.org/document/9750873?source=authoralert official]&lt;br /&gt;
&lt;br /&gt;
=== Conference Papers In English ===&lt;br /&gt;
&lt;br /&gt;
* Yahui Liu, Haoping Yang, Chen Gong*, Qingrong Xia, Zhenghua Li, Min Zhang. 2022. MuCPAD: A Multi-Domain Chinese Predicate-Argument Dataset. In '''NAACL'''. [http://arxiv.org/abs/2205.06703 arxiv]&lt;br /&gt;
* Yue Zhang, Zhenghua Li*, Zuyi Bao, Jiacheng Li, Bo Zhang, Chen Li, Fei Huang, Min Zhang. 2022. MuCGEC: a Multi-Reference Multi-Source Evaluation Dataset for Chinese Grammatical Error Correction. In '''NAACL'''. [https://arxiv.org/abs/2204.10994 arxiv]&lt;br /&gt;
* Ying Li, Shuaike Li, Min Zhang. 2022. Semi-supervised Domain Adaptation for Dependency Parsing with Dynamic Matching Network. In '''ACL'''. [http://hlt.suda.edu.cn/index.php/%E6%96%87%E4%BB%B6:Liying_ACL2022_camera_ready.pdf camera ready pdf] [https://underline.io/lecture/52551-long-semi-supervised-domain-adaptation-for-dependency-parsing-with-dynamic-matching-network video].&lt;br /&gt;
* Houquan Zhou, Yang Li, Zhenghua Li, and Min Zhang. 2022. Bridging Pre-trained Language Models and Hand-crafted Features for Unsupervised POS Tagging. In Findings of the Association for Computational Linguistics: ACL 2022, pages 3276–3290, Dublin, Ireland. Association for Computational Linguistics. [http://hlt.suda.edu.cn/LA/papers/acl-findings-hqzhou-bridging.pdf pdf] [https://arxiv.org/pdf/2203.10315 camera ready pdf] [https://aclanthology.org/2022.findings-acl.259.pdf offcial pdf] [https://underline.io/lecture/49965-findings-bridging-pre-trained-language-models-and-hand-crafted-features-for-unsupervised-pos-tagging video]&lt;br /&gt;
&lt;br /&gt;
== 2021 == &lt;br /&gt;
&lt;br /&gt;
=== Journal/Conference Papers in Chinese ===&lt;br /&gt;
&lt;br /&gt;
* 吴锟，周夏冰，李正华，梁兴伟，陈文亮. 中文知识库问答中的路径选择. 中文信息学报（CCKS会议推荐）. 2021, 35(9):113-122.[[文件:中文知识库问答中的路径选择 吴锟.pdf]]&lt;br /&gt;
&lt;br /&gt;
=== Conference Papers In English ===&lt;br /&gt;
* Yang Hou, Houquan Zhou, Zhenghua Li*, Yu Zhang, Min Zhang, Zhefeng Wang, Baoxing Huai, Nicholas Jing Yuan. A Coarse-to-Fine Labeling Framework for Joint Word Segmentation,  POS Tagging, and Constituent Parsing. Proceedings of CoNLL-2021, pp. 290–299. Punta Cana, Dominican Republic (Online), 10-11 Nov. 2021. [[文件:CoNLL_2021_yhou_official_version.pdf]]&lt;br /&gt;
&lt;br /&gt;
* Kun Wu, Lijie Wang, Zhenghua Li, Ao Zhang, Xinyan Xiao, Hua Wu, Min Zhang, Haifeng Wang. Data Augmentation with Hierarchical SQL-to-Question Generation for Cross-Domain Text-to-SQL Parsing. Proceedings of EMNLP-2021, pp. 8974--8983. Punta Cana, Dominican Republic (Online), 7-11 Nov. 2021. [[文件:EMNLP2021_camera_ready_Data_Augmentation_with_Hierarchical_SQL_to_Question_Generation_forCross_domain_Text_to_SQL_Parsing-09101500.pdf ‎]]&lt;br /&gt;
&lt;br /&gt;
* Qingrong Xia, Zhenghua Li*, Rui Wang, Min Zhang. Stacked AMR Parsing with Silver Data. Proceedings of EMNLP-2021 Findings, pp. 4729--4738. Punta Cana, Dominican Republic (Online), 7-11 Nov. 2021. [[文件:EMNLP_2021_Stacked_AMR_Parsing_with_Silver_Data.pdf]]&lt;br /&gt;
&lt;br /&gt;
* Ying Li, Meishan Zhang, Zhenghua Li*, Min Zhang, Zhefeng Wang, Baoxing Huai, Nicholas Jing Yuan. APGN: Adversarial and Parameter Generation Networks for Multi-Source Cross-Domain Dependency Parsing. Proceedings of EMNLP-2021 Findings, pp. 1727–1733. Punta Cana, Dominican Republic (Online), 7-11 Nov. 2021. [[文件:EMNLP_2021_yli_camera_ready.pdf]]&lt;br /&gt;
&lt;br /&gt;
* Chen Gong, Saihao Huang, Houquan Zhou, Zhenghua Li*, Min Zhang, Zhefeng Wang, Baoxing Huai, Nicholas Jing Yuan. An In-depth Study on Internal Structure of Chinese Words. Proceedings of ACL-2021, pp. 5823–5833. Online, Virtual Event, 1-6 Aug. 2021. [[文件:2021.acl-long.452.pdf]]&lt;br /&gt;
&lt;br /&gt;
* Qingrong Xia, Bo Zhang, Rui Wang, Zhenghua Li*, Yue Zhang, Fei Huang, Luo Si, Min Zhang. 2021. A Unified Span-Based Approach for Opinion Mining with Syntactic Constituents. Proceedings of NAACL-2021, pp. 1795-1804. Mexico City, Mexico (Online), 6-11 June. 2021. [[文件:2021.naacl-main.144.pdf]]&lt;br /&gt;
&lt;br /&gt;
== 2020 == &lt;br /&gt;
&lt;br /&gt;
=== Journal Papers in Chinese ===&lt;br /&gt;
&lt;br /&gt;
* 陆凯华, 李正华, 张民. 2020. 汉语上下位关系分类数据集构建和基准方法比较. 厦门大学学报(自然科学版). 2020, 59 (06): 1004-1010 [[文件:汉语上下位关系分类数据集构建和基准方法比较_陆凯华.pdf]]&lt;br /&gt;
&lt;br /&gt;
=== Journal Papers In English===&lt;br /&gt;
* Chen Gong, Zhenghua Li, Qingrong Xia, Wenliang Chen and Min Zhang. Hierarchical LSTM with char-subword-word tree-structure representation for Chinese named entity recognition. Science China Information Science, 2020, 63(10):1-15. [[文件:Hierarchical_LSTM_with_char-subword-word_tree-structure_representation_for_Chinese_named_entity_recognition.pdf]]&lt;br /&gt;
&lt;br /&gt;
=== Conference Papers In English ===&lt;br /&gt;
&lt;br /&gt;
* Ying Li, Zhenghua Li* and Min Zhang. Semi-supervised Domain Adaptation for Dependency Parsing via Improved Contextualized Word Representations. Proceedings of COLING-2020. pp. 3806–3817. Barcelona, Spain (Online), 8-13 Dec. 2020.[https://www.aclweb.org/anthology/2020.coling-main.338.pdf pdf] [[文件:Liying-2020.coling-main.338.pdf]]&lt;br /&gt;
&lt;br /&gt;
* Qingrong Xia, Rui Wang, Zhenghua Li, Yue Zhang and Min Zhang*. Semantic Role Labeling with Heterogeneous Syntactic Knowledge. Proceedings of COLING-2020. pp. 2979-2990. Barcelona, Spain (Online), 8-13 Dec. 2020. ([https://www.aclweb.org/anthology/2020.coling-main.266.pdf pdf])([[文件:Xiaqingrong-2020.coling-main.266.pdf]])([[文件:Poster-SRL-HDP.pdf]])([[文件:SRL-HDP.pptx]])&lt;br /&gt;
&lt;br /&gt;
* Chen Gong, Zhenghua Li*, Bowei Zou and Min Zhang. Multi-grained Chinese Word Segmentation with Weakly Labeled Data. Proceedings of COLING-2020. pp. 2026–2036. Barcelona, Spain (Online), 8-13 Dec. 2020. [https://www.aclweb.org/anthology/D17-1072.pdf pdf][[文件:Gongchen-2020.coling-main.183.pdf]]&lt;br /&gt;
&lt;br /&gt;
* Lijie Wang, Ao Zhang, Kun Wu, Ke Sun, Zhenghua Li, Hua Wu, Min Zhang and Haifeng Wang. DuSQL: A Large-Scale and Pragmatic Chinese Text-to-SQL Dataset. Proceedings of EMNLP-2020. pp. 6923-6935. Online, 16-20 Nov. 2020. [https://www.aclweb.org/anthology/2020.emnlp-main.562.pdf pdf][[文件:2020.emnlp-main.562.pdf]]&lt;br /&gt;
&lt;br /&gt;
* Houquan Zhou, Yu Zhang, Zhenghua Li, and Min Zhang. Is POS Tagging Necessary or Even Helpful for Neural Dependency Parsing? Proceedings of NLPCC-2020, pp. 179--191. Zhengzhou, China, 14 Oct. - 18 Oct. 2020. ([http://hlt.suda.edu.cn/LA/papers/nlpcc-ijpmo.pdf pdf]) ([http://hlt.suda.edu.cn/LA/papers/nlpcc-ijpmo-official.pdf pdf-official]) ([http://hlt.suda.edu.cn/LA/papers/nlpcc-ijpmo-official-w-content.pdf pdf-official-w-content]) &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;&amp;lt;b&amp;gt;(best paper!)&amp;lt;/b&amp;gt;&amp;lt;/font&amp;gt; &lt;br /&gt;
&lt;br /&gt;
* Yu Zhao, Mingyue Zhou, Zhenghua Li, and Min Zhang. Dependency Parsing with Noisy Multi-Annotation Data. Proceedings of NLPCC-2020, pp. 120-131. Zhengzhou, China, 14 Oct. - 18 Oct. 2020. ([http://hlt.suda.edu.cn/images/e/e5/212_Final_Manuscript_%281%29.pdf pdf]）([http://hlt.suda.edu.cn/LA/papers/nlpcc-yzhao-official.pdf pdf-official]) ([http://hlt.suda.edu.cn/LA/papers/nlpcc-yzhao-official-w-content.pdf pdf-official-w-content])&lt;br /&gt;
&lt;br /&gt;
* Yu Zhang, Houquan Zhou, Zhenghua Li. 2020. Fast and Accurate Neural CRF Constituency Parsing. Proceedings of IJCAI-2020, pp. 4046-4053. Yokohama, Japan, 11-17 Jul. 2020. [https://www.ijcai.org/Proceedings/2020/0560.pdf pdf-official] [http://hlt.suda.edu.cn/LA/papers/0560.pdf pdf] [[http://hlt.suda.edu.cn/LA/videos/V5.mp4 video(5 min version)]] [[http://hlt.suda.edu.cn/LA/videos/V10.mp4 video(10 min version)]] [[http://hlt.suda.edu.cn/LA/videos/V15.mp4 video(15 min version)]]&lt;br /&gt;
&lt;br /&gt;
* Yu Zhang, Zhenghua Li, Min Zhang. 2020. Efficient Second-Order TreeCRF for Neural Dependency Parsing. Proceedings of ACL-2020, pp. 3295-3305. Seattle, America, 5-10 Jul. 2020. [[https://www.aclweb.org/anthology/2020.acl-main.302.pdf pdf-official]] [[http://hlt.suda.edu.cn/LA/papers/2020.acl-main.302.pdf pdf]] [[http://hlt.suda.edu.cn/LA/videos/2020-12-28%2022-21-45.mp4 video]]&lt;br /&gt;
** A very good paper: Timothy Dozat, Christopher D. Manning. ICLR-2017. Deep Biaffine Attention for Neural Dependency Parsing. [https://arxiv.org/abs/1611.01734 arxiv]&lt;br /&gt;
&lt;br /&gt;
* Bo Zhang, Yue Zhang, Rui Wang, Zhenghua Li, Min Zhang. Syntax-Aware Opinion Role Labeling with Dependency Graph Convolutional Networks. Proceedings of ACL-2020, pp. 3249-3258. Seattle, America, 5-10 Jul. 2020. [https://www.aclweb.org/anthology/2020.acl-main.297.pdf pdf] [[文件:Zhangbo-acl2020-ppt-5-24.pdf]]&lt;br /&gt;
&lt;br /&gt;
== before 2020 ==&lt;br /&gt;
* Meishan Zhang, Zhenghua Li, Guohong Fu and Min Zhang. Syntax-Enhanced Neural Machine Translation with Syntax-Aware Word Representations. In Proceedings of the NAACL-2019. pp. 1151–1161. Seattle, America, 5-10 Jun. 2019. [https://www.aclweb.org/anthology/N19-1118.pdf pdf]&lt;br /&gt;
* Bowen Wu, Jiayuan Chao, Baoxun Wang, Zhenghua Li and Min Zhang. Abstractive Summarization via Continuous Copy. EMNLP-2019 Workshop Summarization Submission. Aug 20, 2019. (not accepted)&lt;br /&gt;
&lt;br /&gt;
== 202? Template == &lt;br /&gt;
=== Talks and Misc. ===&lt;br /&gt;
=== Journal/Conference Papers in Chinese ===&lt;br /&gt;
=== Journal Papers In English===&lt;br /&gt;
=== Conference Papers In English===&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CODT&amp;diff=4435</id>
		<title>CODT</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CODT&amp;diff=4435"/>
		<updated>2022-01-07T04:18:23Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* 标注规范 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;本页面目前由彭雪、周明月同学维护。&lt;br /&gt;
&lt;br /&gt;
== 汉语开放依存句法树库（Chinese Open Dependency Treebank, CODT）==&lt;br /&gt;
&lt;br /&gt;
* 读音：[kəʊ'di:ti:]         (CO -&amp;gt; [co]operate D T)&lt;br /&gt;
* Open的含义：1）开放数据，规范和数据均公开并不断完善，欢迎大家一起按照我们的规范标注数据，或者邀请我们标注你们感兴趣的数据；2）开放领域，覆盖不同领域和来源文本&lt;br /&gt;
* 2019年8月从SUCDT改名为CODT&lt;br /&gt;
* This treebank construction project aims to continually build a large-scale Chinese dependency treebank that covers up-to-date texts from different domains and sources, and hence promote the wide application of syntactic analysis techniques.&lt;br /&gt;
&lt;br /&gt;
== 依存句法分析领域移植评测 （已结束，我们会组织下一期评测，发布更多数据）== &lt;br /&gt;
* 我们正在NLPCC-2019会议上组织评测，发布了约4万句人工标注数据，欢迎大家参与：[http://hlt.suda.edu.cn/index.php/Nlpcc-2019-shared-task 网址]&lt;br /&gt;
&lt;br /&gt;
* CCL-2021句法领域移植评测，发布CODT 2.0 [http://hlt.suda.edu.cn/index.php/CCL2021 网址]&lt;br /&gt;
&lt;br /&gt;
== 标注人员培训流程 == &lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/SUCDT-Personnel_Training 人员培训流程]&lt;br /&gt;
&lt;br /&gt;
== 招聘信息（长期、寒暑假兼职） == &lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/CODT-2019-9-recruiting 2019年9月招聘]&lt;br /&gt;
* 旧的：[http://hlt.suda.edu.cn/index.php/SUCDT-2018-12-recruiting 2018年12月招聘]&lt;br /&gt;
* 旧的：[http://hlt.suda.edu.cn/index.php/SUCDT-2018-5-recruiting 2018年5月招聘]&lt;br /&gt;
* 旧的：[http://hlt.suda.edu.cn/~zhli/nlp-anno-recruit.html 2017年6月招聘信息]&lt;br /&gt;
&lt;br /&gt;
== 培训经验 ==&lt;br /&gt;
* 定期招新，形成稳定的高质量标注人员更迭。&lt;br /&gt;
* 招新时，全面介绍标注工作内容，说明标注工作的优势，提高标注工作的兼职竞争力。&lt;br /&gt;
* 提高入职门槛，聘用经面试了解较为适合标注工作的人员，培训时增加高正确率标注人员分享经验的环节，不断更新培训视频和PPT。&lt;br /&gt;
* 公开所有标注人员的标注明细，形成良好的竞争监督机制。&lt;br /&gt;
* 精简标注人员，过滤标注时间不够或标注准确率太低超过两次的人员。&lt;br /&gt;
* 一起认真维护、完善规范，认真培训，认真审核和投诉，给出审核和投诉意见。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== 标注规范 == &lt;br /&gt;
&lt;br /&gt;
* 最新版：[http://hlt.suda.edu.cn/index.php/%E6%96%87%E4%BB%B6:%E6%A0%87%E6%B3%A8%E8%A7%84%E8%8C%832020%E5%B9%B46%E6%9C%886%E6%97%A5%E7%89%88_.pdf 标注规范2020年6月6日版.pdf] &lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/CODT-data-annotation-guideline-past 旧版本标注规范]&lt;br /&gt;
&lt;br /&gt;
== 已标注数据列表（2019.12；以句子为单位，K表示1000） ==&lt;br /&gt;
* 总共：40+11+10+3+18+9+11+7+10+7=126K&lt;br /&gt;
* 规范平衡语料：14+15+11=40K （HIT CTB PMT）&lt;br /&gt;
* 商品评论PC：11K &lt;br /&gt;
* 产品博客PB：10K&lt;br /&gt;
* 网络小说（ZX诛仙）：3K&lt;br /&gt;
* 人人对话：7+11=18K&lt;br /&gt;
* 财经：9K&lt;br /&gt;
* 法律：11K&lt;br /&gt;
* 体育：7K&lt;br /&gt;
* 医学：10K&lt;br /&gt;
* 军事：7K&lt;br /&gt;
&lt;br /&gt;
== 数据共享 == &lt;br /&gt;
&lt;br /&gt;
* 大部分数据向学术界免费共享，支持研究使用。少数数据由于项目或合同约束，需要延迟一些时间后向学术界共享。&lt;br /&gt;
* 企业界需要有偿购买使用权。&lt;br /&gt;
* 数据共享协议下载：[http://hlt.suda.edu.cn/images/b/b6/Codt-sharing-agreement-2021.3-v2.pdf PDF下载链接]&lt;br /&gt;
&lt;br /&gt;
== 论文引用 ==&lt;br /&gt;
&lt;br /&gt;
* Xue Peng, Zhenghua Li, Min Zhang, Rui Wang, Yue Zhang, Luo Si. 2019. '''Overview of the NLPCC 2019 Shared Task: Cross-Domain Dependency Parsing'''. In Proceedings of NLPCC-2019. [http://hlt.suda.edu.cn/~zhli/papers/nlpcc19_shared_task_overview.pdf pdf]&lt;br /&gt;
* Zhenghua Li, Xue Peng, Min Zhang, Rui Wang, Luo Si. 2019. '''Semi-supervised Domain Adaptation for Dependency Parsing'''. Proceedings of '''ACL-2019''', pp. 2386-2395. Florence, Italy, 28 Jul. - 2 Aug. 2019. [http://hlt.suda.edu.cn/~zhli/papers/zhenghua_acl19_dp_figure_1_good.pdf pdf]&lt;br /&gt;
* Xinzhou Jiang, Bo Zhang, Zhenghua Li, Min Zhang, Sheng Li, Luo Si. 2018. '''Supervised Treebank Conversion: Data and Approaches'''. Proceedings of '''ACL-2018''', pp. 2706-2716. Melbourne, Australia. 15-20 Jul. 2018 [http://hlt.suda.edu.cn/~zhli/papers/zhenghua-acl18.pdf pdf]&lt;br /&gt;
*  郭丽娟, 彭雪, 李正华, 张民. 2019. '''面向多领域多来源文本的汉语依存句法树库构建'''. 中文信息学报. 2019, 33(2):34-42 [http://hlt.suda.edu.cn/~zhli/papers/lijuan-cip19-treebank.pdf pdf]&lt;br /&gt;
*  郭丽娟, 李正华, 彭雪, 张民. 2018. '''适应多领域多来源文本的汉语依存句法数据标注规范'''. 中文信息学报. 2018, 32(10):28-35-52 [http://hlt.suda.edu.cn/~zhli/papers/lijuan-jocip18-guideline.pdf pdf]&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=%E6%96%87%E4%BB%B6:%E6%A0%87%E6%B3%A8%E8%A7%84%E8%8C%832020%E5%B9%B46%E6%9C%886%E6%97%A5%E7%89%88_.pdf&amp;diff=4434</id>
		<title>文件:标注规范2020年6月6日版 .pdf</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=%E6%96%87%E4%BB%B6:%E6%A0%87%E6%B3%A8%E8%A7%84%E8%8C%832020%E5%B9%B46%E6%9C%886%E6%97%A5%E7%89%88_.pdf&amp;diff=4434"/>
		<updated>2022-01-07T04:17:16Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CODT&amp;diff=4335</id>
		<title>CODT</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CODT&amp;diff=4335"/>
		<updated>2021-12-17T08:23:13Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;本页面目前由彭雪、周明月同学维护。&lt;br /&gt;
&lt;br /&gt;
== 汉语开放依存句法树库（Chinese Open Dependency Treebank, CODT）==&lt;br /&gt;
&lt;br /&gt;
* 读音：[kəʊ'di:ti:]         (CO -&amp;gt; [co]operate D T)&lt;br /&gt;
* Open的含义：1）开放数据，规范和数据均公开并不断完善，欢迎大家一起按照我们的规范标注数据，或者邀请我们标注你们感兴趣的数据；2）开放领域，覆盖不同领域和来源文本&lt;br /&gt;
* 2019年8月从SUCDT改名为CODT&lt;br /&gt;
* This treebank construction project aims to continually build a large-scale Chinese dependency treebank that covers up-to-date texts from different domains and sources, and hence promote the wide application of syntactic analysis techniques.&lt;br /&gt;
&lt;br /&gt;
== 依存句法分析领域移植评测 （已结束，我们会组织下一期评测，发布更多数据）== &lt;br /&gt;
* 我们正在NLPCC-2019会议上组织评测，发布了约4万句人工标注数据，欢迎大家参与：[http://hlt.suda.edu.cn/index.php/Nlpcc-2019-shared-task 网址]&lt;br /&gt;
&lt;br /&gt;
* CCL-2021句法领域移植评测，发布CODT 2.0 [http://hlt.suda.edu.cn/index.php/CCL2021 网址]&lt;br /&gt;
&lt;br /&gt;
== 标注人员培训流程 == &lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/SUCDT-Personnel_Training 人员培训流程]&lt;br /&gt;
&lt;br /&gt;
== 招聘信息（长期、寒暑假兼职） == &lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/CODT-2019-9-recruiting 2019年9月招聘]&lt;br /&gt;
* 旧的：[http://hlt.suda.edu.cn/index.php/SUCDT-2018-12-recruiting 2018年12月招聘]&lt;br /&gt;
* 旧的：[http://hlt.suda.edu.cn/index.php/SUCDT-2018-5-recruiting 2018年5月招聘]&lt;br /&gt;
* 旧的：[http://hlt.suda.edu.cn/~zhli/nlp-anno-recruit.html 2017年6月招聘信息]&lt;br /&gt;
&lt;br /&gt;
== 培训经验 ==&lt;br /&gt;
* 定期招新，形成稳定的高质量标注人员更迭。&lt;br /&gt;
* 招新时，全面介绍标注工作内容，说明标注工作的优势，提高标注工作的兼职竞争力。&lt;br /&gt;
* 提高入职门槛，聘用经面试了解较为适合标注工作的人员，培训时增加高正确率标注人员分享经验的环节，不断更新培训视频和PPT。&lt;br /&gt;
* 公开所有标注人员的标注明细，形成良好的竞争监督机制。&lt;br /&gt;
* 精简标注人员，过滤标注时间不够或标注准确率太低超过两次的人员。&lt;br /&gt;
* 一起认真维护、完善规范，认真培训，认真审核和投诉，给出审核和投诉意见。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== 标注规范 == &lt;br /&gt;
&lt;br /&gt;
* 最新版：[http://hlt.suda.edu.cn/index.php/%E6%96%87%E4%BB%B6:%E6%A0%87%E6%B3%A8%E8%A7%84%E8%8C%832020%E5%B9%B46%E6%9C%886%E6%97%A5%E7%89%88.pdf 标注规范2020年6月6日版.pdf] &lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/CODT-data-annotation-guideline-past 旧版本标注规范]&lt;br /&gt;
&lt;br /&gt;
== 已标注数据列表（2019.12；以句子为单位，K表示1000） ==&lt;br /&gt;
* 总共：40+11+10+3+18+9+11+7+10+7=126K&lt;br /&gt;
* 规范平衡语料：14+15+11=40K （HIT CTB PMT）&lt;br /&gt;
* 商品评论PC：11K &lt;br /&gt;
* 产品博客PB：10K&lt;br /&gt;
* 网络小说（ZX诛仙）：3K&lt;br /&gt;
* 人人对话：7+11=18K&lt;br /&gt;
* 财经：9K&lt;br /&gt;
* 法律：11K&lt;br /&gt;
* 体育：7K&lt;br /&gt;
* 医学：10K&lt;br /&gt;
* 军事：7K&lt;br /&gt;
&lt;br /&gt;
== 数据共享 == &lt;br /&gt;
&lt;br /&gt;
* 大部分数据向学术界免费共享，支持研究使用。少数数据由于项目或合同约束，需要延迟一些时间后向学术界共享。&lt;br /&gt;
* 企业界需要有偿购买使用权。&lt;br /&gt;
* 数据共享协议下载：[http://hlt.suda.edu.cn/images/b/b6/Codt-sharing-agreement-2021.3-v2.pdf PDF下载链接]&lt;br /&gt;
&lt;br /&gt;
== 论文引用 ==&lt;br /&gt;
&lt;br /&gt;
* Xue Peng, Zhenghua Li, Min Zhang, Rui Wang, Yue Zhang, Luo Si. 2019. '''Overview of the NLPCC 2019 Shared Task: Cross-Domain Dependency Parsing'''. In Proceedings of NLPCC-2019. [http://hlt.suda.edu.cn/~zhli/papers/nlpcc19_shared_task_overview.pdf pdf]&lt;br /&gt;
* Zhenghua Li, Xue Peng, Min Zhang, Rui Wang, Luo Si. 2019. '''Semi-supervised Domain Adaptation for Dependency Parsing'''. Proceedings of '''ACL-2019''', pp. 2386-2395. Florence, Italy, 28 Jul. - 2 Aug. 2019. [http://hlt.suda.edu.cn/~zhli/papers/zhenghua_acl19_dp_figure_1_good.pdf pdf]&lt;br /&gt;
* Xinzhou Jiang, Bo Zhang, Zhenghua Li, Min Zhang, Sheng Li, Luo Si. 2018. '''Supervised Treebank Conversion: Data and Approaches'''. Proceedings of '''ACL-2018''', pp. 2706-2716. Melbourne, Australia. 15-20 Jul. 2018 [http://hlt.suda.edu.cn/~zhli/papers/zhenghua-acl18.pdf pdf]&lt;br /&gt;
*  郭丽娟, 彭雪, 李正华, 张民. 2019. '''面向多领域多来源文本的汉语依存句法树库构建'''. 中文信息学报. 2019, 33(2):34-42 [http://hlt.suda.edu.cn/~zhli/papers/lijuan-cip19-treebank.pdf pdf]&lt;br /&gt;
*  郭丽娟, 李正华, 彭雪, 张民. 2018. '''适应多领域多来源文本的汉语依存句法数据标注规范'''. 中文信息学报. 2018, 32(10):28-35-52 [http://hlt.suda.edu.cn/~zhli/papers/lijuan-jocip18-guideline.pdf pdf]&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CODT-data-annotation-guideline-past&amp;diff=3880</id>
		<title>CODT-data-annotation-guideline-past</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CODT-data-annotation-guideline-past&amp;diff=3880"/>
		<updated>2021-04-30T07:36:06Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;各个版本逐渐增加，大家只需要学习最新版本的标注规范&lt;br /&gt;
* 2019年9月19日版本[[:File:标注规范2019年9月19日版.pdf| 标注规范2019年9月19日版.pdf]] &lt;br /&gt;
* 2019年6月22日版本[[:File:标注规范2019年6月22日版.pdf | 标注规范2019年6月22日版.pdf]]&lt;br /&gt;
* 2019年4月1日版本[[:File:标注规范-2019年4月1日版.pdf| 标注规范-2019年4月1日版.pdf]]&lt;br /&gt;
* 2018年8月25日版本[[:File:annotation-guidelines.pdf| 标注规范-2018年8月25日版.pdf]]&lt;br /&gt;
* 2018年8月1日版本([[:File:标注规范-2018年8月1日版.pdf  | 标注规范-2018年8月1日版.pdf]])&lt;br /&gt;
* 2018年5月12日版本([[:File:标注规范-2018年5月12日版.pdf  | 标注规范-2018年5月12日版.pdf]])&lt;br /&gt;
* 2018年4月3日版本 （[[:File:标注规范-2018年4月3日版.pdf  | 标注规范-2018年4月3日版.pdf]]）&lt;br /&gt;
* 2018年1月20日版本 （[[:File:标注规范-2018年1月20日版-v3.pdf | 标注规范-2018年1月20日版.pdf]]）&lt;br /&gt;
* 2017年12月12日版本 （[[:File:标注规范-2017年12月12日版.pdf | 标注规范-2017年12月12日版.pdf]]）&lt;br /&gt;
* 2017年11月27日版本 （[[:File:标注规范-2017年11月27日版_-_2017.12.9.16.pdf | 标注规范-2017年11月27日版.pdf]]）&lt;br /&gt;
* 2017年7月24日版本 （[[:File:标注规范-2017年7月24日版v1.01.pdf | 标注规范-2017年7月24日版.pdf]]）&lt;br /&gt;
* 2017年7月17日版本 （[[:File:标注规范-2017年7月17日版-v1.01.pdf | 标注规范-2017年7月17日版.pdf]]）&lt;br /&gt;
* 2017年7月15日版本 （[[:File:标注规范-2017年7月15日版.pdf | 标注规范-2017年7月15日版.pdf]]）&lt;br /&gt;
&lt;br /&gt;
*To do&lt;br /&gt;
** nmod vmod amod， adjct细化&lt;br /&gt;
** UD过一遍&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CODT&amp;diff=3879</id>
		<title>CODT</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CODT&amp;diff=3879"/>
		<updated>2021-04-30T07:34:35Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* 标注规范 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;本页面目前由彭雪同学维护。&lt;br /&gt;
&lt;br /&gt;
== 汉语开放依存句法树库（Chinese Open Dependency Treebank, CODT）==&lt;br /&gt;
&lt;br /&gt;
* 读音：[kəʊ'di:ti:]         (CO -&amp;gt; [co]operate D T)&lt;br /&gt;
* Open的含义：1）开放数据，规范和数据均公开并不断完善，欢迎大家一起按照我们的规范标注数据，或者邀请我们标注你们感兴趣的数据；2）开放领域，覆盖不同领域和来源文本&lt;br /&gt;
* 2019年8月从SUCDT改名为CODT&lt;br /&gt;
* This treebank construction project aims to continually build a large-scale Chinese dependency treebank that covers up-to-date texts from different domains and sources, and hence promote the wide application of syntactic analysis techniques.&lt;br /&gt;
&lt;br /&gt;
== 依存句法分析领域移植评测 （已结束，我们会组织下一期评测，发布更多数据）== &lt;br /&gt;
* 我们正在NLPCC-2019会议上组织评测，发布了约4万句人工标注数据，欢迎大家参与：[http://hlt.suda.edu.cn/index.php/Nlpcc-2019-shared-task 网址]&lt;br /&gt;
&lt;br /&gt;
* CCL-2021句法领域移植评测，发布CODT 2.0 [http://hlt.suda.edu.cn/index.php/CCL2021 网址]&lt;br /&gt;
&lt;br /&gt;
== 标注人员培训流程 == &lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/SUCDT-Personnel_Training 人员培训流程]&lt;br /&gt;
&lt;br /&gt;
== 招聘信息（长期、寒暑假兼职） == &lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/CODT-2019-9-recruiting 2019年9月招聘]&lt;br /&gt;
* 旧的：[http://hlt.suda.edu.cn/index.php/SUCDT-2018-12-recruiting 2018年12月招聘]&lt;br /&gt;
* 旧的：[http://hlt.suda.edu.cn/index.php/SUCDT-2018-5-recruiting 2018年5月招聘]&lt;br /&gt;
* 旧的：[http://hlt.suda.edu.cn/~zhli/nlp-anno-recruit.html 2017年6月招聘信息]&lt;br /&gt;
&lt;br /&gt;
== 培训经验 ==&lt;br /&gt;
* 定期招新，形成稳定的高质量标注人员更迭。&lt;br /&gt;
* 招新时，全面介绍标注工作内容，说明标注工作的优势，提高标注工作的兼职竞争力。&lt;br /&gt;
* 提高入职门槛，聘用经面试了解较为适合标注工作的人员，培训时增加高正确率标注人员分享经验的环节，不断更新培训视频和PPT。&lt;br /&gt;
* 公开所有标注人员的标注明细，形成良好的竞争监督机制。&lt;br /&gt;
* 精简标注人员，过滤标注时间不够或标注准确率太低超过两次的人员。&lt;br /&gt;
* 一起认真维护、完善规范，认真培训，认真审核和投诉，给出审核和投诉意见。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== 标注规范 == &lt;br /&gt;
&lt;br /&gt;
* 最新版：[http://hlt.suda.edu.cn/index.php/%E6%96%87%E4%BB%B6:%E6%A0%87%E6%B3%A8%E8%A7%84%E8%8C%832020%E5%B9%B46%E6%9C%886%E6%97%A5%E7%89%88.pdf 标注规范2020年6月6日版.pdf] &lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/CODT-data-annotation-guideline-past 旧版本标注规范]&lt;br /&gt;
&lt;br /&gt;
== 已标注数据列表（2019.12；以句子为单位，K表示1000） ==&lt;br /&gt;
* 总共：40+11+10+3+18+9+11+7+10+7=126K&lt;br /&gt;
* 规范平衡语料：14+15+11=40K （HIT CTB PMT）&lt;br /&gt;
* 商品评论PC：11K &lt;br /&gt;
* 产品博客PB：10K&lt;br /&gt;
* 网络小说（ZX诛仙）：3K&lt;br /&gt;
* 人人对话：7+11=18K&lt;br /&gt;
* 财经：9K&lt;br /&gt;
* 法律：11K&lt;br /&gt;
* 体育：7K&lt;br /&gt;
* 医学：10K&lt;br /&gt;
* 军事：7K&lt;br /&gt;
&lt;br /&gt;
== 数据共享 == &lt;br /&gt;
&lt;br /&gt;
* 大部分数据向学术界免费共享，支持研究使用。少数数据由于项目或合同约束，需要延迟一些时间后向学术界共享。&lt;br /&gt;
* 企业界需要有偿购买使用权。&lt;br /&gt;
* 数据共享协议下载：[http://hlt.suda.edu.cn/images/b/b6/Codt-sharing-agreement-2021.3-v2.pdf PDF下载链接]&lt;br /&gt;
&lt;br /&gt;
== 论文引用 ==&lt;br /&gt;
&lt;br /&gt;
* Xue Peng, Zhenghua Li, Min Zhang, Rui Wang, Yue Zhang, Luo Si. 2019. '''Overview of the NLPCC 2019 Shared Task: Cross-Domain Dependency Parsing'''. In Proceedings of NLPCC-2019. [http://hlt.suda.edu.cn/~zhli/papers/nlpcc19_shared_task_overview.pdf pdf]&lt;br /&gt;
* Zhenghua Li, Xue Peng, Min Zhang, Rui Wang, Luo Si. 2019. '''Semi-supervised Domain Adaptation for Dependency Parsing'''. Proceedings of '''ACL-2019''', pp. 2386-2395. Florence, Italy, 28 Jul. - 2 Aug. 2019. [http://hlt.suda.edu.cn/~zhli/papers/zhenghua_acl19_dp_figure_1_good.pdf pdf]&lt;br /&gt;
* Xinzhou Jiang, Bo Zhang, Zhenghua Li, Min Zhang, Sheng Li, Luo Si. 2018. '''Supervised Treebank Conversion: Data and Approaches'''. Proceedings of '''ACL-2018''', pp. 2706-2716. Melbourne, Australia. 15-20 Jul. 2018 [http://hlt.suda.edu.cn/~zhli/papers/zhenghua-acl18.pdf pdf]&lt;br /&gt;
*  郭丽娟, 彭雪, 李正华, 张民. 2019. '''面向多领域多来源文本的汉语依存句法树库构建'''. 中文信息学报. 2019, 33(2):34-42 [http://hlt.suda.edu.cn/~zhli/papers/lijuan-cip19-treebank.pdf pdf]&lt;br /&gt;
*  郭丽娟, 李正华, 彭雪, 张民. 2018. '''适应多领域多来源文本的汉语依存句法数据标注规范'''. 中文信息学报. 2018, 32(10):28-35-52 [http://hlt.suda.edu.cn/~zhli/papers/lijuan-jocip18-guideline.pdf pdf]&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3878</id>
		<title>CCL2021</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3878"/>
		<updated>2021-04-30T07:21:58Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：撤销Myzhou（讨论）的版本3877&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== '''CCL-2021依存句法分析领域移植评测''' ==&lt;br /&gt;
* [http://cips-cl.org/static/CCL2021/cclEval/taskEvaluation/index.html CCL-2021评测页面]&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/0/04/%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v5.0.pdf 我们的参赛邀请函pdf]&lt;br /&gt;
* [https://docs.qq.com/form/page/DWHltVGFCcmFQVG5h?createTS=1617351588079&amp;amp;templateId=25000#/fill 报名表]&lt;br /&gt;
&lt;br /&gt;
== '''评测日程''' ==&lt;br /&gt;
2021.4.1-4.30 开始报名&lt;br /&gt;
&lt;br /&gt;
2021.4.15 公布相关训练数据&lt;br /&gt;
&lt;br /&gt;
2021.7.13 公布无答案的测试集&lt;br /&gt;
&lt;br /&gt;
2021.7.15 测试集结果提交截止&lt;br /&gt;
&lt;br /&gt;
2021.7.20 评测报告提交&lt;br /&gt;
&lt;br /&gt;
2021.7.30 公布结果&lt;br /&gt;
&lt;br /&gt;
2021.8.13-8.15 CCL2021 评测研讨会&lt;br /&gt;
&lt;br /&gt;
== '''评测奖金''' ==&lt;br /&gt;
受中国中文信息学会资助，本次评测设置了2万元奖金，每个赛道各1万元&lt;br /&gt;
&lt;br /&gt;
第一名：5000元&lt;br /&gt;
&lt;br /&gt;
第二名：3000元&lt;br /&gt;
&lt;br /&gt;
第三名：2000元&lt;br /&gt;
&lt;br /&gt;
== '''评测数据下载''' ==&lt;br /&gt;
'''数据使用协议'''&lt;br /&gt;
&lt;br /&gt;
下载数据前需要签署数据使用协议，在收到数据使用协议后我们会发给您解压密码。&lt;br /&gt;
&amp;lt;!--请您仔细阅读如下两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学（sudaccl2021dep@163.com）--&amp;gt;&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/b/b6/Codt-sharing-agreement-2021.3-v2.pdf CODT2.0数据使用协议下载]（团队负责人签字，如果是公司，必须是公司法人签字并盖合同章）&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/%E6%96%87%E4%BB%B6:Alibaba-unlabeled-data-share-2021-4-4-1.docx PB-PC-unlabeled数据使用协议下载] (机构、学院、学校或公司盖章）&lt;br /&gt;
* 请仔细阅读两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学(sudaccl2021dep@163.com)&lt;br /&gt;
* 请用机构的官方邮箱发送协议&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;由于版权保护问题，我们只面向机构、单位等团体开放数据；对于公司，我们仅面向从事句法分析研究的公司开放数据，签署协议前请先咨询我们是否有可能共享数据；解释权归我们课题组。&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;如果您不需要无标注数据，那么只需要签署标注数据使用协议。&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''训练集/开发集/无标注数据下载'''&lt;br /&gt;
&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/CCL2021_data_readme 数据说明Readme]&lt;br /&gt;
* 训练集/开发集/无标注数据&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/train_dev_2021.4.1.zip 训练集开发集数据 下载]&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/ZX_FIN_LEG_unlabeled_2021.4.1.zip ZX、FIN、LEG无标注数据 下载]&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/PB_PC_unlabeled_2021.4.1.zip PB、PC无标注数据 下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''预训练词向量下载'''&lt;br /&gt;
&lt;br /&gt;
我们分别提供了50维、100维、300维的预训练词向量&lt;br /&gt;
[http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/wordembedding.zip 预训练词向量下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''fine-tune-bert下载'''&lt;br /&gt;
&lt;br /&gt;
我们提供了在bert-base-chinese上微调3轮的结果&lt;br /&gt;
[http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/ccl_ft3.zip fine-tune-bert下载]&lt;br /&gt;
&lt;br /&gt;
== '''评价结果提交''' ==&lt;br /&gt;
提交结果时，请将测试文件打包（zip/tar.gz）发送给周明月同学（sudaccl2021dep@163.com）。压缩包内请按照如下目录/文件命名和组织形式（没有参加的子任务忽略即可），方便我们后续处理。请参考Dev数据及Readme，确保每个文件严格采用CoNLL格式。&lt;br /&gt;
  subtask1-closed/PC-Test.out.conll&lt;br /&gt;
  subtask1-closed/PB-Test.out.conll&lt;br /&gt;
  subtask1-closed/ZX-Test.out.conll&lt;br /&gt;
  ...&lt;br /&gt;
  subtask2-open/PC-Test.out.conll&lt;br /&gt;
  subtask2-open/PB-Test.out.conll&lt;br /&gt;
  subtask2-open/ZX-Test.out.conll&lt;br /&gt;
&lt;br /&gt;
== '''评价报告提交''' ==&lt;br /&gt;
*&amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;所有的参赛单位都需要提交一份简要的报告,介绍清楚评测中使用的方法。&amp;lt;/font&amp;gt;一方面我们需要确保您使用的方法符合我们的任务要求，另一方面我们提交overview文章时需要使用。&amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;请大家在7月15日前以PDF形式提交到周明月邮箱（sudaccl2021dep@163.com）&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== '''评价脚本下载''' ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/evaluate.py 评价脚本下载]&lt;br /&gt;
** 执行命令：python3 evaluate.py gold.conll sys.conll&lt;br /&gt;
** 数据集需要为CoNLL格式，与我们提供的数据集格式相同。&lt;br /&gt;
&lt;br /&gt;
== '''评测背景''' ==&lt;br /&gt;
近年来，随着深度学习技术的发展，尤其是预训练语言模型ELMo/BERT的提出，封闭领域规范文本上的句法分析性能已经达到了比较高的水平。但是，在跨领域文本，尤其是不规范的网络文本上，句法分析的性能会急剧下降。同时，如何在深度学习模型中利用结构化的句法信息也是NLP领域的重要研究问题之一，但是受到真实文本上句法性能的限制。因此，领域移植问题已经成为句法分析研究的重要挑战。为了更充分地支持句法分析领域移植研究，我们自2017年起标注了多领域句法数据集，并命名为汉语开放依存树库（CODT），目前包含16万句，涵盖10多个领域或来源的文本。2019年，我们依托NLPCC-2019会议，组织了第一届跨领域句法分析评测(Peng et al., 2019)，针对“单源零样本”和“单源少样本”领域移植场景，发布了CODT1.0数据集，包含4万句、对应4个领域。&lt;br /&gt;
今年，我们依托CCL-2021会议，组织第二届跨领域句法分析评测，针对“多源零样本”领域移植场景，发布CODT2.0数据集，包含7万句，对应6个领域。其中，通过错误检测和人工校正，CODT2.0与CODT1.0重合的数据的质量进一步提升。&lt;br /&gt;
&lt;br /&gt;
== '''数据设置''' ==&lt;br /&gt;
在本次评测任务中，我们提供约29K句平衡语料（BC）、9K句产品博客（PB）、10K句产品评论（PC）、8K句财经资讯（FIN）、8K句法律资讯（LEG）和3K句网络小说（ZX）六个领域的数据。其中BC作为基础数据，只作为源领域。后五个领域既可以作为源领域，也可以作为目标领域。另外，针对后五个领域，我们还提供了大规模的无标注数据。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align: center;&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
!      !! train !! dev  !! test !! unlabeled&lt;br /&gt;
|-&lt;br /&gt;
| BC   || 26.1K || 1K  || 2K ||   0     &lt;br /&gt;
|-&lt;br /&gt;
| PB   || 5K  || 1.3K || 2.5K || 291K&lt;br /&gt;
|-&lt;br /&gt;
| PC   || 6.8K  || 1.3K || 2.6K || 349K&lt;br /&gt;
|-&lt;br /&gt;
| FIN   || 5K  || 1K  || 1.8K || 118K&lt;br /&gt;
|-&lt;br /&gt;
| LEG   || 5K  || 1K  || 1.9K || 150K &lt;br /&gt;
|-&lt;br /&gt;
| ZX   || 1.5K  || 0.5K  || 1K || 33K&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== '''任务设置''' ==&lt;br /&gt;
本次评测分为两个赛道:&lt;br /&gt;
&lt;br /&gt;
(Closed)：多源零样本领域移植（封闭）&lt;br /&gt;
&lt;br /&gt;
(Open)：多源零样本领域移植（开放）&lt;br /&gt;
&lt;br /&gt;
含义如下：&lt;br /&gt;
* '''多源的含义'''：可以使用其他领域的训练数据作为源领域数据。例如，当目标领域为ZX时，可以使用其他五个领域（包括BC）的训练数据，即BC/PB/PC/FIN/LEG-Train。&lt;br /&gt;
* '''零样本的含义'''：不能使用对应领域的训练数据。例如，当目标领域为ZX时，那么ZX-Train不可作为训练数据使用。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* '''Closed赛道的要求'''：&lt;br /&gt;
1）	只能使用我们提供的数据和信息，包括：所有数据我们都提供分词、自动词性；我们会提供pre-trained word embedding (在Chinese Gigaword 3和所有领域Train/Unlabeled数据上训练word2vec得到)。&lt;br /&gt;
&lt;br /&gt;
2）	不可以使用其他开源工具得到新的信息，如词性、词义等特征。&lt;br /&gt;
&lt;br /&gt;
3）	不可以使用其他的资源，如词典、句法语义树库等。&lt;br /&gt;
&lt;br /&gt;
4）	不可以使用大规模无标注数据上训练的预训练语言模型（任何开源的通用语言模型），但是可以通过预训练语言模型的技术来使用我们提供的无标注数据。即可以使用在我们提供的有标注和无标注数据上从头开始训练预训练模型。&lt;br /&gt;
&lt;br /&gt;
5）	不可以使用NLPCC-2019 CODT1.0的数据。&lt;br /&gt;
&lt;br /&gt;
* '''Open赛道的要求'''：&lt;br /&gt;
&lt;br /&gt;
1）	可以使用任何可通过某种公开方式获取（包括购买）的数据、资源或工具。但是建议参赛者在系统报告中明确说明使用的外部资源以及这些外部资源对性能的影响。&lt;br /&gt;
&lt;br /&gt;
* '''注意事项'''&lt;br /&gt;
1）	开发集的使用：不允许将Dev加入到训练数据中。Dev数据只可以用来调参和选择模型。&lt;br /&gt;
&lt;br /&gt;
2）	无标注数据（Unlabeled）的使用：不限制。同时，6个领域的Train中的句子，只要不使用句法标注信息，也都可以作为无标注数据使用。&lt;br /&gt;
&lt;br /&gt;
3）	预训练语言模型微调：我们将Google发布的bert-base-chinese在所有无标注数据（6个领域的Train，5个领域的Unlabeled数据）进行多轮微调（3轮或10轮），即继续使用语言模型损失函数继续训练。这个模型仅限于Open赛道上的系统使用。我们做这个事情的目的是方便大家试试这个方向，避免大家浪费资源，重复训练。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''如果您对规则有疑问，请随时联系我们确认。如果违反规则，发现后，成绩会直接取消。'''&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3877</id>
		<title>CCL2021</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3877"/>
		<updated>2021-04-30T07:20:06Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* 评测数据下载 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== '''CCL-2021依存句法分析领域移植评测''' ==&lt;br /&gt;
* [http://cips-cl.org/static/CCL2021/cclEval/taskEvaluation/index.html CCL-2021评测页面]&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/0/04/%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v5.0.pdf 我们的参赛邀请函pdf]&lt;br /&gt;
* [https://docs.qq.com/form/page/DWHltVGFCcmFQVG5h?createTS=1617351588079&amp;amp;templateId=25000#/fill 报名表]&lt;br /&gt;
&lt;br /&gt;
== '''评测日程''' ==&lt;br /&gt;
2021.4.1-4.30 开始报名&lt;br /&gt;
&lt;br /&gt;
2021.4.15 公布相关训练数据&lt;br /&gt;
&lt;br /&gt;
2021.7.13 公布无答案的测试集&lt;br /&gt;
&lt;br /&gt;
2021.7.15 测试集结果提交截止&lt;br /&gt;
&lt;br /&gt;
2021.7.20 评测报告提交&lt;br /&gt;
&lt;br /&gt;
2021.7.30 公布结果&lt;br /&gt;
&lt;br /&gt;
2021.8.13-8.15 CCL2021 评测研讨会&lt;br /&gt;
&lt;br /&gt;
== '''评测奖金''' ==&lt;br /&gt;
受中国中文信息学会资助，本次评测设置了2万元奖金，每个赛道各1万元&lt;br /&gt;
&lt;br /&gt;
第一名：5000元&lt;br /&gt;
&lt;br /&gt;
第二名：3000元&lt;br /&gt;
&lt;br /&gt;
第三名：2000元&lt;br /&gt;
&lt;br /&gt;
== '''评测数据下载''' ==&lt;br /&gt;
'''数据使用协议'''&lt;br /&gt;
&lt;br /&gt;
下载数据前需要签署数据使用协议，在收到数据使用协议后我们会发给您解压密码。&lt;br /&gt;
&amp;lt;!--请您仔细阅读如下两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学（sudaccl2021dep@163.com）--&amp;gt;&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/b/b6/Codt-sharing-agreement-2021.3-v2.pdf CODT2.0数据使用协议下载]（团队负责人签字，如果是公司，必须是公司法人签字并盖合同章）&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/%E6%96%87%E4%BB%B6:Alibaba-unlabeled-data-share-2021-4-4-1.docx PB-PC-unlabeled数据使用协议下载] (机构、学院、学校或公司盖章）&lt;br /&gt;
* 请仔细阅读两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学(sudaccl2021dep@163.com)&lt;br /&gt;
* 请用机构的官方邮箱发送协议&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;由于版权保护问题，我们只面向机构、单位等团体开放数据；对于公司，我们仅面向从事句法分析研究的公司开放数据，签署协议前请先咨询我们是否有可能共享数据；解释权归我们课题组。&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;如果您不需要无标注数据，那么只需要签署标注数据使用协议。&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''训练集/开发集/无标注数据下载'''&lt;br /&gt;
&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/CCL2021_data_readme 数据说明Readme]&lt;br /&gt;
* 训练集/开发集/无标注数据&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/train_dev_2021.4.1.zip 训练集开发集数据 下载]&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/ZX_FIN_LEG_unlabeled_2021.4.1.zip ZX、FIN、LEG无标注数据 下载]&lt;br /&gt;
** [http://hlt.suda.edu.cn/index.php/文件:Alibaba-unlabeled-data-share-2021-4-4-1.docx PB、PC无标注数据 下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''预训练词向量下载'''&lt;br /&gt;
&lt;br /&gt;
我们分别提供了50维、100维、300维的预训练词向量&lt;br /&gt;
[http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/wordembedding.zip 预训练词向量下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''fine-tune-bert下载'''&lt;br /&gt;
&lt;br /&gt;
我们提供了在bert-base-chinese上微调3轮的结果&lt;br /&gt;
[http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/ccl_ft3.zip fine-tune-bert下载]&lt;br /&gt;
&lt;br /&gt;
== '''评价结果提交''' ==&lt;br /&gt;
提交结果时，请将测试文件打包（zip/tar.gz）发送给周明月同学（sudaccl2021dep@163.com）。压缩包内请按照如下目录/文件命名和组织形式（没有参加的子任务忽略即可），方便我们后续处理。请参考Dev数据及Readme，确保每个文件严格采用CoNLL格式。&lt;br /&gt;
  subtask1-closed/PC-Test.out.conll&lt;br /&gt;
  subtask1-closed/PB-Test.out.conll&lt;br /&gt;
  subtask1-closed/ZX-Test.out.conll&lt;br /&gt;
  ...&lt;br /&gt;
  subtask2-open/PC-Test.out.conll&lt;br /&gt;
  subtask2-open/PB-Test.out.conll&lt;br /&gt;
  subtask2-open/ZX-Test.out.conll&lt;br /&gt;
&lt;br /&gt;
== '''评价报告提交''' ==&lt;br /&gt;
*&amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;所有的参赛单位都需要提交一份简要的报告,介绍清楚评测中使用的方法。&amp;lt;/font&amp;gt;一方面我们需要确保您使用的方法符合我们的任务要求，另一方面我们提交overview文章时需要使用。&amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;请大家在7月15日前以PDF形式提交到周明月邮箱（sudaccl2021dep@163.com）&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== '''评价脚本下载''' ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/evaluate.py 评价脚本下载]&lt;br /&gt;
** 执行命令：python3 evaluate.py gold.conll sys.conll&lt;br /&gt;
** 数据集需要为CoNLL格式，与我们提供的数据集格式相同。&lt;br /&gt;
&lt;br /&gt;
== '''评测背景''' ==&lt;br /&gt;
近年来，随着深度学习技术的发展，尤其是预训练语言模型ELMo/BERT的提出，封闭领域规范文本上的句法分析性能已经达到了比较高的水平。但是，在跨领域文本，尤其是不规范的网络文本上，句法分析的性能会急剧下降。同时，如何在深度学习模型中利用结构化的句法信息也是NLP领域的重要研究问题之一，但是受到真实文本上句法性能的限制。因此，领域移植问题已经成为句法分析研究的重要挑战。为了更充分地支持句法分析领域移植研究，我们自2017年起标注了多领域句法数据集，并命名为汉语开放依存树库（CODT），目前包含16万句，涵盖10多个领域或来源的文本。2019年，我们依托NLPCC-2019会议，组织了第一届跨领域句法分析评测(Peng et al., 2019)，针对“单源零样本”和“单源少样本”领域移植场景，发布了CODT1.0数据集，包含4万句、对应4个领域。&lt;br /&gt;
今年，我们依托CCL-2021会议，组织第二届跨领域句法分析评测，针对“多源零样本”领域移植场景，发布CODT2.0数据集，包含7万句，对应6个领域。其中，通过错误检测和人工校正，CODT2.0与CODT1.0重合的数据的质量进一步提升。&lt;br /&gt;
&lt;br /&gt;
== '''数据设置''' ==&lt;br /&gt;
在本次评测任务中，我们提供约29K句平衡语料（BC）、9K句产品博客（PB）、10K句产品评论（PC）、8K句财经资讯（FIN）、8K句法律资讯（LEG）和3K句网络小说（ZX）六个领域的数据。其中BC作为基础数据，只作为源领域。后五个领域既可以作为源领域，也可以作为目标领域。另外，针对后五个领域，我们还提供了大规模的无标注数据。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align: center;&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
!      !! train !! dev  !! test !! unlabeled&lt;br /&gt;
|-&lt;br /&gt;
| BC   || 26.1K || 1K  || 2K ||   0     &lt;br /&gt;
|-&lt;br /&gt;
| PB   || 5K  || 1.3K || 2.5K || 291K&lt;br /&gt;
|-&lt;br /&gt;
| PC   || 6.8K  || 1.3K || 2.6K || 349K&lt;br /&gt;
|-&lt;br /&gt;
| FIN   || 5K  || 1K  || 1.8K || 118K&lt;br /&gt;
|-&lt;br /&gt;
| LEG   || 5K  || 1K  || 1.9K || 150K &lt;br /&gt;
|-&lt;br /&gt;
| ZX   || 1.5K  || 0.5K  || 1K || 33K&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== '''任务设置''' ==&lt;br /&gt;
本次评测分为两个赛道:&lt;br /&gt;
&lt;br /&gt;
(Closed)：多源零样本领域移植（封闭）&lt;br /&gt;
&lt;br /&gt;
(Open)：多源零样本领域移植（开放）&lt;br /&gt;
&lt;br /&gt;
含义如下：&lt;br /&gt;
* '''多源的含义'''：可以使用其他领域的训练数据作为源领域数据。例如，当目标领域为ZX时，可以使用其他五个领域（包括BC）的训练数据，即BC/PB/PC/FIN/LEG-Train。&lt;br /&gt;
* '''零样本的含义'''：不能使用对应领域的训练数据。例如，当目标领域为ZX时，那么ZX-Train不可作为训练数据使用。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* '''Closed赛道的要求'''：&lt;br /&gt;
1）	只能使用我们提供的数据和信息，包括：所有数据我们都提供分词、自动词性；我们会提供pre-trained word embedding (在Chinese Gigaword 3和所有领域Train/Unlabeled数据上训练word2vec得到)。&lt;br /&gt;
&lt;br /&gt;
2）	不可以使用其他开源工具得到新的信息，如词性、词义等特征。&lt;br /&gt;
&lt;br /&gt;
3）	不可以使用其他的资源，如词典、句法语义树库等。&lt;br /&gt;
&lt;br /&gt;
4）	不可以使用大规模无标注数据上训练的预训练语言模型（任何开源的通用语言模型），但是可以通过预训练语言模型的技术来使用我们提供的无标注数据。即可以使用在我们提供的有标注和无标注数据上从头开始训练预训练模型。&lt;br /&gt;
&lt;br /&gt;
5）	不可以使用NLPCC-2019 CODT1.0的数据。&lt;br /&gt;
&lt;br /&gt;
* '''Open赛道的要求'''：&lt;br /&gt;
&lt;br /&gt;
1）	可以使用任何可通过某种公开方式获取（包括购买）的数据、资源或工具。但是建议参赛者在系统报告中明确说明使用的外部资源以及这些外部资源对性能的影响。&lt;br /&gt;
&lt;br /&gt;
* '''注意事项'''&lt;br /&gt;
1）	开发集的使用：不允许将Dev加入到训练数据中。Dev数据只可以用来调参和选择模型。&lt;br /&gt;
&lt;br /&gt;
2）	无标注数据（Unlabeled）的使用：不限制。同时，6个领域的Train中的句子，只要不使用句法标注信息，也都可以作为无标注数据使用。&lt;br /&gt;
&lt;br /&gt;
3）	预训练语言模型微调：我们将Google发布的bert-base-chinese在所有无标注数据（6个领域的Train，5个领域的Unlabeled数据）进行多轮微调（3轮或10轮），即继续使用语言模型损失函数继续训练。这个模型仅限于Open赛道上的系统使用。我们做这个事情的目的是方便大家试试这个方向，避免大家浪费资源，重复训练。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''如果您对规则有疑问，请随时联系我们确认。如果违反规则，发现后，成绩会直接取消。'''&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CODT&amp;diff=3872</id>
		<title>CODT</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CODT&amp;diff=3872"/>
		<updated>2021-04-30T06:30:31Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* 数据共享 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;本页面目前由彭雪同学维护。&lt;br /&gt;
&lt;br /&gt;
== 汉语开放依存句法树库（Chinese Open Dependency Treebank, CODT）==&lt;br /&gt;
&lt;br /&gt;
* 读音：[kəʊ'di:ti:]         (CO -&amp;gt; [co]operate D T)&lt;br /&gt;
* Open的含义：1）开放数据，规范和数据均公开并不断完善，欢迎大家一起按照我们的规范标注数据，或者邀请我们标注你们感兴趣的数据；2）开放领域，覆盖不同领域和来源文本&lt;br /&gt;
* 2019年8月从SUCDT改名为CODT&lt;br /&gt;
* This treebank construction project aims to continually build a large-scale Chinese dependency treebank that covers up-to-date texts from different domains and sources, and hence promote the wide application of syntactic analysis techniques.&lt;br /&gt;
&lt;br /&gt;
== 依存句法分析领域移植评测 （已结束，我们会组织下一期评测，发布更多数据）== &lt;br /&gt;
* 我们正在NLPCC-2019会议上组织评测，发布了约4万句人工标注数据，欢迎大家参与：[http://hlt.suda.edu.cn/index.php/Nlpcc-2019-shared-task 网址]&lt;br /&gt;
&lt;br /&gt;
* CCL-2021句法领域移植评测，发布CODT 2.0 [http://hlt.suda.edu.cn/index.php/CCL2021 网址]&lt;br /&gt;
&lt;br /&gt;
== 标注人员培训流程 == &lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/SUCDT-Personnel_Training 人员培训流程]&lt;br /&gt;
&lt;br /&gt;
== 招聘信息（长期、寒暑假兼职） == &lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/CODT-2019-9-recruiting 2019年9月招聘]&lt;br /&gt;
* 旧的：[http://hlt.suda.edu.cn/index.php/SUCDT-2018-12-recruiting 2018年12月招聘]&lt;br /&gt;
* 旧的：[http://hlt.suda.edu.cn/index.php/SUCDT-2018-5-recruiting 2018年5月招聘]&lt;br /&gt;
* 旧的：[http://hlt.suda.edu.cn/~zhli/nlp-anno-recruit.html 2017年6月招聘信息]&lt;br /&gt;
&lt;br /&gt;
== 培训经验 ==&lt;br /&gt;
* 定期招新，形成稳定的高质量标注人员更迭。&lt;br /&gt;
* 招新时，全面介绍标注工作内容，说明标注工作的优势，提高标注工作的兼职竞争力。&lt;br /&gt;
* 提高入职门槛，聘用经面试了解较为适合标注工作的人员，培训时增加高正确率标注人员分享经验的环节，不断更新培训视频和PPT。&lt;br /&gt;
* 公开所有标注人员的标注明细，形成良好的竞争监督机制。&lt;br /&gt;
* 精简标注人员，过滤标注时间不够或标注准确率太低超过两次的人员。&lt;br /&gt;
* 一起认真维护、完善规范，认真培训，认真审核和投诉，给出审核和投诉意见。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== 标注规范 == &lt;br /&gt;
&lt;br /&gt;
* 最新版：[[:File:标注规范2019年9月19日版.pdf| 标注规范2019年9月19日版.pdf]] &lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/CODT-data-annotation-guideline-past 旧版本标注规范]&lt;br /&gt;
&lt;br /&gt;
== 已标注数据列表（2019.12；以句子为单位，K表示1000） ==&lt;br /&gt;
* 总共：40+11+10+3+18+9+11+7+10+7=126K&lt;br /&gt;
* 规范平衡语料：14+15+11=40K （HIT CTB PMT）&lt;br /&gt;
* 商品评论PC：11K &lt;br /&gt;
* 产品博客PB：10K&lt;br /&gt;
* 网络小说（ZX诛仙）：3K&lt;br /&gt;
* 人人对话：7+11=18K&lt;br /&gt;
* 财经：9K&lt;br /&gt;
* 法律：11K&lt;br /&gt;
* 体育：7K&lt;br /&gt;
* 医学：10K&lt;br /&gt;
* 军事：7K&lt;br /&gt;
&lt;br /&gt;
== 数据共享 == &lt;br /&gt;
&lt;br /&gt;
* 大部分数据向学术界免费共享，支持研究使用。少数数据由于项目或合同约束，需要延迟一些时间后向学术界共享。&lt;br /&gt;
* 企业界需要有偿购买使用权。&lt;br /&gt;
* 数据共享协议下载：[http://hlt.suda.edu.cn/images/b/b6/Codt-sharing-agreement-2021.3-v2.pdf PDF下载链接]&lt;br /&gt;
&lt;br /&gt;
== 论文引用 ==&lt;br /&gt;
&lt;br /&gt;
* Xue Peng, Zhenghua Li, Min Zhang, Rui Wang, Yue Zhang, Luo Si. 2019. '''Overview of the NLPCC 2019 Shared Task: Cross-Domain Dependency Parsing'''. In Proceedings of NLPCC-2019. [http://hlt.suda.edu.cn/~zhli/papers/nlpcc19_shared_task_overview.pdf pdf]&lt;br /&gt;
* Zhenghua Li, Xue Peng, Min Zhang, Rui Wang, Luo Si. 2019. '''Semi-supervised Domain Adaptation for Dependency Parsing'''. Proceedings of '''ACL-2019''', pp. 2386-2395. Florence, Italy, 28 Jul. - 2 Aug. 2019. [http://hlt.suda.edu.cn/~zhli/papers/zhenghua_acl19_dp_figure_1_good.pdf pdf]&lt;br /&gt;
* Xinzhou Jiang, Bo Zhang, Zhenghua Li, Min Zhang, Sheng Li, Luo Si. 2018. '''Supervised Treebank Conversion: Data and Approaches'''. Proceedings of '''ACL-2018''', pp. 2706-2716. Melbourne, Australia. 15-20 Jul. 2018 [http://hlt.suda.edu.cn/~zhli/papers/zhenghua-acl18.pdf pdf]&lt;br /&gt;
*  郭丽娟, 彭雪, 李正华, 张民. 2019. '''面向多领域多来源文本的汉语依存句法树库构建'''. 中文信息学报. 2019, 33(2):34-42 [http://hlt.suda.edu.cn/~zhli/papers/lijuan-cip19-treebank.pdf pdf]&lt;br /&gt;
*  郭丽娟, 李正华, 彭雪, 张民. 2018. '''适应多领域多来源文本的汉语依存句法数据标注规范'''. 中文信息学报. 2018, 32(10):28-35-52 [http://hlt.suda.edu.cn/~zhli/papers/lijuan-jocip18-guideline.pdf pdf]&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3805</id>
		<title>CCL2021</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3805"/>
		<updated>2021-04-09T12:22:20Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* 评测数据下载 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== '''CCL-2021依存句法分析领域移植评测''' ==&lt;br /&gt;
* [http://cips-cl.org/static/CCL2021/cclEval/taskEvaluation/index.html CCL-2021评测页面]&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/0/04/%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v5.0.pdf 我们的参赛邀请函pdf]&lt;br /&gt;
* [https://docs.qq.com/form/page/DWHltVGFCcmFQVG5h?createTS=1617351588079&amp;amp;templateId=25000#/fill 报名表]&lt;br /&gt;
&lt;br /&gt;
== '''评测日程''' ==&lt;br /&gt;
2021.4.1-4.30 开始报名&lt;br /&gt;
&lt;br /&gt;
2021.4.15 公布相关训练数据&lt;br /&gt;
&lt;br /&gt;
2021.7.13 公布无答案的测试集&lt;br /&gt;
&lt;br /&gt;
2021.7.15 测试集结果提交截止&lt;br /&gt;
&lt;br /&gt;
2021.7.20 评测报告提交&lt;br /&gt;
&lt;br /&gt;
2021.7.30 公布结果&lt;br /&gt;
&lt;br /&gt;
2021.8.13-8.15 CCL2021 评测研讨会&lt;br /&gt;
&lt;br /&gt;
== '''评测奖金''' ==&lt;br /&gt;
受中国中文信息学会资助，本次评测设置了2万元奖金，每个赛道各1万元&lt;br /&gt;
&lt;br /&gt;
第一名：5000元&lt;br /&gt;
&lt;br /&gt;
第二名：3000元&lt;br /&gt;
&lt;br /&gt;
第三名：2000元&lt;br /&gt;
&lt;br /&gt;
== '''评测数据下载''' ==&lt;br /&gt;
'''数据使用协议'''&lt;br /&gt;
&lt;br /&gt;
下载数据前需要签署数据使用协议，在收到数据使用协议后我们会发给您解压密码。&lt;br /&gt;
&amp;lt;!--请您仔细阅读如下两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学（sudaccl2021dep@163.com）--&amp;gt;&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/b/b6/Codt-sharing-agreement-2021.3-v2.pdf CODT2.0数据使用协议下载]（团队负责人签字，如果是公司，必须是公司法人签字并盖合同章）&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/alibaba-unlabeled-data-share-2019.4.4.doc PB-PC-unlabeled数据使用协议下载] (机构、学院、学校或公司盖章）&lt;br /&gt;
* 请仔细阅读两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学(sudaccl2021dep@163.com)&lt;br /&gt;
* 请用机构的官方邮箱发送协议&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;由于版权保护问题，我们只面向机构、单位等团体开放数据；对于公司，我们仅面向从事句法分析研究的公司开放数据，签署协议前请先咨询我们是否有可能共享数据；解释权归我们课题组。&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;如果您不需要无标注数据，那么只需要签署标注数据使用协议。&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''训练集/开发集/无标注数据下载'''&lt;br /&gt;
&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/CCL2021_data_readme 数据说明Readme]&lt;br /&gt;
* 训练集/开发集/无标注数据&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/train_dev_2021.4.1.zip 训练集开发集数据 下载]&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/ZX_FIN_LEG_unlabeled_2021.4.1.zip ZX、FIN、LEG无标注数据 下载]&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/PB_PC_unlabeled_2021.4.1.zip PB、PC无标注数据 下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''预训练词向量下载'''&lt;br /&gt;
&lt;br /&gt;
我们分别提供了50维、100维、300维的预训练词向量&lt;br /&gt;
[http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/wordembedding.zip 预训练词向量下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''fine-tune-bert下载'''&lt;br /&gt;
&lt;br /&gt;
我们提供了在bert-base-chinese上微调3轮的结果&lt;br /&gt;
[http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/ccl_ft3.zip fine-tune-bert下载]&lt;br /&gt;
&lt;br /&gt;
== '''评价结果提交''' ==&lt;br /&gt;
提交结果时，请将测试文件打包（zip/tar.gz）发送给李帅克同学（skli20@stu.suda.edu.cn）。压缩包内请按照如下目录/文件命名和组织形式（没有参加的子任务忽略即可），方便我们后续处理。请参考Dev数据及Readme，确保每个文件严格采用CoNLL格式。&lt;br /&gt;
  subtask1-closed/PC-Test.out.conll&lt;br /&gt;
  subtask1-closed/PB-Test.out.conll&lt;br /&gt;
  subtask1-closed/ZX-Test.out.conll&lt;br /&gt;
  ...&lt;br /&gt;
  subtask2-open/PC-Test.out.conll&lt;br /&gt;
  subtask2-open/PB-Test.out.conll&lt;br /&gt;
  subtask2-open/ZX-Test.out.conll&lt;br /&gt;
&lt;br /&gt;
== '''评价报告提交''' ==&lt;br /&gt;
*&amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;所有的参赛单位都需要提交一份简要的报告,介绍清楚评测中使用的方法。&amp;lt;/font&amp;gt;一方面我们需要确保您使用的方法符合我们的任务要求，另一方面我们提交overview文章时需要使用。&amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;请大家在7月15日前以PDF形式提交到李帅克邮箱（skli20@stu.suda.edu.cn）&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== '''评价脚本下载''' ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/evaluate.py 评价脚本下载]&lt;br /&gt;
** 执行命令：python3 evaluate.py gold.conll sys.conll&lt;br /&gt;
** 数据集需要为CoNLL格式，与我们提供的数据集格式相同。&lt;br /&gt;
&lt;br /&gt;
== '''评测背景''' ==&lt;br /&gt;
近年来，随着深度学习技术的发展，尤其是预训练语言模型ELMo/BERT的提出，封闭领域规范文本上的句法分析性能已经达到了比较高的水平。但是，在跨领域文本，尤其是不规范的网络文本上，句法分析的性能会急剧下降。同时，如何在深度学习模型中利用结构化的句法信息也是NLP领域的重要研究问题之一，但是受到真实文本上句法性能的限制。因此，领域移植问题已经成为句法分析研究的重要挑战。为了更充分地支持句法分析领域移植研究，我们自2017年起标注了多领域句法数据集，并命名为汉语开放依存树库（CODT），目前包含16万句，涵盖10多个领域或来源的文本。2019年，我们依托NLPCC-2019会议，组织了第一届跨领域句法分析评测(Peng et al., 2019)，针对“单源零样本”和“单源少样本”领域移植场景，发布了CODT1.0数据集，包含4万句、对应4个领域。&lt;br /&gt;
今年，我们依托CCL-2021会议，组织第二届跨领域句法分析评测，针对“多源零样本”领域移植场景，发布CODT2.0数据集，包含7万句，对应6个领域。其中，通过错误检测和人工校正，CODT2.0与CODT1.0重合的数据的质量进一步提升。&lt;br /&gt;
&lt;br /&gt;
== '''数据设置''' ==&lt;br /&gt;
在本次评测任务中，我们提供约29K句平衡语料（BC）、9K句产品博客（PB）、10K句产品评论（PC）、8K句财经资讯（FIN）、8K句法律资讯（LEG）和3K句网络小说（ZX）六个领域的数据。其中BC作为基础数据，只作为源领域。后五个领域既可以作为源领域，也可以作为目标领域。另外，针对后五个领域，我们还提供了大规模的无标注数据。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align: center;&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
!      !! train !! dev  !! test !! unlabeled&lt;br /&gt;
|-&lt;br /&gt;
| BC   || 26.1K || 1K  || 2K ||   0     &lt;br /&gt;
|-&lt;br /&gt;
| PB   || 5K  || 1.3K || 2.5K || 291K&lt;br /&gt;
|-&lt;br /&gt;
| PC   || 6.8K  || 1.3K || 2.6K || 349K&lt;br /&gt;
|-&lt;br /&gt;
| FIN   || 5K  || 1K  || 1.8K || 118K&lt;br /&gt;
|-&lt;br /&gt;
| LEG   || 5K  || 1K  || 1.9K || 150K &lt;br /&gt;
|-&lt;br /&gt;
| ZX   || 1.5K  || 0.5K  || 1K || 33K&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== '''任务设置''' ==&lt;br /&gt;
本次评测分为两个赛道:&lt;br /&gt;
&lt;br /&gt;
(Closed)：多源零样本领域移植（封闭）&lt;br /&gt;
&lt;br /&gt;
(Open)：多源零样本领域移植（开放）&lt;br /&gt;
&lt;br /&gt;
含义如下：&lt;br /&gt;
* '''多源的含义'''：可以使用其他领域的训练数据作为源领域数据。例如，当目标领域为ZX时，可以使用其他五个领域（包括BC）的训练数据，即BC/PB/PC/FIN/LEG-Train。&lt;br /&gt;
* '''零样本的含义'''：不能使用对应领域的训练数据。例如，当目标领域为ZX时，那么ZX-Train不可作为训练数据使用。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* '''Closed赛道的要求'''：&lt;br /&gt;
1）	只能使用我们提供的数据和信息，包括：所有数据我们都提供分词、自动词性；我们会提供pre-trained word embedding (在Chinese Gigaword 3和所有领域Train/Unlabeled数据上训练word2vec得到)。&lt;br /&gt;
&lt;br /&gt;
2）	不可以使用其他开源工具得到新的信息，如词性、词义等特征。&lt;br /&gt;
&lt;br /&gt;
3）	不可以使用其他的资源，如词典、句法语义树库等。&lt;br /&gt;
&lt;br /&gt;
4）	不可以使用大规模无标注数据上训练的预训练语言模型（任何开源的通用语言模型），但是可以通过预训练语言模型的技术来使用我们提供的无标注数据。即可以使用在我们提供的有标注和无标注数据上从头开始训练预训练模型。&lt;br /&gt;
&lt;br /&gt;
5）	不可以使用NLPCC-2019 CODT1.0的数据。&lt;br /&gt;
&lt;br /&gt;
* '''Open赛道的要求'''：&lt;br /&gt;
&lt;br /&gt;
1）	可以使用任何可通过某种公开方式获取（包括购买）的数据、资源或工具。但是建议参赛者在系统报告中明确说明使用的外部资源以及这些外部资源对性能的影响。&lt;br /&gt;
&lt;br /&gt;
* '''注意事项'''&lt;br /&gt;
1）	开发集的使用：不允许将Dev加入到训练数据中。Dev数据只可以用来调参和选择模型。&lt;br /&gt;
&lt;br /&gt;
2）	无标注数据（Unlabeled）的使用：不限制。同时，6个领域的Train中的句子，只要不使用句法标注信息，也都可以作为无标注数据使用。&lt;br /&gt;
&lt;br /&gt;
3）	预训练语言模型微调：我们将Google发布的bert-base-chinese在所有无标注数据（6个领域的Train，5个领域的Unlabeled数据）进行多轮微调（3轮或10轮），即继续使用语言模型损失函数继续训练。这个模型仅限于Open赛道上的系统使用。我们做这个事情的目的是方便大家试试这个方向，避免大家浪费资源，重复训练。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''如果您对规则有疑问，请随时联系我们确认。如果违反规则，发现后，成绩会直接取消。'''&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=%E6%96%87%E4%BB%B6:Codt-sharing-agreement-2021.3-v2.pdf&amp;diff=3804</id>
		<title>文件:Codt-sharing-agreement-2021.3-v2.pdf</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=%E6%96%87%E4%BB%B6:Codt-sharing-agreement-2021.3-v2.pdf&amp;diff=3804"/>
		<updated>2021-04-09T12:22:02Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3803</id>
		<title>CCL2021</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3803"/>
		<updated>2021-04-09T11:46:35Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* 评测数据下载 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== '''CCL-2021依存句法分析领域移植评测''' ==&lt;br /&gt;
* [http://cips-cl.org/static/CCL2021/cclEval/taskEvaluation/index.html CCL-2021评测页面]&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/0/04/%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v5.0.pdf 我们的参赛邀请函pdf]&lt;br /&gt;
* [https://docs.qq.com/form/page/DWHltVGFCcmFQVG5h?createTS=1617351588079&amp;amp;templateId=25000#/fill 报名表]&lt;br /&gt;
&lt;br /&gt;
== '''评测日程''' ==&lt;br /&gt;
2021.4.1-4.30 开始报名&lt;br /&gt;
&lt;br /&gt;
2021.4.15 公布相关训练数据&lt;br /&gt;
&lt;br /&gt;
2021.7.13 公布无答案的测试集&lt;br /&gt;
&lt;br /&gt;
2021.7.15 测试集结果提交截止&lt;br /&gt;
&lt;br /&gt;
2021.7.20 评测报告提交&lt;br /&gt;
&lt;br /&gt;
2021.7.30 公布结果&lt;br /&gt;
&lt;br /&gt;
2021.8.13-8.15 CCL2021 评测研讨会&lt;br /&gt;
&lt;br /&gt;
== '''评测奖金''' ==&lt;br /&gt;
受中国中文信息学会资助，本次评测设置了2万元奖金，每个赛道各1万元&lt;br /&gt;
&lt;br /&gt;
第一名：5000元&lt;br /&gt;
&lt;br /&gt;
第二名：3000元&lt;br /&gt;
&lt;br /&gt;
第三名：2000元&lt;br /&gt;
&lt;br /&gt;
== '''评测数据下载''' ==&lt;br /&gt;
'''数据使用协议'''&lt;br /&gt;
&lt;br /&gt;
下载数据前需要签署数据使用协议，在收到数据使用协议后我们会发给您解压密码。&lt;br /&gt;
&amp;lt;!--请您仔细阅读如下两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学（sudaccl2021dep@163.com）--&amp;gt;&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/c/c1/Codt-sharing-agreement-2021.3-v1.pdf CODT2.0数据使用协议下载]（团队负责人签字，如果是公司，必须是公司法人签字并盖合同章）&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/alibaba-unlabeled-data-share-2019.4.4.doc PB-PC-unlabeled数据使用协议下载] (机构、学院、学校或公司盖章）&lt;br /&gt;
* 请仔细阅读两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学(sudaccl2021dep@163.com)&lt;br /&gt;
* 请用机构的官方邮箱发送协议&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;由于版权保护问题，我们只面向机构、单位等团体开放数据；对于公司，我们仅面向从事句法分析研究的公司开放数据，签署协议前请先咨询我们是否有可能共享数据；解释权归我们课题组。&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;如果您不需要无标注数据，那么只需要签署标注数据使用协议。&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''训练集/开发集/无标注数据下载'''&lt;br /&gt;
&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/CCL2021_data_readme 数据说明Readme]&lt;br /&gt;
* 训练集/开发集/无标注数据&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/train_dev_2021.4.1.zip 训练集开发集数据 下载]&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/ZX_FIN_LEG_unlabeled_2021.4.1.zip ZX、FIN、LEG无标注数据 下载]&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/PB_PC_unlabeled_2021.4.1.zip PB、PC无标注数据 下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''预训练词向量下载'''&lt;br /&gt;
&lt;br /&gt;
我们分别提供了50维、100维、300维的预训练词向量&lt;br /&gt;
[http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/wordembedding.zip 预训练词向量下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''fine-tune-bert下载'''&lt;br /&gt;
&lt;br /&gt;
我们提供了在bert-base-chinese上微调3轮的结果&lt;br /&gt;
[http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/ccl_ft3.zip fine-tune-bert下载]&lt;br /&gt;
&lt;br /&gt;
== '''评价结果提交''' ==&lt;br /&gt;
提交结果时，请将测试文件打包（zip/tar.gz）发送给李帅克同学（skli20@stu.suda.edu.cn）。压缩包内请按照如下目录/文件命名和组织形式（没有参加的子任务忽略即可），方便我们后续处理。请参考Dev数据及Readme，确保每个文件严格采用CoNLL格式。&lt;br /&gt;
  subtask1-closed/PC-Test.out.conll&lt;br /&gt;
  subtask1-closed/PB-Test.out.conll&lt;br /&gt;
  subtask1-closed/ZX-Test.out.conll&lt;br /&gt;
  ...&lt;br /&gt;
  subtask2-open/PC-Test.out.conll&lt;br /&gt;
  subtask2-open/PB-Test.out.conll&lt;br /&gt;
  subtask2-open/ZX-Test.out.conll&lt;br /&gt;
&lt;br /&gt;
== '''评价报告提交''' ==&lt;br /&gt;
*&amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;所有的参赛单位都需要提交一份简要的报告,介绍清楚评测中使用的方法。&amp;lt;/font&amp;gt;一方面我们需要确保您使用的方法符合我们的任务要求，另一方面我们提交overview文章时需要使用。&amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;请大家在7月15日前以PDF形式提交到李帅克邮箱（skli20@stu.suda.edu.cn）&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== '''评价脚本下载''' ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/evaluate.py 评价脚本下载]&lt;br /&gt;
** 执行命令：python3 evaluate.py gold.conll sys.conll&lt;br /&gt;
** 数据集需要为CoNLL格式，与我们提供的数据集格式相同。&lt;br /&gt;
&lt;br /&gt;
== '''评测背景''' ==&lt;br /&gt;
近年来，随着深度学习技术的发展，尤其是预训练语言模型ELMo/BERT的提出，封闭领域规范文本上的句法分析性能已经达到了比较高的水平。但是，在跨领域文本，尤其是不规范的网络文本上，句法分析的性能会急剧下降。同时，如何在深度学习模型中利用结构化的句法信息也是NLP领域的重要研究问题之一，但是受到真实文本上句法性能的限制。因此，领域移植问题已经成为句法分析研究的重要挑战。为了更充分地支持句法分析领域移植研究，我们自2017年起标注了多领域句法数据集，并命名为汉语开放依存树库（CODT），目前包含16万句，涵盖10多个领域或来源的文本。2019年，我们依托NLPCC-2019会议，组织了第一届跨领域句法分析评测(Peng et al., 2019)，针对“单源零样本”和“单源少样本”领域移植场景，发布了CODT1.0数据集，包含4万句、对应4个领域。&lt;br /&gt;
今年，我们依托CCL-2021会议，组织第二届跨领域句法分析评测，针对“多源零样本”领域移植场景，发布CODT2.0数据集，包含7万句，对应6个领域。其中，通过错误检测和人工校正，CODT2.0与CODT1.0重合的数据的质量进一步提升。&lt;br /&gt;
&lt;br /&gt;
== '''数据设置''' ==&lt;br /&gt;
在本次评测任务中，我们提供约29K句平衡语料（BC）、9K句产品博客（PB）、10K句产品评论（PC）、8K句财经资讯（FIN）、8K句法律资讯（LEG）和3K句网络小说（ZX）六个领域的数据。其中BC作为基础数据，只作为源领域。后五个领域既可以作为源领域，也可以作为目标领域。另外，针对后五个领域，我们还提供了大规模的无标注数据。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align: center;&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
!      !! train !! dev  !! test !! unlabeled&lt;br /&gt;
|-&lt;br /&gt;
| BC   || 26.1K || 1K  || 2K ||   0     &lt;br /&gt;
|-&lt;br /&gt;
| PB   || 5K  || 1.3K || 2.5K || 291K&lt;br /&gt;
|-&lt;br /&gt;
| PC   || 6.8K  || 1.3K || 2.6K || 349K&lt;br /&gt;
|-&lt;br /&gt;
| FIN   || 5K  || 1K  || 1.8K || 118K&lt;br /&gt;
|-&lt;br /&gt;
| LEG   || 5K  || 1K  || 1.9K || 150K &lt;br /&gt;
|-&lt;br /&gt;
| ZX   || 1.5K  || 0.5K  || 1K || 33K&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== '''任务设置''' ==&lt;br /&gt;
本次评测分为两个赛道:&lt;br /&gt;
&lt;br /&gt;
(Closed)：多源零样本领域移植（封闭）&lt;br /&gt;
&lt;br /&gt;
(Open)：多源零样本领域移植（开放）&lt;br /&gt;
&lt;br /&gt;
含义如下：&lt;br /&gt;
* '''多源的含义'''：可以使用其他领域的训练数据作为源领域数据。例如，当目标领域为ZX时，可以使用其他五个领域（包括BC）的训练数据，即BC/PB/PC/FIN/LEG-Train。&lt;br /&gt;
* '''零样本的含义'''：不能使用对应领域的训练数据。例如，当目标领域为ZX时，那么ZX-Train不可作为训练数据使用。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* '''Closed赛道的要求'''：&lt;br /&gt;
1）	只能使用我们提供的数据和信息，包括：所有数据我们都提供分词、自动词性；我们会提供pre-trained word embedding (在Chinese Gigaword 3和所有领域Train/Unlabeled数据上训练word2vec得到)。&lt;br /&gt;
&lt;br /&gt;
2）	不可以使用其他开源工具得到新的信息，如词性、词义等特征。&lt;br /&gt;
&lt;br /&gt;
3）	不可以使用其他的资源，如词典、句法语义树库等。&lt;br /&gt;
&lt;br /&gt;
4）	不可以使用大规模无标注数据上训练的预训练语言模型（任何开源的通用语言模型），但是可以通过预训练语言模型的技术来使用我们提供的无标注数据。即可以使用在我们提供的有标注和无标注数据上从头开始训练预训练模型。&lt;br /&gt;
&lt;br /&gt;
5）	不可以使用NLPCC-2019 CODT1.0的数据。&lt;br /&gt;
&lt;br /&gt;
* '''Open赛道的要求'''：&lt;br /&gt;
&lt;br /&gt;
1）	可以使用任何可通过某种公开方式获取（包括购买）的数据、资源或工具。但是建议参赛者在系统报告中明确说明使用的外部资源以及这些外部资源对性能的影响。&lt;br /&gt;
&lt;br /&gt;
* '''注意事项'''&lt;br /&gt;
1）	开发集的使用：不允许将Dev加入到训练数据中。Dev数据只可以用来调参和选择模型。&lt;br /&gt;
&lt;br /&gt;
2）	无标注数据（Unlabeled）的使用：不限制。同时，6个领域的Train中的句子，只要不使用句法标注信息，也都可以作为无标注数据使用。&lt;br /&gt;
&lt;br /&gt;
3）	预训练语言模型微调：我们将Google发布的bert-base-chinese在所有无标注数据（6个领域的Train，5个领域的Unlabeled数据）进行多轮微调（3轮或10轮），即继续使用语言模型损失函数继续训练。这个模型仅限于Open赛道上的系统使用。我们做这个事情的目的是方便大家试试这个方向，避免大家浪费资源，重复训练。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''如果您对规则有疑问，请随时联系我们确认。如果违反规则，发现后，成绩会直接取消。'''&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3802</id>
		<title>CCL2021</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3802"/>
		<updated>2021-04-09T11:29:30Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* CCL-2021依存句法分析领域移植评测 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== '''CCL-2021依存句法分析领域移植评测''' ==&lt;br /&gt;
* [http://cips-cl.org/static/CCL2021/cclEval/taskEvaluation/index.html CCL-2021评测页面]&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/0/04/%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v5.0.pdf 我们的参赛邀请函pdf]&lt;br /&gt;
* [https://docs.qq.com/form/page/DWHltVGFCcmFQVG5h?createTS=1617351588079&amp;amp;templateId=25000#/fill 报名表]&lt;br /&gt;
&lt;br /&gt;
== '''评测日程''' ==&lt;br /&gt;
2021.4.1-4.30 开始报名&lt;br /&gt;
&lt;br /&gt;
2021.4.15 公布相关训练数据&lt;br /&gt;
&lt;br /&gt;
2021.7.13 公布无答案的测试集&lt;br /&gt;
&lt;br /&gt;
2021.7.15 测试集结果提交截止&lt;br /&gt;
&lt;br /&gt;
2021.7.20 评测报告提交&lt;br /&gt;
&lt;br /&gt;
2021.7.30 公布结果&lt;br /&gt;
&lt;br /&gt;
2021.8.13-8.15 CCL2021 评测研讨会&lt;br /&gt;
&lt;br /&gt;
== '''评测奖金''' ==&lt;br /&gt;
受中国中文信息学会资助，本次评测设置了2万元奖金，每个赛道各1万元&lt;br /&gt;
&lt;br /&gt;
第一名：5000元&lt;br /&gt;
&lt;br /&gt;
第二名：3000元&lt;br /&gt;
&lt;br /&gt;
第三名：2000元&lt;br /&gt;
&lt;br /&gt;
== '''评测数据下载''' ==&lt;br /&gt;
'''数据使用协议'''&lt;br /&gt;
&lt;br /&gt;
下载数据前需要签署数据使用协议，在收到数据使用协议后我们会发给您解压密码。&lt;br /&gt;
&amp;lt;!--请您仔细阅读如下两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学（sudaccl2021dep@163.com）--&amp;gt;&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/c/c1/Codt-sharing-agreement-2021.3-v1.pdf CODT2.0数据使用协议下载]（团队负责人签字，如果是公司，必须是公司法人签字）&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/alibaba-unlabeled-data-share-2019.4.4.doc PB-PC-unlabeled数据使用协议下载] (机构、学院、学校或公司盖章）&lt;br /&gt;
* 请仔细阅读两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学(sudaccl2021dep@163.com)&lt;br /&gt;
* 请用机构的官方邮箱发送协议&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;由于版权保护问题，我们只面向机构、单位等团体开放数据；对于公司，我们仅面向从事句法分析研究的公司开放数据，签署协议前请先咨询我们是否有可能共享数据；解释权归我们课题组。&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;如果您不需要无标注数据，那么只需要签署标注数据使用协议。&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''训练集/开发集/无标注数据下载'''&lt;br /&gt;
&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/CCL2021_data_readme 数据说明Readme]&lt;br /&gt;
* 训练集/开发集/无标注数据&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/train_dev_2021.4.1.zip 训练集开发集数据 下载]&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/ZX_FIN_LEG_unlabeled_2021.4.1.zip ZX、FIN、LEG无标注数据 下载]&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/PB_PC_unlabeled_2021.4.1.zip PB、PC无标注数据 下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''预训练词向量下载'''&lt;br /&gt;
&lt;br /&gt;
我们分别提供了50维、100维、300维的预训练词向量&lt;br /&gt;
[http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/wordembedding.zip 预训练词向量下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''fine-tune-bert下载'''&lt;br /&gt;
&lt;br /&gt;
我们提供了在bert-base-chinese上微调3轮的结果&lt;br /&gt;
[http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/ccl_ft3.zip fine-tune-bert下载]&lt;br /&gt;
&lt;br /&gt;
== '''评价结果提交''' ==&lt;br /&gt;
提交结果时，请将测试文件打包（zip/tar.gz）发送给李帅克同学（skli20@stu.suda.edu.cn）。压缩包内请按照如下目录/文件命名和组织形式（没有参加的子任务忽略即可），方便我们后续处理。请参考Dev数据及Readme，确保每个文件严格采用CoNLL格式。&lt;br /&gt;
  subtask1-closed/PC-Test.out.conll&lt;br /&gt;
  subtask1-closed/PB-Test.out.conll&lt;br /&gt;
  subtask1-closed/ZX-Test.out.conll&lt;br /&gt;
  ...&lt;br /&gt;
  subtask2-open/PC-Test.out.conll&lt;br /&gt;
  subtask2-open/PB-Test.out.conll&lt;br /&gt;
  subtask2-open/ZX-Test.out.conll&lt;br /&gt;
&lt;br /&gt;
== '''评价报告提交''' ==&lt;br /&gt;
*&amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;所有的参赛单位都需要提交一份简要的报告,介绍清楚评测中使用的方法。&amp;lt;/font&amp;gt;一方面我们需要确保您使用的方法符合我们的任务要求，另一方面我们提交overview文章时需要使用。&amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;请大家在7月15日前以PDF形式提交到李帅克邮箱（skli20@stu.suda.edu.cn）&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== '''评价脚本下载''' ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/evaluate.py 评价脚本下载]&lt;br /&gt;
** 执行命令：python3 evaluate.py gold.conll sys.conll&lt;br /&gt;
** 数据集需要为CoNLL格式，与我们提供的数据集格式相同。&lt;br /&gt;
&lt;br /&gt;
== '''评测背景''' ==&lt;br /&gt;
近年来，随着深度学习技术的发展，尤其是预训练语言模型ELMo/BERT的提出，封闭领域规范文本上的句法分析性能已经达到了比较高的水平。但是，在跨领域文本，尤其是不规范的网络文本上，句法分析的性能会急剧下降。同时，如何在深度学习模型中利用结构化的句法信息也是NLP领域的重要研究问题之一，但是受到真实文本上句法性能的限制。因此，领域移植问题已经成为句法分析研究的重要挑战。为了更充分地支持句法分析领域移植研究，我们自2017年起标注了多领域句法数据集，并命名为汉语开放依存树库（CODT），目前包含16万句，涵盖10多个领域或来源的文本。2019年，我们依托NLPCC-2019会议，组织了第一届跨领域句法分析评测(Peng et al., 2019)，针对“单源零样本”和“单源少样本”领域移植场景，发布了CODT1.0数据集，包含4万句、对应4个领域。&lt;br /&gt;
今年，我们依托CCL-2021会议，组织第二届跨领域句法分析评测，针对“多源零样本”领域移植场景，发布CODT2.0数据集，包含7万句，对应6个领域。其中，通过错误检测和人工校正，CODT2.0与CODT1.0重合的数据的质量进一步提升。&lt;br /&gt;
&lt;br /&gt;
== '''数据设置''' ==&lt;br /&gt;
在本次评测任务中，我们提供约29K句平衡语料（BC）、9K句产品博客（PB）、10K句产品评论（PC）、8K句财经资讯（FIN）、8K句法律资讯（LEG）和3K句网络小说（ZX）六个领域的数据。其中BC作为基础数据，只作为源领域。后五个领域既可以作为源领域，也可以作为目标领域。另外，针对后五个领域，我们还提供了大规模的无标注数据。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align: center;&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
!      !! train !! dev  !! test !! unlabeled&lt;br /&gt;
|-&lt;br /&gt;
| BC   || 26.1K || 1K  || 2K ||   0     &lt;br /&gt;
|-&lt;br /&gt;
| PB   || 5K  || 1.3K || 2.5K || 291K&lt;br /&gt;
|-&lt;br /&gt;
| PC   || 6.8K  || 1.3K || 2.6K || 349K&lt;br /&gt;
|-&lt;br /&gt;
| FIN   || 5K  || 1K  || 1.8K || 118K&lt;br /&gt;
|-&lt;br /&gt;
| LEG   || 5K  || 1K  || 1.9K || 150K &lt;br /&gt;
|-&lt;br /&gt;
| ZX   || 1.5K  || 0.5K  || 1K || 33K&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== '''任务设置''' ==&lt;br /&gt;
本次评测分为两个赛道:&lt;br /&gt;
&lt;br /&gt;
(Closed)：多源零样本领域移植（封闭）&lt;br /&gt;
&lt;br /&gt;
(Open)：多源零样本领域移植（开放）&lt;br /&gt;
&lt;br /&gt;
含义如下：&lt;br /&gt;
* '''多源的含义'''：可以使用其他领域的训练数据作为源领域数据。例如，当目标领域为ZX时，可以使用其他五个领域（包括BC）的训练数据，即BC/PB/PC/FIN/LEG-Train。&lt;br /&gt;
* '''零样本的含义'''：不能使用对应领域的训练数据。例如，当目标领域为ZX时，那么ZX-Train不可作为训练数据使用。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* '''Closed赛道的要求'''：&lt;br /&gt;
1）	只能使用我们提供的数据和信息，包括：所有数据我们都提供分词、自动词性；我们会提供pre-trained word embedding (在Chinese Gigaword 3和所有领域Train/Unlabeled数据上训练word2vec得到)。&lt;br /&gt;
&lt;br /&gt;
2）	不可以使用其他开源工具得到新的信息，如词性、词义等特征。&lt;br /&gt;
&lt;br /&gt;
3）	不可以使用其他的资源，如词典、句法语义树库等。&lt;br /&gt;
&lt;br /&gt;
4）	不可以使用大规模无标注数据上训练的预训练语言模型（任何开源的通用语言模型），但是可以通过预训练语言模型的技术来使用我们提供的无标注数据。即可以使用在我们提供的有标注和无标注数据上从头开始训练预训练模型。&lt;br /&gt;
&lt;br /&gt;
5）	不可以使用NLPCC-2019 CODT1.0的数据。&lt;br /&gt;
&lt;br /&gt;
* '''Open赛道的要求'''：&lt;br /&gt;
&lt;br /&gt;
1）	可以使用任何可通过某种公开方式获取（包括购买）的数据、资源或工具。但是建议参赛者在系统报告中明确说明使用的外部资源以及这些外部资源对性能的影响。&lt;br /&gt;
&lt;br /&gt;
* '''注意事项'''&lt;br /&gt;
1）	开发集的使用：不允许将Dev加入到训练数据中。Dev数据只可以用来调参和选择模型。&lt;br /&gt;
&lt;br /&gt;
2）	无标注数据（Unlabeled）的使用：不限制。同时，6个领域的Train中的句子，只要不使用句法标注信息，也都可以作为无标注数据使用。&lt;br /&gt;
&lt;br /&gt;
3）	预训练语言模型微调：我们将Google发布的bert-base-chinese在所有无标注数据（6个领域的Train，5个领域的Unlabeled数据）进行多轮微调（3轮或10轮），即继续使用语言模型损失函数继续训练。这个模型仅限于Open赛道上的系统使用。我们做这个事情的目的是方便大家试试这个方向，避免大家浪费资源，重复训练。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''如果您对规则有疑问，请随时联系我们确认。如果违反规则，发现后，成绩会直接取消。'''&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3801</id>
		<title>CCL2021</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3801"/>
		<updated>2021-04-09T11:28:58Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* CCL-2021依存句法分析领域移植评测 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== '''CCL-2021依存句法分析领域移植评测''' ==&lt;br /&gt;
* [http://cips-cl.org/static/CCL2021/cclEval/taskEvaluation/index.html CCL-2021评测页面]&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/2/26/%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v5.0.pdf 我们的参赛邀请函pdf]&lt;br /&gt;
* [https://docs.qq.com/form/page/DWHltVGFCcmFQVG5h?createTS=1617351588079&amp;amp;templateId=25000#/fill 报名表]&lt;br /&gt;
&lt;br /&gt;
== '''评测日程''' ==&lt;br /&gt;
2021.4.1-4.30 开始报名&lt;br /&gt;
&lt;br /&gt;
2021.4.15 公布相关训练数据&lt;br /&gt;
&lt;br /&gt;
2021.7.13 公布无答案的测试集&lt;br /&gt;
&lt;br /&gt;
2021.7.15 测试集结果提交截止&lt;br /&gt;
&lt;br /&gt;
2021.7.20 评测报告提交&lt;br /&gt;
&lt;br /&gt;
2021.7.30 公布结果&lt;br /&gt;
&lt;br /&gt;
2021.8.13-8.15 CCL2021 评测研讨会&lt;br /&gt;
&lt;br /&gt;
== '''评测奖金''' ==&lt;br /&gt;
受中国中文信息学会资助，本次评测设置了2万元奖金，每个赛道各1万元&lt;br /&gt;
&lt;br /&gt;
第一名：5000元&lt;br /&gt;
&lt;br /&gt;
第二名：3000元&lt;br /&gt;
&lt;br /&gt;
第三名：2000元&lt;br /&gt;
&lt;br /&gt;
== '''评测数据下载''' ==&lt;br /&gt;
'''数据使用协议'''&lt;br /&gt;
&lt;br /&gt;
下载数据前需要签署数据使用协议，在收到数据使用协议后我们会发给您解压密码。&lt;br /&gt;
&amp;lt;!--请您仔细阅读如下两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学（sudaccl2021dep@163.com）--&amp;gt;&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/c/c1/Codt-sharing-agreement-2021.3-v1.pdf CODT2.0数据使用协议下载]（团队负责人签字，如果是公司，必须是公司法人签字）&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/alibaba-unlabeled-data-share-2019.4.4.doc PB-PC-unlabeled数据使用协议下载] (机构、学院、学校或公司盖章）&lt;br /&gt;
* 请仔细阅读两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学(sudaccl2021dep@163.com)&lt;br /&gt;
* 请用机构的官方邮箱发送协议&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;由于版权保护问题，我们只面向机构、单位等团体开放数据；对于公司，我们仅面向从事句法分析研究的公司开放数据，签署协议前请先咨询我们是否有可能共享数据；解释权归我们课题组。&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;如果您不需要无标注数据，那么只需要签署标注数据使用协议。&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''训练集/开发集/无标注数据下载'''&lt;br /&gt;
&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/CCL2021_data_readme 数据说明Readme]&lt;br /&gt;
* 训练集/开发集/无标注数据&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/train_dev_2021.4.1.zip 训练集开发集数据 下载]&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/ZX_FIN_LEG_unlabeled_2021.4.1.zip ZX、FIN、LEG无标注数据 下载]&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/PB_PC_unlabeled_2021.4.1.zip PB、PC无标注数据 下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''预训练词向量下载'''&lt;br /&gt;
&lt;br /&gt;
我们分别提供了50维、100维、300维的预训练词向量&lt;br /&gt;
[http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/wordembedding.zip 预训练词向量下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''fine-tune-bert下载'''&lt;br /&gt;
&lt;br /&gt;
我们提供了在bert-base-chinese上微调3轮的结果&lt;br /&gt;
[http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/ccl_ft3.zip fine-tune-bert下载]&lt;br /&gt;
&lt;br /&gt;
== '''评价结果提交''' ==&lt;br /&gt;
提交结果时，请将测试文件打包（zip/tar.gz）发送给李帅克同学（skli20@stu.suda.edu.cn）。压缩包内请按照如下目录/文件命名和组织形式（没有参加的子任务忽略即可），方便我们后续处理。请参考Dev数据及Readme，确保每个文件严格采用CoNLL格式。&lt;br /&gt;
  subtask1-closed/PC-Test.out.conll&lt;br /&gt;
  subtask1-closed/PB-Test.out.conll&lt;br /&gt;
  subtask1-closed/ZX-Test.out.conll&lt;br /&gt;
  ...&lt;br /&gt;
  subtask2-open/PC-Test.out.conll&lt;br /&gt;
  subtask2-open/PB-Test.out.conll&lt;br /&gt;
  subtask2-open/ZX-Test.out.conll&lt;br /&gt;
&lt;br /&gt;
== '''评价报告提交''' ==&lt;br /&gt;
*&amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;所有的参赛单位都需要提交一份简要的报告,介绍清楚评测中使用的方法。&amp;lt;/font&amp;gt;一方面我们需要确保您使用的方法符合我们的任务要求，另一方面我们提交overview文章时需要使用。&amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;请大家在7月15日前以PDF形式提交到李帅克邮箱（skli20@stu.suda.edu.cn）&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== '''评价脚本下载''' ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/evaluate.py 评价脚本下载]&lt;br /&gt;
** 执行命令：python3 evaluate.py gold.conll sys.conll&lt;br /&gt;
** 数据集需要为CoNLL格式，与我们提供的数据集格式相同。&lt;br /&gt;
&lt;br /&gt;
== '''评测背景''' ==&lt;br /&gt;
近年来，随着深度学习技术的发展，尤其是预训练语言模型ELMo/BERT的提出，封闭领域规范文本上的句法分析性能已经达到了比较高的水平。但是，在跨领域文本，尤其是不规范的网络文本上，句法分析的性能会急剧下降。同时，如何在深度学习模型中利用结构化的句法信息也是NLP领域的重要研究问题之一，但是受到真实文本上句法性能的限制。因此，领域移植问题已经成为句法分析研究的重要挑战。为了更充分地支持句法分析领域移植研究，我们自2017年起标注了多领域句法数据集，并命名为汉语开放依存树库（CODT），目前包含16万句，涵盖10多个领域或来源的文本。2019年，我们依托NLPCC-2019会议，组织了第一届跨领域句法分析评测(Peng et al., 2019)，针对“单源零样本”和“单源少样本”领域移植场景，发布了CODT1.0数据集，包含4万句、对应4个领域。&lt;br /&gt;
今年，我们依托CCL-2021会议，组织第二届跨领域句法分析评测，针对“多源零样本”领域移植场景，发布CODT2.0数据集，包含7万句，对应6个领域。其中，通过错误检测和人工校正，CODT2.0与CODT1.0重合的数据的质量进一步提升。&lt;br /&gt;
&lt;br /&gt;
== '''数据设置''' ==&lt;br /&gt;
在本次评测任务中，我们提供约29K句平衡语料（BC）、9K句产品博客（PB）、10K句产品评论（PC）、8K句财经资讯（FIN）、8K句法律资讯（LEG）和3K句网络小说（ZX）六个领域的数据。其中BC作为基础数据，只作为源领域。后五个领域既可以作为源领域，也可以作为目标领域。另外，针对后五个领域，我们还提供了大规模的无标注数据。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align: center;&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
!      !! train !! dev  !! test !! unlabeled&lt;br /&gt;
|-&lt;br /&gt;
| BC   || 26.1K || 1K  || 2K ||   0     &lt;br /&gt;
|-&lt;br /&gt;
| PB   || 5K  || 1.3K || 2.5K || 291K&lt;br /&gt;
|-&lt;br /&gt;
| PC   || 6.8K  || 1.3K || 2.6K || 349K&lt;br /&gt;
|-&lt;br /&gt;
| FIN   || 5K  || 1K  || 1.8K || 118K&lt;br /&gt;
|-&lt;br /&gt;
| LEG   || 5K  || 1K  || 1.9K || 150K &lt;br /&gt;
|-&lt;br /&gt;
| ZX   || 1.5K  || 0.5K  || 1K || 33K&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== '''任务设置''' ==&lt;br /&gt;
本次评测分为两个赛道:&lt;br /&gt;
&lt;br /&gt;
(Closed)：多源零样本领域移植（封闭）&lt;br /&gt;
&lt;br /&gt;
(Open)：多源零样本领域移植（开放）&lt;br /&gt;
&lt;br /&gt;
含义如下：&lt;br /&gt;
* '''多源的含义'''：可以使用其他领域的训练数据作为源领域数据。例如，当目标领域为ZX时，可以使用其他五个领域（包括BC）的训练数据，即BC/PB/PC/FIN/LEG-Train。&lt;br /&gt;
* '''零样本的含义'''：不能使用对应领域的训练数据。例如，当目标领域为ZX时，那么ZX-Train不可作为训练数据使用。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* '''Closed赛道的要求'''：&lt;br /&gt;
1）	只能使用我们提供的数据和信息，包括：所有数据我们都提供分词、自动词性；我们会提供pre-trained word embedding (在Chinese Gigaword 3和所有领域Train/Unlabeled数据上训练word2vec得到)。&lt;br /&gt;
&lt;br /&gt;
2）	不可以使用其他开源工具得到新的信息，如词性、词义等特征。&lt;br /&gt;
&lt;br /&gt;
3）	不可以使用其他的资源，如词典、句法语义树库等。&lt;br /&gt;
&lt;br /&gt;
4）	不可以使用大规模无标注数据上训练的预训练语言模型（任何开源的通用语言模型），但是可以通过预训练语言模型的技术来使用我们提供的无标注数据。即可以使用在我们提供的有标注和无标注数据上从头开始训练预训练模型。&lt;br /&gt;
&lt;br /&gt;
5）	不可以使用NLPCC-2019 CODT1.0的数据。&lt;br /&gt;
&lt;br /&gt;
* '''Open赛道的要求'''：&lt;br /&gt;
&lt;br /&gt;
1）	可以使用任何可通过某种公开方式获取（包括购买）的数据、资源或工具。但是建议参赛者在系统报告中明确说明使用的外部资源以及这些外部资源对性能的影响。&lt;br /&gt;
&lt;br /&gt;
* '''注意事项'''&lt;br /&gt;
1）	开发集的使用：不允许将Dev加入到训练数据中。Dev数据只可以用来调参和选择模型。&lt;br /&gt;
&lt;br /&gt;
2）	无标注数据（Unlabeled）的使用：不限制。同时，6个领域的Train中的句子，只要不使用句法标注信息，也都可以作为无标注数据使用。&lt;br /&gt;
&lt;br /&gt;
3）	预训练语言模型微调：我们将Google发布的bert-base-chinese在所有无标注数据（6个领域的Train，5个领域的Unlabeled数据）进行多轮微调（3轮或10轮），即继续使用语言模型损失函数继续训练。这个模型仅限于Open赛道上的系统使用。我们做这个事情的目的是方便大家试试这个方向，避免大家浪费资源，重复训练。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''如果您对规则有疑问，请随时联系我们确认。如果违反规则，发现后，成绩会直接取消。'''&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=%E6%96%87%E4%BB%B6:%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v5.0.pdf&amp;diff=3800</id>
		<title>文件:依存句法领域移植评测ccl2021-cfp-v5.0.pdf</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=%E6%96%87%E4%BB%B6:%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v5.0.pdf&amp;diff=3800"/>
		<updated>2021-04-09T11:28:44Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3776</id>
		<title>CCL2021</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3776"/>
		<updated>2021-04-02T09:32:35Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* 评测数据下载 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== '''CCL-2021依存句法分析领域移植评测''' ==&lt;br /&gt;
* [http://cips-cl.org/static/CCL2021/cclEval/taskEvaluation/index.html CCL-2021评测页面]&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/2/26/%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v4.0.pdf 我们的参赛邀请函pdf]&lt;br /&gt;
* [https://docs.qq.com/form/page/DWHltVGFCcmFQVG5h?createTS=1617351588079&amp;amp;templateId=25000#/fill 报名表]&lt;br /&gt;
&lt;br /&gt;
== '''评测日程''' ==&lt;br /&gt;
2021.4.1-4.30 开始报名&lt;br /&gt;
&lt;br /&gt;
2021.4.15 公布相关数据&lt;br /&gt;
&lt;br /&gt;
2021.5.1 公布测试集&lt;br /&gt;
&lt;br /&gt;
2021.5.15 公布有答案的测试集&lt;br /&gt;
&lt;br /&gt;
2021.6.15 提交截止&lt;br /&gt;
&lt;br /&gt;
2021.7.31 评测结果发布&lt;br /&gt;
&lt;br /&gt;
== '''评测奖金''' ==&lt;br /&gt;
受中国中文信息学会资助，本次评测设置了2万元奖金，每个赛道各1万元&lt;br /&gt;
&lt;br /&gt;
第一名：5000元&lt;br /&gt;
&lt;br /&gt;
第二名：3000元&lt;br /&gt;
&lt;br /&gt;
第三名：2000元&lt;br /&gt;
&lt;br /&gt;
== '''评测数据下载''' ==&lt;br /&gt;
'''数据使用协议'''&lt;br /&gt;
&lt;br /&gt;
下载数据前需要签署数据使用协议，在收到数据使用协议后我们会发给您解压密码。&lt;br /&gt;
&amp;lt;!--请您仔细阅读如下两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学（sudaccl2021dep@163.com）--&amp;gt;&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/c/c1/Codt-sharing-agreement-2021.3-v1.pdf CODT2.0数据使用协议下载]（团队负责人签字，如果是公司，必须是公司法人签字）&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/alibaba-unlabeled-data-share-2019.4.4.doc PB-PC-unlabeled数据使用协议下载] (机构、学院、学校或公司盖章）&lt;br /&gt;
* 请仔细阅读两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学(sudaccl2021dep@163.com)&lt;br /&gt;
* 请用机构的官方邮箱发送协议&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;由于版权保护问题，我们只面向机构、单位等团体开放数据；对于公司，我们仅面向从事句法分析研究的公司开放数据，签署协议前请先咨询我们是否有可能共享数据；解释权归我们课题组。&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;如果您不需要无标注数据，那么只需要签署标注数据使用协议。&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''训练集/开发集/无标注数据下载'''&lt;br /&gt;
&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/CCL2021_data_readme 数据说明Readme]&lt;br /&gt;
* 训练集/开发集/无标注数据&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/train_dev_2021.4.1.zip 训练集开发集数据 下载]&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/ZX_FIN_LEG_unlabeled_2021.4.1.zip ZX、FIN、LEG无标注数据 下载]&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/PB_PC_unlabeled_2021.4.1.zip PB、PC无标注数据 下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''预训练词向量下载'''&lt;br /&gt;
&lt;br /&gt;
我们分别提供了50维、100维、300维的预训练词向量&lt;br /&gt;
[http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/wordembedding.zip 预训练词向量下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''fine-tune-bert下载'''&lt;br /&gt;
&lt;br /&gt;
我们提供了在bert-base-chinese上微调3轮的结果&lt;br /&gt;
[http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/ccl_ft3.zip fine-tune-bert下载]&lt;br /&gt;
&lt;br /&gt;
== '''评价脚本下载''' ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/evaluate.py 评价脚本下载]&lt;br /&gt;
** 执行命令：python3 evaluate.py gold.conll sys.conll&lt;br /&gt;
** 数据集需要为CoNLL格式，与我们提供的数据集格式相同。&lt;br /&gt;
&lt;br /&gt;
== '''评测背景''' ==&lt;br /&gt;
近年来，随着深度学习技术的发展，尤其是预训练语言模型ELMo/BERT的提出，封闭领域规范文本上的句法分析性能已经达到了比较高的水平。但是，在跨领域文本，尤其是不规范的网络文本上，句法分析的性能会急剧下降。同时，如何在深度学习模型中利用结构化的句法信息也是NLP领域的重要研究问题之一，但是受到真实文本上句法性能的限制。因此，领域移植问题已经成为句法分析研究的重要挑战。为了更充分地支持句法分析领域移植研究，我们自2017年起标注了多领域句法数据集，并命名为汉语开放依存树库（CODT），目前包含16万句，涵盖10多个领域或来源的文本。2019年，我们依托NLPCC-2019会议，组织了第一届跨领域句法分析评测(Peng et al., 2019)，针对“单源零样本”和“单源少样本”领域移植场景，发布了CODT1.0数据集，包含4万句、对应4个领域。&lt;br /&gt;
今年，我们依托CCL-2021会议，组织第二届跨领域句法分析评测，针对“多源零样本”领域移植场景，发布CODT2.0数据集，包含7万句，对应6个领域。其中，通过错误检测和人工校正，CODT2.0与CODT1.0重合的数据的质量进一步提升。&lt;br /&gt;
&lt;br /&gt;
== '''数据设置''' ==&lt;br /&gt;
在本次评测任务中，我们提供约29K句平衡语料（BC）、9K句产品博客（PB）、10K句产品评论（PC）、8K句财经资讯（FIN）、8K句法律资讯（LEG）和3K句网络小说（ZX）六个领域的数据。其中BC作为基础数据，只作为源领域。后五个领域既可以作为源领域，也可以作为目标领域。另外，针对后五个领域，我们还提供了大规模的无标注数据。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align: center;&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
!      !! train !! dev  !! test !! unlabeled&lt;br /&gt;
|-&lt;br /&gt;
| BC   || 26.1K || 1K  || 2K ||   0     &lt;br /&gt;
|-&lt;br /&gt;
| PB   || 5K  || 1.3K || 2.5K || 291K&lt;br /&gt;
|-&lt;br /&gt;
| PC   || 6.8K  || 1.3K || 2.6K || 349K&lt;br /&gt;
|-&lt;br /&gt;
| FIN   || 5K  || 1K  || 1.8K || 118K&lt;br /&gt;
|-&lt;br /&gt;
| LEG   || 5K  || 1K  || 1.9K || 150K &lt;br /&gt;
|-&lt;br /&gt;
| ZX   || 1.5K  || 0.5K  || 1K || 33K&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== '''任务设置''' ==&lt;br /&gt;
本次评测分为两个赛道:&lt;br /&gt;
&lt;br /&gt;
(Closed)：多源零样本领域移植（封闭）&lt;br /&gt;
&lt;br /&gt;
(Open)：多源零样本领域移植（开放）&lt;br /&gt;
&lt;br /&gt;
含义如下：&lt;br /&gt;
* '''多源的含义'''：可以使用其他领域的训练数据作为源领域数据。例如，当目标领域为ZX时，可以使用其他五个领域（包括BC）的训练数据，即BC/PB/PC/FIN/LEG-Train。&lt;br /&gt;
* '''零样本的含义'''：不能使用对应领域的训练数据。例如，当目标领域为ZX时，那么ZX-Train不可作为训练数据使用。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* '''Closed赛道的要求'''：&lt;br /&gt;
1）	只能使用我们提供的数据和信息，包括：所有数据我们都提供分词、自动词性；我们会提供pre-trained word embedding (在Chinese Gigaword 3和所有领域Train/Unlabeled数据上训练word2vec得到)。&lt;br /&gt;
&lt;br /&gt;
2）	不可以使用其他开源工具得到新的信息，如词性、词义等特征。&lt;br /&gt;
&lt;br /&gt;
3）	不可以使用其他的资源，如词典、句法语义树库等。&lt;br /&gt;
&lt;br /&gt;
4）	不可以使用大规模无标注数据上训练的预训练语言模型（任何开源的通用语言模型），但是可以通过预训练语言模型的技术来使用我们提供的无标注数据。即可以使用在我们提供的有标注和无标注数据上从头开始训练预训练模型。&lt;br /&gt;
&lt;br /&gt;
5）	不可以使用NLPCC-2019 CODT1.0的数据。&lt;br /&gt;
&lt;br /&gt;
* '''Open赛道的要求'''：&lt;br /&gt;
&lt;br /&gt;
1）	可以使用任何可通过某种公开方式获取（包括购买）的数据、资源或工具。但是建议参赛者在系统报告中明确说明使用的外部资源以及这些外部资源对性能的影响。&lt;br /&gt;
&lt;br /&gt;
* '''注意事项'''&lt;br /&gt;
1）	开发集的使用：不允许将Dev加入到训练数据中。Dev数据只可以用来调参和选择模型。&lt;br /&gt;
&lt;br /&gt;
2）	无标注数据（Unlabeled）的使用：不限制。同时，6个领域的Train中的句子，只要不使用句法标注信息，也都可以作为无标注数据使用。&lt;br /&gt;
&lt;br /&gt;
3）	预训练语言模型微调：我们将Google发布的bert-base-chinese在所有无标注数据（6个领域的Train，5个领域的Unlabeled数据）进行多轮微调（3轮或10轮），即继续使用语言模型损失函数继续训练。这个模型仅限于Open赛道上的系统使用。我们做这个事情的目的是方便大家试试这个方向，避免大家浪费资源，重复训练。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''如果您对规则有疑问，请随时联系我们确认。如果违反规则，发现后，成绩会直接取消。'''&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3775</id>
		<title>CCL2021</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3775"/>
		<updated>2021-04-02T09:32:10Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* CCL-2021依存句法分析领域移植评测 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== '''CCL-2021依存句法分析领域移植评测''' ==&lt;br /&gt;
* [http://cips-cl.org/static/CCL2021/cclEval/taskEvaluation/index.html CCL-2021评测页面]&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/2/26/%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v4.0.pdf 我们的参赛邀请函pdf]&lt;br /&gt;
* [https://docs.qq.com/form/page/DWHltVGFCcmFQVG5h?createTS=1617351588079&amp;amp;templateId=25000#/fill 报名表]&lt;br /&gt;
&lt;br /&gt;
== '''评测日程''' ==&lt;br /&gt;
2021.4.1-4.30 开始报名&lt;br /&gt;
&lt;br /&gt;
2021.4.15 公布相关数据&lt;br /&gt;
&lt;br /&gt;
2021.5.1 公布测试集&lt;br /&gt;
&lt;br /&gt;
2021.5.15 公布有答案的测试集&lt;br /&gt;
&lt;br /&gt;
2021.6.15 提交截止&lt;br /&gt;
&lt;br /&gt;
2021.7.31 评测结果发布&lt;br /&gt;
&lt;br /&gt;
== '''评测奖金''' ==&lt;br /&gt;
受中国中文信息学会资助，本次评测设置了2万元奖金，每个赛道各1万元&lt;br /&gt;
&lt;br /&gt;
第一名：5000元&lt;br /&gt;
&lt;br /&gt;
第二名：3000元&lt;br /&gt;
&lt;br /&gt;
第三名：2000元&lt;br /&gt;
&lt;br /&gt;
== '''评测数据下载''' ==&lt;br /&gt;
'''数据使用协议'''&lt;br /&gt;
&lt;br /&gt;
下载数据前需要签署数据使用协议，在收到数据使用协议后我们会发给您解压密码。&lt;br /&gt;
&amp;lt;!--请您仔细阅读如下两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学（sudaccl2021dep@163.com）--&amp;gt;&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/c/c1/Codt-sharing-agreement-2021.3-v1.pdf CODT2.0数据使用协议下载]（团队负责人签字，如果是公司，必须是公司法人签字）&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/alibaba-unlabeled-data-share-2019.4.4.doc PB-PC-unlabeled数据使用协议下载] (机构、学院、学校或公司盖章）&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请仔细阅读两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学(sudaccl2021dep@163.com)&amp;lt;/font&amp;gt;&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请用机构的官方邮箱发送协议&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;由于版权保护问题，我们只面向机构、单位等团体开放数据；对于公司，我们仅面向从事句法分析研究的公司开放数据，签署协议前请先咨询我们是否有可能共享数据；解释权归我们课题组。&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;如果您不需要无标注数据，那么只需要签署标注数据使用协议。&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''训练集/开发集/无标注数据下载'''&lt;br /&gt;
&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/CCL2021_data_readme 数据说明Readme]&lt;br /&gt;
* 训练集/开发集/无标注数据&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/train_dev_2021.4.1.zip 训练集开发集数据 下载]&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/ZX_FIN_LEG_unlabeled_2021.4.1.zip ZX、FIN、LEG无标注数据 下载]&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/PB_PC_unlabeled_2021.4.1.zip PB、PC无标注数据 下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''预训练词向量下载'''&lt;br /&gt;
&lt;br /&gt;
我们分别提供了50维、100维、300维的预训练词向量&lt;br /&gt;
[http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/wordembedding.zip 预训练词向量下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''fine-tune-bert下载'''&lt;br /&gt;
&lt;br /&gt;
我们提供了在bert-base-chinese上微调3轮的结果&lt;br /&gt;
[http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/ccl_ft3.zip fine-tune-bert下载]&lt;br /&gt;
&lt;br /&gt;
== '''评价脚本下载''' ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/evaluate.py 评价脚本下载]&lt;br /&gt;
** 执行命令：python3 evaluate.py gold.conll sys.conll&lt;br /&gt;
** 数据集需要为CoNLL格式，与我们提供的数据集格式相同。&lt;br /&gt;
&lt;br /&gt;
== '''评测背景''' ==&lt;br /&gt;
近年来，随着深度学习技术的发展，尤其是预训练语言模型ELMo/BERT的提出，封闭领域规范文本上的句法分析性能已经达到了比较高的水平。但是，在跨领域文本，尤其是不规范的网络文本上，句法分析的性能会急剧下降。同时，如何在深度学习模型中利用结构化的句法信息也是NLP领域的重要研究问题之一，但是受到真实文本上句法性能的限制。因此，领域移植问题已经成为句法分析研究的重要挑战。为了更充分地支持句法分析领域移植研究，我们自2017年起标注了多领域句法数据集，并命名为汉语开放依存树库（CODT），目前包含16万句，涵盖10多个领域或来源的文本。2019年，我们依托NLPCC-2019会议，组织了第一届跨领域句法分析评测(Peng et al., 2019)，针对“单源零样本”和“单源少样本”领域移植场景，发布了CODT1.0数据集，包含4万句、对应4个领域。&lt;br /&gt;
今年，我们依托CCL-2021会议，组织第二届跨领域句法分析评测，针对“多源零样本”领域移植场景，发布CODT2.0数据集，包含7万句，对应6个领域。其中，通过错误检测和人工校正，CODT2.0与CODT1.0重合的数据的质量进一步提升。&lt;br /&gt;
&lt;br /&gt;
== '''数据设置''' ==&lt;br /&gt;
在本次评测任务中，我们提供约29K句平衡语料（BC）、9K句产品博客（PB）、10K句产品评论（PC）、8K句财经资讯（FIN）、8K句法律资讯（LEG）和3K句网络小说（ZX）六个领域的数据。其中BC作为基础数据，只作为源领域。后五个领域既可以作为源领域，也可以作为目标领域。另外，针对后五个领域，我们还提供了大规模的无标注数据。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align: center;&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
!      !! train !! dev  !! test !! unlabeled&lt;br /&gt;
|-&lt;br /&gt;
| BC   || 26.1K || 1K  || 2K ||   0     &lt;br /&gt;
|-&lt;br /&gt;
| PB   || 5K  || 1.3K || 2.5K || 291K&lt;br /&gt;
|-&lt;br /&gt;
| PC   || 6.8K  || 1.3K || 2.6K || 349K&lt;br /&gt;
|-&lt;br /&gt;
| FIN   || 5K  || 1K  || 1.8K || 118K&lt;br /&gt;
|-&lt;br /&gt;
| LEG   || 5K  || 1K  || 1.9K || 150K &lt;br /&gt;
|-&lt;br /&gt;
| ZX   || 1.5K  || 0.5K  || 1K || 33K&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== '''任务设置''' ==&lt;br /&gt;
本次评测分为两个赛道:&lt;br /&gt;
&lt;br /&gt;
(Closed)：多源零样本领域移植（封闭）&lt;br /&gt;
&lt;br /&gt;
(Open)：多源零样本领域移植（开放）&lt;br /&gt;
&lt;br /&gt;
含义如下：&lt;br /&gt;
* '''多源的含义'''：可以使用其他领域的训练数据作为源领域数据。例如，当目标领域为ZX时，可以使用其他五个领域（包括BC）的训练数据，即BC/PB/PC/FIN/LEG-Train。&lt;br /&gt;
* '''零样本的含义'''：不能使用对应领域的训练数据。例如，当目标领域为ZX时，那么ZX-Train不可作为训练数据使用。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* '''Closed赛道的要求'''：&lt;br /&gt;
1）	只能使用我们提供的数据和信息，包括：所有数据我们都提供分词、自动词性；我们会提供pre-trained word embedding (在Chinese Gigaword 3和所有领域Train/Unlabeled数据上训练word2vec得到)。&lt;br /&gt;
&lt;br /&gt;
2）	不可以使用其他开源工具得到新的信息，如词性、词义等特征。&lt;br /&gt;
&lt;br /&gt;
3）	不可以使用其他的资源，如词典、句法语义树库等。&lt;br /&gt;
&lt;br /&gt;
4）	不可以使用大规模无标注数据上训练的预训练语言模型（任何开源的通用语言模型），但是可以通过预训练语言模型的技术来使用我们提供的无标注数据。即可以使用在我们提供的有标注和无标注数据上从头开始训练预训练模型。&lt;br /&gt;
&lt;br /&gt;
5）	不可以使用NLPCC-2019 CODT1.0的数据。&lt;br /&gt;
&lt;br /&gt;
* '''Open赛道的要求'''：&lt;br /&gt;
&lt;br /&gt;
1）	可以使用任何可通过某种公开方式获取（包括购买）的数据、资源或工具。但是建议参赛者在系统报告中明确说明使用的外部资源以及这些外部资源对性能的影响。&lt;br /&gt;
&lt;br /&gt;
* '''注意事项'''&lt;br /&gt;
1）	开发集的使用：不允许将Dev加入到训练数据中。Dev数据只可以用来调参和选择模型。&lt;br /&gt;
&lt;br /&gt;
2）	无标注数据（Unlabeled）的使用：不限制。同时，6个领域的Train中的句子，只要不使用句法标注信息，也都可以作为无标注数据使用。&lt;br /&gt;
&lt;br /&gt;
3）	预训练语言模型微调：我们将Google发布的bert-base-chinese在所有无标注数据（6个领域的Train，5个领域的Unlabeled数据）进行多轮微调（3轮或10轮），即继续使用语言模型损失函数继续训练。这个模型仅限于Open赛道上的系统使用。我们做这个事情的目的是方便大家试试这个方向，避免大家浪费资源，重复训练。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''如果您对规则有疑问，请随时联系我们确认。如果违反规则，发现后，成绩会直接取消。'''&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3774</id>
		<title>CCL2021</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3774"/>
		<updated>2021-04-02T09:32:00Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* CCL-2021依存句法分析领域移植评测 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== '''CCL-2021依存句法分析领域移植评测''' ==&lt;br /&gt;
* [http://cips-cl.org/static/CCL2021/cclEval/taskEvaluation/index.html CCL-2021评测页面]&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/2/26/%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v4.0.pdf 我们的参赛邀请函pdf]&lt;br /&gt;
* &amp;lt;font &amp;gt;[https://docs.qq.com/form/page/DWHltVGFCcmFQVG5h?createTS=1617351588079&amp;amp;templateId=25000#/fill 报名表]&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== '''评测日程''' ==&lt;br /&gt;
2021.4.1-4.30 开始报名&lt;br /&gt;
&lt;br /&gt;
2021.4.15 公布相关数据&lt;br /&gt;
&lt;br /&gt;
2021.5.1 公布测试集&lt;br /&gt;
&lt;br /&gt;
2021.5.15 公布有答案的测试集&lt;br /&gt;
&lt;br /&gt;
2021.6.15 提交截止&lt;br /&gt;
&lt;br /&gt;
2021.7.31 评测结果发布&lt;br /&gt;
&lt;br /&gt;
== '''评测奖金''' ==&lt;br /&gt;
受中国中文信息学会资助，本次评测设置了2万元奖金，每个赛道各1万元&lt;br /&gt;
&lt;br /&gt;
第一名：5000元&lt;br /&gt;
&lt;br /&gt;
第二名：3000元&lt;br /&gt;
&lt;br /&gt;
第三名：2000元&lt;br /&gt;
&lt;br /&gt;
== '''评测数据下载''' ==&lt;br /&gt;
'''数据使用协议'''&lt;br /&gt;
&lt;br /&gt;
下载数据前需要签署数据使用协议，在收到数据使用协议后我们会发给您解压密码。&lt;br /&gt;
&amp;lt;!--请您仔细阅读如下两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学（sudaccl2021dep@163.com）--&amp;gt;&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/c/c1/Codt-sharing-agreement-2021.3-v1.pdf CODT2.0数据使用协议下载]（团队负责人签字，如果是公司，必须是公司法人签字）&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/alibaba-unlabeled-data-share-2019.4.4.doc PB-PC-unlabeled数据使用协议下载] (机构、学院、学校或公司盖章）&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请仔细阅读两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学(sudaccl2021dep@163.com)&amp;lt;/font&amp;gt;&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请用机构的官方邮箱发送协议&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;由于版权保护问题，我们只面向机构、单位等团体开放数据；对于公司，我们仅面向从事句法分析研究的公司开放数据，签署协议前请先咨询我们是否有可能共享数据；解释权归我们课题组。&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;如果您不需要无标注数据，那么只需要签署标注数据使用协议。&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''训练集/开发集/无标注数据下载'''&lt;br /&gt;
&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/CCL2021_data_readme 数据说明Readme]&lt;br /&gt;
* 训练集/开发集/无标注数据&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/train_dev_2021.4.1.zip 训练集开发集数据 下载]&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/ZX_FIN_LEG_unlabeled_2021.4.1.zip ZX、FIN、LEG无标注数据 下载]&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/PB_PC_unlabeled_2021.4.1.zip PB、PC无标注数据 下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''预训练词向量下载'''&lt;br /&gt;
&lt;br /&gt;
我们分别提供了50维、100维、300维的预训练词向量&lt;br /&gt;
[http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/wordembedding.zip 预训练词向量下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''fine-tune-bert下载'''&lt;br /&gt;
&lt;br /&gt;
我们提供了在bert-base-chinese上微调3轮的结果&lt;br /&gt;
[http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/ccl_ft3.zip fine-tune-bert下载]&lt;br /&gt;
&lt;br /&gt;
== '''评价脚本下载''' ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/evaluate.py 评价脚本下载]&lt;br /&gt;
** 执行命令：python3 evaluate.py gold.conll sys.conll&lt;br /&gt;
** 数据集需要为CoNLL格式，与我们提供的数据集格式相同。&lt;br /&gt;
&lt;br /&gt;
== '''评测背景''' ==&lt;br /&gt;
近年来，随着深度学习技术的发展，尤其是预训练语言模型ELMo/BERT的提出，封闭领域规范文本上的句法分析性能已经达到了比较高的水平。但是，在跨领域文本，尤其是不规范的网络文本上，句法分析的性能会急剧下降。同时，如何在深度学习模型中利用结构化的句法信息也是NLP领域的重要研究问题之一，但是受到真实文本上句法性能的限制。因此，领域移植问题已经成为句法分析研究的重要挑战。为了更充分地支持句法分析领域移植研究，我们自2017年起标注了多领域句法数据集，并命名为汉语开放依存树库（CODT），目前包含16万句，涵盖10多个领域或来源的文本。2019年，我们依托NLPCC-2019会议，组织了第一届跨领域句法分析评测(Peng et al., 2019)，针对“单源零样本”和“单源少样本”领域移植场景，发布了CODT1.0数据集，包含4万句、对应4个领域。&lt;br /&gt;
今年，我们依托CCL-2021会议，组织第二届跨领域句法分析评测，针对“多源零样本”领域移植场景，发布CODT2.0数据集，包含7万句，对应6个领域。其中，通过错误检测和人工校正，CODT2.0与CODT1.0重合的数据的质量进一步提升。&lt;br /&gt;
&lt;br /&gt;
== '''数据设置''' ==&lt;br /&gt;
在本次评测任务中，我们提供约29K句平衡语料（BC）、9K句产品博客（PB）、10K句产品评论（PC）、8K句财经资讯（FIN）、8K句法律资讯（LEG）和3K句网络小说（ZX）六个领域的数据。其中BC作为基础数据，只作为源领域。后五个领域既可以作为源领域，也可以作为目标领域。另外，针对后五个领域，我们还提供了大规模的无标注数据。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align: center;&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
!      !! train !! dev  !! test !! unlabeled&lt;br /&gt;
|-&lt;br /&gt;
| BC   || 26.1K || 1K  || 2K ||   0     &lt;br /&gt;
|-&lt;br /&gt;
| PB   || 5K  || 1.3K || 2.5K || 291K&lt;br /&gt;
|-&lt;br /&gt;
| PC   || 6.8K  || 1.3K || 2.6K || 349K&lt;br /&gt;
|-&lt;br /&gt;
| FIN   || 5K  || 1K  || 1.8K || 118K&lt;br /&gt;
|-&lt;br /&gt;
| LEG   || 5K  || 1K  || 1.9K || 150K &lt;br /&gt;
|-&lt;br /&gt;
| ZX   || 1.5K  || 0.5K  || 1K || 33K&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== '''任务设置''' ==&lt;br /&gt;
本次评测分为两个赛道:&lt;br /&gt;
&lt;br /&gt;
(Closed)：多源零样本领域移植（封闭）&lt;br /&gt;
&lt;br /&gt;
(Open)：多源零样本领域移植（开放）&lt;br /&gt;
&lt;br /&gt;
含义如下：&lt;br /&gt;
* '''多源的含义'''：可以使用其他领域的训练数据作为源领域数据。例如，当目标领域为ZX时，可以使用其他五个领域（包括BC）的训练数据，即BC/PB/PC/FIN/LEG-Train。&lt;br /&gt;
* '''零样本的含义'''：不能使用对应领域的训练数据。例如，当目标领域为ZX时，那么ZX-Train不可作为训练数据使用。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* '''Closed赛道的要求'''：&lt;br /&gt;
1）	只能使用我们提供的数据和信息，包括：所有数据我们都提供分词、自动词性；我们会提供pre-trained word embedding (在Chinese Gigaword 3和所有领域Train/Unlabeled数据上训练word2vec得到)。&lt;br /&gt;
&lt;br /&gt;
2）	不可以使用其他开源工具得到新的信息，如词性、词义等特征。&lt;br /&gt;
&lt;br /&gt;
3）	不可以使用其他的资源，如词典、句法语义树库等。&lt;br /&gt;
&lt;br /&gt;
4）	不可以使用大规模无标注数据上训练的预训练语言模型（任何开源的通用语言模型），但是可以通过预训练语言模型的技术来使用我们提供的无标注数据。即可以使用在我们提供的有标注和无标注数据上从头开始训练预训练模型。&lt;br /&gt;
&lt;br /&gt;
5）	不可以使用NLPCC-2019 CODT1.0的数据。&lt;br /&gt;
&lt;br /&gt;
* '''Open赛道的要求'''：&lt;br /&gt;
&lt;br /&gt;
1）	可以使用任何可通过某种公开方式获取（包括购买）的数据、资源或工具。但是建议参赛者在系统报告中明确说明使用的外部资源以及这些外部资源对性能的影响。&lt;br /&gt;
&lt;br /&gt;
* '''注意事项'''&lt;br /&gt;
1）	开发集的使用：不允许将Dev加入到训练数据中。Dev数据只可以用来调参和选择模型。&lt;br /&gt;
&lt;br /&gt;
2）	无标注数据（Unlabeled）的使用：不限制。同时，6个领域的Train中的句子，只要不使用句法标注信息，也都可以作为无标注数据使用。&lt;br /&gt;
&lt;br /&gt;
3）	预训练语言模型微调：我们将Google发布的bert-base-chinese在所有无标注数据（6个领域的Train，5个领域的Unlabeled数据）进行多轮微调（3轮或10轮），即继续使用语言模型损失函数继续训练。这个模型仅限于Open赛道上的系统使用。我们做这个事情的目的是方便大家试试这个方向，避免大家浪费资源，重复训练。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''如果您对规则有疑问，请随时联系我们确认。如果违反规则，发现后，成绩会直接取消。'''&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3773</id>
		<title>CCL2021</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3773"/>
		<updated>2021-04-02T09:13:44Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* 评测数据下载 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== '''CCL-2021依存句法分析领域移植评测''' ==&lt;br /&gt;
* [http://cips-cl.org/static/CCL2021/cclEval/taskEvaluation/index.html CCL-2021评测页面]&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/2/26/%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v4.0.pdf 我们的参赛邀请函pdf]&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;[https://docs.qq.com/form/page/DWHltVGFCcmFQVG5h?createTS=1617351588079&amp;amp;templateId=25000#/fill 报名表]&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== '''评测日程''' ==&lt;br /&gt;
2021.4.1-4.30 开始报名&lt;br /&gt;
&lt;br /&gt;
2021.4.15 公布相关数据&lt;br /&gt;
&lt;br /&gt;
2021.5.1 公布测试集&lt;br /&gt;
&lt;br /&gt;
2021.5.15 公布有答案的测试集&lt;br /&gt;
&lt;br /&gt;
2021.6.15 提交截止&lt;br /&gt;
&lt;br /&gt;
2021.7.31 评测结果发布&lt;br /&gt;
&lt;br /&gt;
== '''评测奖金''' ==&lt;br /&gt;
受中国中文信息学会资助，本次评测设置了2万元奖金，每个赛道各1万元&lt;br /&gt;
&lt;br /&gt;
第一名：5000元&lt;br /&gt;
&lt;br /&gt;
第二名：3000元&lt;br /&gt;
&lt;br /&gt;
第三名：2000元&lt;br /&gt;
&lt;br /&gt;
== '''评测数据下载''' ==&lt;br /&gt;
'''数据使用协议'''&lt;br /&gt;
&lt;br /&gt;
下载数据前需要签署数据使用协议，在收到数据使用协议后我们会发给您解压密码。&lt;br /&gt;
&amp;lt;!--请您仔细阅读如下两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学（sudaccl2021dep@163.com）--&amp;gt;&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/c/c1/Codt-sharing-agreement-2021.3-v1.pdf CODT2.0数据使用协议下载]（团队负责人签字，如果是公司，必须是公司法人签字）&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/alibaba-unlabeled-data-share-2019.4.4.doc PB-PC-unlabeled数据使用协议下载] (机构、学院、学校或公司盖章）&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请仔细阅读两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学(sudaccl2021dep@163.com)&amp;lt;/font&amp;gt;&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请用机构的官方邮箱发送协议&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;由于版权保护问题，我们只面向机构、单位等团体开放数据；对于公司，我们仅面向从事句法分析研究的公司开放数据，签署协议前请先咨询我们是否有可能共享数据；解释权归我们课题组。&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;如果您不需要无标注数据，那么只需要签署标注数据使用协议。&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''训练集/开发集/无标注数据下载'''&lt;br /&gt;
&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/CCL2021_data_readme 数据说明Readme]&lt;br /&gt;
* 训练集/开发集/无标注数据&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/train_dev_2021.4.1.zip 训练集开发集数据 下载]&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/ZX_FIN_LEG_unlabeled_2021.4.1.zip ZX、FIN、LEG无标注数据 下载]&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/PB_PC_unlabeled_2021.4.1.zip PB、PC无标注数据 下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''预训练词向量下载'''&lt;br /&gt;
&lt;br /&gt;
我们分别提供了50维、100维、300维的预训练词向量&lt;br /&gt;
[http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/wordembedding.zip 预训练词向量下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''fine-tune-bert下载'''&lt;br /&gt;
&lt;br /&gt;
我们提供了在bert-base-chinese上微调3轮的结果&lt;br /&gt;
[http://hlt.suda.edu.cn/LA/myzhou/codt2.0_ccl2021/ccl_ft3.zip fine-tune-bert下载]&lt;br /&gt;
&lt;br /&gt;
== '''评价脚本下载''' ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/evaluate.py 评价脚本下载]&lt;br /&gt;
** 执行命令：python3 evaluate.py gold.conll sys.conll&lt;br /&gt;
** 数据集需要为CoNLL格式，与我们提供的数据集格式相同。&lt;br /&gt;
&lt;br /&gt;
== '''评测背景''' ==&lt;br /&gt;
近年来，随着深度学习技术的发展，尤其是预训练语言模型ELMo/BERT的提出，封闭领域规范文本上的句法分析性能已经达到了比较高的水平。但是，在跨领域文本，尤其是不规范的网络文本上，句法分析的性能会急剧下降。同时，如何在深度学习模型中利用结构化的句法信息也是NLP领域的重要研究问题之一，但是受到真实文本上句法性能的限制。因此，领域移植问题已经成为句法分析研究的重要挑战。为了更充分地支持句法分析领域移植研究，我们自2017年起标注了多领域句法数据集，并命名为汉语开放依存树库（CODT），目前包含16万句，涵盖10多个领域或来源的文本。2019年，我们依托NLPCC-2019会议，组织了第一届跨领域句法分析评测(Peng et al., 2019)，针对“单源零样本”和“单源少样本”领域移植场景，发布了CODT1.0数据集，包含4万句、对应4个领域。&lt;br /&gt;
今年，我们依托CCL-2021会议，组织第二届跨领域句法分析评测，针对“多源零样本”领域移植场景，发布CODT2.0数据集，包含7万句，对应6个领域。其中，通过错误检测和人工校正，CODT2.0与CODT1.0重合的数据的质量进一步提升。&lt;br /&gt;
&lt;br /&gt;
== '''数据设置''' ==&lt;br /&gt;
在本次评测任务中，我们提供约29K句平衡语料（BC）、9K句产品博客（PB）、10K句产品评论（PC）、8K句财经资讯（FIN）、8K句法律资讯（LEG）和3K句网络小说（ZX）六个领域的数据。其中BC作为基础数据，只作为源领域。后五个领域既可以作为源领域，也可以作为目标领域。另外，针对后五个领域，我们还提供了大规模的无标注数据。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align: center;&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
!      !! train !! dev  !! test !! unlabeled&lt;br /&gt;
|-&lt;br /&gt;
| BC   || 26.1K || 1K  || 2K ||   0     &lt;br /&gt;
|-&lt;br /&gt;
| PB   || 5K  || 1.3K || 2.5K || 291K&lt;br /&gt;
|-&lt;br /&gt;
| PC   || 6.8K  || 1.3K || 2.6K || 349K&lt;br /&gt;
|-&lt;br /&gt;
| FIN   || 5K  || 1K  || 1.8K || 118K&lt;br /&gt;
|-&lt;br /&gt;
| LEG   || 5K  || 1K  || 1.9K || 150K &lt;br /&gt;
|-&lt;br /&gt;
| ZX   || 1.5K  || 0.5K  || 1K || 33K&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== '''任务设置''' ==&lt;br /&gt;
本次评测分为两个赛道:&lt;br /&gt;
&lt;br /&gt;
(Closed)：多源零样本领域移植（封闭）&lt;br /&gt;
&lt;br /&gt;
(Open)：多源零样本领域移植（开放）&lt;br /&gt;
&lt;br /&gt;
含义如下：&lt;br /&gt;
* '''多源的含义'''：可以使用其他领域的训练数据作为源领域数据。例如，当目标领域为ZX时，可以使用其他五个领域（包括BC）的训练数据，即BC/PB/PC/FIN/LEG-Train。&lt;br /&gt;
* '''零样本的含义'''：不能使用对应领域的训练数据。例如，当目标领域为ZX时，那么ZX-Train不可作为训练数据使用。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* '''Closed赛道的要求'''：&lt;br /&gt;
1）	只能使用我们提供的数据和信息，包括：所有数据我们都提供分词、自动词性；我们会提供pre-trained word embedding (在Chinese Gigaword 3和所有领域Train/Unlabeled数据上训练word2vec得到)。&lt;br /&gt;
&lt;br /&gt;
2）	不可以使用其他开源工具得到新的信息，如词性、词义等特征。&lt;br /&gt;
&lt;br /&gt;
3）	不可以使用其他的资源，如词典、句法语义树库等。&lt;br /&gt;
&lt;br /&gt;
4）	不可以使用大规模无标注数据上训练的预训练语言模型（任何开源的通用语言模型），但是可以通过预训练语言模型的技术来使用我们提供的无标注数据。即可以使用在我们提供的有标注和无标注数据上从头开始训练预训练模型。&lt;br /&gt;
&lt;br /&gt;
5）	不可以使用NLPCC-2019 CODT1.0的数据。&lt;br /&gt;
&lt;br /&gt;
* '''Open赛道的要求'''：&lt;br /&gt;
&lt;br /&gt;
1）	可以使用任何可通过某种公开方式获取（包括购买）的数据、资源或工具。但是建议参赛者在系统报告中明确说明使用的外部资源以及这些外部资源对性能的影响。&lt;br /&gt;
&lt;br /&gt;
* '''注意事项'''&lt;br /&gt;
1）	开发集的使用：不允许将Dev加入到训练数据中。Dev数据只可以用来调参和选择模型。&lt;br /&gt;
&lt;br /&gt;
2）	无标注数据（Unlabeled）的使用：不限制。同时，6个领域的Train中的句子，只要不使用句法标注信息，也都可以作为无标注数据使用。&lt;br /&gt;
&lt;br /&gt;
3）	预训练语言模型微调：我们将Google发布的bert-base-chinese在所有无标注数据（6个领域的Train，5个领域的Unlabeled数据）进行多轮微调（3轮或10轮），即继续使用语言模型损失函数继续训练。这个模型仅限于Open赛道上的系统使用。我们做这个事情的目的是方便大家试试这个方向，避免大家浪费资源，重复训练。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''如果您对规则有疑问，请随时联系我们确认。如果违反规则，发现后，成绩会直接取消。'''&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3772</id>
		<title>CCL2021</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3772"/>
		<updated>2021-04-02T09:12:19Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* 评测数据下载 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== '''CCL-2021依存句法分析领域移植评测''' ==&lt;br /&gt;
* [http://cips-cl.org/static/CCL2021/cclEval/taskEvaluation/index.html CCL-2021评测页面]&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/2/26/%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v4.0.pdf 我们的参赛邀请函pdf]&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;[https://docs.qq.com/form/page/DWHltVGFCcmFQVG5h?createTS=1617351588079&amp;amp;templateId=25000#/fill 报名表]&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== '''评测日程''' ==&lt;br /&gt;
2021.4.1-4.30 开始报名&lt;br /&gt;
&lt;br /&gt;
2021.4.15 公布相关数据&lt;br /&gt;
&lt;br /&gt;
2021.5.1 公布测试集&lt;br /&gt;
&lt;br /&gt;
2021.5.15 公布有答案的测试集&lt;br /&gt;
&lt;br /&gt;
2021.6.15 提交截止&lt;br /&gt;
&lt;br /&gt;
2021.7.31 评测结果发布&lt;br /&gt;
&lt;br /&gt;
== '''评测奖金''' ==&lt;br /&gt;
受中国中文信息学会资助，本次评测设置了2万元奖金，每个赛道各1万元&lt;br /&gt;
&lt;br /&gt;
第一名：5000元&lt;br /&gt;
&lt;br /&gt;
第二名：3000元&lt;br /&gt;
&lt;br /&gt;
第三名：2000元&lt;br /&gt;
&lt;br /&gt;
== '''评测数据下载''' ==&lt;br /&gt;
'''数据使用协议'''&lt;br /&gt;
&lt;br /&gt;
下载数据前需要签署数据使用协议，在收到数据使用协议后我们会发给您解压密码。&lt;br /&gt;
&amp;lt;!--请您仔细阅读如下两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学（sudaccl2021dep@163.com）--&amp;gt;&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/c/c1/Codt-sharing-agreement-2021.3-v1.pdf CODT2.0数据使用协议下载]（团队负责人签字，如果是公司，必须是公司法人签字）&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/alibaba-unlabeled-data-share-2019.4.4.doc PB-PC-unlabeled数据使用协议下载] (机构、学院、学校或公司盖章）&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请仔细阅读两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学(sudaccl2021dep@163.com)&amp;lt;/font&amp;gt;&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请用机构的官方邮箱发送协议&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;由于版权保护问题，我们只面向机构、单位等团体开放数据；对于公司，我们仅面向从事句法分析研究的公司开放数据，签署协议前请先咨询我们是否有可能共享数据；解释权归我们课题组。&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;如果您不需要无标注数据，那么只需要签署标注数据使用协议。&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''训练集/开发集/无标注数据下载'''&lt;br /&gt;
&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/CCL2021_data_readme 数据说明Readme]&lt;br /&gt;
* 训练集/开发集/无标注数据&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/train_dev_2021.4.1.zip 训练集开发集数据 下载]&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/ZX_FIN_LEG_unlabeled_2021.4.1.zip ZX、FIN、LEG无标注数据 下载]&lt;br /&gt;
** [http://hlt.suda.edu.cn/LA/myzhou/PB_PC_unlabeled_2021.4.1.zip PB、PC无标注数据 下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''预训练词向量下载'''&lt;br /&gt;
&lt;br /&gt;
我们分别提供了50维、100维、300维的预训练词向量&lt;br /&gt;
[http://hlt.suda.edu.cn/LA/myzhou/wordembedding.zip 预训练词向量下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''fine-tune-bert下载'''&lt;br /&gt;
&lt;br /&gt;
我们提供了在bert-base-chinese上微调3轮的结果&lt;br /&gt;
[http://hlt.suda.edu.cn/LA/myzhou/ccl_ft3.zip fine-tune-bert下载]&lt;br /&gt;
&lt;br /&gt;
== '''评价脚本下载''' ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/evaluate.py 评价脚本下载]&lt;br /&gt;
** 执行命令：python3 evaluate.py gold.conll sys.conll&lt;br /&gt;
** 数据集需要为CoNLL格式，与我们提供的数据集格式相同。&lt;br /&gt;
&lt;br /&gt;
== '''评测背景''' ==&lt;br /&gt;
近年来，随着深度学习技术的发展，尤其是预训练语言模型ELMo/BERT的提出，封闭领域规范文本上的句法分析性能已经达到了比较高的水平。但是，在跨领域文本，尤其是不规范的网络文本上，句法分析的性能会急剧下降。同时，如何在深度学习模型中利用结构化的句法信息也是NLP领域的重要研究问题之一，但是受到真实文本上句法性能的限制。因此，领域移植问题已经成为句法分析研究的重要挑战。为了更充分地支持句法分析领域移植研究，我们自2017年起标注了多领域句法数据集，并命名为汉语开放依存树库（CODT），目前包含16万句，涵盖10多个领域或来源的文本。2019年，我们依托NLPCC-2019会议，组织了第一届跨领域句法分析评测(Peng et al., 2019)，针对“单源零样本”和“单源少样本”领域移植场景，发布了CODT1.0数据集，包含4万句、对应4个领域。&lt;br /&gt;
今年，我们依托CCL-2021会议，组织第二届跨领域句法分析评测，针对“多源零样本”领域移植场景，发布CODT2.0数据集，包含7万句，对应6个领域。其中，通过错误检测和人工校正，CODT2.0与CODT1.0重合的数据的质量进一步提升。&lt;br /&gt;
&lt;br /&gt;
== '''数据设置''' ==&lt;br /&gt;
在本次评测任务中，我们提供约29K句平衡语料（BC）、9K句产品博客（PB）、10K句产品评论（PC）、8K句财经资讯（FIN）、8K句法律资讯（LEG）和3K句网络小说（ZX）六个领域的数据。其中BC作为基础数据，只作为源领域。后五个领域既可以作为源领域，也可以作为目标领域。另外，针对后五个领域，我们还提供了大规模的无标注数据。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align: center;&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
!      !! train !! dev  !! test !! unlabeled&lt;br /&gt;
|-&lt;br /&gt;
| BC   || 26.1K || 1K  || 2K ||   0     &lt;br /&gt;
|-&lt;br /&gt;
| PB   || 5K  || 1.3K || 2.5K || 291K&lt;br /&gt;
|-&lt;br /&gt;
| PC   || 6.8K  || 1.3K || 2.6K || 349K&lt;br /&gt;
|-&lt;br /&gt;
| FIN   || 5K  || 1K  || 1.8K || 118K&lt;br /&gt;
|-&lt;br /&gt;
| LEG   || 5K  || 1K  || 1.9K || 150K &lt;br /&gt;
|-&lt;br /&gt;
| ZX   || 1.5K  || 0.5K  || 1K || 33K&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== '''任务设置''' ==&lt;br /&gt;
本次评测分为两个赛道:&lt;br /&gt;
&lt;br /&gt;
(Closed)：多源零样本领域移植（封闭）&lt;br /&gt;
&lt;br /&gt;
(Open)：多源零样本领域移植（开放）&lt;br /&gt;
&lt;br /&gt;
含义如下：&lt;br /&gt;
* '''多源的含义'''：可以使用其他领域的训练数据作为源领域数据。例如，当目标领域为ZX时，可以使用其他五个领域（包括BC）的训练数据，即BC/PB/PC/FIN/LEG-Train。&lt;br /&gt;
* '''零样本的含义'''：不能使用对应领域的训练数据。例如，当目标领域为ZX时，那么ZX-Train不可作为训练数据使用。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* '''Closed赛道的要求'''：&lt;br /&gt;
1）	只能使用我们提供的数据和信息，包括：所有数据我们都提供分词、自动词性；我们会提供pre-trained word embedding (在Chinese Gigaword 3和所有领域Train/Unlabeled数据上训练word2vec得到)。&lt;br /&gt;
&lt;br /&gt;
2）	不可以使用其他开源工具得到新的信息，如词性、词义等特征。&lt;br /&gt;
&lt;br /&gt;
3）	不可以使用其他的资源，如词典、句法语义树库等。&lt;br /&gt;
&lt;br /&gt;
4）	不可以使用大规模无标注数据上训练的预训练语言模型（任何开源的通用语言模型），但是可以通过预训练语言模型的技术来使用我们提供的无标注数据。即可以使用在我们提供的有标注和无标注数据上从头开始训练预训练模型。&lt;br /&gt;
&lt;br /&gt;
5）	不可以使用NLPCC-2019 CODT1.0的数据。&lt;br /&gt;
&lt;br /&gt;
* '''Open赛道的要求'''：&lt;br /&gt;
&lt;br /&gt;
1）	可以使用任何可通过某种公开方式获取（包括购买）的数据、资源或工具。但是建议参赛者在系统报告中明确说明使用的外部资源以及这些外部资源对性能的影响。&lt;br /&gt;
&lt;br /&gt;
* '''注意事项'''&lt;br /&gt;
1）	开发集的使用：不允许将Dev加入到训练数据中。Dev数据只可以用来调参和选择模型。&lt;br /&gt;
&lt;br /&gt;
2）	无标注数据（Unlabeled）的使用：不限制。同时，6个领域的Train中的句子，只要不使用句法标注信息，也都可以作为无标注数据使用。&lt;br /&gt;
&lt;br /&gt;
3）	预训练语言模型微调：我们将Google发布的bert-base-chinese在所有无标注数据（6个领域的Train，5个领域的Unlabeled数据）进行多轮微调（3轮或10轮），即继续使用语言模型损失函数继续训练。这个模型仅限于Open赛道上的系统使用。我们做这个事情的目的是方便大家试试这个方向，避免大家浪费资源，重复训练。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''如果您对规则有疑问，请随时联系我们确认。如果违反规则，发现后，成绩会直接取消。'''&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3771</id>
		<title>CCL2021</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3771"/>
		<updated>2021-04-02T09:02:51Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* 评测数据下载 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== '''CCL-2021依存句法分析领域移植评测''' ==&lt;br /&gt;
* [http://cips-cl.org/static/CCL2021/cclEval/taskEvaluation/index.html CCL-2021评测页面]&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/2/26/%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v4.0.pdf 我们的参赛邀请函pdf]&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;[https://docs.qq.com/form/page/DWHltVGFCcmFQVG5h?createTS=1617351588079&amp;amp;templateId=25000#/fill 报名表]&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== '''评测日程''' ==&lt;br /&gt;
2021.4.1-4.30 开始报名&lt;br /&gt;
&lt;br /&gt;
2021.4.15 公布相关数据&lt;br /&gt;
&lt;br /&gt;
2021.5.1 公布测试集&lt;br /&gt;
&lt;br /&gt;
2021.5.15 公布有答案的测试集&lt;br /&gt;
&lt;br /&gt;
2021.6.15 提交截止&lt;br /&gt;
&lt;br /&gt;
2021.7.31 评测结果发布&lt;br /&gt;
&lt;br /&gt;
== '''评测奖金''' ==&lt;br /&gt;
受中国中文信息学会资助，本次评测设置了2万元奖金，每个赛道各1万元&lt;br /&gt;
&lt;br /&gt;
第一名：5000元&lt;br /&gt;
&lt;br /&gt;
第二名：3000元&lt;br /&gt;
&lt;br /&gt;
第三名：2000元&lt;br /&gt;
&lt;br /&gt;
== '''评测数据下载''' ==&lt;br /&gt;
'''数据使用协议'''&lt;br /&gt;
&lt;br /&gt;
下载数据前需要签署数据使用协议，在收到数据使用协议后我们会发给您解压密码。&lt;br /&gt;
&amp;lt;!--请您仔细阅读如下两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学（sudaccl2021dep@163.com）--&amp;gt;&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/c/c1/Codt-sharing-agreement-2021.3-v1.pdf CODT2.0数据使用协议下载]（团队负责人签字，如果是公司，必须是公司法人签字）&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/alibaba-unlabeled-data-share-2019.4.4.doc PB-PC-unlabeled数据使用协议下载] (机构、学院、学校或公司盖章）&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请仔细阅读两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学(sudaccl2021dep@163.com)&amp;lt;/font&amp;gt;&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请用机构的官方邮箱发送协议&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;由于版权保护问题，我们只面向机构、单位等团体开放数据；对于公司，我们仅面向从事句法分析研究的公司开放数据，签署协议前请先咨询我们是否有可能共享数据；解释权归我们课题组。&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;如果您不需要无标注数据，那么只需要签署标注数据使用协议。&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''训练集/开发集/无标注数据下载'''&lt;br /&gt;
&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/CCL2021_data_readme 数据说明Readme]&lt;br /&gt;
* 训练集/开发集/无标注数据&lt;br /&gt;
** [ 训练集开发集数据 下载]&lt;br /&gt;
** [ ZX、FIN、LEG无标注数据 下载]&lt;br /&gt;
** [ PB、PC无标注数据 下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''预训练词向量下载'''&lt;br /&gt;
&lt;br /&gt;
我们分别提供了50维、100维、300维的预训练词向量&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''fine-tune-bert下载'''&lt;br /&gt;
&lt;br /&gt;
我们提供了在bert-base-chinese上微调3轮的结果&lt;br /&gt;
&lt;br /&gt;
== '''评价脚本下载''' ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/evaluate.py 评价脚本下载]&lt;br /&gt;
** 执行命令：python3 evaluate.py gold.conll sys.conll&lt;br /&gt;
** 数据集需要为CoNLL格式，与我们提供的数据集格式相同。&lt;br /&gt;
&lt;br /&gt;
== '''评测背景''' ==&lt;br /&gt;
近年来，随着深度学习技术的发展，尤其是预训练语言模型ELMo/BERT的提出，封闭领域规范文本上的句法分析性能已经达到了比较高的水平。但是，在跨领域文本，尤其是不规范的网络文本上，句法分析的性能会急剧下降。同时，如何在深度学习模型中利用结构化的句法信息也是NLP领域的重要研究问题之一，但是受到真实文本上句法性能的限制。因此，领域移植问题已经成为句法分析研究的重要挑战。为了更充分地支持句法分析领域移植研究，我们自2017年起标注了多领域句法数据集，并命名为汉语开放依存树库（CODT），目前包含16万句，涵盖10多个领域或来源的文本。2019年，我们依托NLPCC-2019会议，组织了第一届跨领域句法分析评测(Peng et al., 2019)，针对“单源零样本”和“单源少样本”领域移植场景，发布了CODT1.0数据集，包含4万句、对应4个领域。&lt;br /&gt;
今年，我们依托CCL-2021会议，组织第二届跨领域句法分析评测，针对“多源零样本”领域移植场景，发布CODT2.0数据集，包含7万句，对应6个领域。其中，通过错误检测和人工校正，CODT2.0与CODT1.0重合的数据的质量进一步提升。&lt;br /&gt;
&lt;br /&gt;
== '''数据设置''' ==&lt;br /&gt;
在本次评测任务中，我们提供约29K句平衡语料（BC）、9K句产品博客（PB）、10K句产品评论（PC）、8K句财经资讯（FIN）、8K句法律资讯（LEG）和3K句网络小说（ZX）六个领域的数据。其中BC作为基础数据，只作为源领域。后五个领域既可以作为源领域，也可以作为目标领域。另外，针对后五个领域，我们还提供了大规模的无标注数据。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align: center;&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
!      !! train !! dev  !! test !! unlabeled&lt;br /&gt;
|-&lt;br /&gt;
| BC   || 26.1K || 1K  || 2K ||   0     &lt;br /&gt;
|-&lt;br /&gt;
| PB   || 5K  || 1.3K || 2.5K || 291K&lt;br /&gt;
|-&lt;br /&gt;
| PC   || 6.8K  || 1.3K || 2.6K || 349K&lt;br /&gt;
|-&lt;br /&gt;
| FIN   || 5K  || 1K  || 1.8K || 118K&lt;br /&gt;
|-&lt;br /&gt;
| LEG   || 5K  || 1K  || 1.9K || 150K &lt;br /&gt;
|-&lt;br /&gt;
| ZX   || 1.5K  || 0.5K  || 1K || 33K&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== '''任务设置''' ==&lt;br /&gt;
本次评测分为两个赛道:&lt;br /&gt;
&lt;br /&gt;
(Closed)：多源零样本领域移植（封闭）&lt;br /&gt;
&lt;br /&gt;
(Open)：多源零样本领域移植（开放）&lt;br /&gt;
&lt;br /&gt;
含义如下：&lt;br /&gt;
* '''多源的含义'''：可以使用其他领域的训练数据作为源领域数据。例如，当目标领域为ZX时，可以使用其他五个领域（包括BC）的训练数据，即BC/PB/PC/FIN/LEG-Train。&lt;br /&gt;
* '''零样本的含义'''：不能使用对应领域的训练数据。例如，当目标领域为ZX时，那么ZX-Train不可作为训练数据使用。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* '''Closed赛道的要求'''：&lt;br /&gt;
1）	只能使用我们提供的数据和信息，包括：所有数据我们都提供分词、自动词性；我们会提供pre-trained word embedding (在Chinese Gigaword 3和所有领域Train/Unlabeled数据上训练word2vec得到)。&lt;br /&gt;
&lt;br /&gt;
2）	不可以使用其他开源工具得到新的信息，如词性、词义等特征。&lt;br /&gt;
&lt;br /&gt;
3）	不可以使用其他的资源，如词典、句法语义树库等。&lt;br /&gt;
&lt;br /&gt;
4）	不可以使用大规模无标注数据上训练的预训练语言模型（任何开源的通用语言模型），但是可以通过预训练语言模型的技术来使用我们提供的无标注数据。即可以使用在我们提供的有标注和无标注数据上从头开始训练预训练模型。&lt;br /&gt;
&lt;br /&gt;
5）	不可以使用NLPCC-2019 CODT1.0的数据。&lt;br /&gt;
&lt;br /&gt;
* '''Open赛道的要求'''：&lt;br /&gt;
&lt;br /&gt;
1）	可以使用任何可通过某种公开方式获取（包括购买）的数据、资源或工具。但是建议参赛者在系统报告中明确说明使用的外部资源以及这些外部资源对性能的影响。&lt;br /&gt;
&lt;br /&gt;
* '''注意事项'''&lt;br /&gt;
1）	开发集的使用：不允许将Dev加入到训练数据中。Dev数据只可以用来调参和选择模型。&lt;br /&gt;
&lt;br /&gt;
2）	无标注数据（Unlabeled）的使用：不限制。同时，6个领域的Train中的句子，只要不使用句法标注信息，也都可以作为无标注数据使用。&lt;br /&gt;
&lt;br /&gt;
3）	预训练语言模型微调：我们将Google发布的bert-base-chinese在所有无标注数据（6个领域的Train，5个领域的Unlabeled数据）进行多轮微调（3轮或10轮），即继续使用语言模型损失函数继续训练。这个模型仅限于Open赛道上的系统使用。我们做这个事情的目的是方便大家试试这个方向，避免大家浪费资源，重复训练。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''如果您对规则有疑问，请随时联系我们确认。如果违反规则，发现后，成绩会直接取消。'''&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3770</id>
		<title>CCL2021</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3770"/>
		<updated>2021-04-02T09:02:37Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* 评测数据下载 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== '''CCL-2021依存句法分析领域移植评测''' ==&lt;br /&gt;
* [http://cips-cl.org/static/CCL2021/cclEval/taskEvaluation/index.html CCL-2021评测页面]&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/2/26/%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v4.0.pdf 我们的参赛邀请函pdf]&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;[https://docs.qq.com/form/page/DWHltVGFCcmFQVG5h?createTS=1617351588079&amp;amp;templateId=25000#/fill 报名表]&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== '''评测日程''' ==&lt;br /&gt;
2021.4.1-4.30 开始报名&lt;br /&gt;
&lt;br /&gt;
2021.4.15 公布相关数据&lt;br /&gt;
&lt;br /&gt;
2021.5.1 公布测试集&lt;br /&gt;
&lt;br /&gt;
2021.5.15 公布有答案的测试集&lt;br /&gt;
&lt;br /&gt;
2021.6.15 提交截止&lt;br /&gt;
&lt;br /&gt;
2021.7.31 评测结果发布&lt;br /&gt;
&lt;br /&gt;
== '''评测奖金''' ==&lt;br /&gt;
受中国中文信息学会资助，本次评测设置了2万元奖金，每个赛道各1万元&lt;br /&gt;
&lt;br /&gt;
第一名：5000元&lt;br /&gt;
&lt;br /&gt;
第二名：3000元&lt;br /&gt;
&lt;br /&gt;
第三名：2000元&lt;br /&gt;
&lt;br /&gt;
== '''评测数据下载''' ==&lt;br /&gt;
'''数据使用协议'''&lt;br /&gt;
&lt;br /&gt;
下载数据前需要签署数据使用协议，在收到数据使用协议后我们会发给您解压密码。&lt;br /&gt;
&amp;lt;!--请您仔细阅读如下两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学（sudaccl2021dep@163.com）--&amp;gt;&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/c/c1/Codt-sharing-agreement-2021.3-v1.pdf CODT2.0数据使用协议下载]（团队负责人签字，如果是公司，必须是公司法人签字）&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/alibaba-unlabeled-data-share-2019.4.4.doc PB-PC-unlabeled数据使用协议下载] (机构、学院、学校或公司盖章）&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请仔细阅读两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学(z641295453@163.com)&amp;lt;/font&amp;gt;&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请用机构的官方邮箱发送协议&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;由于版权保护问题，我们只面向机构、单位等团体开放数据；对于公司，我们仅面向从事句法分析研究的公司开放数据，签署协议前请先咨询我们是否有可能共享数据；解释权归我们课题组。&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;如果您不需要无标注数据，那么只需要签署标注数据使用协议。&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''训练集/开发集/无标注数据下载'''&lt;br /&gt;
&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/CCL2021_data_readme 数据说明Readme]&lt;br /&gt;
* 训练集/开发集/无标注数据&lt;br /&gt;
** [ 训练集开发集数据 下载]&lt;br /&gt;
** [ ZX、FIN、LEG无标注数据 下载]&lt;br /&gt;
** [ PB、PC无标注数据 下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''预训练词向量下载'''&lt;br /&gt;
&lt;br /&gt;
我们分别提供了50维、100维、300维的预训练词向量&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''fine-tune-bert下载'''&lt;br /&gt;
&lt;br /&gt;
我们提供了在bert-base-chinese上微调3轮的结果&lt;br /&gt;
&lt;br /&gt;
== '''评价脚本下载''' ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/evaluate.py 评价脚本下载]&lt;br /&gt;
** 执行命令：python3 evaluate.py gold.conll sys.conll&lt;br /&gt;
** 数据集需要为CoNLL格式，与我们提供的数据集格式相同。&lt;br /&gt;
&lt;br /&gt;
== '''评测背景''' ==&lt;br /&gt;
近年来，随着深度学习技术的发展，尤其是预训练语言模型ELMo/BERT的提出，封闭领域规范文本上的句法分析性能已经达到了比较高的水平。但是，在跨领域文本，尤其是不规范的网络文本上，句法分析的性能会急剧下降。同时，如何在深度学习模型中利用结构化的句法信息也是NLP领域的重要研究问题之一，但是受到真实文本上句法性能的限制。因此，领域移植问题已经成为句法分析研究的重要挑战。为了更充分地支持句法分析领域移植研究，我们自2017年起标注了多领域句法数据集，并命名为汉语开放依存树库（CODT），目前包含16万句，涵盖10多个领域或来源的文本。2019年，我们依托NLPCC-2019会议，组织了第一届跨领域句法分析评测(Peng et al., 2019)，针对“单源零样本”和“单源少样本”领域移植场景，发布了CODT1.0数据集，包含4万句、对应4个领域。&lt;br /&gt;
今年，我们依托CCL-2021会议，组织第二届跨领域句法分析评测，针对“多源零样本”领域移植场景，发布CODT2.0数据集，包含7万句，对应6个领域。其中，通过错误检测和人工校正，CODT2.0与CODT1.0重合的数据的质量进一步提升。&lt;br /&gt;
&lt;br /&gt;
== '''数据设置''' ==&lt;br /&gt;
在本次评测任务中，我们提供约29K句平衡语料（BC）、9K句产品博客（PB）、10K句产品评论（PC）、8K句财经资讯（FIN）、8K句法律资讯（LEG）和3K句网络小说（ZX）六个领域的数据。其中BC作为基础数据，只作为源领域。后五个领域既可以作为源领域，也可以作为目标领域。另外，针对后五个领域，我们还提供了大规模的无标注数据。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align: center;&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
!      !! train !! dev  !! test !! unlabeled&lt;br /&gt;
|-&lt;br /&gt;
| BC   || 26.1K || 1K  || 2K ||   0     &lt;br /&gt;
|-&lt;br /&gt;
| PB   || 5K  || 1.3K || 2.5K || 291K&lt;br /&gt;
|-&lt;br /&gt;
| PC   || 6.8K  || 1.3K || 2.6K || 349K&lt;br /&gt;
|-&lt;br /&gt;
| FIN   || 5K  || 1K  || 1.8K || 118K&lt;br /&gt;
|-&lt;br /&gt;
| LEG   || 5K  || 1K  || 1.9K || 150K &lt;br /&gt;
|-&lt;br /&gt;
| ZX   || 1.5K  || 0.5K  || 1K || 33K&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== '''任务设置''' ==&lt;br /&gt;
本次评测分为两个赛道:&lt;br /&gt;
&lt;br /&gt;
(Closed)：多源零样本领域移植（封闭）&lt;br /&gt;
&lt;br /&gt;
(Open)：多源零样本领域移植（开放）&lt;br /&gt;
&lt;br /&gt;
含义如下：&lt;br /&gt;
* '''多源的含义'''：可以使用其他领域的训练数据作为源领域数据。例如，当目标领域为ZX时，可以使用其他五个领域（包括BC）的训练数据，即BC/PB/PC/FIN/LEG-Train。&lt;br /&gt;
* '''零样本的含义'''：不能使用对应领域的训练数据。例如，当目标领域为ZX时，那么ZX-Train不可作为训练数据使用。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* '''Closed赛道的要求'''：&lt;br /&gt;
1）	只能使用我们提供的数据和信息，包括：所有数据我们都提供分词、自动词性；我们会提供pre-trained word embedding (在Chinese Gigaword 3和所有领域Train/Unlabeled数据上训练word2vec得到)。&lt;br /&gt;
&lt;br /&gt;
2）	不可以使用其他开源工具得到新的信息，如词性、词义等特征。&lt;br /&gt;
&lt;br /&gt;
3）	不可以使用其他的资源，如词典、句法语义树库等。&lt;br /&gt;
&lt;br /&gt;
4）	不可以使用大规模无标注数据上训练的预训练语言模型（任何开源的通用语言模型），但是可以通过预训练语言模型的技术来使用我们提供的无标注数据。即可以使用在我们提供的有标注和无标注数据上从头开始训练预训练模型。&lt;br /&gt;
&lt;br /&gt;
5）	不可以使用NLPCC-2019 CODT1.0的数据。&lt;br /&gt;
&lt;br /&gt;
* '''Open赛道的要求'''：&lt;br /&gt;
&lt;br /&gt;
1）	可以使用任何可通过某种公开方式获取（包括购买）的数据、资源或工具。但是建议参赛者在系统报告中明确说明使用的外部资源以及这些外部资源对性能的影响。&lt;br /&gt;
&lt;br /&gt;
* '''注意事项'''&lt;br /&gt;
1）	开发集的使用：不允许将Dev加入到训练数据中。Dev数据只可以用来调参和选择模型。&lt;br /&gt;
&lt;br /&gt;
2）	无标注数据（Unlabeled）的使用：不限制。同时，6个领域的Train中的句子，只要不使用句法标注信息，也都可以作为无标注数据使用。&lt;br /&gt;
&lt;br /&gt;
3）	预训练语言模型微调：我们将Google发布的bert-base-chinese在所有无标注数据（6个领域的Train，5个领域的Unlabeled数据）进行多轮微调（3轮或10轮），即继续使用语言模型损失函数继续训练。这个模型仅限于Open赛道上的系统使用。我们做这个事情的目的是方便大家试试这个方向，避免大家浪费资源，重复训练。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''如果您对规则有疑问，请随时联系我们确认。如果违反规则，发现后，成绩会直接取消。'''&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3769</id>
		<title>CCL2021</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3769"/>
		<updated>2021-04-02T09:01:31Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* CCL-2021依存句法分析领域移植评测 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== '''CCL-2021依存句法分析领域移植评测''' ==&lt;br /&gt;
* [http://cips-cl.org/static/CCL2021/cclEval/taskEvaluation/index.html CCL-2021评测页面]&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/2/26/%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v4.0.pdf 我们的参赛邀请函pdf]&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;[https://docs.qq.com/form/page/DWHltVGFCcmFQVG5h?createTS=1617351588079&amp;amp;templateId=25000#/fill 报名表]&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== '''评测日程''' ==&lt;br /&gt;
2021.4.1-4.30 开始报名&lt;br /&gt;
&lt;br /&gt;
2021.4.15 公布相关数据&lt;br /&gt;
&lt;br /&gt;
2021.5.1 公布测试集&lt;br /&gt;
&lt;br /&gt;
2021.5.15 公布有答案的测试集&lt;br /&gt;
&lt;br /&gt;
2021.6.15 提交截止&lt;br /&gt;
&lt;br /&gt;
2021.7.31 评测结果发布&lt;br /&gt;
&lt;br /&gt;
== '''评测奖金''' ==&lt;br /&gt;
受中国中文信息学会资助，本次评测设置了2万元奖金，每个赛道各1万元&lt;br /&gt;
&lt;br /&gt;
第一名：5000元&lt;br /&gt;
&lt;br /&gt;
第二名：3000元&lt;br /&gt;
&lt;br /&gt;
第三名：2000元&lt;br /&gt;
&lt;br /&gt;
== '''评测数据下载''' ==&lt;br /&gt;
'''数据使用协议'''&lt;br /&gt;
&lt;br /&gt;
下载数据前需要签署数据使用协议，在收到数据使用协议后我们会发给您解压密码。&lt;br /&gt;
&amp;lt;!--请您仔细阅读如下两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学（z641295453@163.com）--&amp;gt;&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/c/c1/Codt-sharing-agreement-2021.3-v1.pdf CODT2.0数据使用协议下载]（团队负责人签字，如果是公司，必须是公司法人签字）&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/alibaba-unlabeled-data-share-2019.4.4.doc PB-PC-unlabeled数据使用协议下载] (机构、学院、学校或公司盖章）&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请仔细阅读两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学(z641295453@163.com)&amp;lt;/font&amp;gt;&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请用机构的官方邮箱发送协议&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;由于版权保护问题，我们只面向机构、单位等团体开放数据；对于公司，我们仅面向从事句法分析研究的公司开放数据，签署协议前请先咨询我们是否有可能共享数据；解释权归我们课题组。&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;如果您不需要无标注数据，那么只需要签署标注数据使用协议。&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''训练集/开发集/无标注数据下载'''&lt;br /&gt;
&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/CCL2021_data_readme 数据说明Readme]&lt;br /&gt;
* 训练集/开发集/无标注数据&lt;br /&gt;
** [ 训练集开发集数据 下载]&lt;br /&gt;
** [ ZX、FIN、LEG无标注数据 下载]&lt;br /&gt;
** [ PB、PC无标注数据 下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''预训练词向量下载'''&lt;br /&gt;
&lt;br /&gt;
我们分别提供了50维、100维、300维的预训练词向量&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''fine-tune-bert下载'''&lt;br /&gt;
&lt;br /&gt;
我们提供了在bert-base-chinese上微调3轮的结果&lt;br /&gt;
&lt;br /&gt;
== '''评价脚本下载''' ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/evaluate.py 评价脚本下载]&lt;br /&gt;
** 执行命令：python3 evaluate.py gold.conll sys.conll&lt;br /&gt;
** 数据集需要为CoNLL格式，与我们提供的数据集格式相同。&lt;br /&gt;
&lt;br /&gt;
== '''评测背景''' ==&lt;br /&gt;
近年来，随着深度学习技术的发展，尤其是预训练语言模型ELMo/BERT的提出，封闭领域规范文本上的句法分析性能已经达到了比较高的水平。但是，在跨领域文本，尤其是不规范的网络文本上，句法分析的性能会急剧下降。同时，如何在深度学习模型中利用结构化的句法信息也是NLP领域的重要研究问题之一，但是受到真实文本上句法性能的限制。因此，领域移植问题已经成为句法分析研究的重要挑战。为了更充分地支持句法分析领域移植研究，我们自2017年起标注了多领域句法数据集，并命名为汉语开放依存树库（CODT），目前包含16万句，涵盖10多个领域或来源的文本。2019年，我们依托NLPCC-2019会议，组织了第一届跨领域句法分析评测(Peng et al., 2019)，针对“单源零样本”和“单源少样本”领域移植场景，发布了CODT1.0数据集，包含4万句、对应4个领域。&lt;br /&gt;
今年，我们依托CCL-2021会议，组织第二届跨领域句法分析评测，针对“多源零样本”领域移植场景，发布CODT2.0数据集，包含7万句，对应6个领域。其中，通过错误检测和人工校正，CODT2.0与CODT1.0重合的数据的质量进一步提升。&lt;br /&gt;
&lt;br /&gt;
== '''数据设置''' ==&lt;br /&gt;
在本次评测任务中，我们提供约29K句平衡语料（BC）、9K句产品博客（PB）、10K句产品评论（PC）、8K句财经资讯（FIN）、8K句法律资讯（LEG）和3K句网络小说（ZX）六个领域的数据。其中BC作为基础数据，只作为源领域。后五个领域既可以作为源领域，也可以作为目标领域。另外，针对后五个领域，我们还提供了大规模的无标注数据。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align: center;&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
!      !! train !! dev  !! test !! unlabeled&lt;br /&gt;
|-&lt;br /&gt;
| BC   || 26.1K || 1K  || 2K ||   0     &lt;br /&gt;
|-&lt;br /&gt;
| PB   || 5K  || 1.3K || 2.5K || 291K&lt;br /&gt;
|-&lt;br /&gt;
| PC   || 6.8K  || 1.3K || 2.6K || 349K&lt;br /&gt;
|-&lt;br /&gt;
| FIN   || 5K  || 1K  || 1.8K || 118K&lt;br /&gt;
|-&lt;br /&gt;
| LEG   || 5K  || 1K  || 1.9K || 150K &lt;br /&gt;
|-&lt;br /&gt;
| ZX   || 1.5K  || 0.5K  || 1K || 33K&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== '''任务设置''' ==&lt;br /&gt;
本次评测分为两个赛道:&lt;br /&gt;
&lt;br /&gt;
(Closed)：多源零样本领域移植（封闭）&lt;br /&gt;
&lt;br /&gt;
(Open)：多源零样本领域移植（开放）&lt;br /&gt;
&lt;br /&gt;
含义如下：&lt;br /&gt;
* '''多源的含义'''：可以使用其他领域的训练数据作为源领域数据。例如，当目标领域为ZX时，可以使用其他五个领域（包括BC）的训练数据，即BC/PB/PC/FIN/LEG-Train。&lt;br /&gt;
* '''零样本的含义'''：不能使用对应领域的训练数据。例如，当目标领域为ZX时，那么ZX-Train不可作为训练数据使用。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* '''Closed赛道的要求'''：&lt;br /&gt;
1）	只能使用我们提供的数据和信息，包括：所有数据我们都提供分词、自动词性；我们会提供pre-trained word embedding (在Chinese Gigaword 3和所有领域Train/Unlabeled数据上训练word2vec得到)。&lt;br /&gt;
&lt;br /&gt;
2）	不可以使用其他开源工具得到新的信息，如词性、词义等特征。&lt;br /&gt;
&lt;br /&gt;
3）	不可以使用其他的资源，如词典、句法语义树库等。&lt;br /&gt;
&lt;br /&gt;
4）	不可以使用大规模无标注数据上训练的预训练语言模型（任何开源的通用语言模型），但是可以通过预训练语言模型的技术来使用我们提供的无标注数据。即可以使用在我们提供的有标注和无标注数据上从头开始训练预训练模型。&lt;br /&gt;
&lt;br /&gt;
5）	不可以使用NLPCC-2019 CODT1.0的数据。&lt;br /&gt;
&lt;br /&gt;
* '''Open赛道的要求'''：&lt;br /&gt;
&lt;br /&gt;
1）	可以使用任何可通过某种公开方式获取（包括购买）的数据、资源或工具。但是建议参赛者在系统报告中明确说明使用的外部资源以及这些外部资源对性能的影响。&lt;br /&gt;
&lt;br /&gt;
* '''注意事项'''&lt;br /&gt;
1）	开发集的使用：不允许将Dev加入到训练数据中。Dev数据只可以用来调参和选择模型。&lt;br /&gt;
&lt;br /&gt;
2）	无标注数据（Unlabeled）的使用：不限制。同时，6个领域的Train中的句子，只要不使用句法标注信息，也都可以作为无标注数据使用。&lt;br /&gt;
&lt;br /&gt;
3）	预训练语言模型微调：我们将Google发布的bert-base-chinese在所有无标注数据（6个领域的Train，5个领域的Unlabeled数据）进行多轮微调（3轮或10轮），即继续使用语言模型损失函数继续训练。这个模型仅限于Open赛道上的系统使用。我们做这个事情的目的是方便大家试试这个方向，避免大家浪费资源，重复训练。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''如果您对规则有疑问，请随时联系我们确认。如果违反规则，发现后，成绩会直接取消。'''&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3768</id>
		<title>CCL2021</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3768"/>
		<updated>2021-04-02T09:00:55Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* 评测数据下载 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== '''CCL-2021依存句法分析领域移植评测''' ==&lt;br /&gt;
* [http://cips-cl.org/static/CCL2021/cclEval/taskEvaluation/index.html CCL-2021评测页面]&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/2/26/%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v4.0.pdf 我们的参赛邀请函pdf]&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;[https://docs.qq.com/form/page/DWHltVGFCcmFQVG5h?createTS=1617351588079&amp;amp;templateId=25000#/fill 报名表]。&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== '''评测日程''' ==&lt;br /&gt;
2021.4.1-4.30 开始报名&lt;br /&gt;
&lt;br /&gt;
2021.4.15 公布相关数据&lt;br /&gt;
&lt;br /&gt;
2021.5.1 公布测试集&lt;br /&gt;
&lt;br /&gt;
2021.5.15 公布有答案的测试集&lt;br /&gt;
&lt;br /&gt;
2021.6.15 提交截止&lt;br /&gt;
&lt;br /&gt;
2021.7.31 评测结果发布&lt;br /&gt;
&lt;br /&gt;
== '''评测奖金''' ==&lt;br /&gt;
受中国中文信息学会资助，本次评测设置了2万元奖金，每个赛道各1万元&lt;br /&gt;
&lt;br /&gt;
第一名：5000元&lt;br /&gt;
&lt;br /&gt;
第二名：3000元&lt;br /&gt;
&lt;br /&gt;
第三名：2000元&lt;br /&gt;
&lt;br /&gt;
== '''评测数据下载''' ==&lt;br /&gt;
'''数据使用协议'''&lt;br /&gt;
&lt;br /&gt;
下载数据前需要签署数据使用协议，在收到数据使用协议后我们会发给您解压密码。&lt;br /&gt;
&amp;lt;!--请您仔细阅读如下两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学（z641295453@163.com）--&amp;gt;&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/c/c1/Codt-sharing-agreement-2021.3-v1.pdf CODT2.0数据使用协议下载]（团队负责人签字，如果是公司，必须是公司法人签字）&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/alibaba-unlabeled-data-share-2019.4.4.doc PB-PC-unlabeled数据使用协议下载] (机构、学院、学校或公司盖章）&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请仔细阅读两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学(z641295453@163.com)&amp;lt;/font&amp;gt;&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请用机构的官方邮箱发送协议&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;由于版权保护问题，我们只面向机构、单位等团体开放数据；对于公司，我们仅面向从事句法分析研究的公司开放数据，签署协议前请先咨询我们是否有可能共享数据；解释权归我们课题组。&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;如果您不需要无标注数据，那么只需要签署标注数据使用协议。&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''训练集/开发集/无标注数据下载'''&lt;br /&gt;
&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/CCL2021_data_readme 数据说明Readme]&lt;br /&gt;
* 训练集/开发集/无标注数据&lt;br /&gt;
** [ 训练集开发集数据 下载]&lt;br /&gt;
** [ ZX、FIN、LEG无标注数据 下载]&lt;br /&gt;
** [ PB、PC无标注数据 下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''预训练词向量下载'''&lt;br /&gt;
&lt;br /&gt;
我们分别提供了50维、100维、300维的预训练词向量&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''fine-tune-bert下载'''&lt;br /&gt;
&lt;br /&gt;
我们提供了在bert-base-chinese上微调3轮的结果&lt;br /&gt;
&lt;br /&gt;
== '''评价脚本下载''' ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/evaluate.py 评价脚本下载]&lt;br /&gt;
** 执行命令：python3 evaluate.py gold.conll sys.conll&lt;br /&gt;
** 数据集需要为CoNLL格式，与我们提供的数据集格式相同。&lt;br /&gt;
&lt;br /&gt;
== '''评测背景''' ==&lt;br /&gt;
近年来，随着深度学习技术的发展，尤其是预训练语言模型ELMo/BERT的提出，封闭领域规范文本上的句法分析性能已经达到了比较高的水平。但是，在跨领域文本，尤其是不规范的网络文本上，句法分析的性能会急剧下降。同时，如何在深度学习模型中利用结构化的句法信息也是NLP领域的重要研究问题之一，但是受到真实文本上句法性能的限制。因此，领域移植问题已经成为句法分析研究的重要挑战。为了更充分地支持句法分析领域移植研究，我们自2017年起标注了多领域句法数据集，并命名为汉语开放依存树库（CODT），目前包含16万句，涵盖10多个领域或来源的文本。2019年，我们依托NLPCC-2019会议，组织了第一届跨领域句法分析评测(Peng et al., 2019)，针对“单源零样本”和“单源少样本”领域移植场景，发布了CODT1.0数据集，包含4万句、对应4个领域。&lt;br /&gt;
今年，我们依托CCL-2021会议，组织第二届跨领域句法分析评测，针对“多源零样本”领域移植场景，发布CODT2.0数据集，包含7万句，对应6个领域。其中，通过错误检测和人工校正，CODT2.0与CODT1.0重合的数据的质量进一步提升。&lt;br /&gt;
&lt;br /&gt;
== '''数据设置''' ==&lt;br /&gt;
在本次评测任务中，我们提供约29K句平衡语料（BC）、9K句产品博客（PB）、10K句产品评论（PC）、8K句财经资讯（FIN）、8K句法律资讯（LEG）和3K句网络小说（ZX）六个领域的数据。其中BC作为基础数据，只作为源领域。后五个领域既可以作为源领域，也可以作为目标领域。另外，针对后五个领域，我们还提供了大规模的无标注数据。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align: center;&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
!      !! train !! dev  !! test !! unlabeled&lt;br /&gt;
|-&lt;br /&gt;
| BC   || 26.1K || 1K  || 2K ||   0     &lt;br /&gt;
|-&lt;br /&gt;
| PB   || 5K  || 1.3K || 2.5K || 291K&lt;br /&gt;
|-&lt;br /&gt;
| PC   || 6.8K  || 1.3K || 2.6K || 349K&lt;br /&gt;
|-&lt;br /&gt;
| FIN   || 5K  || 1K  || 1.8K || 118K&lt;br /&gt;
|-&lt;br /&gt;
| LEG   || 5K  || 1K  || 1.9K || 150K &lt;br /&gt;
|-&lt;br /&gt;
| ZX   || 1.5K  || 0.5K  || 1K || 33K&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== '''任务设置''' ==&lt;br /&gt;
本次评测分为两个赛道:&lt;br /&gt;
&lt;br /&gt;
(Closed)：多源零样本领域移植（封闭）&lt;br /&gt;
&lt;br /&gt;
(Open)：多源零样本领域移植（开放）&lt;br /&gt;
&lt;br /&gt;
含义如下：&lt;br /&gt;
* '''多源的含义'''：可以使用其他领域的训练数据作为源领域数据。例如，当目标领域为ZX时，可以使用其他五个领域（包括BC）的训练数据，即BC/PB/PC/FIN/LEG-Train。&lt;br /&gt;
* '''零样本的含义'''：不能使用对应领域的训练数据。例如，当目标领域为ZX时，那么ZX-Train不可作为训练数据使用。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* '''Closed赛道的要求'''：&lt;br /&gt;
1）	只能使用我们提供的数据和信息，包括：所有数据我们都提供分词、自动词性；我们会提供pre-trained word embedding (在Chinese Gigaword 3和所有领域Train/Unlabeled数据上训练word2vec得到)。&lt;br /&gt;
&lt;br /&gt;
2）	不可以使用其他开源工具得到新的信息，如词性、词义等特征。&lt;br /&gt;
&lt;br /&gt;
3）	不可以使用其他的资源，如词典、句法语义树库等。&lt;br /&gt;
&lt;br /&gt;
4）	不可以使用大规模无标注数据上训练的预训练语言模型（任何开源的通用语言模型），但是可以通过预训练语言模型的技术来使用我们提供的无标注数据。即可以使用在我们提供的有标注和无标注数据上从头开始训练预训练模型。&lt;br /&gt;
&lt;br /&gt;
5）	不可以使用NLPCC-2019 CODT1.0的数据。&lt;br /&gt;
&lt;br /&gt;
* '''Open赛道的要求'''：&lt;br /&gt;
&lt;br /&gt;
1）	可以使用任何可通过某种公开方式获取（包括购买）的数据、资源或工具。但是建议参赛者在系统报告中明确说明使用的外部资源以及这些外部资源对性能的影响。&lt;br /&gt;
&lt;br /&gt;
* '''注意事项'''&lt;br /&gt;
1）	开发集的使用：不允许将Dev加入到训练数据中。Dev数据只可以用来调参和选择模型。&lt;br /&gt;
&lt;br /&gt;
2）	无标注数据（Unlabeled）的使用：不限制。同时，6个领域的Train中的句子，只要不使用句法标注信息，也都可以作为无标注数据使用。&lt;br /&gt;
&lt;br /&gt;
3）	预训练语言模型微调：我们将Google发布的bert-base-chinese在所有无标注数据（6个领域的Train，5个领域的Unlabeled数据）进行多轮微调（3轮或10轮），即继续使用语言模型损失函数继续训练。这个模型仅限于Open赛道上的系统使用。我们做这个事情的目的是方便大家试试这个方向，避免大家浪费资源，重复训练。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''如果您对规则有疑问，请随时联系我们确认。如果违反规则，发现后，成绩会直接取消。'''&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3767</id>
		<title>CCL2021</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3767"/>
		<updated>2021-04-02T09:00:43Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* CCL-2021依存句法分析领域移植评测 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== '''CCL-2021依存句法分析领域移植评测''' ==&lt;br /&gt;
* [http://cips-cl.org/static/CCL2021/cclEval/taskEvaluation/index.html CCL-2021评测页面]&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/2/26/%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v4.0.pdf 我们的参赛邀请函pdf]&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;[https://docs.qq.com/form/page/DWHltVGFCcmFQVG5h?createTS=1617351588079&amp;amp;templateId=25000#/fill 报名表]。&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== '''评测日程''' ==&lt;br /&gt;
2021.4.1-4.30 开始报名&lt;br /&gt;
&lt;br /&gt;
2021.4.15 公布相关数据&lt;br /&gt;
&lt;br /&gt;
2021.5.1 公布测试集&lt;br /&gt;
&lt;br /&gt;
2021.5.15 公布有答案的测试集&lt;br /&gt;
&lt;br /&gt;
2021.6.15 提交截止&lt;br /&gt;
&lt;br /&gt;
2021.7.31 评测结果发布&lt;br /&gt;
&lt;br /&gt;
== '''评测奖金''' ==&lt;br /&gt;
受中国中文信息学会资助，本次评测设置了2万元奖金，每个赛道各1万元&lt;br /&gt;
&lt;br /&gt;
第一名：5000元&lt;br /&gt;
&lt;br /&gt;
第二名：3000元&lt;br /&gt;
&lt;br /&gt;
第三名：2000元&lt;br /&gt;
&lt;br /&gt;
== '''评测数据下载''' ==&lt;br /&gt;
'''数据使用协议'''&lt;br /&gt;
&lt;br /&gt;
下载数据前需要签署数据使用协议，在收到数据使用协议后我们会发给您解压密码。&lt;br /&gt;
&amp;lt;!--请您仔细阅读如下两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学（z641295453@163.com）--&amp;gt;&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/c/c1/Codt-sharing-agreement-2021.3-v1.pdf CODT2.0数据使用协议下载]（团队负责人签字，如果是公司，必须是公司法人签字）&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/alibaba-unlabeled-data-share-2019.4.4.doc PB-PC-unlabeled数据使用协议下载] (机构、学院、学校或公司盖章）&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请仔细阅读两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学(z641295453@163.com)&amp;lt;/font&amp;gt;&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请用机构的官方邮箱发送协议&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;由于版权保护问题，我们只面向机构、单位等团体开放数据；对于公司，我们仅面向从事句法分析研究的公司开放数据，签署协议前请先咨询我们是否有可能共享数据；解释权归我们课题组。&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;如果您不需要无标注数据，那么只需要签署标注数据使用协议。&amp;lt;/font&amp;gt;&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;您还需要填写[https://docs.qq.com/form/page/DWHltVGFCcmFQVG5h?createTS=1617351588079&amp;amp;templateId=25000#/fill 报名表]。&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''训练集/开发集/无标注数据下载'''&lt;br /&gt;
&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/CCL2021_data_readme 数据说明Readme]&lt;br /&gt;
* 训练集/开发集/无标注数据&lt;br /&gt;
** [ 训练集开发集数据 下载]&lt;br /&gt;
** [ ZX、FIN、LEG无标注数据 下载]&lt;br /&gt;
** [ PB、PC无标注数据 下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''预训练词向量下载'''&lt;br /&gt;
&lt;br /&gt;
我们分别提供了50维、100维、300维的预训练词向量&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''fine-tune-bert下载'''&lt;br /&gt;
&lt;br /&gt;
我们提供了在bert-base-chinese上微调3轮的结果&lt;br /&gt;
&lt;br /&gt;
== '''评价脚本下载''' ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/evaluate.py 评价脚本下载]&lt;br /&gt;
** 执行命令：python3 evaluate.py gold.conll sys.conll&lt;br /&gt;
** 数据集需要为CoNLL格式，与我们提供的数据集格式相同。&lt;br /&gt;
&lt;br /&gt;
== '''评测背景''' ==&lt;br /&gt;
近年来，随着深度学习技术的发展，尤其是预训练语言模型ELMo/BERT的提出，封闭领域规范文本上的句法分析性能已经达到了比较高的水平。但是，在跨领域文本，尤其是不规范的网络文本上，句法分析的性能会急剧下降。同时，如何在深度学习模型中利用结构化的句法信息也是NLP领域的重要研究问题之一，但是受到真实文本上句法性能的限制。因此，领域移植问题已经成为句法分析研究的重要挑战。为了更充分地支持句法分析领域移植研究，我们自2017年起标注了多领域句法数据集，并命名为汉语开放依存树库（CODT），目前包含16万句，涵盖10多个领域或来源的文本。2019年，我们依托NLPCC-2019会议，组织了第一届跨领域句法分析评测(Peng et al., 2019)，针对“单源零样本”和“单源少样本”领域移植场景，发布了CODT1.0数据集，包含4万句、对应4个领域。&lt;br /&gt;
今年，我们依托CCL-2021会议，组织第二届跨领域句法分析评测，针对“多源零样本”领域移植场景，发布CODT2.0数据集，包含7万句，对应6个领域。其中，通过错误检测和人工校正，CODT2.0与CODT1.0重合的数据的质量进一步提升。&lt;br /&gt;
&lt;br /&gt;
== '''数据设置''' ==&lt;br /&gt;
在本次评测任务中，我们提供约29K句平衡语料（BC）、9K句产品博客（PB）、10K句产品评论（PC）、8K句财经资讯（FIN）、8K句法律资讯（LEG）和3K句网络小说（ZX）六个领域的数据。其中BC作为基础数据，只作为源领域。后五个领域既可以作为源领域，也可以作为目标领域。另外，针对后五个领域，我们还提供了大规模的无标注数据。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align: center;&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
!      !! train !! dev  !! test !! unlabeled&lt;br /&gt;
|-&lt;br /&gt;
| BC   || 26.1K || 1K  || 2K ||   0     &lt;br /&gt;
|-&lt;br /&gt;
| PB   || 5K  || 1.3K || 2.5K || 291K&lt;br /&gt;
|-&lt;br /&gt;
| PC   || 6.8K  || 1.3K || 2.6K || 349K&lt;br /&gt;
|-&lt;br /&gt;
| FIN   || 5K  || 1K  || 1.8K || 118K&lt;br /&gt;
|-&lt;br /&gt;
| LEG   || 5K  || 1K  || 1.9K || 150K &lt;br /&gt;
|-&lt;br /&gt;
| ZX   || 1.5K  || 0.5K  || 1K || 33K&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== '''任务设置''' ==&lt;br /&gt;
本次评测分为两个赛道:&lt;br /&gt;
&lt;br /&gt;
(Closed)：多源零样本领域移植（封闭）&lt;br /&gt;
&lt;br /&gt;
(Open)：多源零样本领域移植（开放）&lt;br /&gt;
&lt;br /&gt;
含义如下：&lt;br /&gt;
* '''多源的含义'''：可以使用其他领域的训练数据作为源领域数据。例如，当目标领域为ZX时，可以使用其他五个领域（包括BC）的训练数据，即BC/PB/PC/FIN/LEG-Train。&lt;br /&gt;
* '''零样本的含义'''：不能使用对应领域的训练数据。例如，当目标领域为ZX时，那么ZX-Train不可作为训练数据使用。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* '''Closed赛道的要求'''：&lt;br /&gt;
1）	只能使用我们提供的数据和信息，包括：所有数据我们都提供分词、自动词性；我们会提供pre-trained word embedding (在Chinese Gigaword 3和所有领域Train/Unlabeled数据上训练word2vec得到)。&lt;br /&gt;
&lt;br /&gt;
2）	不可以使用其他开源工具得到新的信息，如词性、词义等特征。&lt;br /&gt;
&lt;br /&gt;
3）	不可以使用其他的资源，如词典、句法语义树库等。&lt;br /&gt;
&lt;br /&gt;
4）	不可以使用大规模无标注数据上训练的预训练语言模型（任何开源的通用语言模型），但是可以通过预训练语言模型的技术来使用我们提供的无标注数据。即可以使用在我们提供的有标注和无标注数据上从头开始训练预训练模型。&lt;br /&gt;
&lt;br /&gt;
5）	不可以使用NLPCC-2019 CODT1.0的数据。&lt;br /&gt;
&lt;br /&gt;
* '''Open赛道的要求'''：&lt;br /&gt;
&lt;br /&gt;
1）	可以使用任何可通过某种公开方式获取（包括购买）的数据、资源或工具。但是建议参赛者在系统报告中明确说明使用的外部资源以及这些外部资源对性能的影响。&lt;br /&gt;
&lt;br /&gt;
* '''注意事项'''&lt;br /&gt;
1）	开发集的使用：不允许将Dev加入到训练数据中。Dev数据只可以用来调参和选择模型。&lt;br /&gt;
&lt;br /&gt;
2）	无标注数据（Unlabeled）的使用：不限制。同时，6个领域的Train中的句子，只要不使用句法标注信息，也都可以作为无标注数据使用。&lt;br /&gt;
&lt;br /&gt;
3）	预训练语言模型微调：我们将Google发布的bert-base-chinese在所有无标注数据（6个领域的Train，5个领域的Unlabeled数据）进行多轮微调（3轮或10轮），即继续使用语言模型损失函数继续训练。这个模型仅限于Open赛道上的系统使用。我们做这个事情的目的是方便大家试试这个方向，避免大家浪费资源，重复训练。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''如果您对规则有疑问，请随时联系我们确认。如果违反规则，发现后，成绩会直接取消。'''&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3766</id>
		<title>CCL2021</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3766"/>
		<updated>2021-04-02T08:59:52Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* 评测数据下载 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== '''CCL-2021依存句法分析领域移植评测''' ==&lt;br /&gt;
* [http://cips-cl.org/static/CCL2021/cclEval/taskEvaluation/index.html CCL-2021评测页面]&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/2/26/%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v4.0.pdf 我们的参赛邀请函pdf]&lt;br /&gt;
&lt;br /&gt;
== '''评测日程''' ==&lt;br /&gt;
2021.4.1-4.30 开始报名&lt;br /&gt;
&lt;br /&gt;
2021.4.15 公布相关数据&lt;br /&gt;
&lt;br /&gt;
2021.5.1 公布测试集&lt;br /&gt;
&lt;br /&gt;
2021.5.15 公布有答案的测试集&lt;br /&gt;
&lt;br /&gt;
2021.6.15 提交截止&lt;br /&gt;
&lt;br /&gt;
2021.7.31 评测结果发布&lt;br /&gt;
&lt;br /&gt;
== '''评测奖金''' ==&lt;br /&gt;
受中国中文信息学会资助，本次评测设置了2万元奖金，每个赛道各1万元&lt;br /&gt;
&lt;br /&gt;
第一名：5000元&lt;br /&gt;
&lt;br /&gt;
第二名：3000元&lt;br /&gt;
&lt;br /&gt;
第三名：2000元&lt;br /&gt;
&lt;br /&gt;
== '''评测数据下载''' ==&lt;br /&gt;
'''数据使用协议'''&lt;br /&gt;
&lt;br /&gt;
下载数据前需要签署数据使用协议，在收到数据使用协议后我们会发给您解压密码。&lt;br /&gt;
&amp;lt;!--请您仔细阅读如下两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学（z641295453@163.com）--&amp;gt;&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/c/c1/Codt-sharing-agreement-2021.3-v1.pdf CODT2.0数据使用协议下载]（团队负责人签字，如果是公司，必须是公司法人签字）&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/alibaba-unlabeled-data-share-2019.4.4.doc PB-PC-unlabeled数据使用协议下载] (机构、学院、学校或公司盖章）&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请仔细阅读两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学(z641295453@163.com)&amp;lt;/font&amp;gt;&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请用机构的官方邮箱发送协议&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;由于版权保护问题，我们只面向机构、单位等团体开放数据；对于公司，我们仅面向从事句法分析研究的公司开放数据，签署协议前请先咨询我们是否有可能共享数据；解释权归我们课题组。&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;如果您不需要无标注数据，那么只需要签署标注数据使用协议。&amp;lt;/font&amp;gt;&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;您还需要填写[https://docs.qq.com/form/page/DWHltVGFCcmFQVG5h?createTS=1617351588079&amp;amp;templateId=25000#/fill 报名表]。&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''训练集/开发集/无标注数据下载'''&lt;br /&gt;
&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/CCL2021_data_readme 数据说明Readme]&lt;br /&gt;
* 训练集/开发集/无标注数据&lt;br /&gt;
** [ 训练集开发集数据 下载]&lt;br /&gt;
** [ ZX、FIN、LEG无标注数据 下载]&lt;br /&gt;
** [ PB、PC无标注数据 下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''预训练词向量下载'''&lt;br /&gt;
&lt;br /&gt;
我们分别提供了50维、100维、300维的预训练词向量&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''fine-tune-bert下载'''&lt;br /&gt;
&lt;br /&gt;
我们提供了在bert-base-chinese上微调3轮的结果&lt;br /&gt;
&lt;br /&gt;
== '''评价脚本下载''' ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/evaluate.py 评价脚本下载]&lt;br /&gt;
** 执行命令：python3 evaluate.py gold.conll sys.conll&lt;br /&gt;
** 数据集需要为CoNLL格式，与我们提供的数据集格式相同。&lt;br /&gt;
&lt;br /&gt;
== '''评测背景''' ==&lt;br /&gt;
近年来，随着深度学习技术的发展，尤其是预训练语言模型ELMo/BERT的提出，封闭领域规范文本上的句法分析性能已经达到了比较高的水平。但是，在跨领域文本，尤其是不规范的网络文本上，句法分析的性能会急剧下降。同时，如何在深度学习模型中利用结构化的句法信息也是NLP领域的重要研究问题之一，但是受到真实文本上句法性能的限制。因此，领域移植问题已经成为句法分析研究的重要挑战。为了更充分地支持句法分析领域移植研究，我们自2017年起标注了多领域句法数据集，并命名为汉语开放依存树库（CODT），目前包含16万句，涵盖10多个领域或来源的文本。2019年，我们依托NLPCC-2019会议，组织了第一届跨领域句法分析评测(Peng et al., 2019)，针对“单源零样本”和“单源少样本”领域移植场景，发布了CODT1.0数据集，包含4万句、对应4个领域。&lt;br /&gt;
今年，我们依托CCL-2021会议，组织第二届跨领域句法分析评测，针对“多源零样本”领域移植场景，发布CODT2.0数据集，包含7万句，对应6个领域。其中，通过错误检测和人工校正，CODT2.0与CODT1.0重合的数据的质量进一步提升。&lt;br /&gt;
&lt;br /&gt;
== '''数据设置''' ==&lt;br /&gt;
在本次评测任务中，我们提供约29K句平衡语料（BC）、9K句产品博客（PB）、10K句产品评论（PC）、8K句财经资讯（FIN）、8K句法律资讯（LEG）和3K句网络小说（ZX）六个领域的数据。其中BC作为基础数据，只作为源领域。后五个领域既可以作为源领域，也可以作为目标领域。另外，针对后五个领域，我们还提供了大规模的无标注数据。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align: center;&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
!      !! train !! dev  !! test !! unlabeled&lt;br /&gt;
|-&lt;br /&gt;
| BC   || 26.1K || 1K  || 2K ||   0     &lt;br /&gt;
|-&lt;br /&gt;
| PB   || 5K  || 1.3K || 2.5K || 291K&lt;br /&gt;
|-&lt;br /&gt;
| PC   || 6.8K  || 1.3K || 2.6K || 349K&lt;br /&gt;
|-&lt;br /&gt;
| FIN   || 5K  || 1K  || 1.8K || 118K&lt;br /&gt;
|-&lt;br /&gt;
| LEG   || 5K  || 1K  || 1.9K || 150K &lt;br /&gt;
|-&lt;br /&gt;
| ZX   || 1.5K  || 0.5K  || 1K || 33K&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== '''任务设置''' ==&lt;br /&gt;
本次评测分为两个赛道:&lt;br /&gt;
&lt;br /&gt;
(Closed)：多源零样本领域移植（封闭）&lt;br /&gt;
&lt;br /&gt;
(Open)：多源零样本领域移植（开放）&lt;br /&gt;
&lt;br /&gt;
含义如下：&lt;br /&gt;
* '''多源的含义'''：可以使用其他领域的训练数据作为源领域数据。例如，当目标领域为ZX时，可以使用其他五个领域（包括BC）的训练数据，即BC/PB/PC/FIN/LEG-Train。&lt;br /&gt;
* '''零样本的含义'''：不能使用对应领域的训练数据。例如，当目标领域为ZX时，那么ZX-Train不可作为训练数据使用。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* '''Closed赛道的要求'''：&lt;br /&gt;
1）	只能使用我们提供的数据和信息，包括：所有数据我们都提供分词、自动词性；我们会提供pre-trained word embedding (在Chinese Gigaword 3和所有领域Train/Unlabeled数据上训练word2vec得到)。&lt;br /&gt;
&lt;br /&gt;
2）	不可以使用其他开源工具得到新的信息，如词性、词义等特征。&lt;br /&gt;
&lt;br /&gt;
3）	不可以使用其他的资源，如词典、句法语义树库等。&lt;br /&gt;
&lt;br /&gt;
4）	不可以使用大规模无标注数据上训练的预训练语言模型（任何开源的通用语言模型），但是可以通过预训练语言模型的技术来使用我们提供的无标注数据。即可以使用在我们提供的有标注和无标注数据上从头开始训练预训练模型。&lt;br /&gt;
&lt;br /&gt;
5）	不可以使用NLPCC-2019 CODT1.0的数据。&lt;br /&gt;
&lt;br /&gt;
* '''Open赛道的要求'''：&lt;br /&gt;
&lt;br /&gt;
1）	可以使用任何可通过某种公开方式获取（包括购买）的数据、资源或工具。但是建议参赛者在系统报告中明确说明使用的外部资源以及这些外部资源对性能的影响。&lt;br /&gt;
&lt;br /&gt;
* '''注意事项'''&lt;br /&gt;
1）	开发集的使用：不允许将Dev加入到训练数据中。Dev数据只可以用来调参和选择模型。&lt;br /&gt;
&lt;br /&gt;
2）	无标注数据（Unlabeled）的使用：不限制。同时，6个领域的Train中的句子，只要不使用句法标注信息，也都可以作为无标注数据使用。&lt;br /&gt;
&lt;br /&gt;
3）	预训练语言模型微调：我们将Google发布的bert-base-chinese在所有无标注数据（6个领域的Train，5个领域的Unlabeled数据）进行多轮微调（3轮或10轮），即继续使用语言模型损失函数继续训练。这个模型仅限于Open赛道上的系统使用。我们做这个事情的目的是方便大家试试这个方向，避免大家浪费资源，重复训练。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''如果您对规则有疑问，请随时联系我们确认。如果违反规则，发现后，成绩会直接取消。'''&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3765</id>
		<title>CCL2021</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3765"/>
		<updated>2021-04-02T08:58:10Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* 评测数据下载 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== '''CCL-2021依存句法分析领域移植评测''' ==&lt;br /&gt;
* [http://cips-cl.org/static/CCL2021/cclEval/taskEvaluation/index.html CCL-2021评测页面]&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/2/26/%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v4.0.pdf 我们的参赛邀请函pdf]&lt;br /&gt;
&lt;br /&gt;
== '''评测日程''' ==&lt;br /&gt;
2021.4.1-4.30 开始报名&lt;br /&gt;
&lt;br /&gt;
2021.4.15 公布相关数据&lt;br /&gt;
&lt;br /&gt;
2021.5.1 公布测试集&lt;br /&gt;
&lt;br /&gt;
2021.5.15 公布有答案的测试集&lt;br /&gt;
&lt;br /&gt;
2021.6.15 提交截止&lt;br /&gt;
&lt;br /&gt;
2021.7.31 评测结果发布&lt;br /&gt;
&lt;br /&gt;
== '''评测奖金''' ==&lt;br /&gt;
受中国中文信息学会资助，本次评测设置了2万元奖金，每个赛道各1万元&lt;br /&gt;
&lt;br /&gt;
第一名：5000元&lt;br /&gt;
&lt;br /&gt;
第二名：3000元&lt;br /&gt;
&lt;br /&gt;
第三名：2000元&lt;br /&gt;
&lt;br /&gt;
== '''评测数据下载''' ==&lt;br /&gt;
'''数据使用协议'''&lt;br /&gt;
&lt;br /&gt;
下载数据前需要签署数据使用协议，在收到数据使用协议后我们会发给您解压密码。&lt;br /&gt;
&amp;lt;!--请您仔细阅读如下两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学（z641295453@163.com）--&amp;gt;&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/c/c1/Codt-sharing-agreement-2021.3-v1.pdf CODT2.0数据使用协议下载]（团队负责人签字，如果是公司，必须是公司法人签字）&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/alibaba-unlabeled-data-share-2019.4.4.doc PB-PC-unlabeled数据使用协议下载] (机构、学院、学校或公司盖章）&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请仔细阅读两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学(z641295453@163.com)&amp;lt;/font&amp;gt;&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请用机构的官方邮箱发送协议&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;由于版权保护问题，我们只面向机构、单位等团体开放数据；对于公司，我们仅面向从事句法分析研究的公司开放数据，签署协议前请先咨询我们是否有可能共享数据；解释权归我们课题组。&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;如果您不需要无标注数据，那么只需要签署标注数据使用协议。&amp;lt;/font&amp;gt;&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;您还需要填写[https://docs.qq.com/form/page/DWHltVGFCcmFQVG5h?createTS=1617351588079&amp;amp;templateId=25000#/fill 报名表]。&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''训练集/开发集/无标注数据下载'''&lt;br /&gt;
&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/CCL2021_data_readme 数据说明Readme]&lt;br /&gt;
* 训练集/开发集/无标注数据&lt;br /&gt;
** [http://hlt.suda.edu.cn/images/2/26/Train_dev_2021.4.1.zip 训练集开发集数据 下载]&lt;br /&gt;
** [ ZX、FIN、LEG无标注数据 下载]&lt;br /&gt;
** [ PB、PC无标注数据 下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''预训练词向量下载'''&lt;br /&gt;
&lt;br /&gt;
我们分别提供了50维、100维、300维的预训练词向量&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''fine-tune-bert下载'''&lt;br /&gt;
&lt;br /&gt;
我们提供了在bert-base-chinese上微调3轮的结果&lt;br /&gt;
&lt;br /&gt;
== '''评价脚本下载''' ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/evaluate.py 评价脚本下载]&lt;br /&gt;
** 执行命令：python3 evaluate.py gold.conll sys.conll&lt;br /&gt;
** 数据集需要为CoNLL格式，与我们提供的数据集格式相同。&lt;br /&gt;
&lt;br /&gt;
== '''评测背景''' ==&lt;br /&gt;
近年来，随着深度学习技术的发展，尤其是预训练语言模型ELMo/BERT的提出，封闭领域规范文本上的句法分析性能已经达到了比较高的水平。但是，在跨领域文本，尤其是不规范的网络文本上，句法分析的性能会急剧下降。同时，如何在深度学习模型中利用结构化的句法信息也是NLP领域的重要研究问题之一，但是受到真实文本上句法性能的限制。因此，领域移植问题已经成为句法分析研究的重要挑战。为了更充分地支持句法分析领域移植研究，我们自2017年起标注了多领域句法数据集，并命名为汉语开放依存树库（CODT），目前包含16万句，涵盖10多个领域或来源的文本。2019年，我们依托NLPCC-2019会议，组织了第一届跨领域句法分析评测(Peng et al., 2019)，针对“单源零样本”和“单源少样本”领域移植场景，发布了CODT1.0数据集，包含4万句、对应4个领域。&lt;br /&gt;
今年，我们依托CCL-2021会议，组织第二届跨领域句法分析评测，针对“多源零样本”领域移植场景，发布CODT2.0数据集，包含7万句，对应6个领域。其中，通过错误检测和人工校正，CODT2.0与CODT1.0重合的数据的质量进一步提升。&lt;br /&gt;
&lt;br /&gt;
== '''数据设置''' ==&lt;br /&gt;
在本次评测任务中，我们提供约29K句平衡语料（BC）、9K句产品博客（PB）、10K句产品评论（PC）、8K句财经资讯（FIN）、8K句法律资讯（LEG）和3K句网络小说（ZX）六个领域的数据。其中BC作为基础数据，只作为源领域。后五个领域既可以作为源领域，也可以作为目标领域。另外，针对后五个领域，我们还提供了大规模的无标注数据。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align: center;&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
!      !! train !! dev  !! test !! unlabeled&lt;br /&gt;
|-&lt;br /&gt;
| BC   || 26.1K || 1K  || 2K ||   0     &lt;br /&gt;
|-&lt;br /&gt;
| PB   || 5K  || 1.3K || 2.5K || 291K&lt;br /&gt;
|-&lt;br /&gt;
| PC   || 6.8K  || 1.3K || 2.6K || 349K&lt;br /&gt;
|-&lt;br /&gt;
| FIN   || 5K  || 1K  || 1.8K || 118K&lt;br /&gt;
|-&lt;br /&gt;
| LEG   || 5K  || 1K  || 1.9K || 150K &lt;br /&gt;
|-&lt;br /&gt;
| ZX   || 1.5K  || 0.5K  || 1K || 33K&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== '''任务设置''' ==&lt;br /&gt;
本次评测分为两个赛道:&lt;br /&gt;
&lt;br /&gt;
(Closed)：多源零样本领域移植（封闭）&lt;br /&gt;
&lt;br /&gt;
(Open)：多源零样本领域移植（开放）&lt;br /&gt;
&lt;br /&gt;
含义如下：&lt;br /&gt;
* '''多源的含义'''：可以使用其他领域的训练数据作为源领域数据。例如，当目标领域为ZX时，可以使用其他五个领域（包括BC）的训练数据，即BC/PB/PC/FIN/LEG-Train。&lt;br /&gt;
* '''零样本的含义'''：不能使用对应领域的训练数据。例如，当目标领域为ZX时，那么ZX-Train不可作为训练数据使用。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* '''Closed赛道的要求'''：&lt;br /&gt;
1）	只能使用我们提供的数据和信息，包括：所有数据我们都提供分词、自动词性；我们会提供pre-trained word embedding (在Chinese Gigaword 3和所有领域Train/Unlabeled数据上训练word2vec得到)。&lt;br /&gt;
&lt;br /&gt;
2）	不可以使用其他开源工具得到新的信息，如词性、词义等特征。&lt;br /&gt;
&lt;br /&gt;
3）	不可以使用其他的资源，如词典、句法语义树库等。&lt;br /&gt;
&lt;br /&gt;
4）	不可以使用大规模无标注数据上训练的预训练语言模型（任何开源的通用语言模型），但是可以通过预训练语言模型的技术来使用我们提供的无标注数据。即可以使用在我们提供的有标注和无标注数据上从头开始训练预训练模型。&lt;br /&gt;
&lt;br /&gt;
5）	不可以使用NLPCC-2019 CODT1.0的数据。&lt;br /&gt;
&lt;br /&gt;
* '''Open赛道的要求'''：&lt;br /&gt;
&lt;br /&gt;
1）	可以使用任何可通过某种公开方式获取（包括购买）的数据、资源或工具。但是建议参赛者在系统报告中明确说明使用的外部资源以及这些外部资源对性能的影响。&lt;br /&gt;
&lt;br /&gt;
* '''注意事项'''&lt;br /&gt;
1）	开发集的使用：不允许将Dev加入到训练数据中。Dev数据只可以用来调参和选择模型。&lt;br /&gt;
&lt;br /&gt;
2）	无标注数据（Unlabeled）的使用：不限制。同时，6个领域的Train中的句子，只要不使用句法标注信息，也都可以作为无标注数据使用。&lt;br /&gt;
&lt;br /&gt;
3）	预训练语言模型微调：我们将Google发布的bert-base-chinese在所有无标注数据（6个领域的Train，5个领域的Unlabeled数据）进行多轮微调（3轮或10轮），即继续使用语言模型损失函数继续训练。这个模型仅限于Open赛道上的系统使用。我们做这个事情的目的是方便大家试试这个方向，避免大家浪费资源，重复训练。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''如果您对规则有疑问，请随时联系我们确认。如果违反规则，发现后，成绩会直接取消。'''&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3764</id>
		<title>CCL2021</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3764"/>
		<updated>2021-04-02T08:57:46Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* 评测数据下载 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== '''CCL-2021依存句法分析领域移植评测''' ==&lt;br /&gt;
* [http://cips-cl.org/static/CCL2021/cclEval/taskEvaluation/index.html CCL-2021评测页面]&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/2/26/%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v4.0.pdf 我们的参赛邀请函pdf]&lt;br /&gt;
&lt;br /&gt;
== '''评测日程''' ==&lt;br /&gt;
2021.4.1-4.30 开始报名&lt;br /&gt;
&lt;br /&gt;
2021.4.15 公布相关数据&lt;br /&gt;
&lt;br /&gt;
2021.5.1 公布测试集&lt;br /&gt;
&lt;br /&gt;
2021.5.15 公布有答案的测试集&lt;br /&gt;
&lt;br /&gt;
2021.6.15 提交截止&lt;br /&gt;
&lt;br /&gt;
2021.7.31 评测结果发布&lt;br /&gt;
&lt;br /&gt;
== '''评测奖金''' ==&lt;br /&gt;
受中国中文信息学会资助，本次评测设置了2万元奖金，每个赛道各1万元&lt;br /&gt;
&lt;br /&gt;
第一名：5000元&lt;br /&gt;
&lt;br /&gt;
第二名：3000元&lt;br /&gt;
&lt;br /&gt;
第三名：2000元&lt;br /&gt;
&lt;br /&gt;
== '''评测数据下载''' ==&lt;br /&gt;
'''数据使用协议'''&lt;br /&gt;
&lt;br /&gt;
下载数据前需要签署数据使用协议，在收到数据使用协议后我们会发给您解压密码。&lt;br /&gt;
&amp;lt;!--请您仔细阅读如下两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学（z641295453@163.com）--&amp;gt;&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/c/c1/Codt-sharing-agreement-2021.3-v1.pdf CODT2.0数据使用协议下载]（团队负责人签字，如果是公司，必须是公司法人签字）&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/alibaba-unlabeled-data-share-2019.4.4.doc PB-PC-unlabeled数据使用协议下载] (机构、学院、学校或公司盖章）&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请仔细阅读两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学(z641295453@163.com)&amp;lt;/font&amp;gt;&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请用机构的官方邮箱发送协议&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;由于版权保护问题，我们只面向机构、单位等团体开放数据；对于公司，我们仅面向从事句法分析研究的公司开放数据，签署协议前请先咨询我们是否有可能共享数据；解释权归我们课题组。&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;如果您不需要无标注数据，那么只需要签署标注数据使用协议。&amp;lt;/font&amp;gt;&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;您还需要填写[【腾讯文档】CCL2021-跨领域句法分析评测https://docs.qq.com/form/page/DWHltVGFCcmFQVG5h?_w_tencentdocx_form=1 报名表]。&amp;lt;/font&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''训练集/开发集/无标注数据下载'''&lt;br /&gt;
&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/CCL2021_data_readme 数据说明Readme]&lt;br /&gt;
* 训练集/开发集/无标注数据&lt;br /&gt;
** [http://hlt.suda.edu.cn/images/2/26/Train_dev_2021.4.1.zip 训练集开发集数据 下载]&lt;br /&gt;
** [ ZX、FIN、LEG无标注数据 下载]&lt;br /&gt;
** [ PB、PC无标注数据 下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''预训练词向量下载'''&lt;br /&gt;
&lt;br /&gt;
我们分别提供了50维、100维、300维的预训练词向量&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''fine-tune-bert下载'''&lt;br /&gt;
&lt;br /&gt;
我们提供了在bert-base-chinese上微调3轮的结果&lt;br /&gt;
&lt;br /&gt;
== '''评价脚本下载''' ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/evaluate.py 评价脚本下载]&lt;br /&gt;
** 执行命令：python3 evaluate.py gold.conll sys.conll&lt;br /&gt;
** 数据集需要为CoNLL格式，与我们提供的数据集格式相同。&lt;br /&gt;
&lt;br /&gt;
== '''评测背景''' ==&lt;br /&gt;
近年来，随着深度学习技术的发展，尤其是预训练语言模型ELMo/BERT的提出，封闭领域规范文本上的句法分析性能已经达到了比较高的水平。但是，在跨领域文本，尤其是不规范的网络文本上，句法分析的性能会急剧下降。同时，如何在深度学习模型中利用结构化的句法信息也是NLP领域的重要研究问题之一，但是受到真实文本上句法性能的限制。因此，领域移植问题已经成为句法分析研究的重要挑战。为了更充分地支持句法分析领域移植研究，我们自2017年起标注了多领域句法数据集，并命名为汉语开放依存树库（CODT），目前包含16万句，涵盖10多个领域或来源的文本。2019年，我们依托NLPCC-2019会议，组织了第一届跨领域句法分析评测(Peng et al., 2019)，针对“单源零样本”和“单源少样本”领域移植场景，发布了CODT1.0数据集，包含4万句、对应4个领域。&lt;br /&gt;
今年，我们依托CCL-2021会议，组织第二届跨领域句法分析评测，针对“多源零样本”领域移植场景，发布CODT2.0数据集，包含7万句，对应6个领域。其中，通过错误检测和人工校正，CODT2.0与CODT1.0重合的数据的质量进一步提升。&lt;br /&gt;
&lt;br /&gt;
== '''数据设置''' ==&lt;br /&gt;
在本次评测任务中，我们提供约29K句平衡语料（BC）、9K句产品博客（PB）、10K句产品评论（PC）、8K句财经资讯（FIN）、8K句法律资讯（LEG）和3K句网络小说（ZX）六个领域的数据。其中BC作为基础数据，只作为源领域。后五个领域既可以作为源领域，也可以作为目标领域。另外，针对后五个领域，我们还提供了大规模的无标注数据。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align: center;&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
!      !! train !! dev  !! test !! unlabeled&lt;br /&gt;
|-&lt;br /&gt;
| BC   || 26.1K || 1K  || 2K ||   0     &lt;br /&gt;
|-&lt;br /&gt;
| PB   || 5K  || 1.3K || 2.5K || 291K&lt;br /&gt;
|-&lt;br /&gt;
| PC   || 6.8K  || 1.3K || 2.6K || 349K&lt;br /&gt;
|-&lt;br /&gt;
| FIN   || 5K  || 1K  || 1.8K || 118K&lt;br /&gt;
|-&lt;br /&gt;
| LEG   || 5K  || 1K  || 1.9K || 150K &lt;br /&gt;
|-&lt;br /&gt;
| ZX   || 1.5K  || 0.5K  || 1K || 33K&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== '''任务设置''' ==&lt;br /&gt;
本次评测分为两个赛道:&lt;br /&gt;
&lt;br /&gt;
(Closed)：多源零样本领域移植（封闭）&lt;br /&gt;
&lt;br /&gt;
(Open)：多源零样本领域移植（开放）&lt;br /&gt;
&lt;br /&gt;
含义如下：&lt;br /&gt;
* '''多源的含义'''：可以使用其他领域的训练数据作为源领域数据。例如，当目标领域为ZX时，可以使用其他五个领域（包括BC）的训练数据，即BC/PB/PC/FIN/LEG-Train。&lt;br /&gt;
* '''零样本的含义'''：不能使用对应领域的训练数据。例如，当目标领域为ZX时，那么ZX-Train不可作为训练数据使用。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* '''Closed赛道的要求'''：&lt;br /&gt;
1）	只能使用我们提供的数据和信息，包括：所有数据我们都提供分词、自动词性；我们会提供pre-trained word embedding (在Chinese Gigaword 3和所有领域Train/Unlabeled数据上训练word2vec得到)。&lt;br /&gt;
&lt;br /&gt;
2）	不可以使用其他开源工具得到新的信息，如词性、词义等特征。&lt;br /&gt;
&lt;br /&gt;
3）	不可以使用其他的资源，如词典、句法语义树库等。&lt;br /&gt;
&lt;br /&gt;
4）	不可以使用大规模无标注数据上训练的预训练语言模型（任何开源的通用语言模型），但是可以通过预训练语言模型的技术来使用我们提供的无标注数据。即可以使用在我们提供的有标注和无标注数据上从头开始训练预训练模型。&lt;br /&gt;
&lt;br /&gt;
5）	不可以使用NLPCC-2019 CODT1.0的数据。&lt;br /&gt;
&lt;br /&gt;
* '''Open赛道的要求'''：&lt;br /&gt;
&lt;br /&gt;
1）	可以使用任何可通过某种公开方式获取（包括购买）的数据、资源或工具。但是建议参赛者在系统报告中明确说明使用的外部资源以及这些外部资源对性能的影响。&lt;br /&gt;
&lt;br /&gt;
* '''注意事项'''&lt;br /&gt;
1）	开发集的使用：不允许将Dev加入到训练数据中。Dev数据只可以用来调参和选择模型。&lt;br /&gt;
&lt;br /&gt;
2）	无标注数据（Unlabeled）的使用：不限制。同时，6个领域的Train中的句子，只要不使用句法标注信息，也都可以作为无标注数据使用。&lt;br /&gt;
&lt;br /&gt;
3）	预训练语言模型微调：我们将Google发布的bert-base-chinese在所有无标注数据（6个领域的Train，5个领域的Unlabeled数据）进行多轮微调（3轮或10轮），即继续使用语言模型损失函数继续训练。这个模型仅限于Open赛道上的系统使用。我们做这个事情的目的是方便大家试试这个方向，避免大家浪费资源，重复训练。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''如果您对规则有疑问，请随时联系我们确认。如果违反规则，发现后，成绩会直接取消。'''&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3760</id>
		<title>CCL2021</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3760"/>
		<updated>2021-04-02T07:54:06Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* 评测数据下载 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== '''CCL-2021依存句法分析领域移植评测''' ==&lt;br /&gt;
* [http://cips-cl.org/static/CCL2021/cclEval/tasks/index.html CCL-2021评测页面]&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/2/26/%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v4.0.pdf 我们的参赛邀请函pdf]&lt;br /&gt;
&lt;br /&gt;
== '''评测日程''' ==&lt;br /&gt;
2021.4.1 开始并公布训练集、开发集、无标注数据&lt;br /&gt;
&lt;br /&gt;
2021.** 公布无答案测试集&lt;br /&gt;
&lt;br /&gt;
2021.** 公布有答案的测试集&lt;br /&gt;
&lt;br /&gt;
2021.** 提交截止&lt;br /&gt;
&lt;br /&gt;
2021.** 公布结果&lt;br /&gt;
&lt;br /&gt;
2021.7.1 评测结束&lt;br /&gt;
&lt;br /&gt;
== '''评测奖金''' ==&lt;br /&gt;
受中国中文信息学会资助，本次评测设置了2万元奖金，每个赛道各1万元&lt;br /&gt;
&lt;br /&gt;
第一名：5000元&lt;br /&gt;
&lt;br /&gt;
第二名：3000元&lt;br /&gt;
&lt;br /&gt;
第三名：2000元&lt;br /&gt;
&lt;br /&gt;
== '''评测数据下载''' ==&lt;br /&gt;
'''数据使用协议'''&lt;br /&gt;
&lt;br /&gt;
下载数据前需要签署数据使用协议，在收到数据使用协议后我们会发给您解压密码。&lt;br /&gt;
&amp;lt;!--请您仔细阅读如下两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学（z641295453@163.com）--&amp;gt;&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/c/c1/Codt-sharing-agreement-2021.3-v1.pdf CODT2.0数据使用协议下载]（团队负责人签字，如果是公司，必须是公司法人签字）&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/alibaba-unlabeled-data-share-2019.4.4.doc PB-PC-unlabeled数据使用协议下载] (机构、学院、学校或公司盖章）&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请仔细阅读两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学(z641295453@163.com)&amp;lt;/font&amp;gt;&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请用机构的官方邮箱发送协议&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;由于版权保护问题，我们只面向机构、单位等团体开放数据；对于公司，我们仅面向从事句法分析研究的公司开放数据，签署协议前请先咨询我们是否有可能共享数据；解释权归我们课题组。&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;如果您不需要无标注数据，那么只需要签署标注数据使用协议。&amp;lt;/font&amp;gt;&lt;br /&gt;
&amp;lt;!--* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;您还需要【评测报名表】也请同时发给周明月同学。&amp;lt;/font&amp;gt;--&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''训练集/开发集/无标注数据下载'''&lt;br /&gt;
&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/CCL2021_data_readme 数据说明Readme]&lt;br /&gt;
* 训练集/开发集/无标注数据&lt;br /&gt;
** [http://hlt.suda.edu.cn/images/2/26/Train_dev_2021.4.1.zip 训练集开发集数据 下载]&lt;br /&gt;
** [ ZX、FIN、LEG无标注数据 下载]&lt;br /&gt;
** [ PB、PC无标注数据 下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''预训练词向量下载'''&lt;br /&gt;
&lt;br /&gt;
我们分别提供了50维、100维、300维的预训练词向量&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''fine-tune-bert下载'''&lt;br /&gt;
&lt;br /&gt;
我们提供了在bert-base-chinese上微调3轮的结果&lt;br /&gt;
&lt;br /&gt;
== '''评价脚本下载''' ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/evaluate.py 评价脚本下载]&lt;br /&gt;
** 执行命令：python3 evaluate.py gold.conll sys.conll&lt;br /&gt;
** 数据集需要为CoNLL格式，与我们提供的数据集格式相同。&lt;br /&gt;
&lt;br /&gt;
== '''评测背景''' ==&lt;br /&gt;
近年来，随着深度学习技术的发展，尤其是预训练语言模型ELMo/BERT的提出，封闭领域规范文本上的句法分析性能已经达到了比较高的水平。但是，在跨领域文本，尤其是不规范的网络文本上，句法分析的性能会急剧下降。同时，如何在深度学习模型中利用结构化的句法信息也是NLP领域的重要研究问题之一，但是受到真实文本上句法性能的限制。因此，领域移植问题已经成为句法分析研究的重要挑战。为了更充分地支持句法分析领域移植研究，我们自2017年起标注了多领域句法数据集，并命名为汉语开放依存树库（CODT），目前包含16万句，涵盖10多个领域或来源的文本。2019年，我们依托NLPCC-2019会议，组织了第一届跨领域句法分析评测(Peng et al., 2019)，针对“单源零样本”和“单源少样本”领域移植场景，发布了CODT1.0数据集，包含4万句、对应4个领域。&lt;br /&gt;
今年，我们依托CCL-2021会议，组织第二届跨领域句法分析评测，针对“多源零样本”领域移植场景，发布CODT2.0数据集，包含7万句，对应6个领域。其中，通过错误检测和人工校正，CODT2.0与CODT1.0重合的数据的质量进一步提升。&lt;br /&gt;
&lt;br /&gt;
== '''数据设置''' ==&lt;br /&gt;
在本次评测任务中，我们提供约29K句平衡语料（BC）、9K句产品博客（PB）、10K句产品评论（PC）、8K句财经资讯（FIN）、8K句法律资讯（LEG）和3K句网络小说（ZX）六个领域的数据。其中BC作为基础数据，只作为源领域。后五个领域既可以作为源领域，也可以作为目标领域。另外，针对后五个领域，我们还提供了大规模的无标注数据。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align: center;&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
!      !! train !! dev  !! test !! unlabeled&lt;br /&gt;
|-&lt;br /&gt;
| BC   || 26.1K || 1K  || 2K ||   0     &lt;br /&gt;
|-&lt;br /&gt;
| PB   || 5K  || 1.3K || 2.5K || 291K&lt;br /&gt;
|-&lt;br /&gt;
| PC   || 6.8K  || 1.3K || 2.6K || 349K&lt;br /&gt;
|-&lt;br /&gt;
| FIN   || 5K  || 1K  || 1.8K || 118K&lt;br /&gt;
|-&lt;br /&gt;
| LEG   || 5K  || 1K  || 1.9K || 150K &lt;br /&gt;
|-&lt;br /&gt;
| ZX   || 1.5K  || 0.5K  || 1K || 33K&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== '''任务设置''' ==&lt;br /&gt;
本次评测分为两个赛道:&lt;br /&gt;
&lt;br /&gt;
(Closed)：多源零样本领域移植（封闭）&lt;br /&gt;
&lt;br /&gt;
(Open)：多源零样本领域移植（开放）&lt;br /&gt;
&lt;br /&gt;
含义如下：&lt;br /&gt;
* '''多源的含义'''：可以使用其他领域的训练数据作为源领域数据。例如，当目标领域为ZX时，可以使用其他五个领域（包括BC）的训练数据，即BC/PB/PC/FIN/LEG-Train。&lt;br /&gt;
* '''零样本的含义'''：不能使用对应领域的训练数据。例如，当目标领域为ZX时，那么ZX-Train不可作为训练数据使用。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* '''Closed赛道的要求'''：&lt;br /&gt;
1）	只能使用我们提供的数据和信息，包括：所有数据我们都提供分词、自动词性；我们会提供pre-trained word embedding (在Chinese Gigaword 3和所有领域Train/Unlabeled数据上训练word2vec得到)。&lt;br /&gt;
&lt;br /&gt;
2）	不可以使用其他开源工具得到新的信息，如词性、词义等特征。&lt;br /&gt;
&lt;br /&gt;
3）	不可以使用其他的资源，如词典、句法语义树库等。&lt;br /&gt;
&lt;br /&gt;
4）	不可以使用大规模无标注数据上训练的预训练语言模型（任何开源的通用语言模型），但是可以通过预训练语言模型的技术来使用我们提供的无标注数据。即可以使用在我们提供的有标注和无标注数据上从头开始训练预训练模型。&lt;br /&gt;
&lt;br /&gt;
5）	不可以使用NLPCC-2019 CODT1.0的数据。&lt;br /&gt;
&lt;br /&gt;
* '''Open赛道的要求'''：&lt;br /&gt;
&lt;br /&gt;
1）	可以使用任何可通过某种公开方式获取（包括购买）的数据、资源或工具。但是建议参赛者在系统报告中明确说明使用的外部资源以及这些外部资源对性能的影响。&lt;br /&gt;
&lt;br /&gt;
* '''注意事项'''&lt;br /&gt;
1）	开发集的使用：不允许将Dev加入到训练数据中。Dev数据只可以用来调参和选择模型。&lt;br /&gt;
&lt;br /&gt;
2）	无标注数据（Unlabeled）的使用：不限制。同时，6个领域的Train中的句子，只要不使用句法标注信息，也都可以作为无标注数据使用。&lt;br /&gt;
&lt;br /&gt;
3）	预训练语言模型微调：我们将Google发布的bert-base-chinese在所有无标注数据（6个领域的Train，5个领域的Unlabeled数据）进行多轮微调（3轮或10轮），即继续使用语言模型损失函数继续训练。这个模型仅限于Open赛道上的系统使用。我们做这个事情的目的是方便大家试试这个方向，避免大家浪费资源，重复训练。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''如果您对规则有疑问，请随时联系我们确认。如果违反规则，发现后，成绩会直接取消。'''&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3758</id>
		<title>CCL2021</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3758"/>
		<updated>2021-04-02T07:52:52Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* 评测数据下载 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== '''CCL-2021依存句法分析领域移植评测''' ==&lt;br /&gt;
* [http://cips-cl.org/static/CCL2021/cclEval/tasks/index.html CCL-2021评测页面]&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/2/26/%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v4.0.pdf 我们的参赛邀请函pdf]&lt;br /&gt;
&lt;br /&gt;
== '''评测日程''' ==&lt;br /&gt;
2021.4.1 开始并公布训练集、开发集、无标注数据&lt;br /&gt;
&lt;br /&gt;
2021.** 公布无答案测试集&lt;br /&gt;
&lt;br /&gt;
2021.** 公布有答案的测试集&lt;br /&gt;
&lt;br /&gt;
2021.** 提交截止&lt;br /&gt;
&lt;br /&gt;
2021.** 公布结果&lt;br /&gt;
&lt;br /&gt;
2021.7.1 评测结束&lt;br /&gt;
&lt;br /&gt;
== '''评测奖金''' ==&lt;br /&gt;
受中国中文信息学会资助，本次评测设置了2万元奖金，每个赛道各1万元&lt;br /&gt;
&lt;br /&gt;
第一名：5000元&lt;br /&gt;
&lt;br /&gt;
第二名：3000元&lt;br /&gt;
&lt;br /&gt;
第三名：2000元&lt;br /&gt;
&lt;br /&gt;
== '''评测数据下载''' ==&lt;br /&gt;
'''数据使用协议'''&lt;br /&gt;
&lt;br /&gt;
下载数据前需要签署数据使用协议，在收到数据使用协议后我们会发给您解压密码。&lt;br /&gt;
&amp;lt;!--请您仔细阅读如下两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学（z641295453@163.com）--&amp;gt;&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/c/c1/Codt-sharing-agreement-2021.3-v1.pdf CODT2.0数据使用协议下载]（团队负责人签字，如果是公司，必须是公司法人签字）&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/alibaba-unlabeled-data-share-2019.4.4.doc PB-PC-unlabeled数据使用协议下载] (机构、学院、学校或公司盖章）&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请仔细阅读两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学(z641295453@163.com)&amp;lt;/font&amp;gt;&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请用机构的官方邮箱发送协议&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;由于版权保护问题，我们只面向机构、单位等团体开放数据；对于公司，我们仅面向从事句法分析研究的公司开放数据，签署协议前请先咨询我们是否有可能共享数据；解释权归我们课题组。&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;如果您不需要无标注数据，那么只需要签署标注数据使用协议。&amp;lt;/font&amp;gt;&lt;br /&gt;
&amp;lt;!--* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;您还需要【评测报名表】也请同时发给周明月同学。&amp;lt;/font&amp;gt;--&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''训练集/开发集/无标注数据下载'''&lt;br /&gt;
&lt;br /&gt;
* [http://hlt.suda.edu.cn/index.php/CCL2021_data_readme 数据说明Readme]&lt;br /&gt;
* 训练集/开发集/无标注数据&lt;br /&gt;
** [ 训练集开发集数据 下载]&lt;br /&gt;
** [ ZX、FIN、LEG无标注数据 下载]&lt;br /&gt;
** [ PB、PC无标注数据 下载]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''预训练词向量下载'''&lt;br /&gt;
&lt;br /&gt;
我们分别提供了50维、100维、300维的预训练词向量&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''fine-tune-bert下载'''&lt;br /&gt;
&lt;br /&gt;
我们提供了在bert-base-chinese上微调3轮的结果&lt;br /&gt;
&lt;br /&gt;
== '''评价脚本下载''' ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/evaluate.py 评价脚本下载]&lt;br /&gt;
** 执行命令：python3 evaluate.py gold.conll sys.conll&lt;br /&gt;
** 数据集需要为CoNLL格式，与我们提供的数据集格式相同。&lt;br /&gt;
&lt;br /&gt;
== '''评测背景''' ==&lt;br /&gt;
近年来，随着深度学习技术的发展，尤其是预训练语言模型ELMo/BERT的提出，封闭领域规范文本上的句法分析性能已经达到了比较高的水平。但是，在跨领域文本，尤其是不规范的网络文本上，句法分析的性能会急剧下降。同时，如何在深度学习模型中利用结构化的句法信息也是NLP领域的重要研究问题之一，但是受到真实文本上句法性能的限制。因此，领域移植问题已经成为句法分析研究的重要挑战。为了更充分地支持句法分析领域移植研究，我们自2017年起标注了多领域句法数据集，并命名为汉语开放依存树库（CODT），目前包含16万句，涵盖10多个领域或来源的文本。2019年，我们依托NLPCC-2019会议，组织了第一届跨领域句法分析评测(Peng et al., 2019)，针对“单源零样本”和“单源少样本”领域移植场景，发布了CODT1.0数据集，包含4万句、对应4个领域。&lt;br /&gt;
今年，我们依托CCL-2021会议，组织第二届跨领域句法分析评测，针对“多源零样本”领域移植场景，发布CODT2.0数据集，包含7万句，对应6个领域。其中，通过错误检测和人工校正，CODT2.0与CODT1.0重合的数据的质量进一步提升。&lt;br /&gt;
&lt;br /&gt;
== '''数据设置''' ==&lt;br /&gt;
在本次评测任务中，我们提供约29K句平衡语料（BC）、9K句产品博客（PB）、10K句产品评论（PC）、8K句财经资讯（FIN）、8K句法律资讯（LEG）和3K句网络小说（ZX）六个领域的数据。其中BC作为基础数据，只作为源领域。后五个领域既可以作为源领域，也可以作为目标领域。另外，针对后五个领域，我们还提供了大规模的无标注数据。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align: center;&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
!      !! train !! dev  !! test !! unlabeled&lt;br /&gt;
|-&lt;br /&gt;
| BC   || 26.1K || 1K  || 2K ||   0     &lt;br /&gt;
|-&lt;br /&gt;
| PB   || 5K  || 1.3K || 2.5K || 291K&lt;br /&gt;
|-&lt;br /&gt;
| PC   || 6.8K  || 1.3K || 2.6K || 349K&lt;br /&gt;
|-&lt;br /&gt;
| FIN   || 5K  || 1K  || 1.8K || 118K&lt;br /&gt;
|-&lt;br /&gt;
| LEG   || 5K  || 1K  || 1.9K || 150K &lt;br /&gt;
|-&lt;br /&gt;
| ZX   || 1.5K  || 0.5K  || 1K || 33K&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== '''任务设置''' ==&lt;br /&gt;
本次评测分为两个赛道:&lt;br /&gt;
&lt;br /&gt;
(Closed)：多源零样本领域移植（封闭）&lt;br /&gt;
&lt;br /&gt;
(Open)：多源零样本领域移植（开放）&lt;br /&gt;
&lt;br /&gt;
含义如下：&lt;br /&gt;
* '''多源的含义'''：可以使用其他领域的训练数据作为源领域数据。例如，当目标领域为ZX时，可以使用其他五个领域（包括BC）的训练数据，即BC/PB/PC/FIN/LEG-Train。&lt;br /&gt;
* '''零样本的含义'''：不能使用对应领域的训练数据。例如，当目标领域为ZX时，那么ZX-Train不可作为训练数据使用。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* '''Closed赛道的要求'''：&lt;br /&gt;
1）	只能使用我们提供的数据和信息，包括：所有数据我们都提供分词、自动词性；我们会提供pre-trained word embedding (在Chinese Gigaword 3和所有领域Train/Unlabeled数据上训练word2vec得到)。&lt;br /&gt;
&lt;br /&gt;
2）	不可以使用其他开源工具得到新的信息，如词性、词义等特征。&lt;br /&gt;
&lt;br /&gt;
3）	不可以使用其他的资源，如词典、句法语义树库等。&lt;br /&gt;
&lt;br /&gt;
4）	不可以使用大规模无标注数据上训练的预训练语言模型（任何开源的通用语言模型），但是可以通过预训练语言模型的技术来使用我们提供的无标注数据。即可以使用在我们提供的有标注和无标注数据上从头开始训练预训练模型。&lt;br /&gt;
&lt;br /&gt;
5）	不可以使用NLPCC-2019 CODT1.0的数据。&lt;br /&gt;
&lt;br /&gt;
* '''Open赛道的要求'''：&lt;br /&gt;
&lt;br /&gt;
1）	可以使用任何可通过某种公开方式获取（包括购买）的数据、资源或工具。但是建议参赛者在系统报告中明确说明使用的外部资源以及这些外部资源对性能的影响。&lt;br /&gt;
&lt;br /&gt;
* '''注意事项'''&lt;br /&gt;
1）	开发集的使用：不允许将Dev加入到训练数据中。Dev数据只可以用来调参和选择模型。&lt;br /&gt;
&lt;br /&gt;
2）	无标注数据（Unlabeled）的使用：不限制。同时，6个领域的Train中的句子，只要不使用句法标注信息，也都可以作为无标注数据使用。&lt;br /&gt;
&lt;br /&gt;
3）	预训练语言模型微调：我们将Google发布的bert-base-chinese在所有无标注数据（6个领域的Train，5个领域的Unlabeled数据）进行多轮微调（3轮或10轮），即继续使用语言模型损失函数继续训练。这个模型仅限于Open赛道上的系统使用。我们做这个事情的目的是方便大家试试这个方向，避免大家浪费资源，重复训练。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''如果您对规则有疑问，请随时联系我们确认。如果违反规则，发现后，成绩会直接取消。'''&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021_data_readme&amp;diff=3757</id>
		<title>CCL2021 data readme</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021_data_readme&amp;diff=3757"/>
		<updated>2021-04-02T07:50:20Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* 文件格式说明 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
== train_dev_unlabeled==&lt;br /&gt;
* Unlabeled文件夹：&lt;br /&gt;
**包括PB-Unlabeled.conll、PC-Unlabeled.conll、ZX-Unlabeled.conll、FIN-Unlabeled.conll、LEG-Unlabeled.conll五个文件；&lt;br /&gt;
**无标注数据仅提供分词和词性（第四列）信息；&lt;br /&gt;
* Train文件夹：&lt;br /&gt;
**包括BC-Train-full.conll、PB-Train-full.conll、PC-Train-full.conll、ZX-Train-full.conll、FIN-Train-full.conll、LEG-Train-full.conll六个文件；&lt;br /&gt;
**文件中最后一列为依存弧的概率，如果概率为2，则对应弧为人工标注，否则为模型补全；&lt;br /&gt;
* Dev文件夹：&lt;br /&gt;
**包括BC-Dev.conll、PB-Dev.conll、PC-Dev.conll、ZX-Dev.conll、FIN-Dev.conll、LEG-Dev.conll六个文件；&lt;br /&gt;
**文件中第7列为“-1”且第8列为“none”,代表该弧未进行人工标注。&lt;br /&gt;
&lt;br /&gt;
== 文件格式说明 ==&lt;br /&gt;
所有文件均采用utf-8编码&lt;br /&gt;
&lt;br /&gt;
Train/Dev/Unlabeled数据文件均为“CoNLL”格式，在CoNLL格式中，每个词语占一行，每行10列，无值列用下划线 '_' 代替，列的分隔符为制表符'\t'，行的分隔符为换行符'\n'；句子与句子之间用空行'\n'分隔。&lt;br /&gt;
下面介绍一下我们本次评测使用到的列：&lt;br /&gt;
*1.当前词在句子中的序号，从1开始；&lt;br /&gt;
*2.当前词语或标点；&lt;br /&gt;
*4.当前词语的词性；&lt;br /&gt;
*7.当前词语的核心词；&lt;br /&gt;
*8.当前词语与核心词的依存关系；&lt;br /&gt;
*10.依存弧的概率；&lt;br /&gt;
&lt;br /&gt;
== Word Embedding预训练 ==&lt;br /&gt;
*是通过word2vec在Chinese Gigaword V3（约1100万句、自动分词）和所有领域Train/Unlabeled上训练10词迭代得到。&lt;br /&gt;
&lt;br /&gt;
== fine-tune-bert ==&lt;br /&gt;
* 使用hugging face的脚本（transformers==3.3.1）在所有领域Train/Unlabeled上训练fine-tune bert 3轮。&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021_data_readme&amp;diff=3756</id>
		<title>CCL2021 data readme</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021_data_readme&amp;diff=3756"/>
		<updated>2021-04-02T07:50:13Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* 文件格式说明 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
== train_dev_unlabeled==&lt;br /&gt;
* Unlabeled文件夹：&lt;br /&gt;
**包括PB-Unlabeled.conll、PC-Unlabeled.conll、ZX-Unlabeled.conll、FIN-Unlabeled.conll、LEG-Unlabeled.conll五个文件；&lt;br /&gt;
**无标注数据仅提供分词和词性（第四列）信息；&lt;br /&gt;
* Train文件夹：&lt;br /&gt;
**包括BC-Train-full.conll、PB-Train-full.conll、PC-Train-full.conll、ZX-Train-full.conll、FIN-Train-full.conll、LEG-Train-full.conll六个文件；&lt;br /&gt;
**文件中最后一列为依存弧的概率，如果概率为2，则对应弧为人工标注，否则为模型补全；&lt;br /&gt;
* Dev文件夹：&lt;br /&gt;
**包括BC-Dev.conll、PB-Dev.conll、PC-Dev.conll、ZX-Dev.conll、FIN-Dev.conll、LEG-Dev.conll六个文件；&lt;br /&gt;
**文件中第7列为“-1”且第8列为“none”,代表该弧未进行人工标注。&lt;br /&gt;
&lt;br /&gt;
== 文件格式说明 ==&lt;br /&gt;
所有文件均采用utf-8编码&lt;br /&gt;
Train/Dev/Unlabeled数据文件均为“CoNLL”格式，在CoNLL格式中，每个词语占一行，每行10列，无值列用下划线 '_' 代替，列的分隔符为制表符'\t'，行的分隔符为换行符'\n'；句子与句子之间用空行'\n'分隔。&lt;br /&gt;
下面介绍一下我们本次评测使用到的列：&lt;br /&gt;
*1.当前词在句子中的序号，从1开始；&lt;br /&gt;
*2.当前词语或标点；&lt;br /&gt;
*4.当前词语的词性；&lt;br /&gt;
*7.当前词语的核心词；&lt;br /&gt;
*8.当前词语与核心词的依存关系；&lt;br /&gt;
*10.依存弧的概率；&lt;br /&gt;
&lt;br /&gt;
== Word Embedding预训练 ==&lt;br /&gt;
*是通过word2vec在Chinese Gigaword V3（约1100万句、自动分词）和所有领域Train/Unlabeled上训练10词迭代得到。&lt;br /&gt;
&lt;br /&gt;
== fine-tune-bert ==&lt;br /&gt;
* 使用hugging face的脚本（transformers==3.3.1）在所有领域Train/Unlabeled上训练fine-tune bert 3轮。&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021_data_readme&amp;diff=3755</id>
		<title>CCL2021 data readme</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021_data_readme&amp;diff=3755"/>
		<updated>2021-04-02T07:49:54Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* Word Embedding预训练 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
== train_dev_unlabeled==&lt;br /&gt;
* Unlabeled文件夹：&lt;br /&gt;
**包括PB-Unlabeled.conll、PC-Unlabeled.conll、ZX-Unlabeled.conll、FIN-Unlabeled.conll、LEG-Unlabeled.conll五个文件；&lt;br /&gt;
**无标注数据仅提供分词和词性（第四列）信息；&lt;br /&gt;
* Train文件夹：&lt;br /&gt;
**包括BC-Train-full.conll、PB-Train-full.conll、PC-Train-full.conll、ZX-Train-full.conll、FIN-Train-full.conll、LEG-Train-full.conll六个文件；&lt;br /&gt;
**文件中最后一列为依存弧的概率，如果概率为2，则对应弧为人工标注，否则为模型补全；&lt;br /&gt;
* Dev文件夹：&lt;br /&gt;
**包括BC-Dev.conll、PB-Dev.conll、PC-Dev.conll、ZX-Dev.conll、FIN-Dev.conll、LEG-Dev.conll六个文件；&lt;br /&gt;
**文件中第7列为“-1”且第8列为“none”,代表该弧未进行人工标注。&lt;br /&gt;
&lt;br /&gt;
== 文件格式说明 ==&lt;br /&gt;
Train/Dev/Unlabeled数据文件均为“CoNLL”格式，在CoNLL格式中，每个词语占一行，每行10列，无值列用下划线 '_' 代替，列的分隔符为制表符'\t'，行的分隔符为换行符'\n'；句子与句子之间用空行'\n'分隔。&lt;br /&gt;
下面介绍一下我们本次评测使用到的列：&lt;br /&gt;
*1.当前词在句子中的序号，从1开始；&lt;br /&gt;
*2.当前词语或标点；&lt;br /&gt;
*4.当前词语的词性；&lt;br /&gt;
*7.当前词语的核心词；&lt;br /&gt;
*8.当前词语与核心词的依存关系；&lt;br /&gt;
*10.依存弧的概率；&lt;br /&gt;
&lt;br /&gt;
== Word Embedding预训练 ==&lt;br /&gt;
*是通过word2vec在Chinese Gigaword V3（约1100万句、自动分词）和所有领域Train/Unlabeled上训练10词迭代得到。&lt;br /&gt;
&lt;br /&gt;
== fine-tune-bert ==&lt;br /&gt;
* 使用hugging face的脚本（transformers==3.3.1）在所有领域Train/Unlabeled上训练fine-tune bert 3轮。&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021_data_readme&amp;diff=3754</id>
		<title>CCL2021 data readme</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021_data_readme&amp;diff=3754"/>
		<updated>2021-04-02T07:49:38Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* fine-tune-bert */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
== train_dev_unlabeled==&lt;br /&gt;
* Unlabeled文件夹：&lt;br /&gt;
**包括PB-Unlabeled.conll、PC-Unlabeled.conll、ZX-Unlabeled.conll、FIN-Unlabeled.conll、LEG-Unlabeled.conll五个文件；&lt;br /&gt;
**无标注数据仅提供分词和词性（第四列）信息；&lt;br /&gt;
* Train文件夹：&lt;br /&gt;
**包括BC-Train-full.conll、PB-Train-full.conll、PC-Train-full.conll、ZX-Train-full.conll、FIN-Train-full.conll、LEG-Train-full.conll六个文件；&lt;br /&gt;
**文件中最后一列为依存弧的概率，如果概率为2，则对应弧为人工标注，否则为模型补全；&lt;br /&gt;
* Dev文件夹：&lt;br /&gt;
**包括BC-Dev.conll、PB-Dev.conll、PC-Dev.conll、ZX-Dev.conll、FIN-Dev.conll、LEG-Dev.conll六个文件；&lt;br /&gt;
**文件中第7列为“-1”且第8列为“none”,代表该弧未进行人工标注。&lt;br /&gt;
&lt;br /&gt;
== 文件格式说明 ==&lt;br /&gt;
Train/Dev/Unlabeled数据文件均为“CoNLL”格式，在CoNLL格式中，每个词语占一行，每行10列，无值列用下划线 '_' 代替，列的分隔符为制表符'\t'，行的分隔符为换行符'\n'；句子与句子之间用空行'\n'分隔。&lt;br /&gt;
下面介绍一下我们本次评测使用到的列：&lt;br /&gt;
*1.当前词在句子中的序号，从1开始；&lt;br /&gt;
*2.当前词语或标点；&lt;br /&gt;
*4.当前词语的词性；&lt;br /&gt;
*7.当前词语的核心词；&lt;br /&gt;
*8.当前词语与核心词的依存关系；&lt;br /&gt;
*10.依存弧的概率；&lt;br /&gt;
&lt;br /&gt;
== Word Embedding预训练 ==&lt;br /&gt;
*是通过word2vec在Chinese Gigaword V3（约1100万句、自动分词）和所有领域Train/Unlabeled上训练10词迭代得到。&lt;br /&gt;
*Word Embedding文件均采用UTF-8编码。&lt;br /&gt;
&lt;br /&gt;
== fine-tune-bert ==&lt;br /&gt;
* 使用hugging face的脚本（transformers==3.3.1）在所有领域Train/Unlabeled上训练fine-tune bert 3轮。&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021_data_readme&amp;diff=3753</id>
		<title>CCL2021 data readme</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021_data_readme&amp;diff=3753"/>
		<updated>2021-04-02T07:48:39Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* Word Embedding预训练 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
== train_dev_unlabeled==&lt;br /&gt;
* Unlabeled文件夹：&lt;br /&gt;
**包括PB-Unlabeled.conll、PC-Unlabeled.conll、ZX-Unlabeled.conll、FIN-Unlabeled.conll、LEG-Unlabeled.conll五个文件；&lt;br /&gt;
**无标注数据仅提供分词和词性（第四列）信息；&lt;br /&gt;
* Train文件夹：&lt;br /&gt;
**包括BC-Train-full.conll、PB-Train-full.conll、PC-Train-full.conll、ZX-Train-full.conll、FIN-Train-full.conll、LEG-Train-full.conll六个文件；&lt;br /&gt;
**文件中最后一列为依存弧的概率，如果概率为2，则对应弧为人工标注，否则为模型补全；&lt;br /&gt;
* Dev文件夹：&lt;br /&gt;
**包括BC-Dev.conll、PB-Dev.conll、PC-Dev.conll、ZX-Dev.conll、FIN-Dev.conll、LEG-Dev.conll六个文件；&lt;br /&gt;
**文件中第7列为“-1”且第8列为“none”,代表该弧未进行人工标注。&lt;br /&gt;
&lt;br /&gt;
== 文件格式说明 ==&lt;br /&gt;
Train/Dev/Unlabeled数据文件均为“CoNLL”格式，在CoNLL格式中，每个词语占一行，每行10列，无值列用下划线 '_' 代替，列的分隔符为制表符'\t'，行的分隔符为换行符'\n'；句子与句子之间用空行'\n'分隔。&lt;br /&gt;
下面介绍一下我们本次评测使用到的列：&lt;br /&gt;
*1.当前词在句子中的序号，从1开始；&lt;br /&gt;
*2.当前词语或标点；&lt;br /&gt;
*4.当前词语的词性；&lt;br /&gt;
*7.当前词语的核心词；&lt;br /&gt;
*8.当前词语与核心词的依存关系；&lt;br /&gt;
*10.依存弧的概率；&lt;br /&gt;
&lt;br /&gt;
== Word Embedding预训练 ==&lt;br /&gt;
*是通过word2vec在Chinese Gigaword V3（约1100万句、自动分词）和所有领域Train/Unlabeled上训练10词迭代得到。&lt;br /&gt;
*Word Embedding文件均采用UTF-8编码。&lt;br /&gt;
&lt;br /&gt;
== fine-tune-bert ==&lt;br /&gt;
* 我们基于 Peng et al. (2019)中描述的预训练语言模型微调的方法，将 Google 发布的 bert-base-chinese 在所有无标注数据（6 个领域的Train，5 个领域的 Unlabeled 数据）进行多轮微调（3 轮），即继续使用语言模型损失函数继续训练。&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3752</id>
		<title>CCL2021</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3752"/>
		<updated>2021-04-02T07:40:41Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* 评测数据下载 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== '''CCL-2021依存句法分析领域移植评测''' ==&lt;br /&gt;
* [http://cips-cl.org/static/CCL2021/cclEval/tasks/index.html CCL-2021评测页面]&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/2/26/%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v4.0.pdf 我们的参赛邀请函pdf]&lt;br /&gt;
&lt;br /&gt;
== '''评测日程''' ==&lt;br /&gt;
2021.4.1 开始并公布训练集、开发集、无标注数据&lt;br /&gt;
&lt;br /&gt;
2021.** 公布无答案测试集&lt;br /&gt;
&lt;br /&gt;
2021.** 公布有答案的测试集&lt;br /&gt;
&lt;br /&gt;
2021.** 提交截止&lt;br /&gt;
&lt;br /&gt;
2021.** 公布结果&lt;br /&gt;
&lt;br /&gt;
2021.7.1 评测结束&lt;br /&gt;
&lt;br /&gt;
== '''评测奖金''' ==&lt;br /&gt;
受中国中文信息学会资助，本次评测设置了2万元奖金，每个赛道各1万元&lt;br /&gt;
&lt;br /&gt;
第一名：5000元&lt;br /&gt;
&lt;br /&gt;
第二名：3000元&lt;br /&gt;
&lt;br /&gt;
第三名：2000元&lt;br /&gt;
&lt;br /&gt;
== '''评测数据下载''' ==&lt;br /&gt;
'''数据使用协议'''&lt;br /&gt;
&lt;br /&gt;
下载数据前需要签署数据使用协议，在收到数据使用协议后我们会发给您解压密码。&lt;br /&gt;
&amp;lt;!--请您仔细阅读如下两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学（z641295453@163.com）--&amp;gt;&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/c/c1/Codt-sharing-agreement-2021.3-v1.pdf CODT2.0数据使用协议下载]（团队负责人签字，如果是公司，必须是公司法人签字）&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/alibaba-unlabeled-data-share-2019.4.4.doc PB-PC-unlabeled数据使用协议下载] (机构、学院、学校或公司盖章）&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请仔细阅读两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学(z641295453@163.com)&amp;lt;/font&amp;gt;&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请用机构的官方邮箱发送协议&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;由于版权保护问题，我们只面向机构、单位等团体开放数据；对于公司，我们仅面向从事句法分析研究的公司开放数据，签署协议前请先咨询我们是否有可能共享数据；解释权归我们课题组。&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;如果您不需要无标注数据，那么只需要签署标注数据使用协议。&amp;lt;/font&amp;gt;&lt;br /&gt;
&amp;lt;!--* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;您还需要【评测报名表】也请同时发给周明月同学。&amp;lt;/font&amp;gt;--&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''训练集/开发集/无标注数据下载'''&lt;br /&gt;
&lt;br /&gt;
[http://hlt.suda.edu.cn/index.php/CCL2021_data_readme 数据说明Readme]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''预训练词向量下载'''&lt;br /&gt;
&lt;br /&gt;
我们分别提供了50维、100维、300维的预训练词向量&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''fine-tune-bert下载'''&lt;br /&gt;
&lt;br /&gt;
我们提供了在bert-base-chinese上微调3轮的结果&lt;br /&gt;
&lt;br /&gt;
== '''评价脚本下载''' ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/evaluate.py 评价脚本下载]&lt;br /&gt;
** 执行命令：python3 evaluate.py gold.conll sys.conll&lt;br /&gt;
** 数据集需要为CoNLL格式，与我们提供的数据集格式相同。&lt;br /&gt;
&lt;br /&gt;
== '''评测背景''' ==&lt;br /&gt;
近年来，随着深度学习技术的发展，尤其是预训练语言模型ELMo/BERT的提出，封闭领域规范文本上的句法分析性能已经达到了比较高的水平。但是，在跨领域文本，尤其是不规范的网络文本上，句法分析的性能会急剧下降。同时，如何在深度学习模型中利用结构化的句法信息也是NLP领域的重要研究问题之一，但是受到真实文本上句法性能的限制。因此，领域移植问题已经成为句法分析研究的重要挑战。为了更充分地支持句法分析领域移植研究，我们自2017年起标注了多领域句法数据集，并命名为汉语开放依存树库（CODT），目前包含16万句，涵盖10多个领域或来源的文本。2019年，我们依托NLPCC-2019会议，组织了第一届跨领域句法分析评测(Peng et al., 2019)，针对“单源零样本”和“单源少样本”领域移植场景，发布了CODT1.0数据集，包含4万句、对应4个领域。&lt;br /&gt;
今年，我们依托CCL-2021会议，组织第二届跨领域句法分析评测，针对“多源零样本”领域移植场景，发布CODT2.0数据集，包含7万句，对应6个领域。其中，通过错误检测和人工校正，CODT2.0与CODT1.0重合的数据的质量进一步提升。&lt;br /&gt;
&lt;br /&gt;
== '''数据设置''' ==&lt;br /&gt;
在本次评测任务中，我们提供约29K句平衡语料（BC）、9K句产品博客（PB）、10K句产品评论（PC）、8K句财经资讯（FIN）、8K句法律资讯（LEG）和3K句网络小说（ZX）六个领域的数据。其中BC作为基础数据，只作为源领域。后五个领域既可以作为源领域，也可以作为目标领域。另外，针对后五个领域，我们还提供了大规模的无标注数据。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align: center;&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
!      !! train !! dev  !! test !! unlabeled&lt;br /&gt;
|-&lt;br /&gt;
| BC   || 26.1K || 1K  || 2K ||   0     &lt;br /&gt;
|-&lt;br /&gt;
| PB   || 5K  || 1.3K || 2.5K || 291K&lt;br /&gt;
|-&lt;br /&gt;
| PC   || 6.8K  || 1.3K || 2.6K || 349K&lt;br /&gt;
|-&lt;br /&gt;
| FIN   || 5K  || 1K  || 1.8K || 118K&lt;br /&gt;
|-&lt;br /&gt;
| LEG   || 5K  || 1K  || 1.9K || 150K &lt;br /&gt;
|-&lt;br /&gt;
| ZX   || 1.5K  || 0.5K  || 1K || 33K&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== '''任务设置''' ==&lt;br /&gt;
本次评测分为两个赛道:&lt;br /&gt;
&lt;br /&gt;
(Closed)：多源零样本领域移植（封闭）&lt;br /&gt;
&lt;br /&gt;
(Open)：多源零样本领域移植（开放）&lt;br /&gt;
&lt;br /&gt;
含义如下：&lt;br /&gt;
* '''多源的含义'''：可以使用其他领域的训练数据作为源领域数据。例如，当目标领域为ZX时，可以使用其他五个领域（包括BC）的训练数据，即BC/PB/PC/FIN/LEG-Train。&lt;br /&gt;
* '''零样本的含义'''：不能使用对应领域的训练数据。例如，当目标领域为ZX时，那么ZX-Train不可作为训练数据使用。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* '''Closed赛道的要求'''：&lt;br /&gt;
1）	只能使用我们提供的数据和信息，包括：所有数据我们都提供分词、自动词性；我们会提供pre-trained word embedding (在Chinese Gigaword 3和所有领域Train/Unlabeled数据上训练word2vec得到)。&lt;br /&gt;
&lt;br /&gt;
2）	不可以使用其他开源工具得到新的信息，如词性、词义等特征。&lt;br /&gt;
&lt;br /&gt;
3）	不可以使用其他的资源，如词典、句法语义树库等。&lt;br /&gt;
&lt;br /&gt;
4）	不可以使用大规模无标注数据上训练的预训练语言模型（任何开源的通用语言模型），但是可以通过预训练语言模型的技术来使用我们提供的无标注数据。即可以使用在我们提供的有标注和无标注数据上从头开始训练预训练模型。&lt;br /&gt;
&lt;br /&gt;
5）	不可以使用NLPCC-2019 CODT1.0的数据。&lt;br /&gt;
&lt;br /&gt;
* '''Open赛道的要求'''：&lt;br /&gt;
&lt;br /&gt;
1）	可以使用任何可通过某种公开方式获取（包括购买）的数据、资源或工具。但是建议参赛者在系统报告中明确说明使用的外部资源以及这些外部资源对性能的影响。&lt;br /&gt;
&lt;br /&gt;
* '''注意事项'''&lt;br /&gt;
1）	开发集的使用：不允许将Dev加入到训练数据中。Dev数据只可以用来调参和选择模型。&lt;br /&gt;
&lt;br /&gt;
2）	无标注数据（Unlabeled）的使用：不限制。同时，6个领域的Train中的句子，只要不使用句法标注信息，也都可以作为无标注数据使用。&lt;br /&gt;
&lt;br /&gt;
3）	预训练语言模型微调：我们将Google发布的bert-base-chinese在所有无标注数据（6个领域的Train，5个领域的Unlabeled数据）进行多轮微调（3轮或10轮），即继续使用语言模型损失函数继续训练。这个模型仅限于Open赛道上的系统使用。我们做这个事情的目的是方便大家试试这个方向，避免大家浪费资源，重复训练。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''如果您对规则有疑问，请随时联系我们确认。如果违反规则，发现后，成绩会直接取消。'''&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3751</id>
		<title>CCL2021</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3751"/>
		<updated>2021-04-02T07:39:34Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* 评测数据下载 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== '''CCL-2021依存句法分析领域移植评测''' ==&lt;br /&gt;
* [http://cips-cl.org/static/CCL2021/cclEval/tasks/index.html CCL-2021评测页面]&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/2/26/%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v4.0.pdf 我们的参赛邀请函pdf]&lt;br /&gt;
&lt;br /&gt;
== '''评测日程''' ==&lt;br /&gt;
2021.4.1 开始并公布训练集、开发集、无标注数据&lt;br /&gt;
&lt;br /&gt;
2021.** 公布无答案测试集&lt;br /&gt;
&lt;br /&gt;
2021.** 公布有答案的测试集&lt;br /&gt;
&lt;br /&gt;
2021.** 提交截止&lt;br /&gt;
&lt;br /&gt;
2021.** 公布结果&lt;br /&gt;
&lt;br /&gt;
2021.7.1 评测结束&lt;br /&gt;
&lt;br /&gt;
== '''评测奖金''' ==&lt;br /&gt;
受中国中文信息学会资助，本次评测设置了2万元奖金，每个赛道各1万元&lt;br /&gt;
&lt;br /&gt;
第一名：5000元&lt;br /&gt;
&lt;br /&gt;
第二名：3000元&lt;br /&gt;
&lt;br /&gt;
第三名：2000元&lt;br /&gt;
&lt;br /&gt;
== '''评测数据下载''' ==&lt;br /&gt;
'''数据使用协议'''&lt;br /&gt;
&lt;br /&gt;
下载数据前需要签署数据使用协议，在收到数据使用协议后我们会发给您解压密码。&lt;br /&gt;
&amp;lt;!--请您仔细阅读如下两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学（z641295453@163.com）--&amp;gt;&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/c/c1/Codt-sharing-agreement-2021.3-v1.pdf CODT2.0数据使用协议下载]（团队负责人签字，如果是公司，必须是公司法人签字）&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/alibaba-unlabeled-data-share-2019.4.4.doc PB-PC-unlabeled数据使用协议下载] (机构、学院、学校或公司盖章）&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请仔细阅读两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学(z641295453@163.com)&amp;lt;/font&amp;gt;&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请用机构的官方邮箱发送协议&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;由于版权保护问题，我们只面向机构、单位等团体开放数据；对于公司，我们仅面向从事句法分析研究的公司开放数据，签署协议前请先咨询我们是否有可能共享数据；解释权归我们课题组。&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;如果您不需要无标注数据，那么只需要签署标注数据使用协议。&amp;lt;/font&amp;gt;&lt;br /&gt;
&amp;lt;!--* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;您还需要【评测报名表】也请同时发给周明月同学。&amp;lt;/font&amp;gt;--&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''训练集/开发集/无标注数据下载'''&lt;br /&gt;
&lt;br /&gt;
[http://hlt.suda.edu.cn/index.php/CCL2021_data_readme#fine-tune-bert 数据说明Readme]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''预训练词向量下载'''&lt;br /&gt;
&lt;br /&gt;
我们分别提供了50维、100维、300维的预训练词向量&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''fine-tune-bert下载'''&lt;br /&gt;
&lt;br /&gt;
我们提供了在bert-base-chinese上微调3轮的结果&lt;br /&gt;
&lt;br /&gt;
== '''评价脚本下载''' ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/evaluate.py 评价脚本下载]&lt;br /&gt;
** 执行命令：python3 evaluate.py gold.conll sys.conll&lt;br /&gt;
** 数据集需要为CoNLL格式，与我们提供的数据集格式相同。&lt;br /&gt;
&lt;br /&gt;
== '''评测背景''' ==&lt;br /&gt;
近年来，随着深度学习技术的发展，尤其是预训练语言模型ELMo/BERT的提出，封闭领域规范文本上的句法分析性能已经达到了比较高的水平。但是，在跨领域文本，尤其是不规范的网络文本上，句法分析的性能会急剧下降。同时，如何在深度学习模型中利用结构化的句法信息也是NLP领域的重要研究问题之一，但是受到真实文本上句法性能的限制。因此，领域移植问题已经成为句法分析研究的重要挑战。为了更充分地支持句法分析领域移植研究，我们自2017年起标注了多领域句法数据集，并命名为汉语开放依存树库（CODT），目前包含16万句，涵盖10多个领域或来源的文本。2019年，我们依托NLPCC-2019会议，组织了第一届跨领域句法分析评测(Peng et al., 2019)，针对“单源零样本”和“单源少样本”领域移植场景，发布了CODT1.0数据集，包含4万句、对应4个领域。&lt;br /&gt;
今年，我们依托CCL-2021会议，组织第二届跨领域句法分析评测，针对“多源零样本”领域移植场景，发布CODT2.0数据集，包含7万句，对应6个领域。其中，通过错误检测和人工校正，CODT2.0与CODT1.0重合的数据的质量进一步提升。&lt;br /&gt;
&lt;br /&gt;
== '''数据设置''' ==&lt;br /&gt;
在本次评测任务中，我们提供约29K句平衡语料（BC）、9K句产品博客（PB）、10K句产品评论（PC）、8K句财经资讯（FIN）、8K句法律资讯（LEG）和3K句网络小说（ZX）六个领域的数据。其中BC作为基础数据，只作为源领域。后五个领域既可以作为源领域，也可以作为目标领域。另外，针对后五个领域，我们还提供了大规模的无标注数据。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align: center;&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
!      !! train !! dev  !! test !! unlabeled&lt;br /&gt;
|-&lt;br /&gt;
| BC   || 26.1K || 1K  || 2K ||   0     &lt;br /&gt;
|-&lt;br /&gt;
| PB   || 5K  || 1.3K || 2.5K || 291K&lt;br /&gt;
|-&lt;br /&gt;
| PC   || 6.8K  || 1.3K || 2.6K || 349K&lt;br /&gt;
|-&lt;br /&gt;
| FIN   || 5K  || 1K  || 1.8K || 118K&lt;br /&gt;
|-&lt;br /&gt;
| LEG   || 5K  || 1K  || 1.9K || 150K &lt;br /&gt;
|-&lt;br /&gt;
| ZX   || 1.5K  || 0.5K  || 1K || 33K&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== '''任务设置''' ==&lt;br /&gt;
本次评测分为两个赛道:&lt;br /&gt;
&lt;br /&gt;
(Closed)：多源零样本领域移植（封闭）&lt;br /&gt;
&lt;br /&gt;
(Open)：多源零样本领域移植（开放）&lt;br /&gt;
&lt;br /&gt;
含义如下：&lt;br /&gt;
* '''多源的含义'''：可以使用其他领域的训练数据作为源领域数据。例如，当目标领域为ZX时，可以使用其他五个领域（包括BC）的训练数据，即BC/PB/PC/FIN/LEG-Train。&lt;br /&gt;
* '''零样本的含义'''：不能使用对应领域的训练数据。例如，当目标领域为ZX时，那么ZX-Train不可作为训练数据使用。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* '''Closed赛道的要求'''：&lt;br /&gt;
1）	只能使用我们提供的数据和信息，包括：所有数据我们都提供分词、自动词性；我们会提供pre-trained word embedding (在Chinese Gigaword 3和所有领域Train/Unlabeled数据上训练word2vec得到)。&lt;br /&gt;
&lt;br /&gt;
2）	不可以使用其他开源工具得到新的信息，如词性、词义等特征。&lt;br /&gt;
&lt;br /&gt;
3）	不可以使用其他的资源，如词典、句法语义树库等。&lt;br /&gt;
&lt;br /&gt;
4）	不可以使用大规模无标注数据上训练的预训练语言模型（任何开源的通用语言模型），但是可以通过预训练语言模型的技术来使用我们提供的无标注数据。即可以使用在我们提供的有标注和无标注数据上从头开始训练预训练模型。&lt;br /&gt;
&lt;br /&gt;
5）	不可以使用NLPCC-2019 CODT1.0的数据。&lt;br /&gt;
&lt;br /&gt;
* '''Open赛道的要求'''：&lt;br /&gt;
&lt;br /&gt;
1）	可以使用任何可通过某种公开方式获取（包括购买）的数据、资源或工具。但是建议参赛者在系统报告中明确说明使用的外部资源以及这些外部资源对性能的影响。&lt;br /&gt;
&lt;br /&gt;
* '''注意事项'''&lt;br /&gt;
1）	开发集的使用：不允许将Dev加入到训练数据中。Dev数据只可以用来调参和选择模型。&lt;br /&gt;
&lt;br /&gt;
2）	无标注数据（Unlabeled）的使用：不限制。同时，6个领域的Train中的句子，只要不使用句法标注信息，也都可以作为无标注数据使用。&lt;br /&gt;
&lt;br /&gt;
3）	预训练语言模型微调：我们将Google发布的bert-base-chinese在所有无标注数据（6个领域的Train，5个领域的Unlabeled数据）进行多轮微调（3轮或10轮），即继续使用语言模型损失函数继续训练。这个模型仅限于Open赛道上的系统使用。我们做这个事情的目的是方便大家试试这个方向，避免大家浪费资源，重复训练。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''如果您对规则有疑问，请随时联系我们确认。如果违反规则，发现后，成绩会直接取消。'''&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021_data_readme&amp;diff=3750</id>
		<title>CCL2021 data readme</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021_data_readme&amp;diff=3750"/>
		<updated>2021-04-02T07:38:44Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* fine-tune-bert */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
== train_dev_unlabeled==&lt;br /&gt;
* Unlabeled文件夹：&lt;br /&gt;
**包括PB-Unlabeled.conll、PC-Unlabeled.conll、ZX-Unlabeled.conll、FIN-Unlabeled.conll、LEG-Unlabeled.conll五个文件；&lt;br /&gt;
**无标注数据仅提供分词和词性（第四列）信息；&lt;br /&gt;
* Train文件夹：&lt;br /&gt;
**包括BC-Train-full.conll、PB-Train-full.conll、PC-Train-full.conll、ZX-Train-full.conll、FIN-Train-full.conll、LEG-Train-full.conll六个文件；&lt;br /&gt;
**文件中最后一列为依存弧的概率，如果概率为2，则对应弧为人工标注，否则为模型补全；&lt;br /&gt;
* Dev文件夹：&lt;br /&gt;
**包括BC-Dev.conll、PB-Dev.conll、PC-Dev.conll、ZX-Dev.conll、FIN-Dev.conll、LEG-Dev.conll六个文件；&lt;br /&gt;
**文件中第7列为“-1”且第8列为“none”,代表该弧未进行人工标注。&lt;br /&gt;
&lt;br /&gt;
== 文件格式说明 ==&lt;br /&gt;
Train/Dev/Unlabeled数据文件均为“CoNLL”格式，在CoNLL格式中，每个词语占一行，每行10列，无值列用下划线 '_' 代替，列的分隔符为制表符'\t'，行的分隔符为换行符'\n'；句子与句子之间用空行'\n'分隔。&lt;br /&gt;
下面介绍一下我们本次评测使用到的列：&lt;br /&gt;
*1.当前词在句子中的序号，从1开始；&lt;br /&gt;
*2.当前词语或标点；&lt;br /&gt;
*4.当前词语的词性；&lt;br /&gt;
*7.当前词语的核心词；&lt;br /&gt;
*8.当前词语与核心词的依存关系；&lt;br /&gt;
*10.依存弧的概率；&lt;br /&gt;
&lt;br /&gt;
== Word Embedding预训练 ==&lt;br /&gt;
*Word Embedding是通过word2vec在Chinese Gigaword V3（约1100万句、自动分词）和目标领域Train/Unlabeled上训练10次迭代得到。&lt;br /&gt;
*Word Embedding文件均采用UTF-8编码。&lt;br /&gt;
&lt;br /&gt;
== fine-tune-bert ==&lt;br /&gt;
* 我们基于 Peng et al. (2019)中描述的预训练语言模型微调的方法，将 Google 发布的 bert-base-chinese 在所有无标注数据（6 个领域的Train，5 个领域的 Unlabeled 数据）进行多轮微调（3 轮），即继续使用语言模型损失函数继续训练。&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021_data_readme&amp;diff=3749</id>
		<title>CCL2021 data readme</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021_data_readme&amp;diff=3749"/>
		<updated>2021-04-02T07:36:01Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* Word Embedding预训练 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
== train_dev_unlabeled==&lt;br /&gt;
* Unlabeled文件夹：&lt;br /&gt;
**包括PB-Unlabeled.conll、PC-Unlabeled.conll、ZX-Unlabeled.conll、FIN-Unlabeled.conll、LEG-Unlabeled.conll五个文件；&lt;br /&gt;
**无标注数据仅提供分词和词性（第四列）信息；&lt;br /&gt;
* Train文件夹：&lt;br /&gt;
**包括BC-Train-full.conll、PB-Train-full.conll、PC-Train-full.conll、ZX-Train-full.conll、FIN-Train-full.conll、LEG-Train-full.conll六个文件；&lt;br /&gt;
**文件中最后一列为依存弧的概率，如果概率为2，则对应弧为人工标注，否则为模型补全；&lt;br /&gt;
* Dev文件夹：&lt;br /&gt;
**包括BC-Dev.conll、PB-Dev.conll、PC-Dev.conll、ZX-Dev.conll、FIN-Dev.conll、LEG-Dev.conll六个文件；&lt;br /&gt;
**文件中第7列为“-1”且第8列为“none”,代表该弧未进行人工标注。&lt;br /&gt;
&lt;br /&gt;
== 文件格式说明 ==&lt;br /&gt;
Train/Dev/Unlabeled数据文件均为“CoNLL”格式，在CoNLL格式中，每个词语占一行，每行10列，无值列用下划线 '_' 代替，列的分隔符为制表符'\t'，行的分隔符为换行符'\n'；句子与句子之间用空行'\n'分隔。&lt;br /&gt;
下面介绍一下我们本次评测使用到的列：&lt;br /&gt;
*1.当前词在句子中的序号，从1开始；&lt;br /&gt;
*2.当前词语或标点；&lt;br /&gt;
*4.当前词语的词性；&lt;br /&gt;
*7.当前词语的核心词；&lt;br /&gt;
*8.当前词语与核心词的依存关系；&lt;br /&gt;
*10.依存弧的概率；&lt;br /&gt;
&lt;br /&gt;
== Word Embedding预训练 ==&lt;br /&gt;
*Word Embedding是通过word2vec在Chinese Gigaword V3（约1100万句、自动分词）和目标领域Train/Unlabeled上训练10次迭代得到。&lt;br /&gt;
*Word Embedding文件均采用UTF-8编码。&lt;br /&gt;
&lt;br /&gt;
== fine-tune-bert ==&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021_data_readme&amp;diff=3748</id>
		<title>CCL2021 data readme</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021_data_readme&amp;diff=3748"/>
		<updated>2021-04-02T07:32:05Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* train_dev_unlabeled */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
== train_dev_unlabeled==&lt;br /&gt;
* Unlabeled文件夹：&lt;br /&gt;
**包括PB-Unlabeled.conll、PC-Unlabeled.conll、ZX-Unlabeled.conll、FIN-Unlabeled.conll、LEG-Unlabeled.conll五个文件；&lt;br /&gt;
**无标注数据仅提供分词和词性（第四列）信息；&lt;br /&gt;
* Train文件夹：&lt;br /&gt;
**包括BC-Train-full.conll、PB-Train-full.conll、PC-Train-full.conll、ZX-Train-full.conll、FIN-Train-full.conll、LEG-Train-full.conll六个文件；&lt;br /&gt;
**文件中最后一列为依存弧的概率，如果概率为2，则对应弧为人工标注，否则为模型补全；&lt;br /&gt;
* Dev文件夹：&lt;br /&gt;
**包括BC-Dev.conll、PB-Dev.conll、PC-Dev.conll、ZX-Dev.conll、FIN-Dev.conll、LEG-Dev.conll六个文件；&lt;br /&gt;
**文件中第7列为“-1”且第8列为“none”,代表该弧未进行人工标注。&lt;br /&gt;
&lt;br /&gt;
== 文件格式说明 ==&lt;br /&gt;
Train/Dev/Unlabeled数据文件均为“CoNLL”格式，在CoNLL格式中，每个词语占一行，每行10列，无值列用下划线 '_' 代替，列的分隔符为制表符'\t'，行的分隔符为换行符'\n'；句子与句子之间用空行'\n'分隔。&lt;br /&gt;
下面介绍一下我们本次评测使用到的列：&lt;br /&gt;
*1.当前词在句子中的序号，从1开始；&lt;br /&gt;
*2.当前词语或标点；&lt;br /&gt;
*4.当前词语的词性；&lt;br /&gt;
*7.当前词语的核心词；&lt;br /&gt;
*8.当前词语与核心词的依存关系；&lt;br /&gt;
*10.依存弧的概率；&lt;br /&gt;
&lt;br /&gt;
== Word Embedding预训练 ==&lt;br /&gt;
*Word Embedding是通过word2vec在Chinese Gigaword V3（约1100万句、自动分词）和目标领域Train/Unlabeled上训练10次迭代得到。&lt;br /&gt;
*Word Embedding文件均采用UTF-8编码。&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021_data_readme&amp;diff=3747</id>
		<title>CCL2021 data readme</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021_data_readme&amp;diff=3747"/>
		<updated>2021-04-02T07:27:46Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：创建页面，内容为“ == train_dev_unlabeled== * Unlabeled文件夹： **包括PB-Unlabeled.conll、PC-Unlabeled.conll、ZX-Unlabeled.conll三个文件； **无标注数据仅提供分...”&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
== train_dev_unlabeled==&lt;br /&gt;
* Unlabeled文件夹：&lt;br /&gt;
**包括PB-Unlabeled.conll、PC-Unlabeled.conll、ZX-Unlabeled.conll三个文件；&lt;br /&gt;
**无标注数据仅提供分词和词性（第四列）信息；&lt;br /&gt;
* Train文件夹：&lt;br /&gt;
**包括BC-Train.conll、PB-Train.conll、PC-Train.conll、ZX-Train.conll四个文件；&lt;br /&gt;
**文件中最后一列为依存弧的概率，如果概率为1，则对应弧为人工标注，否则为模型补全；&lt;br /&gt;
* Dev文件夹：&lt;br /&gt;
**包括BC-Dev.conll、PB-Dev.conll、PC-Dev.conll、ZX-Dev.conll四个文件；&lt;br /&gt;
**文件中第7列为“-1”且第8列为“none”,代表该弧未进行人工标注。&lt;br /&gt;
&lt;br /&gt;
== 文件格式说明 ==&lt;br /&gt;
Train/Dev/Unlabeled数据文件均为“CoNLL”格式，在CoNLL格式中，每个词语占一行，每行10列，无值列用下划线 '_' 代替，列的分隔符为制表符'\t'，行的分隔符为换行符'\n'；句子与句子之间用空行'\n'分隔。&lt;br /&gt;
下面介绍一下我们本次评测使用到的列：&lt;br /&gt;
*1.当前词在句子中的序号，从1开始；&lt;br /&gt;
*2.当前词语或标点；&lt;br /&gt;
*4.当前词语的词性；&lt;br /&gt;
*7.当前词语的核心词；&lt;br /&gt;
*8.当前词语与核心词的依存关系；&lt;br /&gt;
*10.依存弧的概率；&lt;br /&gt;
&lt;br /&gt;
== Word Embedding预训练 ==&lt;br /&gt;
*Word Embedding是通过word2vec在Chinese Gigaword V3（约1100万句、自动分词）和目标领域Train/Unlabeled上训练10次迭代得到。&lt;br /&gt;
*Word Embedding文件均采用UTF-8编码。&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3746</id>
		<title>CCL2021</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3746"/>
		<updated>2021-04-02T05:52:17Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* 评测数据下载 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== '''CCL-2021依存句法分析领域移植评测''' ==&lt;br /&gt;
* [http://cips-cl.org/static/CCL2021/cclEval/tasks/index.html CCL-2021评测页面]&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/2/26/%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v4.0.pdf 我们的参赛邀请函pdf]&lt;br /&gt;
&lt;br /&gt;
== '''评测日程''' ==&lt;br /&gt;
2021.4.1 开始并公布训练集、开发集、无标注数据&lt;br /&gt;
&lt;br /&gt;
2021.** 公布无答案测试集&lt;br /&gt;
&lt;br /&gt;
2021.** 公布有答案的测试集&lt;br /&gt;
&lt;br /&gt;
2021.** 提交截止&lt;br /&gt;
&lt;br /&gt;
2021.** 公布结果&lt;br /&gt;
&lt;br /&gt;
2021.7.1 评测结束&lt;br /&gt;
&lt;br /&gt;
== '''评测奖金''' ==&lt;br /&gt;
受中国中文信息学会资助，本次评测设置了2万元奖金，每个赛道各1万元&lt;br /&gt;
&lt;br /&gt;
第一名：5000元&lt;br /&gt;
&lt;br /&gt;
第二名：3000元&lt;br /&gt;
&lt;br /&gt;
第三名：2000元&lt;br /&gt;
&lt;br /&gt;
== '''评测数据下载''' ==&lt;br /&gt;
'''数据使用协议'''&lt;br /&gt;
&lt;br /&gt;
下载数据前需要签署数据使用协议，在收到数据使用协议后我们会发给您解压密码。&lt;br /&gt;
&amp;lt;!--请您仔细阅读如下两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学（z641295453@163.com）--&amp;gt;&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/c/c1/Codt-sharing-agreement-2021.3-v1.pdf CODT2.0数据使用协议下载]（团队负责人签字，如果是公司，必须是公司法人签字）&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/alibaba-unlabeled-data-share-2019.4.4.doc PB-PC-unlabeled数据使用协议下载] (机构、学院、学校或公司盖章）&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请仔细阅读两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学(z641295453@163.com)&amp;lt;/font&amp;gt;&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请用机构的官方邮箱发送协议&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;由于版权保护问题，我们只面向机构、单位等团体开放数据；对于公司，我们仅面向从事句法分析研究的公司开放数据，签署协议前请先咨询我们是否有可能共享数据；解释权归我们课题组。&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;如果您不需要无标注数据，那么只需要签署标注数据使用协议。&amp;lt;/font&amp;gt;&lt;br /&gt;
&amp;lt;!--* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;您还需要【评测报名表】也请同时发给周明月同学。&amp;lt;/font&amp;gt;--&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''训练集/开发集/无标注数据下载'''&lt;br /&gt;
&lt;br /&gt;
[数据说明Readme]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''预训练词向量下载'''&lt;br /&gt;
&lt;br /&gt;
我们分别提供了50维、100维、300维的预训练词向量&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''fine-tune-bert下载'''&lt;br /&gt;
&lt;br /&gt;
我们提供了在bert-base-chinese上微调3轮的结果&lt;br /&gt;
&lt;br /&gt;
== '''评价脚本下载''' ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/evaluate.py 评价脚本下载]&lt;br /&gt;
** 执行命令：python3 evaluate.py gold.conll sys.conll&lt;br /&gt;
** 数据集需要为CoNLL格式，与我们提供的数据集格式相同。&lt;br /&gt;
&lt;br /&gt;
== '''评测背景''' ==&lt;br /&gt;
近年来，随着深度学习技术的发展，尤其是预训练语言模型ELMo/BERT的提出，封闭领域规范文本上的句法分析性能已经达到了比较高的水平。但是，在跨领域文本，尤其是不规范的网络文本上，句法分析的性能会急剧下降。同时，如何在深度学习模型中利用结构化的句法信息也是NLP领域的重要研究问题之一，但是受到真实文本上句法性能的限制。因此，领域移植问题已经成为句法分析研究的重要挑战。为了更充分地支持句法分析领域移植研究，我们自2017年起标注了多领域句法数据集，并命名为汉语开放依存树库（CODT），目前包含16万句，涵盖10多个领域或来源的文本。2019年，我们依托NLPCC-2019会议，组织了第一届跨领域句法分析评测(Peng et al., 2019)，针对“单源零样本”和“单源少样本”领域移植场景，发布了CODT1.0数据集，包含4万句、对应4个领域。&lt;br /&gt;
今年，我们依托CCL-2021会议，组织第二届跨领域句法分析评测，针对“多源零样本”领域移植场景，发布CODT2.0数据集，包含7万句，对应6个领域。其中，通过错误检测和人工校正，CODT2.0与CODT1.0重合的数据的质量进一步提升。&lt;br /&gt;
&lt;br /&gt;
== '''数据设置''' ==&lt;br /&gt;
在本次评测任务中，我们提供约29K句平衡语料（BC）、9K句产品博客（PB）、10K句产品评论（PC）、8K句财经资讯（FIN）、8K句法律资讯（LEG）和3K句网络小说（ZX）六个领域的数据。其中BC作为基础数据，只作为源领域。后五个领域既可以作为源领域，也可以作为目标领域。另外，针对后五个领域，我们还提供了大规模的无标注数据。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align: center;&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
!      !! train !! dev  !! test !! unlabeled&lt;br /&gt;
|-&lt;br /&gt;
| BC   || 26.1K || 1K  || 2K ||   0     &lt;br /&gt;
|-&lt;br /&gt;
| PB   || 5K  || 1.3K || 2.5K || 291K&lt;br /&gt;
|-&lt;br /&gt;
| PC   || 6.8K  || 1.3K || 2.6K || 349K&lt;br /&gt;
|-&lt;br /&gt;
| FIN   || 5K  || 1K  || 1.8K || 118K&lt;br /&gt;
|-&lt;br /&gt;
| LEG   || 5K  || 1K  || 1.9K || 150K &lt;br /&gt;
|-&lt;br /&gt;
| ZX   || 1.5K  || 0.5K  || 1K || 33K&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== '''任务设置''' ==&lt;br /&gt;
本次评测分为两个赛道:&lt;br /&gt;
&lt;br /&gt;
(Closed)：多源零样本领域移植（封闭）&lt;br /&gt;
&lt;br /&gt;
(Open)：多源零样本领域移植（开放）&lt;br /&gt;
&lt;br /&gt;
含义如下：&lt;br /&gt;
* '''多源的含义'''：可以使用其他领域的训练数据作为源领域数据。例如，当目标领域为ZX时，可以使用其他五个领域（包括BC）的训练数据，即BC/PB/PC/FIN/LEG-Train。&lt;br /&gt;
* '''零样本的含义'''：不能使用对应领域的训练数据。例如，当目标领域为ZX时，那么ZX-Train不可作为训练数据使用。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* '''Closed赛道的要求'''：&lt;br /&gt;
1）	只能使用我们提供的数据和信息，包括：所有数据我们都提供分词、自动词性；我们会提供pre-trained word embedding (在Chinese Gigaword 3和所有领域Train/Unlabeled数据上训练word2vec得到)。&lt;br /&gt;
&lt;br /&gt;
2）	不可以使用其他开源工具得到新的信息，如词性、词义等特征。&lt;br /&gt;
&lt;br /&gt;
3）	不可以使用其他的资源，如词典、句法语义树库等。&lt;br /&gt;
&lt;br /&gt;
4）	不可以使用大规模无标注数据上训练的预训练语言模型（任何开源的通用语言模型），但是可以通过预训练语言模型的技术来使用我们提供的无标注数据。即可以使用在我们提供的有标注和无标注数据上从头开始训练预训练模型。&lt;br /&gt;
&lt;br /&gt;
5）	不可以使用NLPCC-2019 CODT1.0的数据。&lt;br /&gt;
&lt;br /&gt;
* '''Open赛道的要求'''：&lt;br /&gt;
&lt;br /&gt;
1）	可以使用任何可通过某种公开方式获取（包括购买）的数据、资源或工具。但是建议参赛者在系统报告中明确说明使用的外部资源以及这些外部资源对性能的影响。&lt;br /&gt;
&lt;br /&gt;
* '''注意事项'''&lt;br /&gt;
1）	开发集的使用：不允许将Dev加入到训练数据中。Dev数据只可以用来调参和选择模型。&lt;br /&gt;
&lt;br /&gt;
2）	无标注数据（Unlabeled）的使用：不限制。同时，6个领域的Train中的句子，只要不使用句法标注信息，也都可以作为无标注数据使用。&lt;br /&gt;
&lt;br /&gt;
3）	预训练语言模型微调：我们将Google发布的bert-base-chinese在所有无标注数据（6个领域的Train，5个领域的Unlabeled数据）进行多轮微调（3轮或10轮），即继续使用语言模型损失函数继续训练。这个模型仅限于Open赛道上的系统使用。我们做这个事情的目的是方便大家试试这个方向，避免大家浪费资源，重复训练。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''如果您对规则有疑问，请随时联系我们确认。如果违反规则，发现后，成绩会直接取消。'''&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3745</id>
		<title>CCL2021</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3745"/>
		<updated>2021-04-02T05:50:49Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* 评测数据下载 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== '''CCL-2021依存句法分析领域移植评测''' ==&lt;br /&gt;
* [http://cips-cl.org/static/CCL2021/cclEval/tasks/index.html CCL-2021评测页面]&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/2/26/%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v4.0.pdf 我们的参赛邀请函pdf]&lt;br /&gt;
&lt;br /&gt;
== '''评测日程''' ==&lt;br /&gt;
2021.4.1 开始并公布训练集、开发集、无标注数据&lt;br /&gt;
&lt;br /&gt;
2021.** 公布无答案测试集&lt;br /&gt;
&lt;br /&gt;
2021.** 公布有答案的测试集&lt;br /&gt;
&lt;br /&gt;
2021.** 提交截止&lt;br /&gt;
&lt;br /&gt;
2021.** 公布结果&lt;br /&gt;
&lt;br /&gt;
2021.7.1 评测结束&lt;br /&gt;
&lt;br /&gt;
== '''评测奖金''' ==&lt;br /&gt;
受中国中文信息学会资助，本次评测设置了2万元奖金，每个赛道各1万元&lt;br /&gt;
&lt;br /&gt;
第一名：5000元&lt;br /&gt;
&lt;br /&gt;
第二名：3000元&lt;br /&gt;
&lt;br /&gt;
第三名：2000元&lt;br /&gt;
&lt;br /&gt;
== '''评测数据下载''' ==&lt;br /&gt;
'''数据使用协议'''&lt;br /&gt;
&lt;br /&gt;
下载数据前需要签署数据使用协议，在收到数据使用协议后我们会发给您解压密码。&lt;br /&gt;
请您仔细阅读如下两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学（z641295453@163.com）&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/c/c1/Codt-sharing-agreement-2021.3-v1.pdf CODT2.0数据使用协议下载]（团队负责人签字，如果是公司，必须是公司法人签字）&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/alibaba-unlabeled-data-share-2019.4.4.doc PB-PC-unlabeled数据使用协议下载] (机构、学院、学校或公司盖章）&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请仔细阅读两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学&amp;lt;/font&amp;gt;&lt;br /&gt;
* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;请用机构的官方邮箱发送协议&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;由于版权保护问题，我们只面向机构、单位等团体开放数据；对于公司，我们仅面向从事句法分析研究的公司开放数据，签署协议前请先咨询我们是否有可能共享数据；解释权归我们课题组。&amp;lt;/font&amp;gt;&lt;br /&gt;
** &amp;lt;font color=&amp;quot;#FF0000&amp;quot;&amp;gt;如果您不需要无标注数据，那么只需要签署标注数据使用协议。&amp;lt;/font&amp;gt;&lt;br /&gt;
&amp;lt;!--* &amp;lt;font style=&amp;quot;background-color:yellow&amp;quot;&amp;gt;您还需要【评测报名表】也请同时发给周明月同学。&amp;lt;/font&amp;gt;--&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''训练集/开发集/无标注数据下载'''&lt;br /&gt;
&lt;br /&gt;
[数据说明Readme]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''预训练词向量下载'''&lt;br /&gt;
&lt;br /&gt;
我们分别提供了50维、100维、300维的预训练词向量&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''fine-tune-bert下载'''&lt;br /&gt;
&lt;br /&gt;
我们提供了在bert-base-chinese上微调3轮的结果&lt;br /&gt;
&lt;br /&gt;
== '''评价脚本下载''' ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/evaluate.py 评价脚本下载]&lt;br /&gt;
** 执行命令：python3 evaluate.py gold.conll sys.conll&lt;br /&gt;
** 数据集需要为CoNLL格式，与我们提供的数据集格式相同。&lt;br /&gt;
&lt;br /&gt;
== '''评测背景''' ==&lt;br /&gt;
近年来，随着深度学习技术的发展，尤其是预训练语言模型ELMo/BERT的提出，封闭领域规范文本上的句法分析性能已经达到了比较高的水平。但是，在跨领域文本，尤其是不规范的网络文本上，句法分析的性能会急剧下降。同时，如何在深度学习模型中利用结构化的句法信息也是NLP领域的重要研究问题之一，但是受到真实文本上句法性能的限制。因此，领域移植问题已经成为句法分析研究的重要挑战。为了更充分地支持句法分析领域移植研究，我们自2017年起标注了多领域句法数据集，并命名为汉语开放依存树库（CODT），目前包含16万句，涵盖10多个领域或来源的文本。2019年，我们依托NLPCC-2019会议，组织了第一届跨领域句法分析评测(Peng et al., 2019)，针对“单源零样本”和“单源少样本”领域移植场景，发布了CODT1.0数据集，包含4万句、对应4个领域。&lt;br /&gt;
今年，我们依托CCL-2021会议，组织第二届跨领域句法分析评测，针对“多源零样本”领域移植场景，发布CODT2.0数据集，包含7万句，对应6个领域。其中，通过错误检测和人工校正，CODT2.0与CODT1.0重合的数据的质量进一步提升。&lt;br /&gt;
&lt;br /&gt;
== '''数据设置''' ==&lt;br /&gt;
在本次评测任务中，我们提供约29K句平衡语料（BC）、9K句产品博客（PB）、10K句产品评论（PC）、8K句财经资讯（FIN）、8K句法律资讯（LEG）和3K句网络小说（ZX）六个领域的数据。其中BC作为基础数据，只作为源领域。后五个领域既可以作为源领域，也可以作为目标领域。另外，针对后五个领域，我们还提供了大规模的无标注数据。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align: center;&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
!      !! train !! dev  !! test !! unlabeled&lt;br /&gt;
|-&lt;br /&gt;
| BC   || 26.1K || 1K  || 2K ||   0     &lt;br /&gt;
|-&lt;br /&gt;
| PB   || 5K  || 1.3K || 2.5K || 291K&lt;br /&gt;
|-&lt;br /&gt;
| PC   || 6.8K  || 1.3K || 2.6K || 349K&lt;br /&gt;
|-&lt;br /&gt;
| FIN   || 5K  || 1K  || 1.8K || 118K&lt;br /&gt;
|-&lt;br /&gt;
| LEG   || 5K  || 1K  || 1.9K || 150K &lt;br /&gt;
|-&lt;br /&gt;
| ZX   || 1.5K  || 0.5K  || 1K || 33K&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== '''任务设置''' ==&lt;br /&gt;
本次评测分为两个赛道:&lt;br /&gt;
&lt;br /&gt;
(Closed)：多源零样本领域移植（封闭）&lt;br /&gt;
&lt;br /&gt;
(Open)：多源零样本领域移植（开放）&lt;br /&gt;
&lt;br /&gt;
含义如下：&lt;br /&gt;
* '''多源的含义'''：可以使用其他领域的训练数据作为源领域数据。例如，当目标领域为ZX时，可以使用其他五个领域（包括BC）的训练数据，即BC/PB/PC/FIN/LEG-Train。&lt;br /&gt;
* '''零样本的含义'''：不能使用对应领域的训练数据。例如，当目标领域为ZX时，那么ZX-Train不可作为训练数据使用。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* '''Closed赛道的要求'''：&lt;br /&gt;
1）	只能使用我们提供的数据和信息，包括：所有数据我们都提供分词、自动词性；我们会提供pre-trained word embedding (在Chinese Gigaword 3和所有领域Train/Unlabeled数据上训练word2vec得到)。&lt;br /&gt;
&lt;br /&gt;
2）	不可以使用其他开源工具得到新的信息，如词性、词义等特征。&lt;br /&gt;
&lt;br /&gt;
3）	不可以使用其他的资源，如词典、句法语义树库等。&lt;br /&gt;
&lt;br /&gt;
4）	不可以使用大规模无标注数据上训练的预训练语言模型（任何开源的通用语言模型），但是可以通过预训练语言模型的技术来使用我们提供的无标注数据。即可以使用在我们提供的有标注和无标注数据上从头开始训练预训练模型。&lt;br /&gt;
&lt;br /&gt;
5）	不可以使用NLPCC-2019 CODT1.0的数据。&lt;br /&gt;
&lt;br /&gt;
* '''Open赛道的要求'''：&lt;br /&gt;
&lt;br /&gt;
1）	可以使用任何可通过某种公开方式获取（包括购买）的数据、资源或工具。但是建议参赛者在系统报告中明确说明使用的外部资源以及这些外部资源对性能的影响。&lt;br /&gt;
&lt;br /&gt;
* '''注意事项'''&lt;br /&gt;
1）	开发集的使用：不允许将Dev加入到训练数据中。Dev数据只可以用来调参和选择模型。&lt;br /&gt;
&lt;br /&gt;
2）	无标注数据（Unlabeled）的使用：不限制。同时，6个领域的Train中的句子，只要不使用句法标注信息，也都可以作为无标注数据使用。&lt;br /&gt;
&lt;br /&gt;
3）	预训练语言模型微调：我们将Google发布的bert-base-chinese在所有无标注数据（6个领域的Train，5个领域的Unlabeled数据）进行多轮微调（3轮或10轮），即继续使用语言模型损失函数继续训练。这个模型仅限于Open赛道上的系统使用。我们做这个事情的目的是方便大家试试这个方向，避免大家浪费资源，重复训练。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''如果您对规则有疑问，请随时联系我们确认。如果违反规则，发现后，成绩会直接取消。'''&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3744</id>
		<title>CCL2021</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3744"/>
		<updated>2021-04-02T05:48:36Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* 评测数据下载 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== '''CCL-2021依存句法分析领域移植评测''' ==&lt;br /&gt;
* [http://cips-cl.org/static/CCL2021/cclEval/tasks/index.html CCL-2021评测页面]&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/2/26/%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v4.0.pdf 我们的参赛邀请函pdf]&lt;br /&gt;
&lt;br /&gt;
== '''评测日程''' ==&lt;br /&gt;
2021.4.1 开始并公布训练集、开发集、无标注数据&lt;br /&gt;
&lt;br /&gt;
2021.** 公布无答案测试集&lt;br /&gt;
&lt;br /&gt;
2021.** 公布有答案的测试集&lt;br /&gt;
&lt;br /&gt;
2021.** 提交截止&lt;br /&gt;
&lt;br /&gt;
2021.** 公布结果&lt;br /&gt;
&lt;br /&gt;
2021.7.1 评测结束&lt;br /&gt;
&lt;br /&gt;
== '''评测奖金''' ==&lt;br /&gt;
受中国中文信息学会资助，本次评测设置了2万元奖金，每个赛道各1万元&lt;br /&gt;
&lt;br /&gt;
第一名：5000元&lt;br /&gt;
&lt;br /&gt;
第二名：3000元&lt;br /&gt;
&lt;br /&gt;
第三名：2000元&lt;br /&gt;
&lt;br /&gt;
== '''评测数据下载''' ==&lt;br /&gt;
'''数据使用协议'''&lt;br /&gt;
&lt;br /&gt;
下载数据前需要签署数据使用协议，在收到数据使用协议后我们会发给您解压密码。&lt;br /&gt;
请您仔细阅读如下两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学（z641295453@163.com）&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/c/c1/Codt-sharing-agreement-2021.3-v1.pdf CODT2.0数据使用协议下载]（团队负责人签字，如果是公司，必须是公司法人签字）&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/alibaba-unlabeled-data-share-2019.4.4.doc PB-PC-unlabeled数据使用协议下载] (机构、学院、学校或公司盖章）&lt;br /&gt;
&lt;br /&gt;
'''训练集/开发集/无标注数据下载'''&lt;br /&gt;
&lt;br /&gt;
[数据说明Readme]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''预训练词向量下载'''&lt;br /&gt;
&lt;br /&gt;
我们分别提供了50维、100维、300维的预训练词向量&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''fine-tune-bert下载'''&lt;br /&gt;
&lt;br /&gt;
我们提供了在bert-base-chinese上微调3轮的结果&lt;br /&gt;
&lt;br /&gt;
== '''评价脚本下载''' ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/evaluate.py 评价脚本下载]&lt;br /&gt;
** 执行命令：python3 evaluate.py gold.conll sys.conll&lt;br /&gt;
** 数据集需要为CoNLL格式，与我们提供的数据集格式相同。&lt;br /&gt;
&lt;br /&gt;
== '''评测背景''' ==&lt;br /&gt;
近年来，随着深度学习技术的发展，尤其是预训练语言模型ELMo/BERT的提出，封闭领域规范文本上的句法分析性能已经达到了比较高的水平。但是，在跨领域文本，尤其是不规范的网络文本上，句法分析的性能会急剧下降。同时，如何在深度学习模型中利用结构化的句法信息也是NLP领域的重要研究问题之一，但是受到真实文本上句法性能的限制。因此，领域移植问题已经成为句法分析研究的重要挑战。为了更充分地支持句法分析领域移植研究，我们自2017年起标注了多领域句法数据集，并命名为汉语开放依存树库（CODT），目前包含16万句，涵盖10多个领域或来源的文本。2019年，我们依托NLPCC-2019会议，组织了第一届跨领域句法分析评测(Peng et al., 2019)，针对“单源零样本”和“单源少样本”领域移植场景，发布了CODT1.0数据集，包含4万句、对应4个领域。&lt;br /&gt;
今年，我们依托CCL-2021会议，组织第二届跨领域句法分析评测，针对“多源零样本”领域移植场景，发布CODT2.0数据集，包含7万句，对应6个领域。其中，通过错误检测和人工校正，CODT2.0与CODT1.0重合的数据的质量进一步提升。&lt;br /&gt;
&lt;br /&gt;
== '''数据设置''' ==&lt;br /&gt;
在本次评测任务中，我们提供约29K句平衡语料（BC）、9K句产品博客（PB）、10K句产品评论（PC）、8K句财经资讯（FIN）、8K句法律资讯（LEG）和3K句网络小说（ZX）六个领域的数据。其中BC作为基础数据，只作为源领域。后五个领域既可以作为源领域，也可以作为目标领域。另外，针对后五个领域，我们还提供了大规模的无标注数据。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align: center;&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
!      !! train !! dev  !! test !! unlabeled&lt;br /&gt;
|-&lt;br /&gt;
| BC   || 26.1K || 1K  || 2K ||   0     &lt;br /&gt;
|-&lt;br /&gt;
| PB   || 5K  || 1.3K || 2.5K || 291K&lt;br /&gt;
|-&lt;br /&gt;
| PC   || 6.8K  || 1.3K || 2.6K || 349K&lt;br /&gt;
|-&lt;br /&gt;
| FIN   || 5K  || 1K  || 1.8K || 118K&lt;br /&gt;
|-&lt;br /&gt;
| LEG   || 5K  || 1K  || 1.9K || 150K &lt;br /&gt;
|-&lt;br /&gt;
| ZX   || 1.5K  || 0.5K  || 1K || 33K&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== '''任务设置''' ==&lt;br /&gt;
本次评测分为两个赛道:&lt;br /&gt;
&lt;br /&gt;
(Closed)：多源零样本领域移植（封闭）&lt;br /&gt;
&lt;br /&gt;
(Open)：多源零样本领域移植（开放）&lt;br /&gt;
&lt;br /&gt;
含义如下：&lt;br /&gt;
* '''多源的含义'''：可以使用其他领域的训练数据作为源领域数据。例如，当目标领域为ZX时，可以使用其他五个领域（包括BC）的训练数据，即BC/PB/PC/FIN/LEG-Train。&lt;br /&gt;
* '''零样本的含义'''：不能使用对应领域的训练数据。例如，当目标领域为ZX时，那么ZX-Train不可作为训练数据使用。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* '''Closed赛道的要求'''：&lt;br /&gt;
1）	只能使用我们提供的数据和信息，包括：所有数据我们都提供分词、自动词性；我们会提供pre-trained word embedding (在Chinese Gigaword 3和所有领域Train/Unlabeled数据上训练word2vec得到)。&lt;br /&gt;
&lt;br /&gt;
2）	不可以使用其他开源工具得到新的信息，如词性、词义等特征。&lt;br /&gt;
&lt;br /&gt;
3）	不可以使用其他的资源，如词典、句法语义树库等。&lt;br /&gt;
&lt;br /&gt;
4）	不可以使用大规模无标注数据上训练的预训练语言模型（任何开源的通用语言模型），但是可以通过预训练语言模型的技术来使用我们提供的无标注数据。即可以使用在我们提供的有标注和无标注数据上从头开始训练预训练模型。&lt;br /&gt;
&lt;br /&gt;
5）	不可以使用NLPCC-2019 CODT1.0的数据。&lt;br /&gt;
&lt;br /&gt;
* '''Open赛道的要求'''：&lt;br /&gt;
&lt;br /&gt;
1）	可以使用任何可通过某种公开方式获取（包括购买）的数据、资源或工具。但是建议参赛者在系统报告中明确说明使用的外部资源以及这些外部资源对性能的影响。&lt;br /&gt;
&lt;br /&gt;
* '''注意事项'''&lt;br /&gt;
1）	开发集的使用：不允许将Dev加入到训练数据中。Dev数据只可以用来调参和选择模型。&lt;br /&gt;
&lt;br /&gt;
2）	无标注数据（Unlabeled）的使用：不限制。同时，6个领域的Train中的句子，只要不使用句法标注信息，也都可以作为无标注数据使用。&lt;br /&gt;
&lt;br /&gt;
3）	预训练语言模型微调：我们将Google发布的bert-base-chinese在所有无标注数据（6个领域的Train，5个领域的Unlabeled数据）进行多轮微调（3轮或10轮），即继续使用语言模型损失函数继续训练。这个模型仅限于Open赛道上的系统使用。我们做这个事情的目的是方便大家试试这个方向，避免大家浪费资源，重复训练。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''如果您对规则有疑问，请随时联系我们确认。如果违反规则，发现后，成绩会直接取消。'''&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3743</id>
		<title>CCL2021</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3743"/>
		<updated>2021-04-02T05:48:01Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* 评测数据下载 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== '''CCL-2021依存句法分析领域移植评测''' ==&lt;br /&gt;
* [http://cips-cl.org/static/CCL2021/cclEval/tasks/index.html CCL-2021评测页面]&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/2/26/%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v4.0.pdf 我们的参赛邀请函pdf]&lt;br /&gt;
&lt;br /&gt;
== '''评测日程''' ==&lt;br /&gt;
2021.4.1 开始并公布训练集、开发集、无标注数据&lt;br /&gt;
&lt;br /&gt;
2021.** 公布无答案测试集&lt;br /&gt;
&lt;br /&gt;
2021.** 公布有答案的测试集&lt;br /&gt;
&lt;br /&gt;
2021.** 提交截止&lt;br /&gt;
&lt;br /&gt;
2021.** 公布结果&lt;br /&gt;
&lt;br /&gt;
2021.7.1 评测结束&lt;br /&gt;
&lt;br /&gt;
== '''评测奖金''' ==&lt;br /&gt;
受中国中文信息学会资助，本次评测设置了2万元奖金，每个赛道各1万元&lt;br /&gt;
&lt;br /&gt;
第一名：5000元&lt;br /&gt;
&lt;br /&gt;
第二名：3000元&lt;br /&gt;
&lt;br /&gt;
第三名：2000元&lt;br /&gt;
&lt;br /&gt;
== '''评测数据下载''' ==&lt;br /&gt;
'''数据使用协议'''&lt;br /&gt;
&lt;br /&gt;
下载数据前需要签署数据使用协议，在收到数据使用协议后我们会发给您解压密码。&lt;br /&gt;
请您仔细阅读如下两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/c/c1/Codt-sharing-agreement-2021.3-v1.pdf CODT2.0数据使用协议下载]（团队负责人签字，如果是公司，必须是公司法人签字）&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/alibaba-unlabeled-data-share-2019.4.4.doc PB-PC-unlabeled数据使用协议下载] (机构、学院、学校或公司盖章）&lt;br /&gt;
&lt;br /&gt;
'''训练集/开发集/无标注数据下载'''&lt;br /&gt;
&lt;br /&gt;
[数据说明Readme]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''预训练词向量下载'''&lt;br /&gt;
&lt;br /&gt;
我们分别提供了50维、100维、300维的预训练词向量&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''fine-tune-bert下载'''&lt;br /&gt;
&lt;br /&gt;
我们提供了在bert-base-chinese上微调3轮的结果&lt;br /&gt;
&lt;br /&gt;
== '''评价脚本下载''' ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/evaluate.py 评价脚本下载]&lt;br /&gt;
** 执行命令：python3 evaluate.py gold.conll sys.conll&lt;br /&gt;
** 数据集需要为CoNLL格式，与我们提供的数据集格式相同。&lt;br /&gt;
&lt;br /&gt;
== '''评测背景''' ==&lt;br /&gt;
近年来，随着深度学习技术的发展，尤其是预训练语言模型ELMo/BERT的提出，封闭领域规范文本上的句法分析性能已经达到了比较高的水平。但是，在跨领域文本，尤其是不规范的网络文本上，句法分析的性能会急剧下降。同时，如何在深度学习模型中利用结构化的句法信息也是NLP领域的重要研究问题之一，但是受到真实文本上句法性能的限制。因此，领域移植问题已经成为句法分析研究的重要挑战。为了更充分地支持句法分析领域移植研究，我们自2017年起标注了多领域句法数据集，并命名为汉语开放依存树库（CODT），目前包含16万句，涵盖10多个领域或来源的文本。2019年，我们依托NLPCC-2019会议，组织了第一届跨领域句法分析评测(Peng et al., 2019)，针对“单源零样本”和“单源少样本”领域移植场景，发布了CODT1.0数据集，包含4万句、对应4个领域。&lt;br /&gt;
今年，我们依托CCL-2021会议，组织第二届跨领域句法分析评测，针对“多源零样本”领域移植场景，发布CODT2.0数据集，包含7万句，对应6个领域。其中，通过错误检测和人工校正，CODT2.0与CODT1.0重合的数据的质量进一步提升。&lt;br /&gt;
&lt;br /&gt;
== '''数据设置''' ==&lt;br /&gt;
在本次评测任务中，我们提供约29K句平衡语料（BC）、9K句产品博客（PB）、10K句产品评论（PC）、8K句财经资讯（FIN）、8K句法律资讯（LEG）和3K句网络小说（ZX）六个领域的数据。其中BC作为基础数据，只作为源领域。后五个领域既可以作为源领域，也可以作为目标领域。另外，针对后五个领域，我们还提供了大规模的无标注数据。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align: center;&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
!      !! train !! dev  !! test !! unlabeled&lt;br /&gt;
|-&lt;br /&gt;
| BC   || 26.1K || 1K  || 2K ||   0     &lt;br /&gt;
|-&lt;br /&gt;
| PB   || 5K  || 1.3K || 2.5K || 291K&lt;br /&gt;
|-&lt;br /&gt;
| PC   || 6.8K  || 1.3K || 2.6K || 349K&lt;br /&gt;
|-&lt;br /&gt;
| FIN   || 5K  || 1K  || 1.8K || 118K&lt;br /&gt;
|-&lt;br /&gt;
| LEG   || 5K  || 1K  || 1.9K || 150K &lt;br /&gt;
|-&lt;br /&gt;
| ZX   || 1.5K  || 0.5K  || 1K || 33K&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== '''任务设置''' ==&lt;br /&gt;
本次评测分为两个赛道:&lt;br /&gt;
&lt;br /&gt;
(Closed)：多源零样本领域移植（封闭）&lt;br /&gt;
&lt;br /&gt;
(Open)：多源零样本领域移植（开放）&lt;br /&gt;
&lt;br /&gt;
含义如下：&lt;br /&gt;
* '''多源的含义'''：可以使用其他领域的训练数据作为源领域数据。例如，当目标领域为ZX时，可以使用其他五个领域（包括BC）的训练数据，即BC/PB/PC/FIN/LEG-Train。&lt;br /&gt;
* '''零样本的含义'''：不能使用对应领域的训练数据。例如，当目标领域为ZX时，那么ZX-Train不可作为训练数据使用。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* '''Closed赛道的要求'''：&lt;br /&gt;
1）	只能使用我们提供的数据和信息，包括：所有数据我们都提供分词、自动词性；我们会提供pre-trained word embedding (在Chinese Gigaword 3和所有领域Train/Unlabeled数据上训练word2vec得到)。&lt;br /&gt;
&lt;br /&gt;
2）	不可以使用其他开源工具得到新的信息，如词性、词义等特征。&lt;br /&gt;
&lt;br /&gt;
3）	不可以使用其他的资源，如词典、句法语义树库等。&lt;br /&gt;
&lt;br /&gt;
4）	不可以使用大规模无标注数据上训练的预训练语言模型（任何开源的通用语言模型），但是可以通过预训练语言模型的技术来使用我们提供的无标注数据。即可以使用在我们提供的有标注和无标注数据上从头开始训练预训练模型。&lt;br /&gt;
&lt;br /&gt;
5）	不可以使用NLPCC-2019 CODT1.0的数据。&lt;br /&gt;
&lt;br /&gt;
* '''Open赛道的要求'''：&lt;br /&gt;
&lt;br /&gt;
1）	可以使用任何可通过某种公开方式获取（包括购买）的数据、资源或工具。但是建议参赛者在系统报告中明确说明使用的外部资源以及这些外部资源对性能的影响。&lt;br /&gt;
&lt;br /&gt;
* '''注意事项'''&lt;br /&gt;
1）	开发集的使用：不允许将Dev加入到训练数据中。Dev数据只可以用来调参和选择模型。&lt;br /&gt;
&lt;br /&gt;
2）	无标注数据（Unlabeled）的使用：不限制。同时，6个领域的Train中的句子，只要不使用句法标注信息，也都可以作为无标注数据使用。&lt;br /&gt;
&lt;br /&gt;
3）	预训练语言模型微调：我们将Google发布的bert-base-chinese在所有无标注数据（6个领域的Train，5个领域的Unlabeled数据）进行多轮微调（3轮或10轮），即继续使用语言模型损失函数继续训练。这个模型仅限于Open赛道上的系统使用。我们做这个事情的目的是方便大家试试这个方向，避免大家浪费资源，重复训练。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''如果您对规则有疑问，请随时联系我们确认。如果违反规则，发现后，成绩会直接取消。'''&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3714</id>
		<title>CCL2021</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3714"/>
		<updated>2021-03-22T08:00:22Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* 评测数据下载 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== '''CCL-2021依存句法分析领域移植评测''' ==&lt;br /&gt;
* [http://cips-cl.org/static/CCL2021/cclEval/tasks/index.html CCL-2021评测页面]&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/2/26/%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v4.0.pdf 我们的参赛邀请函pdf]&lt;br /&gt;
&lt;br /&gt;
== '''评测日程''' ==&lt;br /&gt;
2021.4.1 开始并公布训练集、开发集、无标注数据&lt;br /&gt;
&lt;br /&gt;
2021.** 公布无答案测试集&lt;br /&gt;
&lt;br /&gt;
2021.** 公布有答案的测试集&lt;br /&gt;
&lt;br /&gt;
2021.** 提交截止&lt;br /&gt;
&lt;br /&gt;
2021.** 公布结果&lt;br /&gt;
&lt;br /&gt;
2021.7.1 评测结束&lt;br /&gt;
&lt;br /&gt;
== '''评测奖金''' ==&lt;br /&gt;
受中国中文信息学会资助，本次评测设置了2万元奖金，每个赛道各1万元&lt;br /&gt;
&lt;br /&gt;
第一名：5000元&lt;br /&gt;
&lt;br /&gt;
第二名：3000元&lt;br /&gt;
&lt;br /&gt;
第三名：2000元&lt;br /&gt;
&lt;br /&gt;
== '''评测数据下载''' ==&lt;br /&gt;
'''数据使用协议'''&lt;br /&gt;
&lt;br /&gt;
下载数据前需要签署数据使用协议，在收到数据使用协议后我们会发给您解压密码。&lt;br /&gt;
请您仔细阅读如下两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/c/c1/Codt-sharing-agreement-2021.3-v1.pdf CODT2.0数据使用协议下载]（团队负责人签字，如果是公司，必须是公司法人签字）&lt;br /&gt;
* [PB-PC-unlabeled数据使用协议下载] (机构、学院、学校或公司盖章）&lt;br /&gt;
&lt;br /&gt;
'''训练集/开发集/无标注数据下载'''&lt;br /&gt;
&lt;br /&gt;
[数据说明Readme]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''预训练词向量下载'''&lt;br /&gt;
&lt;br /&gt;
我们分别提供了50维、100维、300维的预训练词向量&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''fine-tune-bert下载'''&lt;br /&gt;
&lt;br /&gt;
我们提供了在bert-base-chinese上微调3轮的结果&lt;br /&gt;
&lt;br /&gt;
== '''评价脚本下载''' ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/evaluate.py 评价脚本下载]&lt;br /&gt;
** 执行命令：python3 evaluate.py gold.conll sys.conll&lt;br /&gt;
** 数据集需要为CoNLL格式，与我们提供的数据集格式相同。&lt;br /&gt;
&lt;br /&gt;
== '''评测背景''' ==&lt;br /&gt;
近年来，随着深度学习技术的发展，尤其是预训练语言模型ELMo/BERT的提出，封闭领域规范文本上的句法分析性能已经达到了比较高的水平。但是，在跨领域文本，尤其是不规范的网络文本上，句法分析的性能会急剧下降。同时，如何在深度学习模型中利用结构化的句法信息也是NLP领域的重要研究问题之一，但是受到真实文本上句法性能的限制。因此，领域移植问题已经成为句法分析研究的重要挑战。为了更充分地支持句法分析领域移植研究，我们自2017年起标注了多领域句法数据集，并命名为汉语开放依存树库（CODT），目前包含16万句，涵盖10多个领域或来源的文本。2019年，我们依托NLPCC-2019会议，组织了第一届跨领域句法分析评测(Peng et al., 2019)，针对“单源零样本”和“单源少样本”领域移植场景，发布了CODT1.0数据集，包含4万句、对应4个领域。&lt;br /&gt;
今年，我们依托CCL-2021会议，组织第二届跨领域句法分析评测，针对“多源零样本”领域移植场景，发布CODT2.0数据集，包含7万句，对应6个领域。其中，通过错误检测和人工校正，CODT2.0与CODT1.0重合的数据的质量进一步提升。&lt;br /&gt;
&lt;br /&gt;
== '''数据设置''' ==&lt;br /&gt;
在本次评测任务中，我们提供约29K句平衡语料（BC）、9K句产品博客（PB）、10K句产品评论（PC）、8K句财经资讯（FIN）、8K句法律资讯（LEG）和3K句网络小说（ZX）六个领域的数据。其中BC作为基础数据，只作为源领域。后五个领域既可以作为源领域，也可以作为目标领域。另外，针对后五个领域，我们还提供了大规模的无标注数据。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align: center;&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
!      !! train !! dev  !! test !! unlabeled&lt;br /&gt;
|-&lt;br /&gt;
| BC   || 26.1K || 1K  || 2K ||   0     &lt;br /&gt;
|-&lt;br /&gt;
| PB   || 5K  || 1.3K || 2.5K || 291K&lt;br /&gt;
|-&lt;br /&gt;
| PC   || 6.8K  || 1.3K || 2.6K || 349K&lt;br /&gt;
|-&lt;br /&gt;
| FIN   || 5K  || 1K  || 1.8K || 118K&lt;br /&gt;
|-&lt;br /&gt;
| LEG   || 5K  || 1K  || 1.9K || 150K &lt;br /&gt;
|-&lt;br /&gt;
| ZX   || 1.5K  || 0.5K  || 1K || 33K&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== '''任务设置''' ==&lt;br /&gt;
本次评测分为两个赛道:&lt;br /&gt;
&lt;br /&gt;
(Closed)：多源零样本领域移植（封闭）&lt;br /&gt;
&lt;br /&gt;
(Open)：多源零样本领域移植（开放）&lt;br /&gt;
&lt;br /&gt;
含义如下：&lt;br /&gt;
* '''多源的含义'''：可以使用其他领域的训练数据作为源领域数据。例如，当目标领域为ZX时，可以使用其他五个领域（包括BC）的训练数据，即BC/PB/PC/FIN/LEG-Train。&lt;br /&gt;
* '''零样本的含义'''：不能使用对应领域的训练数据。例如，当目标领域为ZX时，那么ZX-Train不可作为训练数据使用。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* '''Closed赛道的要求'''：&lt;br /&gt;
1）	只能使用我们提供的数据和信息，包括：所有数据我们都提供分词、自动词性；我们会提供pre-trained word embedding (在Chinese Gigaword 3和所有领域Train/Unlabeled数据上训练word2vec得到)。&lt;br /&gt;
&lt;br /&gt;
2）	不可以使用其他开源工具得到新的信息，如词性、词义等特征。&lt;br /&gt;
&lt;br /&gt;
3）	不可以使用其他的资源，如词典、句法语义树库等。&lt;br /&gt;
&lt;br /&gt;
4）	不可以使用大规模无标注数据上训练的预训练语言模型（任何开源的通用语言模型），但是可以通过预训练语言模型的技术来使用我们提供的无标注数据。即可以使用在我们提供的有标注和无标注数据上从头开始训练预训练模型。&lt;br /&gt;
&lt;br /&gt;
5）	不可以使用NLPCC-2019 CODT1.0的数据。&lt;br /&gt;
&lt;br /&gt;
* '''Open赛道的要求'''：&lt;br /&gt;
&lt;br /&gt;
1）	可以使用任何可通过某种公开方式获取（包括购买）的数据、资源或工具。但是建议参赛者在系统报告中明确说明使用的外部资源以及这些外部资源对性能的影响。&lt;br /&gt;
&lt;br /&gt;
* '''注意事项'''&lt;br /&gt;
1）	开发集的使用：不允许将Dev加入到训练数据中。Dev数据只可以用来调参和选择模型。&lt;br /&gt;
&lt;br /&gt;
2）	无标注数据（Unlabeled）的使用：不限制。同时，6个领域的Train中的句子，只要不使用句法标注信息，也都可以作为无标注数据使用。&lt;br /&gt;
&lt;br /&gt;
3）	预训练语言模型微调：我们将Google发布的bert-base-chinese在所有无标注数据（6个领域的Train，5个领域的Unlabeled数据）进行多轮微调（3轮或10轮），即继续使用语言模型损失函数继续训练。这个模型仅限于Open赛道上的系统使用。我们做这个事情的目的是方便大家试试这个方向，避免大家浪费资源，重复训练。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''如果您对规则有疑问，请随时联系我们确认。如果违反规则，发现后，成绩会直接取消。'''&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=%E6%96%87%E4%BB%B6:Codt-sharing-agreement-2021.3-v1.pdf&amp;diff=3712</id>
		<title>文件:Codt-sharing-agreement-2021.3-v1.pdf</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=%E6%96%87%E4%BB%B6:Codt-sharing-agreement-2021.3-v1.pdf&amp;diff=3712"/>
		<updated>2021-03-22T08:00:05Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3711</id>
		<title>CCL2021</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3711"/>
		<updated>2021-03-22T07:59:19Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* CCL-2021依存句法分析领域移植评测 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== '''CCL-2021依存句法分析领域移植评测''' ==&lt;br /&gt;
* [http://cips-cl.org/static/CCL2021/cclEval/tasks/index.html CCL-2021评测页面]&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/2/26/%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v4.0.pdf 我们的参赛邀请函pdf]&lt;br /&gt;
&lt;br /&gt;
== '''评测日程''' ==&lt;br /&gt;
2021.4.1 开始并公布训练集、开发集、无标注数据&lt;br /&gt;
&lt;br /&gt;
2021.** 公布无答案测试集&lt;br /&gt;
&lt;br /&gt;
2021.** 公布有答案的测试集&lt;br /&gt;
&lt;br /&gt;
2021.** 提交截止&lt;br /&gt;
&lt;br /&gt;
2021.** 公布结果&lt;br /&gt;
&lt;br /&gt;
2021.7.1 评测结束&lt;br /&gt;
&lt;br /&gt;
== '''评测奖金''' ==&lt;br /&gt;
受中国中文信息学会资助，本次评测设置了2万元奖金，每个赛道各1万元&lt;br /&gt;
&lt;br /&gt;
第一名：5000元&lt;br /&gt;
&lt;br /&gt;
第二名：3000元&lt;br /&gt;
&lt;br /&gt;
第三名：2000元&lt;br /&gt;
&lt;br /&gt;
== '''评测数据下载''' ==&lt;br /&gt;
'''数据使用协议'''&lt;br /&gt;
&lt;br /&gt;
下载数据前需要签署数据使用协议，在收到数据使用协议后我们会发给您解压密码。&lt;br /&gt;
请您仔细阅读如下两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学&lt;br /&gt;
* [CODT2.0数据使用协议下载]（团队负责人签字，如果是公司，必须是公司法人签字）&lt;br /&gt;
* [PB-PC-unlabeled数据使用协议下载] (机构、学院、学校或公司盖章）&lt;br /&gt;
&lt;br /&gt;
'''训练集/开发集/无标注数据'''&lt;br /&gt;
&lt;br /&gt;
[数据说明Readme]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''预训练词向量下载'''&lt;br /&gt;
&lt;br /&gt;
我们分别提供了50维、100维、300维的预训练词向量&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''fine-tune-bert'''&lt;br /&gt;
&lt;br /&gt;
我们提供了在bert-base-chinese上微调3轮的结果&lt;br /&gt;
&lt;br /&gt;
== '''评价脚本下载''' ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/evaluate.py 评价脚本下载]&lt;br /&gt;
** 执行命令：python3 evaluate.py gold.conll sys.conll&lt;br /&gt;
** 数据集需要为CoNLL格式，与我们提供的数据集格式相同。&lt;br /&gt;
&lt;br /&gt;
== '''评测背景''' ==&lt;br /&gt;
近年来，随着深度学习技术的发展，尤其是预训练语言模型ELMo/BERT的提出，封闭领域规范文本上的句法分析性能已经达到了比较高的水平。但是，在跨领域文本，尤其是不规范的网络文本上，句法分析的性能会急剧下降。同时，如何在深度学习模型中利用结构化的句法信息也是NLP领域的重要研究问题之一，但是受到真实文本上句法性能的限制。因此，领域移植问题已经成为句法分析研究的重要挑战。为了更充分地支持句法分析领域移植研究，我们自2017年起标注了多领域句法数据集，并命名为汉语开放依存树库（CODT），目前包含16万句，涵盖10多个领域或来源的文本。2019年，我们依托NLPCC-2019会议，组织了第一届跨领域句法分析评测(Peng et al., 2019)，针对“单源零样本”和“单源少样本”领域移植场景，发布了CODT1.0数据集，包含4万句、对应4个领域。&lt;br /&gt;
今年，我们依托CCL-2021会议，组织第二届跨领域句法分析评测，针对“多源零样本”领域移植场景，发布CODT2.0数据集，包含7万句，对应6个领域。其中，通过错误检测和人工校正，CODT2.0与CODT1.0重合的数据的质量进一步提升。&lt;br /&gt;
&lt;br /&gt;
== '''数据设置''' ==&lt;br /&gt;
在本次评测任务中，我们提供约29K句平衡语料（BC）、9K句产品博客（PB）、10K句产品评论（PC）、8K句财经资讯（FIN）、8K句法律资讯（LEG）和3K句网络小说（ZX）六个领域的数据。其中BC作为基础数据，只作为源领域。后五个领域既可以作为源领域，也可以作为目标领域。另外，针对后五个领域，我们还提供了大规模的无标注数据。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align: center;&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
!      !! train !! dev  !! test !! unlabeled&lt;br /&gt;
|-&lt;br /&gt;
| BC   || 26.1K || 1K  || 2K ||   0     &lt;br /&gt;
|-&lt;br /&gt;
| PB   || 5K  || 1.3K || 2.5K || 291K&lt;br /&gt;
|-&lt;br /&gt;
| PC   || 6.8K  || 1.3K || 2.6K || 349K&lt;br /&gt;
|-&lt;br /&gt;
| FIN   || 5K  || 1K  || 1.8K || 118K&lt;br /&gt;
|-&lt;br /&gt;
| LEG   || 5K  || 1K  || 1.9K || 150K &lt;br /&gt;
|-&lt;br /&gt;
| ZX   || 1.5K  || 0.5K  || 1K || 33K&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== '''任务设置''' ==&lt;br /&gt;
本次评测分为两个赛道:&lt;br /&gt;
&lt;br /&gt;
(Closed)：多源零样本领域移植（封闭）&lt;br /&gt;
&lt;br /&gt;
(Open)：多源零样本领域移植（开放）&lt;br /&gt;
&lt;br /&gt;
含义如下：&lt;br /&gt;
* '''多源的含义'''：可以使用其他领域的训练数据作为源领域数据。例如，当目标领域为ZX时，可以使用其他五个领域（包括BC）的训练数据，即BC/PB/PC/FIN/LEG-Train。&lt;br /&gt;
* '''零样本的含义'''：不能使用对应领域的训练数据。例如，当目标领域为ZX时，那么ZX-Train不可作为训练数据使用。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* '''Closed赛道的要求'''：&lt;br /&gt;
1）	只能使用我们提供的数据和信息，包括：所有数据我们都提供分词、自动词性；我们会提供pre-trained word embedding (在Chinese Gigaword 3和所有领域Train/Unlabeled数据上训练word2vec得到)。&lt;br /&gt;
&lt;br /&gt;
2）	不可以使用其他开源工具得到新的信息，如词性、词义等特征。&lt;br /&gt;
&lt;br /&gt;
3）	不可以使用其他的资源，如词典、句法语义树库等。&lt;br /&gt;
&lt;br /&gt;
4）	不可以使用大规模无标注数据上训练的预训练语言模型（任何开源的通用语言模型），但是可以通过预训练语言模型的技术来使用我们提供的无标注数据。即可以使用在我们提供的有标注和无标注数据上从头开始训练预训练模型。&lt;br /&gt;
&lt;br /&gt;
5）	不可以使用NLPCC-2019 CODT1.0的数据。&lt;br /&gt;
&lt;br /&gt;
* '''Open赛道的要求'''：&lt;br /&gt;
&lt;br /&gt;
1）	可以使用任何可通过某种公开方式获取（包括购买）的数据、资源或工具。但是建议参赛者在系统报告中明确说明使用的外部资源以及这些外部资源对性能的影响。&lt;br /&gt;
&lt;br /&gt;
* '''注意事项'''&lt;br /&gt;
1）	开发集的使用：不允许将Dev加入到训练数据中。Dev数据只可以用来调参和选择模型。&lt;br /&gt;
&lt;br /&gt;
2）	无标注数据（Unlabeled）的使用：不限制。同时，6个领域的Train中的句子，只要不使用句法标注信息，也都可以作为无标注数据使用。&lt;br /&gt;
&lt;br /&gt;
3）	预训练语言模型微调：我们将Google发布的bert-base-chinese在所有无标注数据（6个领域的Train，5个领域的Unlabeled数据）进行多轮微调（3轮或10轮），即继续使用语言模型损失函数继续训练。这个模型仅限于Open赛道上的系统使用。我们做这个事情的目的是方便大家试试这个方向，避免大家浪费资源，重复训练。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''如果您对规则有疑问，请随时联系我们确认。如果违反规则，发现后，成绩会直接取消。'''&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=%E6%96%87%E4%BB%B6:%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v4.0.pdf&amp;diff=3710</id>
		<title>文件:依存句法领域移植评测ccl2021-cfp-v4.0.pdf</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=%E6%96%87%E4%BB%B6:%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v4.0.pdf&amp;diff=3710"/>
		<updated>2021-03-22T07:58:54Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
	<entry>
		<id>http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3707</id>
		<title>CCL2021</title>
		<link rel="alternate" type="text/html" href="http://hlt.suda.edu.cn/index.php?title=CCL2021&amp;diff=3707"/>
		<updated>2021-03-22T06:35:13Z</updated>

		<summary type="html">&lt;p&gt;Myzhou：/* CCL-2021依存句法分析领域移植评测 */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== '''CCL-2021依存句法分析领域移植评测''' ==&lt;br /&gt;
* [http://cips-cl.org/static/CCL2021/cclEval/tasks/index.html CCL-2021评测页面]&lt;br /&gt;
* [http://hlt.suda.edu.cn/images/c/cf/%E4%BE%9D%E5%AD%98%E5%8F%A5%E6%B3%95%E9%A2%86%E5%9F%9F%E7%A7%BB%E6%A4%8D%E8%AF%84%E6%B5%8Bccl2021-cfp-v3.0.pdf 我们的参赛邀请函pdf]&lt;br /&gt;
&lt;br /&gt;
== '''评测背景''' ==&lt;br /&gt;
近年来，随着深度学习技术的发展，尤其是预训练语言模型ELMo/BERT的提出，封闭领域规范文本上的句法分析性能已经达到了比较高的水平。但是，在跨领域文本，尤其是不规范的网络文本上，句法分析的性能会急剧下降。同时，如何在深度学习模型中利用结构化的句法信息也是NLP领域的重要研究问题之一，但是受到真实文本上句法性能的限制。因此，领域移植问题已经成为句法分析研究的重要挑战。为了更充分地支持句法分析领域移植研究，我们自2017年起标注了多领域句法数据集，并命名为汉语开放依存树库（CODT），目前包含16万句，涵盖10多个领域或来源的文本。2019年，我们依托NLPCC-2019会议，组织了第一届跨领域句法分析评测(Peng et al., 2019)，针对“单源零样本”和“单源少样本”领域移植场景，发布了CODT1.0数据集，包含4万句、对应4个领域。&lt;br /&gt;
今年，我们依托CCL-2021会议，组织第二届跨领域句法分析评测，针对“多源零样本”领域移植场景，发布CODT2.0数据集，包含7万句，对应6个领域。其中，通过错误检测和人工校正，CODT2.0与CODT1.0重合的数据的质量进一步提升。&lt;br /&gt;
&lt;br /&gt;
== '''数据设置''' ==&lt;br /&gt;
在本次评测任务中，我们提供约29K句平衡语料（BC）、9K句产品博客（PB）、10K句产品评论（PC）、8K句财经资讯（FIN）、8K句法律资讯（LEG）和3K句网络小说（ZX）六个领域的数据。其中BC作为基础数据，只作为源领域。后五个领域既可以作为源领域，也可以作为目标领域。另外，针对后五个领域，我们还提供了大规模的无标注数据。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align: center;&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
!      !! train !! dev  !! test !! unlabeled&lt;br /&gt;
|-&lt;br /&gt;
| BC   || 26.1K || 1K  || 2K ||   0     &lt;br /&gt;
|-&lt;br /&gt;
| PB   || 5K  || 1.3K || 2.5K || 291K&lt;br /&gt;
|-&lt;br /&gt;
| PC   || 6.8K  || 1.3K || 2.6K || 349K&lt;br /&gt;
|-&lt;br /&gt;
| FIN   || 5K  || 1K  || 1.8K || 118K&lt;br /&gt;
|-&lt;br /&gt;
| LEG   || 5K  || 1K  || 1.9K || 150K &lt;br /&gt;
|-&lt;br /&gt;
| ZX   || 1.5K  || 0.5K  || 1K || 33K&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== '''任务设置''' ==&lt;br /&gt;
本次评测分为两个赛道:&lt;br /&gt;
&lt;br /&gt;
(Closed)：多源零样本领域移植（封闭）&lt;br /&gt;
&lt;br /&gt;
(Open)：多源零样本领域移植（开放）&lt;br /&gt;
&lt;br /&gt;
含义如下：&lt;br /&gt;
* '''多源的含义'''：可以使用其他领域的训练数据作为源领域数据。例如，当目标领域为ZX时，可以使用其他五个领域（包括BC）的训练数据，即BC/PB/PC/FIN/LEG-Train。&lt;br /&gt;
* '''零样本的含义'''：不能使用对应领域的训练数据。例如，当目标领域为ZX时，那么ZX-Train不可作为训练数据使用。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
* '''Closed赛道的要求'''：&lt;br /&gt;
1）	只能使用我们提供的数据和信息，包括：所有数据我们都提供分词、自动词性；我们会提供pre-trained word embedding (在Chinese Gigaword 3和所有领域Train/Unlabeled数据上训练word2vec得到)。&lt;br /&gt;
&lt;br /&gt;
2）	不可以使用其他开源工具得到新的信息，如词性、词义等特征。&lt;br /&gt;
&lt;br /&gt;
3）	不可以使用其他的资源，如词典、句法语义树库等。&lt;br /&gt;
&lt;br /&gt;
4）	不可以使用大规模无标注数据上训练的预训练语言模型（任何开源的通用语言模型），但是可以通过预训练语言模型的技术来使用我们提供的无标注数据。即可以使用在我们提供的有标注和无标注数据上从头开始训练预训练模型。&lt;br /&gt;
&lt;br /&gt;
5）	不可以使用NLPCC-2019 CODT1.0的数据。&lt;br /&gt;
&lt;br /&gt;
* '''Open赛道的要求'''：&lt;br /&gt;
&lt;br /&gt;
1）	可以使用任何可通过某种公开方式获取（包括购买）的数据、资源或工具。但是建议参赛者在系统报告中明确说明使用的外部资源以及这些外部资源对性能的影响。&lt;br /&gt;
&lt;br /&gt;
* '''注意事项'''&lt;br /&gt;
1）	开发集的使用：不允许将Dev加入到训练数据中。Dev数据只可以用来调参和选择模型。&lt;br /&gt;
&lt;br /&gt;
2）	无标注数据（Unlabeled）的使用：不限制。同时，6个领域的Train中的句子，只要不使用句法标注信息，也都可以作为无标注数据使用。&lt;br /&gt;
&lt;br /&gt;
3）	预训练语言模型微调：我们将Google发布的bert-base-chinese在所有无标注数据（6个领域的Train，5个领域的Unlabeled数据）进行多轮微调（3轮或10轮），即继续使用语言模型损失函数继续训练。这个模型仅限于Open赛道上的系统使用。我们做这个事情的目的是方便大家试试这个方向，避免大家浪费资源，重复训练。&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''如果您对规则有疑问，请随时联系我们确认。如果违反规则，发现后，成绩会直接取消。'''&lt;br /&gt;
&lt;br /&gt;
== '''评测日程''' ==&lt;br /&gt;
2021.4.1 开始并公布训练集、开发集、无标注数据&lt;br /&gt;
&lt;br /&gt;
2021.** 公布无答案测试集&lt;br /&gt;
&lt;br /&gt;
2021.** 公布有答案的测试集&lt;br /&gt;
&lt;br /&gt;
2021.** 提交截止&lt;br /&gt;
&lt;br /&gt;
2021.** 公布结果&lt;br /&gt;
&lt;br /&gt;
2021.7.1 评测结束&lt;br /&gt;
&lt;br /&gt;
== '''评测奖金''' ==&lt;br /&gt;
受中国中文信息学会资助，本次评测设置了2万元奖金，每个赛道各1万元&lt;br /&gt;
&lt;br /&gt;
第一名：5000元&lt;br /&gt;
&lt;br /&gt;
第二名：3000元&lt;br /&gt;
&lt;br /&gt;
第三名：2000元&lt;br /&gt;
&lt;br /&gt;
== '''评测数据下载''' ==&lt;br /&gt;
'''数据使用协议'''&lt;br /&gt;
&lt;br /&gt;
下载数据前需要签署数据使用协议，在收到数据使用协议后我们会发给您解压密码。&lt;br /&gt;
请您仔细阅读如下两个协议，并根据要求签署两个协议，然后统一发邮件给周明月同学&lt;br /&gt;
* [标注数据使用协议下载]（团队负责人签字，如果是公司，必须是公司法人签字）&lt;br /&gt;
* [无标注数据使用协议下载] (机构、学院、学校或公司盖章）&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''训练集/开发集/无标注数据'''&lt;br /&gt;
&lt;br /&gt;
[数据说明Readme]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''预训练词向量下载'''&lt;br /&gt;
&lt;br /&gt;
我们分别提供了50维、100维、300维的预训练词向量&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
'''fine-tune-bert'''&lt;br /&gt;
&lt;br /&gt;
我们分别提供了在bert-base-chinese上微调3轮、10轮的结果&lt;br /&gt;
&lt;br /&gt;
== '''评价脚本下载''' ==&lt;br /&gt;
* [http://hlt.suda.edu.cn/~zhli/nlpcc2019-shared-task/evaluate.py 评价脚本下载]&lt;br /&gt;
** 执行命令：python3 evaluate.py gold.conll sys.conll&lt;br /&gt;
** 数据集需要为CoNLL格式，与我们提供的数据集格式相同。&lt;/div&gt;</summary>
		<author><name>Myzhou</name></author>
	</entry>
</feed>