RobeCzech: Czech RoBERTa, a monolingual contextualized language representation model
Milan Straka 0000-0003-3295-5576 Jakub Náplava 0000-0003-2259-1377 Jana Straková 0000-0003-0075-2408 David Samuel 0000-0003-2866-1022
Abstract
We present RobeCzech, a monolingual RoBERTa language representation model trained on Czech data. RoBERTa is a robustly optimized Transformer-based pretraining approach. We show that RobeCzech considerably outperforms equally-sized multilingual and Czech-trained contextualized language representation models, surpasses current state of the art in all five evaluated NLP tasks and reaches state-of-the-art results in four of them. The RobeCzech model is released publicly at https://hdl.handle.net/11234/1-3691 and https://huggingface.co/ufal/robeczech-base.
中文速览
捷克语自然语言处理长期依赖多语言模型,但这类模型因为要兼顾多种语言而对单一语言的表现有所妥协。研究团队专门用近50亿词的捷克语语料(包括大型书面语语料库、新闻杂志、网络文本和维基百科)训练了一个单语言版RoBERTa模型,命名为RobeCzech,并采用字节级BPE分词和优化的预训练策略。在词性标注、词形还原、依存句法分析、命名实体识别、语义分析和情感分析共五项任务上的测试表明,RobeCzech在所有任务上均超越了同等规模的多语言模型(包括多语言BERT和XLM-RoBERTa base)以及此前最优的捷克语模型Czert,在其中四项任务上刷新了最佳记录,词性标注错误率更降低了25%。该研究证明了为资源相对丰富但非英语的语言单独训练专用模型的价值,且RobeCzech已开源发布,可供学术界和工业界直接使用。
原文 arXiv:2105.11314;中英对照 + 大白话阅读 https://aha.fim.ai/paper/2105.11314v2