SemEval-2020 Task 12: Multilingual Offensive Language Identification in Social Media (OffensEval 2020)
Marcos Zampieri1, Preslav Nakov2, Sara Rosenthal3, Pepa Atanasova4, Georgi Karadzhov5 Hamdy Mubarak2, Leon Derczynski6, Zeses Pitenis7, Çağrı Çöltekin8 1Rochester Institute of Technology, USA, 2Qatar Computing Research Institute, Qatar 3IBM Research, USA, 4University of Copenhagen, Denmark, 5University of Cambridge, UK 6IT University Copenhagen, Denmark, 7University of Wolverhampton, UK 8University of Tübingen, Germany
Abstract
utf8
中文速览
网络上的仇恨言论、网络欺凌等攻击性语言检测问题正变得日益重要,但此前的研究大多只针对英语、且训练数据规模有限。OffensEval-2020(SemEval-2020 Task 12)在2019年版本的基础上大幅扩展,提供了一个包含超过900万条英文推文的半监督标注数据集(SOLID),并首次引入阿拉伯语、丹麦语、希腊语和土耳其语,让参赛者可以探索跨语言迁移学习。比赛沿用三级层次化标注框架,依次判断文本是否具有攻击性、攻击是否有特定目标、以及目标属于个人还是群体,共吸引528支队伍报名、145支提交正式结果,并创下SemEval赛事单任务系统描述论文数量之最(70篇)。绝大多数顶尖参赛系统采用BERT、RoBERTa或XLM-RoBERTa等预训练Transformer模型,英语子任务A的最佳F1值高达0.92,这充分表明大规模预训练语言模型结合半监督数据已成为攻击性语言检测的主流范式,而多语言数据集的发布也为未来跨语言研究奠定了重要基础。
原文 arXiv:2006.07235;中英对照 + 大白话阅读 https://aha.fim.ai/paper/2006.07235v2