Annotators with Attitudes: How Annotator Beliefs And Identities Bias Toxic Language Detection
Maarten Sap♡♠ Swabha Swayamdipta♠ Laura Vianna♢ Xuhui Zhou♣ Yejin Choi♡♠ Noah A. Smith♡♠ ♡Paul G. Allen School of Computer Science, University of Washington, Seattle, WA, USA ♠Allen Institute for AI, Seattle, WA, USA ♢Department of Psychology, University of Washington, Seattle, WA, USA ♣Georgia Institute of Technology, Atlanta, GA, USA
Abstract
Warning: this paper discusses and contains content that is offensive or upsetting.
中文速览
毒性语言(toxic language)的判断本质上是主观的,不同身份和信念的人对同一条帖子的感受可能截然不同,但现有数据集在标注时往往忽略了这种差异。研究者招募了政治立场和种族背景各异的美国参与者,分两项在线实验系统考察"谁在标注、为什么这样标注、在标注什么",重点分析标注者的种族、政治倾向以及种族主义信念、言论自由态度等七项心理量表,与他们对三类文本——反黑人语言、非裔美国人英语(AAE)方言、粗口——毒性评分之间的关联。结果发现,种族主义信念得分越高的标注者越不倾向于将反黑人内容判定为有毒,而政治立场越保守的标注者则越容易把AAE方言本身标成有毒,揭示了注释偏见的社会根源。进一步的案例分析显示,广泛使用的毒性检测工具PerspectiveAPI的打分实际上更接近特定态度群体(如高种族主义信念者)的判断,而非全体用户的共识。这项研究表明,毒性标签必须结合标注者的社会背景变量来解读,否则数据集和模型都会系统性地放大特定群体的偏见,对公平的内容审核产生深远影响。
原文 arXiv:2111.07997;中英对照 + 大白话阅读 https://aha.fim.ai/paper/2111.07997v2