Challenges in Automated Debiasing for Toxic Language Detection
Xuhui Zhou♡ Maarten Sap♣ Swabha Swayamdipta♢ Noah A. Smith♣♢ Yejin Choi♣♢ ♡Department of Linguistics, University of Washington ♣Paul G. Allen School of Computer Science、Engineering, University of Washington ♢Allen Institute for Artificial Intelligence
Abstract
Warning: this paper contains content that may be offensive or upsetting.
中文速览
有害言论检测系统长期存在一个核心缺陷:模型会把包含少数族裔身份词汇或非裔美国英语(African American English,AAE)方言特征的文本错误地判为有毒内容,对少数群体造成系统性歧视。研究者系统测试了目前主流的两类去偏方法——基于额外训练目标的集成去偏训练(Learned-Mixin)和基于训练难度的数据过滤(AFLite、DataMaps)——发现二者在减轻词汇偏见上效果有限,对方言偏见的改善尤为不足,"去偏"后的模型依然会不成比例地将黑人用户的推文标记为有毒内容。为此,研究者提出一种概念验证方案:借助 GPT-3 的少样本方言翻译,将被标注为有毒的 AAE 推文自动转写为白人主流英语(White-Aligned English,WAE),再对译文判断是否真的有毒,从而对原始标签进行自动纠正——结果显示,这种直接修正数据标签的方式比在有偏数据上训练后再去偏效果更好。这一发现对有害言论检测领域有重要启示:与其事后修补模型,不如从源头修正带有偏见的训练标注,才是解决方言与种族偏见的更有效路径。
原文 arXiv:2102.00086;中英对照 + 大白话阅读 https://aha.fim.ai/paper/2102.00086v1