Harms of Gender Exclusivity and Challenges in Non-Binary Representation in Language Technologies
Sunipa Dev she/her UCLA、Masoud Monajatipoor* he/him UCLA、Anaelia Ovalle* they/he/she UCLA、Arjun Subramonian* they/them UCLA, Queer in AI \ANDJeff M Phillips he/him University of Utah、Kai-Wei Chang he/him UCLA
Abstract
Content Warning: This paper contains examples of stereotypes and associations, misgendering, erasure, and other harms that could be offensive and triggering to trans and non-binary individuals.
中文速览
现有的自然语言处理(NLP)研究在讨论性别偏见时,几乎默认性别只有男女两种,这本身就是一种对非二元性别(non-binary gender)群体的持续伤害。这篇论文系统梳理了性别与英语语言的复杂关系,并对具备AI背景的非二元性别人士进行问卷调查,从当事人视角收集他们在真实NLP应用中遭受的具体伤害,包括被错误指代性别(misgendering)和身份被抹除(erasure)。研究随后检测了GloVe和BERT这两类主流语言表示模型,发现非二元性别相关词汇和代词在训练数据中严重匮乏,导致模型学到的表示质量低下且不稳定,甚至在已知当事人代词的情况下仍会将其错误归入二元性别。这一发现揭示了一个恶性循环:社会对非二元性别的忽视导致数据稀缺,数据稀缺又让模型强化并传播偏见,进而加剧现实中的歧视与抹除,提醒NLP领域必须从根本上重新审视对性别的建模方式,而不能将非二元群体的问题简单视为二元性别偏见研究的附属品。
原文 arXiv:2108.12084;中英对照 + 大白话阅读 https://aha.fim.ai/paper/2108.12084v2