Social Bias Frames: Reasoning about Social and Power Implications of Language
Maarten Sap† Saadia Gabriel†‡ Lianhui Qin†‡ Dan Jurafsky⋄ Noah A. Smith†‡ Yejin Choi†‡ †Paul G. Allen School of Computer Science、Engineering, University of Washington ‡Allen Institute for Artificial Intelligence ⋄Linguistics、Computer Science Departments, Stanford University
Abstract
Warning: this paper contains content that may be offensive or upsetting.
中文速览
网络上充斥着大量隐性偏见表达——比如"降低标准才能招到更多女性"这句话,明面上没骂人,却暗含"女性能力不足"的刻板印象——现有的毒性分类模型只能判断"有没有问题",却说不清"哪里有问题、针对哪个群体、暗示了什么"。为此,研究者提出了「社会偏见框架」(Social Bias Frames)这一形式化体系,将一段话的冒犯性、针对群体、隐含刻板印象等维度同时结构化表示,并配套构建了包含15万条标注的「社会偏见推断语料库」(SBIC),覆盖逾3.4万条涉及千余个人口群体的隐含陈述。实验表明,以GPT为代表的最先进神经模型在判断某句话"是否存在偏见"时能达到80%的F1分数,但在生成详细解释性框架(如具体刻板印象内容)方面表现明显不足。这项工作说明,要让AI真正理解语言中的社会偏见,仅靠分类远远不够,还需要将结构化语用推理与常识推理深度结合。
原文 arXiv:1911.03891;中英对照 + 大白话阅读 https://aha.fim.ai/paper/1911.03891v3