TuringAdvice: A Generative and Dynamic Evaluation of Language Use
Rowan Zellers♠ Ari Holtzman♠ Elizabeth Clark♠ Lianhui Qin♠ Ali Farhadi♠ Yejin Choi♠♡ ♠Paul G. Allen School of Computer Science、Engineering, University of Washington ♡Allen Institute for Artificial Intelligence rowanzellers.com/advice
Abstract
We propose TuringAdvice, a new challenge task and dataset for language understanding models. Given a written situation that a real person is currently facing, a model must generate helpful advice in natural language. Our evaluation framework tests a fundamental aspect of human language understanding: our ability to use language to resolve open-ended situations by communicating with each other.
中文速览
真实的人在生活中遇到困境时会向他人寻求建议,而一个真正理解语言的AI理应能给出有用的回应——为了测试这一能力,研究者提出了TuringAdvice这一新挑战:给定一段真实用户描述的困境,模型需要用自然语言写出切实有帮助的建议。研究者从Reddit上收集了大量真实求助帖子,构建了动态数据集RedditAdvice,并由人工评估员直接比较模型建议与真实用户写出的建议哪个更有帮助。实验结果令人警醒:在60万条领域内数据微调后,拥有110亿参数的T5只有14%的情况下写出了不亚于人类的建议,而参数量更大的GPT-3(1750亿参数)却只有4%,甚至还频繁生成有害内容。这项研究揭示了一个深层问题:当前主流的多选题式基准测试会让模型钻空子、学捷径,而真正开放式的语言生成任务才能暴露模型在理解语言、认知世界方面的真实短板,为NLP研究指出了亟需突破的方向。
原文 arXiv:2004.03607;中英对照 + 大白话阅读 https://aha.fim.ai/paper/2004.03607v2