Unicorn on Rainbow: A Universal Commonsense Reasoning Model on a New Multitask Benchmark
Nicholas Lourie♠♠\spadesuit Ronan Le Bras♠♠\spadesuit Chandra Bhagavatula♠♠\spadesuit Yejin Choi ♡♡\heartsuit♠♠\spadesuit
Abstract
Commonsense AI has long been seen as a near impossible goal—until recently. Now, research interest has sharply increased with an influx of new benchmarks and models.
中文速览
常识推理长期被视为人工智能的难题,现有模型往往只在单一数据集上表现出色,却难以跨任务泛化。研究者提出了Rainbow多任务基准(涵盖六个多选问答数据集)以及一种新型评估工具——"等价代价曲线"(cost equivalent curve),用来衡量迁移学习在不同数据量下究竟能节省多少标注成本。通过超过4800个模型的大规模实验,他们发现:采用"先多任务预训练、再在目标任务上微调"的序列训练策略几乎总能带来提升;同类QA常识数据集之间迁移效果显著,而常识知识图谱则迁移效果很差;此外出人意料的是,越大的模型从迁移学习中获益越多。基于这些发现,他们推出了通用常识推理模型Unicorn,在αNLI、HellaSWAG、PIQA等8项主流常识基准上全面刷新了当时的最佳成绩,为构建能够跨任务泛化的常识AI系统提供了系统性的方法论指导。
原文 arXiv:2103.13009;中英对照 + 大白话阅读 https://aha.fim.ai/paper/2103.13009v1