Frustratingly Easy Domain Adaptation
Hal Daumé III School of Computing University of Utah Salt Lake City, Utah 84112
Abstract
We describe an approach to domain adaptation that is appropriate exactly in the case when one has enough “target” data to do slightly better than just using only “source” data. Our approach is incredibly simple, easy to implement as a preprocessing step (10 lines of Perl!) and outperforms state-of-the-art approaches on a range of datasets. Moreover, it is trivially extended to a multi-domain adaptation problem, where one has data from a variety of different domains.
中文速览
领域自适应(domain adaptation)是自然语言处理中的经典难题:模型在新闻语料上训练得很好,但换个领域就"水土不服"。这篇论文提出了一种极其简单的解决方法——特征增广(feature augmentation):把每个特征复制成三份,分别代表"通用版本"、"源领域专属版本"和"目标领域专属版本",源域数据用前两份、目标域数据用后两份,然后直接扔给任意标准分类器训练,全程不需要改动算法本身,用十行Perl脚本即可实现。在命名实体识别、浅层句法分析、词性标注等多个序列标注任务上,该方法的表现与当时最先进的方法持平甚至更好,而那些方法往往需要复杂的EM算法且慢十几倍。这项工作的价值在于:它把领域自适应这个听起来高深的问题,变成了一个任何人都能在数分钟内动手实现的预处理步骤,极大降低了工程门槛,同时也启发了后续大量多任务学习和领域泛化的研究。
原文 arXiv:0907.1815;中英对照 + 大白话阅读 https://aha.fim.ai/paper/0907.1815v1