DART: Open-Domain Structured Data Record to Text Generation
Linyong Nan Affiliation: Yale University Dragomir Radev Affiliation: Yale University Affiliation: Salesforce Research Rui Zhang Affiliation: Penn State University Amrit Rau Affiliation: Yale University Abhinand Sivaprasad Affiliation: Yale University Chiachun Hsieh Xiangru Tang Aadit Vyas Neha Verma Pranav Krishna Affiliation: Yale University Affiliation: Yale University Affiliation: Yale University Affiliation: The University of Hong Kong Affiliation: MIT{linyong.nan, Yangxiaokang Liu Nadia Irwanto Jessica Pan Faiaz Rahman Ahmad Zaidi Affiliation: Yale University Affiliation: Yale University Affiliation: Yale University Affiliation: Yale University Affiliation: Yale University Murori Mutuma Yasin Tarabar Ankit Gupta Tao Yu Yi Chern Tan Affiliation: Yale University Affiliation: Yale University Affiliation: Yale University Affiliation: Yale University Affiliation: Yale University Xi Victoria Lin Caiming Xiong Richard Socher Nazneen Fatema Rajani Thanks: Now at Facebook AI. Affiliation: Salesforce Research Affiliation: Salesforce Research Affiliation: Salesforce Research Affiliation: Salesforce Research
Abstract
We present DART, an open domain structured DAta Record to Text generation dataset with over 82k instances (DARTs). Data-to-Text annotations can be a costly process, especially when dealing with tables which are the major source of structured data and contain non-trivial structures. To this end, we propose a procedure of extracting semantic triples from tables that encodes their structures by exploiting the semantic dependencies among table headers and the table title. Our dataset construction framework effectively merged heterogeneous sources from open domain semantic parsing and dialogue-act-based meaning representation tasks by utilizing techniques such as: tree ontology annotation, question-answer pair to declarative sentence conversion, and predicate unification, all with minimum post-editing. We present systematic evaluation on DART as well as new state-of-the-art results on WebNLG 2017 to show that DART (1) poses new challenges to existing data-to-text datasets and (2) facilitates out-of-domain generalization. Our data and code can be found at https://github.com/Yale-LILY/dart.
原文 arXiv:2007.02871;中英对照 + 大白话阅读 https://aha.fim.ai/paper/2007.02871v2