Exact post-selection inference, with application to the lasso
Jason D. [ Dennis L. [ Yuekai [ Jonathan E. [ University of California, Berkeley\thanksmarkM1, California Polytechnic State University\thanksmarkM2 and Stanford University\thanksmarkM3 J. D. Lee University of California, Berkeley 465 Soda Hall Berkeley, California 94720 USA D. L. Sun California Polytechnic State University Building 25, Room 107D San Luis Obispo, California USA Y. Sun University of California, Berkeley 367 Evans Hall Berkeley, California 94720 USA J. E. Taylor Stanford University 390 Serra Mall Stanford, California USA
Abstract
We develop a general approach to valid inference after model selection. At the core of our framework is a result that characterizes the distribution of a post-selection estimator conditioned on the selection event. We specialize the approach to model selection by the lasso to form valid confidence intervals for the selected coefficients and test whether all relevant variables have been included in the model.
中文速览
用 Lasso 做变量筛选之后,传统的置信区间和 p 值就失效了——因为我们是"挑着看"数据才决定保留哪些变量,再对这些变量做推断就等于用同一份数据既选模型又做检验,结果会严重高估显著性。这篇文章给出了一套严格的"选后推断(post-selection inference)"框架:核心思路是把 Lasso 选中某个模型这件事精确地表达成对观测数据的一组线性不等式约束(一个多面体),然后在"条件于恰好选中这个模型"的前提下推导出估计量的精确条件分布——结果是一个截断正态分布,由此可以构造出均匀分布的枢轴统计量,进而给出有效的条件置信区间和假设检验。模拟与真实数据实验表明,这些置信区间在名义覆盖率上表现准确,而且还能检验 Lasso 是否遗漏了重要变量。这项工作的重要性在于,它首次让人们能够在高维数据分析中"先用 Lasso 挑变量、再对挑出的系数做可靠推断",为数据驱动建模与统计推断的衔接提供了坚实的理论基础。
原文 arXiv:1311.6238;中英对照 + 大白话阅读 https://aha.fim.ai/paper/1311.6238v8