Does data interpolation contradict statistical optimality?
Mikhail Belkin The Ohio State University Alexander Rakhlin MIT Alexandre B. Tsybakov CREST, ENSAE
Abstract
We show that learning methods interpolating the training data can achieve optimal rates for the problems of nonparametric regression and prediction with square loss.
中文速览
过去人们普遍认为好的统计方法应该对训练数据做平滑而非精确拟合,但这项研究证明,完全插值训练数据的估计量同样可以在非参数回归和均方损失预测问题上达到最优收敛速率。研究者采用奇异核(singular kernel)版本的 Nadaraya-Watson 估计量——当核函数在原点趋于无穷时,估计量会恰好通过每一个训练样本点——并在 Hölder 光滑性假设下,严格证明其均方误差达到经典的极小化极大最优速率 $n^{-2\beta/(2\beta+d)}$。关键在于,虽然估计量对每个数据点精确插值,但每个点的影响是局部的,大量数据点共同将函数"拉向"真实回归函数,从而在插值与偏差-方差权衡之间实现了和谐共存。这一结果不仅从理论上为神经网络"过拟合却泛化良好"的现象提供了统计视角,也首次表明插值规则可以在极小化极大意义下达到最优,打破了"插值必然损害泛化"的传统认知。
原文 arXiv:1806.09471;中英对照 + 大白话阅读 https://aha.fim.ai/paper/1806.09471v1