To Understand Deep Learning We Need to Understand Kernel Learning
Mikhail Belkin Department of Computer Science and Engineering Siyuan Ma Department of Computer Science and Engineering Soumik Mandal Department of Computer Science and Engineering
Abstract
Generalization performance of classifiers in deep learning has recently become a subject of intense study. Deep models, which are typically heavily over-parametrized, tend to fit the training data exactly. Despite this “overfitting", they perform well on test data, a phenomenon not yet fully understood.
中文速览
过去大家普遍认为,让模型在训练集上完美拟合数据(即"过拟合"或插值)必然导致测试性能变差,然而深度学习中的大量实验打破了这一直觉。本文通过六个真实数据集和两个合成数据集,系统地证明核方法(kernel machines)同样存在这种现象——即使训练误差被压到零、标签还被大量随机噪声污染,核分类器在测试集上依然表现优异。理论上,作者证明了光滑核(如高斯核)的零损失解的 RKHS 范数会随数据量近乎指数级增长,这意味着所有现有的基于范数的泛化界都会随数据规模发散,无法为插值解提供任何有意义的保证。此外,实验还揭示了一个与深度 ReLU 网络高度平行的规律:非光滑的拉普拉斯核可以轻松拟合随机标签,而光滑的高斯核则难以做到,但两者的测试泛化性能却几乎相同,说明泛化能力取决于核函数本身的结构特性,而非优化过程。这一系列发现表明,理解深度学习泛化之前,必须先为更简单、更易分析的核方法建立全新的理论框架,现有依赖复杂度控制和范数集中不等式的经典理论已难以胜任。
原文 arXiv:1802.01396;中英对照 + 大白话阅读 https://aha.fim.ai/paper/1802.01396v3