Deeply learned face representations are sparse, selective, and robust
Yi Sun1 Xiaogang Wang2,3 Xiaoou Tang1,3 1Department of Information Engineering, The Chinese University of Hong Kong 2Department of Electronic Engineering, The Chinese University of Hong Kong 3Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences
Abstract
This paper designs a high-performance deep convolutional network (DeepID2+) for face recognition. It is learned with the identification-verification supervisory signal. By increasing the dimension of hidden representations and adding supervision to early convolutional layers, DeepID2+ achieves new state-of-the-art on LFW and YouTube Faces benchmarks.
中文速览
人脸识别领域长期面临如何同时提升性能与理解深层网络内部机制的双重挑战,这项工作提出了一个改进的深度卷积网络 DeepID2+,通过扩大隐层特征维度(从160维提升至512维)、增加训练数据以及对每个卷积层都施加身份识别与验证的联合监督信号,在 LFW 和 YouTube Faces 两大标准测试集上刷新了当时的最优成绩(LFW 人脸验证准确率达 99.47%)。更重要的是,研究者系统分析了这个高性能网络神经元激活值的三个内在特性:约一半神经元对任意给定图片处于激活状态的"适度稀疏性"使得不同身份的人脸在特征空间中区分度最大,甚至将激活值二值化后准确率仅下降约1%;高层神经元对身份及性别、年龄等属性表现出高度的"选择性",尽管训练时从未标注过属性信息,网络却自发学会了这些高层语义概念;此外,高层神经元对遮挡等图像污染具有显著的"鲁棒性",无需在训练集中加入遮挡样本即可自然习得。这些发现不仅为理解深度人脸识别网络的工作原理提供了重要依据,也为大规模人脸检索中的存储与计算效率优化指明了新方向。
原文 arXiv:1412.1265;中英对照 + 大白话阅读 https://aha.fim.ai/paper/1412.1265v1