Gradients of Counterfactuals
Mukund Sundararajan, Ankur Taly、Qiqi Yan Google Inc. Mountain View, CA 94043, USA
Abstract
Gradients have been used to quantify feature importance in machine learning models. Unfortunately, in nonlinear deep networks, not only individual neurons but also the whole network can saturate, and as a result an important input feature can have a tiny gradient. We study various networks, and observe that this phenomena is indeed widespread, across many inputs.
中文速览
梯度(gradient)本是衡量深度学习模型特征重要性的直觉工具,但当网络发生饱和时,真正重要的输入特征对应的梯度反而会接近零,导致梯度失效。为解决这一问题,作者提出"内部梯度"(interior gradients)方法:将原始输入从零按比例缩放到实际值,沿这条路径上的一系列反事实输入计算梯度,再通过积分将其累积为"积分梯度"(integrated gradients),使各特征重要性分数之和恰好等于模型的预测分数。在 GoogleNet 图像识别、配体虚拟筛选网络和 Penn Treebank LSTM 语言模型上的实验均表明,这一方法比直接使用梯度更准确地捕捉到真正影响预测的特征。与此前需要深度修改网络实现的方法相比,积分梯度只需在标准框架中调用反向传播即可完成,极大地降低了实际落地的门槛,对需要理解和调试深度网络的从业者来说意义显著。
原文 arXiv:1611.02639;中英对照 + 大白话阅读 https://aha.fim.ai/paper/1611.02639v2