Quantizing deep convolutional networks for efficient inference: A whitepaper
Raghuraman Krishnamoorthi
Abstract
We present an overview of techniques for quantizing convolutional neural networks for inference with integer weights and activations.
中文速览
卷积神经网络(CNN)部署到手机、嵌入式设备等边缘端时,模型太大、推理太慢、功耗太高,量化(quantization)是解决这一问题的关键手段——把原本32位浮点的权重和激活值压缩成8位甚至4位整数。这篇论文系统梳理了多种量化方案:对权重做逐通道(per-channel)量化、对激活值做逐层(per-layer)量化,仅凭训练后量化(post-training quantization)就能让大多数CNN的精度损失控制在2%以内;若进一步引入量化感知训练(quantization-aware training),精度差距可缩小到1%,甚至能将权重压缩到4位。实测显示,量化模型在CPU上推理速度提升2–3倍,在高通QDSP等专用定点处理器上最高加速10倍,模型体积也缩小至原来的四分之一。这项工作不仅提供了TensorFlow/TensorFlowLite的完整工具链,还给出了硬件设计建议,对学术界和工业界将大模型轻量化落地具有直接的实用价值。
原文 arXiv:1806.08342;中英对照 + 大白话阅读 https://aha.fim.ai/paper/1806.08342v1