Advances in All-Neural Speech Recognition
Abstract
This paper advances the design of CTC-based all-neural (or end-to-end) speech recognizers. We propose a novel symbol inventory, and a novel iterated-CTC method in which a second system is used to transform a noisy initial output into a cleaner version. We present a number of stabilization and initialization methods we have found useful in training these networks.
中文速览
端到端语音识别(all-neural ASR)不依赖传统隐马尔可夫模型和发音词典,但在识别准确率上仍落后于经典混合系统。本文提出了两项关键改进:一是设计了一套新的符号表,用大写字母标记词首字符来取代空格符号,同时引入双字母单元处理重复字符,使解码更简洁;二是提出"迭代CTC"(iterated CTC)方法,先用一个RNN/CTC网络将声学特征转为带噪字符序列,再训练第二个CTC网络对该噪声字符序列进行纠错,从而在完全不依赖外部解码器的前提下提升输出质量。此外,论文还系统梳理了梯度裁剪、稀有符号平滑、输出层恒等矩阵初始化等多种训练稳定化技巧。在NIST 2000电话对话测试集上,无论是否使用外部语言模型,该系统均大幅超越同类全神经网络方法的已有最优结果,证明了在减少对传统语音识别组件依赖的同时仍能显著提升性能的可行性。
原文 arXiv:1609.05935;中英对照 + 大白话阅读 https://aha.fim.ai/paper/1609.05935v2