Recurrent World Models Facilitate Policy Evolution
David Ha Google Brain Tokyo, Japan、Jürgen Schmidhuber NNAISENSE The Swiss AI Lab, IDSIA (USI、SUPSI)
Abstract
A generative recurrent neural network is quickly trained in an unsupervised manner to model popular reinforcement learning environments through compressed spatio-temporal representations. The world model’s extracted features are fed into compact and simple policies trained by evolution, achieving state of the art results in various environments. We also train our agent entirely inside of an environment generated by its own internal world model, and transfer this policy back into the actual environment. Interactive version of paper: https://worldmodels.github.io
中文速览
人工智能体如何像人类一样建立对世界的内部预测模型,并以此来学习完成任务?这篇论文提出了一个由视觉压缩器(VAE)、记忆预测器(MDN-RNN)和简单控制器三部分组成的"世界模型"框架:VAE将每帧图像压缩成低维向量,RNN则在此基础上预测未来状态的概率分布,而只有几百个参数的线性控制器则利用这两个模块提取的特征、通过进化算法来学习决策策略。实验结果显示,该方法在赛车游戏CarRacing-v0上首次达到了解题标准(平均得分906分),在VizDoom射击躲避任务中也刷新了最佳成绩;更进一步,研究者让智能体完全在自己"想象"出来的虚拟环境中训练,再将策略迁移回真实环境,同样取得了有竞争力的表现。这项工作的重要意义在于:它证明了将大容量的感知与记忆模块和轻量级的决策模块解耦,不仅能降低强化学习的训练难度,还使得"在脑海中练习"这一类似人类的学习方式在人工智能中成为可能。
原文 arXiv:1809.01999;中英对照 + 大白话阅读 https://aha.fim.ai/paper/1809.01999v1