《通过学习模型进行规划以掌控 Atari、围棋、国际象棋与将棋》论文总结

yo3nglau

2026/05/18

Categories: Paper Reading Tags: Model-Based RL MCTS Planning Reinforcement Learning

View English Version

影响力与复现性

MuZero 于 2020 年发表在 Nature 上,是 DeepMind 基于模型的强化学习研究中最具影响力的成果之一:它证明了一个完全不了解游戏规则的算法,既能在围棋、国际象棋和将棋上与专用系统并驾齐驱,又能在全部 57 款 Atari 游戏中刷新最优成绩,由此深刻影响了后续一代关于学习模型规划的研究。DeepMind 尚未官方开源 MuZero,但社区实现(如 OpenMuZero、muzero-general)维护活跃,且与论文结果高度吻合。复现 Atari 基准需要 4–8 张 NVIDIA V100 或 A100,完整训练通常需要数天。棋类游戏的复现门槛则高得多:原始实验依赖大规模 TPU Pod 进行分布式自对弈,单机 GPU 环境虽可近似复现,但训练周期可能长达数周。

论文总结

MuZero 是 DeepMind 提出的基于模型的强化学习算法,使用单一方法在视觉复杂环境和精确规划任务中均实现了超人水平的性能。其核心洞见是:智能体不需要重建完整环境的模型,只需预测与规划直接相关的量,即策略、价值函数和即时奖励。MuZero 构建了一个包含三个学习组件的内部世界模型:将观测编码为隐状态的表示函数、在假设动作下滚动隐状态的动态函数,以及在每步读取策略和价值的预测函数。决策时,MuZero 在该学习模型上应用蒙特卡洛树搜索(MCTS)来选择动作。

Paper: Julian Schrittwieser, Ioannis Antonoglou, Thomas Hubert, Karen Simonyan, Laurent Sifre, Simon Schmitt, Arthur Guez, Edward Lockhart, Demis Hassabis, Thore Graepel, Timothy Lillicrap, David Silver. “Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model.” Nature 588, 604–609 (2020). https://doi.org/10.1038/s41586-020-03051-4

Code: https://github.com/werner-duvaud/muzero-general

    / [pdf]