DeepMind首席科学家Davis Silver认为,第4代AlphaGo(也就是与柯洁比赛的这一代)通过进行“自我学习”已经训练出了40层神经网络。在整个学习过程中,系统要对棋局进行图像扫描,分成无数个小块依次进行处理,最终构成整个全局观。这个“全局观”,就是AlphaGo与人类最不一样的地方,也是AlphaGo具备的一个重要能力:策略网络。通过让AlphaGo自己跟自己比,下个几万场,判断哪个策略最有效。而在这个步骤结束后,继而形成价值网络,用来负责估算胜率。每走出一步,价值网络就是通过这样的函数来预测未来的输赢,而不是静态地去考虑这步棋。原文链接