论文部分内容阅读
文中以围捕问题作为研究平台,以提高多Agent系统中Q学习算法的学习效率作为研究目标,提出了一种基于改进蚁群算法的Q学习算法。该算法将信息素的概念引入到Q学习中,结合采用动态自适应调整信息素挥发因子的蚁群算法,使Agent在进行行为决策时不再只以Q值作为参考标准,而是考量Q值与信息素的综合效应,加强了Agent彼此间的信息共享,增强了交互性。并且对于复杂变化的周围环境,根据具体环境条件,设立分阶段的多奖惩标准,使算法对于环境和状态有更好的适应性。仿真实验证明了改进后的Q学习算法提高了学习系统的效率,高效地