首页 /研究 /静态与时变网络上的方差缩减Q学习
LEARNING

静态与时变网络上的方差缩减Q学习

Sreejeet Maity, Feng Zhu, Aritra Mitra, Robert W. Heath

发表年份
2026
访问权限
开放获取

摘要

本文提出了一种名为VRDQ的基于epoch的分布式Q学习算法,用于多智能体在静态和时变网络上协作学习最优状态-动作价值函数。该算法通过共识协议扩散信息,实现了线性加速,且仅需对数级别的通信成本。

关键词

decentralized reinforcement learningQ-learningvariance reductionconsensus protocoltime-varying networks

相关论文

查看 LEARNING 分类全部论文