首页 /研究 /基于批处理的鲁棒异步Q学习:应对奖励与状态破坏
LEARNING

基于批处理的鲁棒异步Q学习:应对奖励与状态破坏

Sreejeet Maity, Aritra Mitra

发表年份
2026
访问权限
开放获取

摘要

本文提出了一种名为BR-Async-Q的鲁棒Q学习算法,通过将在线数据流分批处理并构建鲁棒的贝尔曼最优算子估计,来抵御奖励和状态观测的对抗性破坏。该算法在理论上首次为异步Q学习提供了面对双重破坏的鲁棒性保证,且当仅奖励被破坏时,其误差界在最小最大意义下最优。

关键词

robust Q-learningadversarial corruptionbatch processingasynchronous learningHuber contamination

相关论文

查看 LEARNING 分类全部论文