OALib Journal期刊
ISSN: 2333-9721
费用：99美元

投递稿件

查看量	下载量

相关文章
更多...

软件学报 2008

基于后悔值的多agent冲突博弈强化学习模型

, PP. 2957-2967

肖正？,张世永？

Keywords: markov对策,强化学习,冲突博弈,冲突消解

Full-Text Cite this paper Add to My Lib

Abstract:

对于冲突博弈,研究了一种理性保守的行为选择方法,即最小化最坏情况下agent的后悔值.在该方法下,agent当前的行为策略在未来可能造成的损失最小,并且在没有任何其他agent信息的条件下,能够得到nash均衡混合策略.基于后悔值提出了多agent复杂环境下冲突博弈的强化学习模型以及算法实现.该模型中通过引入交叉熵距离建立信念更新过程,进一步优化了冲突博弈时的行为选择策略.基于markov重复博弈模型验证了算法的收敛性,分析了信念与最优策略的关系.此外,与mmdp(multi-agentmarkovdecisionprocess)下q学习扩展算法相比,该算法在很大程度上减少了冲突发生的次数,增强了agent行为的协调性,并且提高了系统的性能,有利于维持系统的稳定.

Full-Text

Contact Us

service@oalib.com

QQ:3279437679

WhatsApp +8615387084133