第489章 互动博弈以及人工智能的应用(第4页)
竞标广告投放。
2.
强化学习(reinforcement
learning,
rl)与博弈
(1)
单智能体
rl
vs.
多智能体
rl(marl)
?传统强化学习(如
alphago)通常只考虑一个智能体在固定环境中的学习问题。
?**多智能体强化学习(marl)**引入博弈论思想,让多个
ai
代理在互动环境中优化策略,如
openai
的
dota
2
ai
或
deepmind
的
alphastar(星际争霸
ai)。
(2)
典型博弈策略学习
?零和博弈(zero-sum
game):
?例如棋类
ai(围棋、国际象棋、德州扑克
ai)使用**对抗性强化学习(adversarial
rl)**优化策略,使自己获胜的概率最大。
?非零和博弈(non-zero-sum
game):
?例如
ai
在共享经济(如
uber、滴滴司机动态定价)中学习如何平衡竞争和合作,优化收益。
本章未完,点击下一页继续阅读