第490章 人工智能的本源(第6页)
+
博弈论(game-theoretic
rl):用于优化
ai
代理在动态环境中的策略,如自动驾驶。
2.
典型
ai
博弈论应用
(1)
alphago:对抗性博弈
+
强化学习
?背景:围棋被认为是最复杂的棋类游戏之一,搜索空间极大,传统搜索算法难以解决。
?技术:
?蒙特卡洛树搜索(mcts):预测最优落子。
?深度强化学习(deep
rl):通过“自我博弈(self-play)”
不断优化策略。
?零和博弈(zero-sum
game):每一方的胜利意味着另一方的失败。
(2)
德州扑克
ai(libratus、p露ribus):不完全信息博弈
?挑战:扑克游戏具有隐藏信息(对手的牌),与围棋等完全信息博弈不同。
?技术:
?博弈均衡计算(nash
equilibrium
approximation):找到长期最优策略。
?逆向归纳推理(counterfactual
regret
minimization,
cfr):动态调整策略,欺骗对手。
(3)
自动驾驶:多智能体博弈
?挑战:无人车必须与其他车辆、行人、交通信号互动,决策必须权衡速度、安全性和效率。
?技术:
?合作博弈:多辆自动驾驶车共享信息,优化通行。
?非合作博弈:ai
本章未完,点击下一页继续阅读