应用与展望
AlphaGo 与蒙特卡洛树搜索 (MCTS)
强化学习算法分为两类:
- 无模型 (Model-free):如 DQN、策略梯度。不学习环境的状态转移与奖励机制,直接学习动作选择策略。
- 基于模型 (Model-based):构建环境内部模型,主要包含两部分:
- 状态转移模型 (Transition Model):预测 P(s′∣s,a)
- 奖励模型 (Reward Model):预测 R(s,a,s′)
蒙特卡洛树搜索(Monte Carlo Tree Search,MCTS) 是一种基于模型的强化学习方法,在对弈时向前模拟推演做决策,不需要在线更新网络参数。
MCTS 的四个步骤
假设已有策略网络 π(a∣s;θ) 和价值网络 v(s;ω),MCTS 每次决策包含多轮模拟,每轮分为四个步骤:
-
选择 (Selection):
依据胜率与策略网络概率之和选择动作:
score(a)≜Q(a)+1+N(a)η⋅π(a∣s;θ)
其中 N(a) 是动作 a 的访问次数,Q(a) 为此前模拟算出的动作平均价值。
-
扩展 (Expansion):
利用策略网络抽样对手动作 at′∼π(⋅∣st′;θ),生成新的推演状态。
-
求值 (Evaluation):
从新状态开始,使用策略网络快速模拟博弈直至出结果(得到奖励 r∈{+1,−1}),并结合价值网络估值计算状态评估:
V(st+1)≜2r+v(st+1;ω)
-
回溯 (Backup):
更新推演路径上所有动作的访问计数 N(a) 与平均价值 Q(a)。
模拟结束后,根据访问次数最多的动作做出最终决策:at=argmaxaN(a)。
AlphaGo 演进历程
现实世界中的应用
- 神经网络结构搜索 (NAS):利用 RL 自动搜索最优网络架构。
- 自动生成 SQL 语句:根据数据库上下文生成高效查询语句。
- 推荐系统:
- 传统监督学习假设用户兴趣固定,拟合已有喜好。
- 强化学习假设用户兴趣可被发掘,主动探索用户潜在喜好(如虚拟淘宝系统)。
- 网约车调度:优化车辆时空分配,需使用正则项保证价值网络对时间、地点平滑。
强化学习落地的四大制约因素
- 样本复杂度极高:训练需要海量交互数据。
- 探索代价高昂:在真实物理世界(如自动驾驶、工业机器人)随机探索风险极大。
- 超参数高度敏感:激活函数、学习率等微小调整会导致结果天差地别。
- 稳定性较差:同一套代码更换随机种子可能导致从收敛变为完全发散。
附录:贝尔曼方程的严谨数学推导
根据折扣回报定义 Ut=Rt+γUt+1,动作价值函数为 Qπ(st,at)=E[Ut∣St=st,At=at]:
Qπ(st,at)=ESt+1:,At+1:[Rt+γ⋅Ut+1∣St=st,At=at]=ESt+1[Rt∣St=st,At=at]+γ⋅ESt+1,At+1[Qπ(St+1,At+1)∣St=st,At=at](A.1)
定理 A.1:动作价值的贝尔曼方程 (Qπ→Qπ)
假设奖励 Rt 是 (St,At,St+1) 的函数,则:
Qπ(st,at)=ESt+1,At+1[Rt+γ⋅Qπ(St+1,At+1)∣St=st,At=at]
定理 A.2:动作价值与状态价值的关系 (Qπ→Vπ)
由于 Vπ(St+1)=EAt+1[Q(St+1,At+1)],可得:
Qπ(st,at)=ESt+1[Rt+γ⋅Vπ(St+1)∣St=st,At=at]
定理 A.3:状态价值的贝尔曼方程 (Vπ→Vπ)
由于 Vπ(St)=EAt[Q(St,At)],可得:
Vπ(st)=EAt,St+1[Rt+γ⋅Vπ(St+1)∣St=st]
定理 A.4:最优贝尔曼方程 (Optimal Bellman Equations)
设最优动作 At+1=argmaxAQ∗(St+1,A),可得:
Q∗(st,at)=ESt+1∼p(⋅∣st,at)[Rt+γ⋅maxA∈AQ∗(St+1,A)∣St=st,At=at]