∑

数学知识体系

Observatory Archive of Mathematics
⌕2026/8/31
概念

动态规划

贝尔曼最优性原理把问题分解为子问题,HJB 方程是值函数满足的 PDE,与庞特里亚金原理互为表里。

所属主题:变分法 ↗
阅读路径

参考可汗学院 Get ready 机制:先修概念 → 当前概念 → 进阶概念,✓ 表示已读。

01定义

贝尔曼最优性原理:最优策略的任一尾段仍是最优的。由此递推得值函数满足 HJB 方程(连续时间)或贝尔曼方程(离散时间)——与庞特里亚金原理互为表里,是随机最优控制的自然语言。
起点 终点 金路径:每步取局部最优递推(V(x) = max 后继值)
多阶段决策:值函数从终点逆向递推

02核心要点

01

HJB 方程

−Vt=max⁡u{L+Vx⋅f}-V_t=\max_u\{L+V_x\cdot f\}:值函数的一阶非线性 PDE;粘性解理论(1980 年代)使不光滑值函数也获唯一性。

02

与最大值原理互译

沿最优轨线 λ=Vx\lambda=V_x:HJB 是「全场」视角,庞特里亚金是「单轨」视角——两者描述同一最优性。

03

随机与强化学习

随机最优控制的 HJB 成为半线性 PDE;离散版贝尔曼方程即强化学习的理论根基(Q-learning、值迭代)。

03关键公式

V(x)=max⁡u{r(x,u)+γV(f(x,u))}V(x)=\max_{u}\Bigl\{r(x,u)+\gamma V\bigl(f(x,u)\bigr)\Bigr\}

04历史沿革

贝尔曼 1953-1957 年创立动态规划(RAND 公司);「维度灾难」一词亦出自他;克兰德尔-利翁斯 1983 年的粘性解理论补齐 PDE 严格性。

05应用与延伸

强化学习算法(AlphaGo 的价值网络即值函数近似)、机器人运动规划、金融衍生品的美式期权定价、供应链多阶段库存优化。

06交互演示

网格最短路径:DP 填表与回溯dp[i][j] = cost[i][j] + min(dp[i−1][j], dp[i][j−1]),只能向右/向下走

07相关概念