动态规划
贝尔曼最优性原理把问题分解为子问题,HJB 方程是值函数满足的 PDE,与庞特里亚金原理互为表里。
所属主题:变分法 ↗阅读路径
参考可汗学院 Get ready 机制:先修概念 → 当前概念 → 进阶概念,✓ 表示已读。
01定义
贝尔曼最优性原理:最优策略的任一尾段仍是最优的。由此递推得值函数满足 HJB 方程(连续时间)或贝尔曼方程(离散时间)——与庞特里亚金原理互为表里,是随机最优控制的自然语言。
02核心要点
01
HJB 方程
:值函数的一阶非线性 PDE;粘性解理论(1980 年代)使不光滑值函数也获唯一性。
02
与最大值原理互译
沿最优轨线 :HJB 是「全场」视角,庞特里亚金是「单轨」视角——两者描述同一最优性。
03
随机与强化学习
随机最优控制的 HJB 成为半线性 PDE;离散版贝尔曼方程即强化学习的理论根基(Q-learning、值迭代)。
03关键公式
04历史沿革
贝尔曼 1953-1957 年创立动态规划(RAND 公司);「维度灾难」一词亦出自他;克兰德尔-利翁斯 1983 年的粘性解理论补齐 PDE 严格性。
05应用与延伸
强化学习算法(AlphaGo 的价值网络即值函数近似)、机器人运动规划、金融衍生品的美式期权定价、供应链多阶段库存优化。
06交互演示
网格最短路径:DP 填表与回溯dp[i][j] = cost[i][j] + min(dp[i−1][j], dp[i][j−1]),只能向右/向下走