求解《连续时间套利理论》习题25.4——最优控制的鞅性质相关疑问
首先得先给你指出一个大概率的笔误:你写的$C(t,u)$定义里,第二项的积分变量重复用了$t$,这肯定不对,正确的定义应该是:
$$
C(t, u) = \int_0^t F(s, X_s^u, u_s)ds + \mathbb{E}_{t, X_tu}\left[\int_tT F(s, X_s^u, u_s)ds + \Phi(X_T^u)\right]
$$
这个笔误应该是你误以为它是鞅的关键原因——错误的积分变量会让你在拆分条件期望时出现不合理的抵消。
接下来我们一步步拆解这两个问题:
(a) 任意控制律下$C(t,u)$是次鞅
先回忆次鞅的核心定义:对任意$0 \leq s < t \leq T$,必须满足$\mathbb{E}[C(t,u) | \mathcal{F}_s] \geq C(s,u)$。
我们先展开$\mathbb{E}[C(t,u) | \mathcal{F}_s]$:
$$
\mathbb{E}[C(t,u) | \mathcal{F}s] = \mathbb{E}\left[\int_0^t F(r, X_r^u, u_r)dr + \mathbb{E}{t,X_tu}\left[\int_tT F(r,X_r^u,u_r)dr + \Phi(X_T^u)\right] \bigg| \mathcal{F}_s\right]
$$
把第一个积分拆成$\int_0^s + \int_s^t$,然后对第二项用迭代期望定律(因为$\mathcal{F}_s \subset \mathcal{F}t$),可以把内层的条件期望拆掉,得到:
$$
\mathbb{E}\left[\mathbb{E}{t,X_tu}\left[\int_tT F(r,X_r^u,u_r)dr + \Phi(X_T^u)\right] \bigg| \mathcal{F}_s\right] = \mathbb{E}\left[\int_t^T F(r,X_r^u,u_r)dr + \Phi(X_T^u) \bigg| \mathcal{F}_s\right]
$$
把这些合并起来:
$$
\mathbb{E}[C(t,u) | \mathcal{F}_s] = \int_0^s F(r,X_r^u,u_r)dr + \mathbb{E}\left[\int_s^T F(r,X_r^u,u_r)dr + \Phi(X_T^u) \bigg| \mathcal{F}_s\right]
$$
现在对比$C(s,u)$的定义:
$$
C(s,u) = \int_0^s F(r,X_r^u,u_r)dr + \mathbb{E}_{s,X_su}\left[\int_sT F(r,X_r^u,u_r)dr + \Phi(X_T^u)\right]
$$
这里要引入值函数$V(t,x)$——它表示在时刻$t$、状态为$x$时,使用最优控制能达到的最小成本:
$$
V(t,x) = \inf_{u \in \mathcal{U}} \mathbb{E}_{t,x}\left[\int_t^T F(r,X_r^u,u_r)dr + \Phi(X_T^u)\right]
$$
对于任意非最优的控制$u$,显然有$\mathbb{E}_{t,X_tu}\left[\int_tT F(r,X_r^u,u_r)dr + \Phi(X_T^u)\right] \geq V(t,X_t^u)$,毕竟$V$是所有控制成本的下确界。
接下来用伊藤公式分析$C(t,u)$的动态。我们可以把$C(t,u)$写成$\int_0^t F(r,X_r^u,u_r)dr + V_u(t,X_t^u)$,其中$V_u(t,x)$是固定控制$u$下的成本函数。对于非最优的$u$,$V_u$满足HJB方程的松弛形式:
$$
\frac{\partial V_u}{\partial t} + \mu(t,x,u) \frac{\partial V_u}{\partial x} + \frac{1}{2}\sigma^2(t,x,u) \frac{\partial^2 V_u}{\partial x^2} + F(t,x,u) \geq 0
$$
这个不等式的本质是:对于非最优控制,你无法通过调整控制来降低成本,所以成本的“瞬时变化率”是非负的。
对$C(t,u)$应用伊藤公式展开微分:
$$
dC(t,u) = F(t,X_t^u,u_t)dt + dV_u(t,X_t^u)
$$
把$dV_u$的伊藤展开代入,再结合上面的HJB不等式,就能得到:
$$
dC(t,u) \geq \sigma(t,X_t^u,u_t)\frac{\partial V_u}{\partial x}dW_t
$$
这说明$C(t,u)$的漂移项是非负的,满足局部次鞅的性质;如果再加上一致可积这类正则性条件,它就是一个正式的次鞅了——这就证明了(a)。
你之前的错误就是没考虑到非最优控制对应的HJB是不等式而非等式,加上积分变量的笔误,才误以为它是鞅。
(b) 最优控制律下$C(t,u)$是鞅
当$u$是最优控制$u_$时,$V_u(t,x)$就等于值函数$V(t,x)$,此时HJB方程取等号:
$$
\frac{\partial V}{\partial t} + \mu(t,x,u_) \frac{\partial V}{\partial x} + \frac{1}{2}\sigma^2(t,x,u_) \frac{\partial^2 V}{\partial x^2} + F(t,x,u_) = 0
$$
这个等式的意思是:最优控制下,成本的瞬时变化率为0,因为你已经找不到任何调整控制的方式来降低成本了。
同样对$C(t,u_)$应用伊藤公式:
$$
dC(t,u_) = F(t,X_t^{u_},u_t)dt + dV(t,X_t^{u})
$$
代入HJB的等式后,漂移项直接抵消为0:
$$
dC(t,u_) = \sigma(t,X_t^{u_},u_t)\frac{\partial V}{\partial x}dW_t
$$
这说明$C(t,u)$是一个局部鞅,加上正则性条件后就是一个鞅,满足$\mathbb{E}[C(t,u_) | \mathcal{F}s] = C(s,u*)$,这就证明了(b)。
备注:内容来源于stack exchange,提问作者Wittgenstein's Poker

