ベルマン方程式(Bellman Equation)

強化学習における**ベルマン方程式(Bellman Equation)は、状態や状態-行動ペアの価値関数(value function)**を再帰的に定義するための基本的な関係式です。これは、動的計画法(Dynamic Programming)に基づく手法(例:価値反復や方策反復)を用いて最適な方策を求める際の中心的な理論です。


1. ベルマン方程式とは

ベルマン方程式は、次の2つの価値関数に対して定義されます:

  • 状態価値関数(state-value function)

  • 状態-行動価値関数(action-value function)

それぞれについて、詳細に見ていきます。


2. 状態価値関数のベルマン方程式(V関数)

ある方策πに従ったときの状態価値関数 Vπ(s)V^\pi(s) は、次のように定義されます:

Vπ(s)=Eπ[Rt+1+γVπ(St+1)St=s]V^\pi(s) = \mathbb{E}_\pi \left[ R_{t+1} + \gamma V^\pi(S_{t+1}) \mid S_t = s \right]

説明

  • Vπ(s)V^\pi(s):状態 ss における、方策 π\pi に従ったときの期待される累積報酬

  • Rt+1R_{t+1}:状態 ss において行動 aπ(s)a \sim \pi(s) を取った際に得られる即時報酬

  • γ\gamma:割引率(将来の報酬の現在価値を考慮)

  • St+1S_{t+1}:次の状態

  • 期待値 Eπ\mathbb{E}_\pi:方策πと環境の確率遷移に基づく期待値

これは、現在の価値は即時報酬と次状態の価値の合計(期待値)であるという考え方です。


3. 状態-行動価値関数のベルマン方程式(Q関数)

一方、状態 ss における行動 aa の価値(Q関数)は次のように表されます:

Qπ(s,a)=Eπ[Rt+1+γQπ(St+1,At+1)St=s,At=a]Q^\pi(s, a) = \mathbb{E}_\pi \left[ R_{t+1} + \gamma Q^\pi(S_{t+1}, A_{t+1}) \mid S_t = s, A_t = a \right]

説明

  • Qπ(s,a)Q^\pi(s, a):状態 ss で行動 aa を取ったときの期待累積報酬

  • 次の状態 St+1S_{t+1} で方策 π\pi に従って次の行動 At+1A_{t+1} を選ぶ


4. 最適ベルマン方程式(Optimal Bellman Equation)

最適方策 π\pi^* における状態価値関数 V(s)V^*(s) は次のように定義されます:

V(s)=maxaE[Rt+1+γV(St+1)St=s,At=a]V^*(s) = \max_a \mathbb{E} \left[ R_{t+1} + \gamma V^*(S_{t+1}) \mid S_t = s, A_t = a \right]

また、Q関数の最適版は:

Q(s,a)=E[Rt+1+γmaxaQ(St+1,a)St=s,At=a]Q^*(s, a) = \mathbb{E} \left[ R_{t+1} + \gamma \max_{a’} Q^*(S_{t+1}, a’) \mid S_t = s, A_t = a \right]

これらは、最適価値関数の帰納的な定義であり、価値反復アルゴリズムやQ学習などの理論的基盤になります。


5. 意義と応用

  • ベルマン方程式は、動的計画法(DP)に基づく価値関数の更新の中核です。

  • 特に、**価値反復(Value Iteration)方策反復(Policy Iteration)**は、これらの方程式を用いて最適方策を反復的に導出します。

  • モデルベースの強化学習(環境モデルが既知)において、理論的に最適な方策を計算可能にします。


まとめ

  • ベルマン方程式は、価値関数を帰納的(再帰的)に表現する数式。

  • 強化学習の多くのアルゴリズム(DP, Q学習, DQNなど)の理論的な根幹をなす。

  • 状態価値関数と行動価値関数の両方に対して、一般・最適な形が存在する。

生成日:2025/06/01