Expected SARSA

Expected SARSA(期待値SARSA)は、強化学習におけるモデルフリーかつオンポリシーな手法であり、SARSA(State-Action-Reward-State-Action)の改良版と見なされます。SARSAと同様に行動価値関数 Q(s,a)Q(s, a) を用いて学習を行いますが、次状態での行動の選び方とその評価に違いがあります。


1. 背景と位置づけ

  • モデルフリー:環境の遷移確率や報酬モデルを知らずに学習する。

  • オンポリシー:現在使用している方策(policy)に基づいて、行動の価値を評価・更新する。

  • TD(Temporal Difference)学習:経験を通じて逐次的に価値関数を更新する方法。


2. 通常のSARSAとの違い

SARSA

次の状態 ss’ において実際に選ばれた行動 aa’ に基づいて更新する。

Q(s,a)Q(s,a)+α[r+γQ(s,a)Q(s,a)]Q(s, a) \leftarrow Q(s, a) + \alpha \left[ r + \gamma Q(s’, a’) – Q(s, a) \right]

Expected SARSA

次の状態 ss’ におけるすべての可能な行動に対する期待値を使って更新する。すなわち、次の行動価値の期待値(方策に基づく加重平均)を使用する。

Q(s,a)Q(s,a)+α[r+γaπ(as)Q(s,a)Q(s,a)]Q(s, a) \leftarrow Q(s, a) + \alpha \left[ r + \gamma \sum_{a’} \pi(a’|s’) Q(s’, a’) – Q(s, a) \right]


3. 各項の意味

  • s,a,r,ss, a, r, s’:現在の状態、行動、報酬、次の状態

  • α\alpha:学習率(0~1)

  • γ\gamma:割引率(0~1)

  • π(as)\pi(a’|s’):次の状態における行動選択の確率(現在の方策)


4. 特徴と利点

  • より安定した学習:SARSAに比べて、期待値をとることでランダムな行動の影響を平均化し、より安定した更新が可能。

  • ノイズに強い:次に選ばれる行動1つだけに依存せず、全行動の加重平均を使うため、探索ノイズに影響されにくい。

  • 計算コスト:すべての可能な行動に対して Q(s,a)Q(s’, a’) を計算する必要があり、計算負荷がやや高くなる。


5. ε-greedy 方策との関係

例えば、ε-greedy方策を使う場合、期待値は次のように計算されます:

aπ(as)Q(s,a)=εAaQ(s,a)+(1ε)maxaQ(s,a)\sum_{a’} \pi(a’|s’) Q(s’, a’) = \frac{\varepsilon}{|\mathcal{A}|} \sum_{a’} Q(s’, a’) + (1 – \varepsilon) \max_{a’} Q(s’, a’)

ここで、A|\mathcal{A}| は行動の総数です。


6. 応用とまとめ

Expected SARSA は、実用的な強化学習アルゴリズムとして、より滑らかな学習を実現できる手法であり、特に環境にノイズが多い場合や学習の安定性を求める場面で有用です。SARSA と Q学習の中間的な性質を持ち、バランスの取れたアプローチといえます。

生成日:2025/06/01