KLダイバージェンス

KLダイバージェンス(Kullback-Leiblerダイバージェンス)は、情報理論において中心的な概念であり、主に2つの確率分布の違い(非対称な“距離”)を定量的に表すために用いられます。機械学習、とりわけ**強化学習(例:方策最適化や探索制御)**の理論やアルゴリズム設計において非常に重要な役割を果たします。


定義と直感的な理解

確率分布 PP(真の分布)と QQ(近似分布)に対して、KLダイバージェンス DKL(PQ)D_{KL}(P || Q) は以下のように定義されます:

DKL(PQ)=xP(x)logP(x)Q(x)D_{KL}(P || Q) = \sum_x P(x) \log \frac{P(x)}{Q(x)}

連続分布の場合:

DKL(PQ)=P(x)logP(x)Q(x)dxD_{KL}(P || Q) = \int P(x) \log \frac{P(x)}{Q(x)} dx

この式は、分布 QQ を用いて分布 PP を近似するときの情報損失を表します。つまり、「実際には PP に従ってデータが生成されているのに、あたかも QQ に従っていると仮定してしまった場合に、どれだけの“誤り”があるか」を表す量です。


性質

  1. 非負性(非対称性)

    DKL(PQ)0D_{KL}(P || Q) \geq 0

    等号成立は P=QP = Q のときのみ(すなわち、情報損失がないとき)。

  2. 非対称性

    DKL(PQ)DKL(QP)D_{KL}(P || Q) \neq D_{KL}(Q || P)

    これはKLダイバージェンスが距離関数(metric)ではないことを意味します。

  3. 期待値形式

    DKL(PQ)=ExP[logP(x)Q(x)]D_{KL}(P || Q) = \mathbb{E}_{x \sim P} \left[ \log \frac{P(x)}{Q(x)} \right]

    よって、**KLダイバージェンスは、真の分布下での「対数尤度の差の期待値」**とも捉えることができます。


強化学習における利用例

KLダイバージェンスは、強化学習において以下のような目的で使用されます:

1. 方策最適化(Policy Optimization)

例:Trust Region Policy Optimization(TRPO)Proximal Policy Optimization(PPO)

  • 新しい方策 πnew\pi_{\text{new}} を旧方策 πold\pi_{\text{old}} に対して更新するときに、

    DKL(πoldπnew)<δD_{KL}(\pi_{\text{old}} || \pi_{\text{new}}) < \delta

    のように制約を設けることで、急激な方策変更による不安定さを防ぐ

2. 方策の正則化

  • KLダイバージェンスを損失関数に加えて、現在の方策が過去の方策から逸脱しすぎないように制御する。

    Loss=Reward TermβDKL(πoldπnew)\text{Loss} = \text{Reward Term} – \beta \cdot D_{KL}(\pi_{\text{old}} || \pi_{\text{new}})

3. 探索と既知の分布との比較

  • 既存の知識(事前分布)と得られた行動分布の違いをKLダイバージェンスで測定し、新しい情報が得られたかどうかを判断する指標として利用。


他の情報理論量との関係

  • エントロピー H(P)H(P)
    情報の平均的不確かさ。

  • 交差エントロピー H(P,Q)H(P, Q)
    分布 QQ を用いて PP を表現したときの情報量。

  • KLダイバージェンスは次の関係式を満たします:

DKL(PQ)=H(P,Q)H(P)D_{KL}(P || Q) = H(P, Q) – H(P)

つまり、交差エントロピーから真のエントロピーを引いたものがKLダイバージェンスです。


まとめ

特性 内容
意味 分布 PP から見たときに分布 QQ との“違い”を測る尺度
主な用途 強化学習での方策制御、正則化、情報ゲインの測定など
数学的特徴 非負、非対称、期待値形式
関連概念 エントロピー、交差エントロピー

生成日:2025/06/01