1. はじめに

情報理論は、データ科学や機械学習の分野で非常に重要な役割を果たしています。本記事では、情報理論の中核となる「情報量」「エントロピー」「KLダイバージェンス」について、その基本概念から応用例までを体系的に解説します。これらの理解を深めることで、確率分布の性質を捉えたり、データの効率的な処理やモデリングが可能になります。

2. 情報量とは何か?

情報量の基本概念

情報量とは、ある事象が起こった際に得られる「情報の量」を定量化したものです。直感的には、「予想外の出来事ほど多くの情報を含む」と考えることができます。

例えば、コインを投げたときに「表」が出る確率が 50% であれば、その結果はそれほど驚きではありません。一方、ほとんど出ない特定の事象(例えば、特殊なサイコロで1が出る確率が1%)が発生した場合、その情報量は非常に大きくなります。

情報量の定義

情報量 \(I(x)\) は次の式で定義されます:

$$I(x)=−\log P(x) $$

ここで、

  • \(P(x)\) は事象 \(x\) が発生する確率。
  • log は通常 2 を底とする対数を使います(単位はビット)。

例:

  • コインの「表」が出る確率 \(P(x)=0.5\)の場合、情報量は \(−\log_2 0.5 = 1\) ビットです。
  • \(P(x)=0.01\) の場合、情報量は \(−\log_2 0.01≈6.64\) ビットです。
 

3. エントロピー:不確実性の定量化

エントロピーの直感的な理解

エントロピーとは、ある確率分布に基づく「不確実性の平均的な大きさ」を表します。すべての事象が均等に発生する場合、エントロピーは最大化されます。一方で、特定の事象が確実に発生する場合、エントロピーはゼロになります。

以下はその一例です。

  • コインの表裏が同じ確率の場合(公平なコイン)、エントロピーは最大。
  • 確率が偏った場合(例: 表が必ず出るコイン)、エントロピーは最小。

シャノンのエントロピー

エントロピー \(H(X)\) は次の式で定義されます:

$$H(X) = -\sum P(x) log P(x)$$

\(x\) は \(X\) の取り得る値

ここで、

  • \(X\) は確率変数、\(x\) はその値。
  • \(P(x)\) は各事象 \(x\) の確率。

例: サイコロのエントロピー

  • 各目が均等に出るサイコロ\(P(x) = 1/6\)の場合:
$$H(X) = -6 × (1/6) × log₂(1/6) ≒ 2.58ビット$$
 

4. KLダイバージェンス:確率分布間の差異を測る

KLダイバージェンスの定義

KLダイバージェンス(Kullback-Leibler Divergence)は、2つの確率分布 \(P\) と \(Q\) の間の差異を測る指標です。特に、真の分布 \(P\) に従ってデータが生成されると仮定したとき、間違った分布 \(Q\) を用いてそのデータをモデル化する際に失う「情報効率」を定量化します。

定義式:

$$D_{KL}(P∣∣Q)=∑_{x∈X}{P(x)log\frac{P(x)}{Q(x)}} $$

重要な性質

  • 非負性:\(D_{KL}(P∣∣Q) ≥0\)
  • 対称性がない:\(D_{KL}(P∣∣Q)≠D_{KL}(Q∣∣P)\)

例: コインの分布

偏ったコインの真の確率が表60%・裏40%であるのに、あなたが表50%・裏50%の公平なコインだと想定している場合を考えます。
この認識のズレをKLダイバージェンスで計算すると:

  • 真の分布 \(P(x)\) :表0.6, 裏0.4
  • あなたの想定 \(Q(x)\):表0.5, 裏0.5
  • KLダイバージェンス:約0.020
$$D_{KL}(P||Q) = P(\text{表}) \log \frac{P(\text{表})}{Q(\text{表})} + P(\text{裏}) \log \frac{P(\text{裏})}{Q(\text{裏})} = 0.6 \times \log 1.2 + 0.4 \times \log 0.8 = 0.1094 + (-0.0892) = 0.0202$$

この値は、間違った想定により失われる情報効率を表します。値が大きいほど分布間の差異が大きく、より多くの「予測の無駄」が生じていることを意味します。

5. エントロピーとKLダイバージェンスの関係

クロスエントロピーとKLダイバージェンス

クロスエントロピー\(H(P,Q)\)は、真の分布 \(P\) をモデル \(Q\) で近似する際の「総コスト」を示します。この総コストは以下のように分解できます:

$$H(P,Q) = H(P)+D_{KL}(P∣∣Q) $$

ここで、

  • \(H(P)\) は 真の分布\(P\) のエントロピー(理論上の最小コスト)。
  • \(D_{KL}(P∣∣Q)\)は モデル\(Q\) を用いたことによる余分なコスト。

直感的な理解: 真の分布を知っていれば最小コスト \(H(P)\) で済むところを、モデルQを使うためにKLダイバージェンス分だけ余分なコストが発生します。

実用的な意味: 機械学習では、 \(H(P)\) は定数なので、クロスエントロピーを最小化することはKLダイバージェンスを最小化することと等価です。つまり、KLダイバージェンスはモデルが真の分布にどれだけ近いかを測る指標として機能します。

この関係により、KLダイバージェンスが「モデルの適合度」を評価する自然な尺度となることが理解できます。

6. 具体例で学ぶ情報理論

例1: コイン投げのエントロピー

  • 公平なコイン(P(表)=0.5 P(裏) = 0.5)のエントロピー:
$$H(X)=−0.5log_2(0.5)−0.5log_2(0.5)=1ビット$$
 

例2: KLダイバージェンスの計算

  • P=[0.8,0.2]、Q = [0.5, 0.5] の場合:
$$D_{KL}(P∣∣Q)=0.8log_2\frac{0.8}{0.5}+0.2log_2\frac{0.2}{0.5}≈0.278ビット$$
 

7. 情報理論の応用分野

機械学習での活用

  • 分類問題: クロスエントロピー損失で予測精度を向上させる
    • 予測確率のエントロピーを最小化することで、より確信度の高い分類を実現
  • 生成モデル: GANやVAEで現実的なデータを生成する際の分布学習にKLダイバージェンスを活用
    • 生成分布と真の分布の差異をKLダイバージェンスで測定し最小化
  • 自然言語処理: 言語モデルが次の単語を予測する確率計算に情報量を使用
    • 稀な単語ほど高い情報量を持つという性質を利用

データ処理・通信分野

  • データ圧縮: ZIP形式やJPEG画像圧縮で、冗長な情報を削減
    • エントロピーが低い(予測しやすい)部分を効率的に圧縮
  • 誤り訂正: 通信エラーを検出・修正してデータの正確性を保証
    • エントロピーの概念で雑音の影響を定量化

学習した概念の活用ポイント

  • 情報量: 稀な事象ほど価値が高いという原理
  • エントロピー: 不確実性やランダムさの定量化
  • KLダイバージェンス: 2つの分布の違いを数値化

これらの概念が組み合わさることで、スマートフォン、インターネット、AI技術の根幹を支える数学的基盤として、現代社会に欠かせない役割を果たしています。

8. まとめと今後の展望

本記事では、情報量、エントロピー、KLダイバージェンスの基本概念と、応用を解説しました。これらの理解は、確率分布を扱うあらゆる分野で重要です。数式が多く登場し大変ですが、数式の実装等を通じて着実に理解していくことをおすすめします。

\ シェア /

E資格スピードパッケージ2023#2修了者合格率100%達成

zero to one E資格 jdla

zero to oneの「E資格」向け認定プログラム

日本ディープラーニング協会の実施するE資格の受験ならzero to oneの「E資格」向け認定プログラム (税込165,000円) をおすすめします。当講座は、東京大学大学院工学系研究科の松尾豊教授と東北大学大学院情報科学研究科の岡谷貴之教授が監修する実践的なプログラムとなっています。
厚生労働省の教育訓練給付制度対象のE資格認定プログラムの中では最安値※となり、実質負担額49,500円~(支給割合70%の場合)で受講可能です。※2023年弊社調べ zero to one E資格 jdla

人工知能基礎講座を提供中

人工知能の第一人者である東京大学の松尾豊教授が監修した人工知能基礎講座を受講してみませんか? 人工知能の歴史から自然言語処理、機械学習、深層学習といった最先端のトピックやAIに関わる法律問題まで網羅しているので全てのビジネスパーソン・AIの初学者におすすめです。

サンプル動画

人工知能基礎講座はこちら↓ zero to one G検定 人工知能基礎 jdla

AI初学者・ビジネスパーソン向けのG検定対策講座

G検定受験前にトレーニングしたい方向けの問題集「G検定実践トレーニング」も提供中です。 zero to one E資格 jdla