ChatGPT や Gemini に質問すると、単に情報を返すだけでなく、丁寧な言葉遣いで、的外れな内容を避けながら答えてくれます。しかし、本来の大規模言語モデル(LLM)は、基本的にはインターネット上の膨大なテキストから「次の単語を統計的に予測する」よう訓練されています。では、なぜ現代のAIはここまで人間の意図を理解し、回答できるのでしょうか?

その答えの中心にあるのが RLHF(Reinforcement Learning from Human Feedback:人間のフィードバックを用いた強化学習) という技術です。

本記事では、RLHFが必要とされる理由から、その3つのステップ、そして最新の動向まで、初学者の方にも理解できるよう丁寧に解説します。

1.なぜRLHFが必要なのか

まず、RLHFが必要な理由について見ていきましょう。

事前学習だけのモデルは”自動補完機”に過ぎない

ChatGPT のようなAIチャットのベースとなる大規模言語モデルは、Webページ・書籍・論文など膨大なテキストを学習することで、「次に来る単語を予測する」能力を身につけています。この段階を 事前学習(Pre-training) と呼びます。

事前学習によって、モデルは豊富な言語能力と知識を獲得します。しかしそれは、あくまで「統計的に続きやすい文章(トークン)を生成する」ことに特化した能力です。
例えば、「履歴書の書き方を教えてください」という指示を与えると、事前学習後のモデルは「Microsoft Word を使って作成します」のような、正確に指示の意図を汲むことが出来ていない、単なる文章の続きを返してしまうことがあります[1]。これは質問に答えているのではなく、続きそうな文章のパターンを「補完」しているだけの状態になっています。

出典:Ouyang, Long, et al., 2022 “Training language models to follow instructions with human feedback.”

数式では表せない「価値観の壁」

RLHFが必要な理由として、もう一つ、より根本的な問題があります。「有用性」「誠実さ」「倫理的に適切かどうか」といった人間の価値判断は、数学的な数式として定義できません。

例えば、「良い回答とは何か」をスコアで表そうとしても、「100点満点の何点」という絶対的な基準は存在しません。ユーモアを求める人もいれば、簡潔さを重視する人もいる。同じ回答でも、文脈や読む人によって「良さ」は変わります。このような主観的・多面的な基準を、単純な数式や固定的な目的関数として完全に定義することは非常に困難です。

さらに深刻なのは、インターネット上のテキストには偏見・有害な表現・誤情報も大量に含まれており、事前学習モデルはそれらをそのまま吸収してしまうことです。

目標は「3H」の達成

この問題を解決するために、OpenAI や Anthropic などの研究機関は 「3H」[2] と呼ばれる基準を掲げています。

  • Helpful(有用性):ユーザーの指示を正確に理解し、タスクを完遂すること
  • Honest(誠実性):事実に基づいた回答をし、もっともらしい嘘(ハルシネーション)を避けること
  • Harmless(無害性):差別・暴力・不法行為を助長する出力を行わないこと

この3つのHを同時に満たすことは、事前学習だけでは達成できません。RLHFは、この3Hに沿うようモデルの振る舞いを調整する「アラインメント」のプロセスです。

出典:Bai, Yuntao, et al., 2022 “Training a helpful and harmless assistant with reinforcement learning from human feedback.”

2.RLHFの3ステップ

RLHFは大きく3つのステップで構成されています。それぞれを順番に見ていきましょう。

ステップ① 教師あり微調整(SFT:Supervised Fine-Tuning)

まず、人間のアノテーター(作業者)が「質問(プロンプト)」と「理想的な回答」のペアを大量に作成します。これは「メールを要約して」「この概念を簡単に説明して」「この問題の解き方を教えて」といったさまざまなタスクに対する模範解答集です。このデータを使って、事前学習済みのモデルを微調整(Fine-Tuning)します。

SFTの目的は、事前学習済みモデルに「対話の型」と「指示に従う姿勢」を学ばせることです。「質問には答える」「丁寧な言葉遣いをする」「ユーザーが求めていることを中心に話す」といった基本的なコミュニケーションパターンを身につけさせます。

しかし、SFTだけでは「学習データに存在しない状況」での細かな好みや安全性判断まで十分に一般化できないことがあります。RLHFは、そのような曖昧な価値判断を追加で学習させる役割を持っています。

このステップを経たモデルは、次の強化学習のための出発点(ベースライン)となります。

ステップ② 報酬モデル(Reward Model)の構築

SFT でモデルに型を教えることはできました。しかし、「2つの回答のうちどちらが人間にとってより好ましいか」という微妙なニュアンスを学ばせるには、別のアプローチが必要です。そこで登場するのが 報酬モデル(Reward Model) です。報酬モデルは、人間の「好み」を数値化し、回答の質を評価する「審判」として機能します。

手順は以下の通りです。

  1. 回答の生成:同じ質問に対して、SFT 済みモデルが複数のパターンの回答を生成します
  2. 人間によるランキング:評価者が複数の回答を比較して「どちらの回答がより優れているか」を順位付けします
  3. 報酬モデルの訓練:このランキングデータをもとに、「人間が好む回答に高いスコアを出す」ように報酬モデルを学習させます

ポイントは、「この回答は100点満点の何点か」という絶対評価ではなく、「AとBならどちらが良いか」という相対比較を使うことです。人間は絶対的なスコアをつけるよりも、2つを比べて「こちらの方が良い」と判断する方が一貫性のある評価をしやすい、という心理学的な知見に基づいた設計です。

ステップ③ 強化学習による最適化(PPO)

報酬モデルという「審判」が完成したら、いよいよ本番の強化学習です。初期のRLHFでは一般的に PPO(Proximal Policy Optimization:近傍方策最適化) と呼ばれるアルゴリズムが用いられました。

プロセスは以下のサイクルを繰り返します。

  1. 生成:メインモデルが質問に対して回答を生成する
  2. 採点:報酬モデルがその回答にスコアをつける
  3. 更新:メインモデルがスコア(報酬)を最大化する方向にパラメータを更新する(ただし、モデルが極端な方向へ崩壊しないよう、元モデルから逸脱しすぎない制約がある)

このフィードバックループを何万回も繰り返すことで、モデルは「人間から高く評価される回答を生成する能力」を獲得していきます。

しかしここで「報酬ハッキング」という問題が発生します。報酬の最大化だけを追求すると、モデルが報酬モデルの弱点を突いて「見かけ上スコアは高いが、実際には役に立たない回答」を生成し始めるのです。例えば、「丁寧であれば高スコアになる」と学習したモデルが、内容のない丁寧な文章を延々と生成する、といったケースが起こり得ます。

これを防ぐために、KLダイバージェンス・ペナルティという仕組みが導入されています。KLダイバージェンスとは、2つの確率分布がどれだけ異なるかを測る指標です。

具体的には、「現在強化学習を行っている最中のモデル」と「強化学習を開始する直前の教師あり微調整(SFT)済みモデル」の2つについて、ある指示に対して次にどの単語(トークン)を選ぶかという確率の分布(出力のパターン)を比較します。

これを用いて「強化学習後のモデルがSFT後のモデルから極端に離れすぎないようにする」制約を設けることで、モデルが報酬スコアを稼ぐためだけに、不自然に偏った言葉選びをしたり、元の言語能力を失って支離滅裂な文章を生成したりする(報酬ハッキング)ことを防ぎます。これにより、基本的な言語能力を保ちながら、人間の好みにも適応できるようバランスをとる安全装置として機能します。

まとめ:RLHFの仕組み

  1. 教師あり微調整(SFT:Supervised Fine-Tuning)
  2. 報酬モデル(Reward Model)の構築
  3. 強化学習による最適化(PPO)

この3ステップを通じて、事前学習モデルは単なる「統計的な次単語予測器」から、「人間の意図や価値観に沿った挙動ができるAI」へと進化します。OpenAI の研究では、人間による指示追従性評価において、13億パラメータで RLHF を施した InstructGPT が、100倍以上のサイズを持つ 1750億パラメータの GPT-3 よりも人間から高く評価されたという結果が報告されています[1]。モデルの「量(パラメータ数)」より「質と方向性(RLHFによる整列)」がいかに重要かを示す、非常に印象的な結果です。

3.最新の動向:RLHFはどこへ向かっているのか

最後に、RLHF の最新動向について簡単に紹介します。新しいアルゴリズムやフィードバック方法などRLHF の周辺技術は大きな進化を遂げています。

1.新しいアルゴリズムの台頭(DPO・GRPO)

従来の PPO は強力ですが、「報酬モデルの学習」と「強化学習」という2段階のパイプラインが必要で、実装が複雑で計算コストも高いという課題がありました。これを簡略化する手法が次々と登場しています。

DPO(Direct Preference Optimization)[3]
DPOは報酬モデルを構築するステップを完全に省略し、人間の比較データから直接モデルを最適化する手法です。数学的に証明された等価性により、PPO と似た効果を得ながら、実装の簡便さと計算コストの低さを実現しています。オープンソースコミュニティでの普及が著しく、多くのモデルで採用されています(Llama 3 (Meta), Gemma 2 (Google)等)。

出典:Rafailov, Rafael, et al., 2023 “Direct preference optimization: Your language model is secretly a reward model.” 

GRPO(Group Relative Policy Optimization)[4]
GRPOはDeepSeek によって導入された手法です。PPO では学習を安定化させるために「批評者モデル(Critic)」と呼ばれる補助モデルが必要で、「現在の状況からどれだけ良い報酬が期待できるか」を評価してメインモデルの更新を導く役割を担います。GRPO はこの巨大な Critic モデルを廃止し、同じ質問に対して生成した複数回答をグループ内で相対比較することで、メモリ消費を大幅に削減します。これにより、より大規模なモデルや長いコンテキストでの強化学習が現実的になりました(DeepSeek-R1)。

出典:Guo, Daya, et al., 2025 “Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.”

2.フィードバックの自動化(RLAIF・Constitutional AI)

RLHF の大きな課題は、人間によるフィードバックのコストです。大量の比較評価を人間が担当するのは時間と費用がかかり、スケールさせることが難しいという限界がありました。この問題を解決するために、「AIがAIを評価する」アプローチが急速に普及しています。

RLAIF(Reinforcement Learning from AI Feedback)[5] は、人間の代わりに別の強力な AI が回答を評価・ランク付けする手法です。人間によるフィードバックと比較して、コストを 100分の1以下に抑えられるとされており、データ収集のスケーラビリティが飛躍的に向上しました。
しかし、人間の価値観との乖離など懸念点は存在しています。そのため少量の人間の評価とAIの評価の組み合わせによる対策などが考えられています。

出典:Lee, Harrison, et al. (Google), 2023 “Rlaif: Scaling reinforcement learning from human feedback with ai feedback.”

Constitutional AI(憲法AI)[6]は Anthropic が推進する手法で、AI が「憲法(行動規範)」と呼ばれるルール集に基づいて自己批判・修正を行います。人間が細かく評価する代わりに、原則をAI自身に内面化させるアプローチで、2023年時点では約60の原則で構成されていた『憲法』は、2026年1月に約23000語の包括的な文書へと刷新されました。単なるルールの羅列から、行動の理由や価値観の背景を説明する形式へと進化し、より洗練された安全基準が構築されています。

出典:Bai, Yuntao, et al., (Anthropic), 2022 “Constitutional ai: Harmlessness from ai feedback.”

4.まとめ

本記事では、RLHF の全体像を解説しました。

RLHF の本質は、「確率モデルを人間のパートナーへと変えるアラインメント(価値整列)のプロセス」です。そして今、そのプロセスはAI自身がAIを評価・育成する方向へと急速に進化しつつあります。

パラメータ数を積み上げるだけの「量の競争」から、「どのように人間の意図と整列させるか」という「質の追求」に踏み込んだRLHFの考え方は、AIが社会に信頼されるパートナーとして溶け込むための本質的な技術として、今後もその重要性を増し続けると思います。この記事が、皆さんのRLHF理解の足がかりとなれば幸いです。

参考文献

[1] Ouyang, Long, et al. “Training language models to follow instructions with human feedback.” Advances in neural information processing systems 35 (2022): 27730-27744.

[2] Bai, Yuntao, et al. “Training a helpful and harmless assistant with reinforcement learning from human feedback.” arXiv preprint arXiv:2204.05862 (2022)

[3] Rafailov, Rafael, et al. “Direct preference optimization: Your language model is secretly a reward model.” Advances in neural information processing systems 36 (2023): 53728-53741.

[4] Guo, Daya, et al. “Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.” arXiv preprint arXiv:2501.12948 (2025).

[5] Lee, Harrison, et al. “Rlaif: Scaling reinforcement learning from human feedback with ai feedback.” (2023).

[6] Bai, Yuntao, et al. “Constitutional ai: Harmlessness from ai feedback.” arXiv preprint arXiv:2212.08073 (2022).

\ シェア /

E資格スピードパッケージ2023#2修了者合格率100%達成

zero to one E資格 jdla

zero to oneの「E資格」向け認定プログラム

日本ディープラーニング協会の実施するE資格の受験ならzero to oneの「E資格」向け認定プログラム (税込165,000円) をおすすめします。当講座は、東京大学大学院工学系研究科の松尾豊教授と東北大学大学院情報科学研究科の岡谷貴之教授が監修する実践的なプログラムとなっています。
厚生労働省の教育訓練給付制度対象のE資格認定プログラムの中では最安値※となり、実質負担額49,500円~(支給割合70%の場合)で受講可能です。※2023年弊社調べ zero to one E資格 jdla

人工知能基礎講座を提供中

人工知能の第一人者である東京大学の松尾豊教授が監修した人工知能基礎講座を受講してみませんか? 人工知能の歴史から自然言語処理、機械学習、深層学習といった最先端のトピックやAIに関わる法律問題まで網羅しているので全てのビジネスパーソン・AIの初学者におすすめです。

サンプル動画

人工知能基礎講座はこちら↓ zero to one G検定 人工知能基礎 jdla

AI初学者・ビジネスパーソン向けのG検定対策講座

G検定受験前にトレーニングしたい方向けの問題集「G検定実践トレーニング」も提供中です。 zero to one E資格 jdla