RLHF - 人間のフィードバックで学ぶ

RLHF(人間のフィードバックによる強化学習)は、AIの回答品質を人間の好みに合わせて向上させる技術です。

編集・検証: AIパスポートスタディ編集部 公式情報: GUGA 生成AIパスポート公式ページ 制作・検証方針
深見 つむぎ(普段) 深見 つむぎ

先生は今日、また研修で不在。
最近、AI 安全性関連のニュースでRLHFという言葉をよく見るから、3人で予習しておきましょう。
Reinforcement Learning from Human Feedback、人間のフィードバックによる強化学習、の略です。

雪村 ましろ(あせる) 雪村 ましろ

RLHF…長いね、ましろ舌噛みそうぉ。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

あ、そういえばさ、うちの妹が学校の絵の発表会で先生や友達からコメントもらって、どんどん絵が上手くなってったんだよね。
今思うと、あれに近いかも。

深見 つむぎ(普段) 深見 つむぎ

ジャスミンちゃん、それ実は今日の RLHF とまったく同じ構造なの!
みんなの評価フィードバックで上達していくってことね。

雪村 ましろ(笑顔) 雪村 ましろ

妹さんも RLHF なんだぁ!
えへへ、AI と一緒だねっ。

戸倉 ジャスミン(笑い) 戸倉 ジャスミン

うそっ!?
よっしゃ、あたしの説明もイケてるじゃん!

深見 つむぎ(普段) 深見 つむぎ

RLHF のステップを整理すると、①LLM に同じ質問に対して複数の回答を生成させる → ②人間の評価者が「どの回答が良いか」をランキングする → ③ランキングデータで報酬モデルを学習 → ④報酬モデルのスコアを最大化するように LLM を強化学習(PPOなど)で調整——です。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

4段階もあるの?
でも要は「人間が採点 → 採点者AIを作る → それでLLMを育てる」って流れでしょ。
妹の発表会で言うと、先生1人で全員分ずっと見るの大変だから、先輩生徒がアドバイスする仕組みを作った、みたいなもんだね!

深見 つむぎ(普段) 深見 つむぎ

ジャスミンちゃん、今日はたとえが冴えてるね、ちょっと感心。
そう、人間が全件評価するのはコスト的に無理だから、一度スコア化できる報酬モデルを育てて、それを使って LLM を強化学習で調整する、という工夫なの。

雪村 ましろ(普段) 雪村 ましろ

で、RLHF の効果は?

深見 つむぎ(普段) 深見 つむぎ

有害出力の抑制・丁寧な語り口・事実に基づく回答傾向など、「人間が好む方向」に仕上げられます。
ChatGPT の対話品質の高さは RLHF の成果と言われていますね。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

めっちゃすご〜い!
人間の好みに合わせて学習させるって、考え方はシンプルだけど強力だね。
でもさ、人間の評価自体が偏ってたら、AIも偏った方向に育っちゃうんじゃない?

深見 つむぎ(普段) 深見 つむぎ

ジャスミンちゃん、鋭い。
実際、評価者の文化・属性・時間帯による評価ブレは研究で指摘されています。
評価者のバイアスが報酬モデルに転写され、それが LLM に伝播する——これを評価者バイアス問題と言います。
評価者の多様性確保や、評価プロトコルの丁寧な設計が重要です。

雪村 ましろ(普段) 雪村 ましろ

AI のお師匠さんも、完璧じゃないんだね…結局 AI も、関わる人間次第ってこと。

深見 つむぎ(普段) 深見 つむぎ

補足: 最近は RLHF の代替としてDPO(Direct Preference Optimization)など、報酬モデル不要で直接選好を学習する手法も出てきています。
さらにConstitutional AIのように、人間の代わりに AI 自身が評価する方式(RLAIF)も登場しています。
先生が戻ったら、妹さんの話も一緒に報告しよう!

確認クイズ

RLHF のプロセスに含まれないものはどれか。

  1. 人間による回答のランキング
  2. 報酬モデルの学習
  3. 強化学習によるLLMの改善
  4. 大量データによる事前学習
こたえを見る

正解: 4. 大量データによる事前学習

事前学習は RLHF の前段階であり、RLHF 自体には含まれません。RLHFは「人間評価→報酬モデル→強化学習」の3要素が本体です。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。