将棋を指していると『この場面ならこう動かす』という戦略が自然にできますね。強化学習の『方策』と『報酬』の関係を、身近な例えから丁寧に整理します。長期と短期のトレードオフに注目してください。
先週、姪っ子とすごろくをしたんですが、毎回同じマスで必ず右に進むんです。
あれって強化学習でいう『方策』ですよね?
ふふ、いいところに目を付けたわね。
方策は、まさに『この状況ならこうする』というルールのこと。
英語ではpolicyね。
つまり、状態→行動の対応表みたいなもんだね!
『状況Aなら前進、状況Bなら防御』みたいな感じ?
その通り。
そして方策が良いかどうかを測るのが報酬。
プラスの報酬が大きければ『いい行動』、マイナスなら『悪い行動』と評価されるわ。
ゲームでスコアが上がるとうれしくて、減ると悲しい…あれが報酬ですか〜?
まさに。
ただ強化学習で重要なのは『目先の報酬だけでなく、将来の報酬も足し合わせて考える』点なの。
これを累積報酬の最大化と呼ぶわ。
目先より長期って、例えばどういうこと?
将棋なら『今この駒を取ると+10点』より『ここは我慢して数手後に相手玉を詰める』方が結果的に勝てる、みたいな話ですね。
まさに。
強化学習では『状態→行動→報酬→次の状態』というサイクルを、長期のゴールを意識しながら回し続けるわ。
将来の報酬をどれくらい重視するかを調整する『割引率(γ)』というパラメータもあるの。
目の前のお菓子を我慢して、夕ごはんを美味しく食べる感じ…?
ましろ、例えが生活感ありすぎ(笑)。
でも、めっちゃ腹落ちする!
最適な方策を見つける方法としてQ学習や方策勾配法などがありますが、試験では『方策=行動ルール』『累積報酬を最大化する』だけで十分ですね。
そうね。
補足すると、AIが賢くなる=方策が上手くなる、と言い換えてもいいわ。
方策を改善するために、失敗も成功も経験するんですね〜。
人生みたい。
また、強化学習には『探索(exploration)』と『活用(exploitation)』のジレンマというのもあるの。
新しい行動を試すべきか、今まで良かった行動を選ぶべきか、というバランス問題よ。
新しい店に挑戦するか、いつものお気に入りに行くか、みたいな話か!
それ、人間もめっちゃ悩むじゃん。
その通りです。
強化学習の設計ではこのバランスが重要で、ε-greedy法などの工夫があります。
ε(イプシロン)の確率でランダム探索、残りで既知の最良行動、というシンプルな仕組みです。
ε-greedy、ギリシャ文字と英語が混ざっててかっこいい名前ですね〜!
試験では『方策と報酬の役割』『長期の累積報酬を最大化』をセットで覚えて。
細かい手法名までは不要よ。
なるほど、ゲーム上級者の『型』が方策で、点数が報酬ってことか〜!
納得!
ゲームプレイヤーの上達過程と、強化学習の仕組みって、本当に似ていますね〜!
確認クイズ
強化学習における『方策』の説明として正しいものはどれか?
- 訓練データの正解ラベル
- エージェントの行動ルール
- データの前処理方法
- モデルの評価指標
こたえを見る
正解: 2. エージェントの行動ルール
方策(Policy)はエージェントが各状態でどの行動を選ぶかを決めるルールです。強化学習の目的は、累積報酬を最大化する最適な方策を見つけることです。訓練データや前処理、評価指標とは役割が異なります。