強化学習とは
強化学習(Reinforcement Learning:RL)とは、AIエージェントが試行錯誤を通じて「報酬を最大化する行動」を学習する機械学習手法です。環境と相互作用しながら学習する点が教師あり学習・教師なし学習と根本的に異なります。
強化学習の基本概念
エージェント(学習主体)が環境(状態)を観測し行動を選択すると、環境から報酬と次の状態が返ってきます。この繰り返しで「長期的な累積報酬を最大化する方策(行動ルール)」を学習します。チェス・囲碁のAlphaGoもDeepMindの強化学習で実現されました。
RLHF(人間フィードバックによる強化学習)
ChatGPT等のLLMが「有用で安全な回答」を生成できるのは、RLHFのおかげです。人間の評価者が回答に優劣をつけ、そのフィードバックで報酬モデルを学習し、LLMを改善するプロセスです。
ビジネスへの応用
広告入札の自動最適化・サプライチェーン最適化・レコメンデーションシステム・ロボットの動作学習・自動運転の走行制御などで強化学習が活用されています。