アラインメント(AI の振る舞いを人間の意図や価値観に合わせる取り組み)の代表的な手法です。人が複数の回答を比べて順位をつけ、その評価を報酬として学習させることで、望ましい応答に近づけます。
アラインメント(AI の振る舞いを人間の意図や価値観に合わせる取り組み)の代表的な手法です。人が複数の回答を比べて順位をつけ、その評価を報酬として学習させることで、望ましい応答に近づけます。
2022 年の InstructGPT で効果が示され、ChatGPT のような対話 AI が実用的になった転機とされます。人の代わりに AI が評価する Constitutional AI や、手順を簡略化した DPO なども広く使われています。
左に「複数の AI 回答を見比べて順位をつける評価者」、右に「素直な受け答えを返す学習後の AI」の流れ図。矢印で「評価 → 報酬 → 学習」の循環を示す
擬人化ポンチ絵 · 後日差し込みAI の振る舞いを人間の意図に合わせる学習手法です。
対話 AI が指示に素直に従いやすくなります。
評価者の偏りがそのまま挙動に反映されます。
チャット AI の使い勝手や応答の質を左右します。
ChatGPT が急に使いやすくなった理由の一つと知ること。
Constitutional AI、DPO、RLVR(J-131)
InstructGPT の論文提出は 2022 年 3 月。