id: J-57(誌面表示: J-57) · 物理ページ: 760–761(pages=2) · category: term_general · figure_type: workflow · status: ready · evaluation_date: 2026-08-10
tagline 45/25-45何を 94/60-200どこで 111/60-200会話例 39/25-50見1 25/15-40見2 21/15-40見3 21/15-40見4 23/15-40見5 29/15-40見6 32/15-50
← J-56 GDPR 目次 J-58 EU AI Act →
一般語彙
760

RLHF・アラインメント

アラインメント
人間のフィードバックによる強化学習の略。人間の評価を報酬に AI の振る舞いを整える手法です。
体験区分:少しだけ触った 推奨読者レベル:Level 3-4

何をしてくれるか

アラインメント(AI の振る舞いを人間の意図や価値観に合わせる取り組み)の代表的な手法です。人が複数の回答を比べて順位をつけ、その評価を報酬として学習させることで、望ましい応答に近づけます。

どこで出会うか

2022 年の InstructGPT で効果が示され、ChatGPT のような対話 AI が実用的になった転機とされます。人の代わりに AI が評価する Constitutional AI や、手順を簡略化した DPO なども広く使われています。

ワークフロー図
図(figure_type: workflow)は本番生成器(Astro + React primitive)で描画。
iter 22 時点ではプレースホルダ。
RLHF・アラインメント を使う人

左に「複数の AI 回答を見比べて順位をつける評価者」、右に「素直な受け答えを返す学習後の AI」の流れ図。矢印で「評価 → 報酬 → 学習」の循環を示す

擬人化ポンチ絵 · 後日差し込み
開発フローでの位置
事前学習
教師ありファインチューニング
RLHF
リリース後の観測
利用者の検証
2026.08·ready
「RLHF のおかげで ChatGPT は素直に指示へ従うようになったんですよね。」
RLHF・アラインメントの見方
761
この用語の見どころ
1
役割

AI の振る舞いを人間の意図に合わせる学習手法です。

2
うれしさ

対話 AI が指示に素直に従いやすくなります。

3
注意点

評価者の偏りがそのまま挙動に反映されます。

4
どこで役立つか

チャット AI の使い勝手や応答の質を左右します。

5
はじめに

ChatGPT が急に使いやすくなった理由の一つと知ること。

6
深掘り先

Constitutional AI、DPO、RLVR(J-131)

非エンジニアのつまずき
  • 人が順位をつけるだけで賢くなるのが、直感に反します
  • 誰の価値観に合わせているのか、外からは見えません
  • アラインメントと RLHF の関係が分かりにくいです
私のコメント
  • 第一印象:それらしい回答が返る仕掛けだと分かります
  • 良い点:破綻しない受け答えになります
  • ダメな点:あの AI 臭さの原因でもある気がします
  • 誰向けか:出力の癖を疑いたい人向けです
関連用語
備考

InstructGPT の論文提出は 2022 年 3 月。

J-57·term_general
バイブコーディング図鑑