数学の解答やコードのテスト通過など、正誤を機械的に判定できる課題を使ってモデルを鍛える強化学習です。人の好みを教師にする RLHF とは違い、客観的な正解・不正解が教師になります。
数学の解答やコードのテスト通過など、正誤を機械的に判定できる課題を使ってモデルを鍛える強化学習です。人の好みを教師にする RLHF とは違い、客観的な正解・不正解が教師になります。
数学やコーディングに強いモデルの学習方法を調べると出てくる語です。自動採点できる分野で標準的な学習法になったとされ、答え合わせしにくい文章の良し悪しには使えません。
「人が採点する RLHF」と「機械が採点する RLVR」を左右に対比させた図
擬人化ポンチ絵 · 後日差し込み答え合わせできる課題でモデルを鍛える手法です。
人手のラベル付けなしに自動で学習を回せます。
答え合わせできる領域でしか鍛えられません。
数学やコード生成の精度向上に使われます。
RLHF との教師の違いから理解します。
検証器の設計、グッドハートの法則、Evals
「特定モデルが RLVR で作られた」という断定は避けた。