AI が出した回答を、別の AI モデルが採点します。人手だけでは追いつかない量を素早くさばくための評価方法で、評価軸ごとにルーブリック(採点基準表)を用意すると点数のぶれが減ります。
AI が出した回答を、別の AI モデルが採点します。人手だけでは追いつかない量を素早くさばくための評価方法で、評価軸ごとにルーブリック(採点基準表)を用意すると点数のぶれが減ります。
自社のプロダクトやエージェントの出力を継続的に採点したいときに登場します。Evals(評価のしくみ)を作る場面で、人手評価では追いつかない量をさばく一次判定役として使われることが多い立場です。
生成した AI の答えが、別枠に立つ judge 役の AI に渡ってルーブリックと照らして採点され、判断に迷う境界事例だけ矢印が人へ分岐する 3 段の構造
擬人化ポンチ絵 · 後日差し込みAI の出力を別の AI が採点し、良し悪しを判定します。
人手評価では追いつかない量を素早くさばけます。
採点プロンプトが曖昧だと点数がぶれます。
評価器づくりや品質チェックの自動化に役立ちます。
審判役と実行役のモデルを分けて試すと安心です。
ルーブリック設計、一致率の検証、Evals
一致率 75〜90% は目安として紹介されている数字であり、断定的な合格ラインではありません。