モデルやプロンプトの出来を、決めた基準で繰り返し測るしくみです。決定的な判定・統計的な判定・LLM-as-a-judge(G-51)の 3 種を、安く確実な順に使い分けます。
モデルやプロンプトの出来を、決めた基準で繰り返し測るしくみです。決定的な判定・統計的な判定・LLM-as-a-judge(G-51)の 3 種を、安く確実な順に使い分けます。
AI に仕事を任せる前に、合格ラインを 5 個書き出すような場面で使います。プロンプトを変えるたび毎回目で確認するのは大変なので、決めた基準で自動的に測り直す土台として使われます。
「合格ライン」を書いたチェックリストを手に持つ人が、AI の出力を横に並べて 1 項目ずつ照らし合わせている様子
擬人化ポンチ絵 · 後日差し込み仕事の合格基準を、自分で決めて測る物差しです。
感覚ではなく数字で良し悪しを判断できます。
指標を先に決めると本番の失敗を見落とします。
AI に仕事を任せる前の合否ラインづくりに向きます。
まず失敗例を 5 個集めて基準にします。
LLM-as-a-judge、ゴールデンデータセット
先に指標を決めてからデータを作る(top-down)と本番で転びやすく、先に実際の失敗を集めてから指標を設計する(bottom-up)方が本番の壊れ方を当てやすい、という整理が 2026 年時…