ハイブリッド検索などで広めに拾った候補を、質問と文書を一緒に読むモデルに渡して並べ直します。絞り込んだ上位だけを LLM に渡すことで、答えの精度を底上げする工程です。
ハイブリッド検索などで広めに拾った候補を、質問と文書を一緒に読むモデルに渡して並べ直します。絞り込んだ上位だけを LLM に渡すことで、答えの精度を底上げする工程です。
RAG(G-15)を組んで検索精度が伸び悩んだときや、候補が多すぎて LLM に渡しきれないときに、絞り込みの仕上げ役として登場します。
「広く拾う → 並べ直す → 少しだけ渡す」の 3 段のベルトコンベア。書類選考と面接になぞらえ、左に大量の候補カード、中央でモデルが選別、右に厳選された数枚だけが残る様子
擬人化ポンチ絵 · 後日差し込み広く拾った候補を、関連度順に並べ直します。
LLM に渡す枠を、いちばん効くものだけで使えます。
cross-encoder(質問と文書を一緒に読む方式)は高コストです。
ハイブリッド検索や RAG の仕上げ工程で使います。
まずは検索結果の並べ替えから試します。
Cohere Rerank、BGE Reranker
cross-encoder(質問と文書をまとめて読んで関連度を出す方式)はあらかじめベクトル化しておく bi-encoder より精度が高い代わりにコストが高いため、一次検索で絞った上位 50…