モデルの規模・学習データ量・計算量を増やすほど、性能がなだらかに伸びていく傾向を示す考え方です。2020年前後の研究で、べき乗則に近い形が確認されました。
モデルの規模・学習データ量・計算量を増やすほど、性能がなだらかに伸びていく傾向を示す考え方です。2020年前後の研究で、べき乗則に近い形が確認されました。
新モデル発表のニュース記事や、巨額の学習投資を説明する記事で頻繁に見かけます。2024年以降は、答えを出すときに長く考えさせる方向の話でも登場します。
右肩上がりのグラフ(横軸=計算量、縦軸=性能)。2024年あたりで学習量の矢印から分岐して「推論時の計算」を示す二本目の矢印が伸びる
擬人化ポンチ絵 · 後日差し込み投資判断や設計方針を考える目安になる考え方です。
闇雲に試すより、資源配分の見通しが立てやすくなります。
保証ではなく観測された傾向で、頭打ちの議論も続いています。
新モデル発表の記事や投資額の説明で見かけます。
データ量とモデル規模の釣り合いから知ると入りやすいです。
Chinchilla研究、推論時計算、ムーアの法則
「法則」と訳されるが物理法則のような保証ではなく、観測されたデータから見えている傾向である点に注意。