大規模言語モデル訓練における下流タスク指標のスケーリング特性の再検討
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Apple Machine Learning
研究チームが、大規模言語モデルの訓練予算からベンチマーク性能のスケーリングを直接モデル化する枠組みを提案し、固定トークン対パラメータ比率では単純なべき法則が複数の下流タスクの精度を正確に記述できることを発見した。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
大規模言語モデル(LLM)のスケーリング則に関する従来の研究は、事前学習損失(pretraining loss)のような代理指標に焦点を当てており、下流タスク(downstream task)の性能予測は信頼性が低いとされてきました。本論文は、学習コストからベンチマーク性能のスケーリングを直接モデル化する枠組みを提案し、この見解に再考を促します。トークンとパラメータの比率が固定されている場合、単純なべき乗則(power law)が、複数の主要な下流タスクにおける対数精度(log accuracy)のスケーリング挙動を高い精度で記述できることを明らかにしました。結果として、この直接的なアプローチは、以前提案された二段階手順(two-stage procedure)よりも優れた外挿性能(extrapolates)を示すことが分かりました…
原文を表示
While scaling laws for Large Language Models (LLMs) traditionally focus on proxy metrics like pretraining loss, predicting downstream task performance has been considered unreliable. This paper challenges that view by proposing a direct framework to model the scaling of benchmark performance from the training budget. We find that for a fixed token-to-parameter ratio, a simple power law can accurately describe the scaling behavior of log accuracy on multiple popular downstream tasks. Our results show that the direct approach extrapolates better than the previously proposed two-stage procedure…
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み