言語モデルの事前学習における一般化ダイナミクス(17 分読)
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
研究者らは、言語モデルが事前学習中にパターン模倣と適応的知能の間で予測不能に切り替わる「モードホッピング」現象を解明し、この動的挙動を活用して最適なチェックポイントの選択やデータ選別、一般化性能を予測する指標の開発を提案した。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
言語モデル(LM)は、事前学習中に模倣パターンを繰り返すことと適応的知能を発揮することの間で予測不能な切り替えを起こし、この現象は「モードホッピング」と呼ばれます。この振る舞いは標準的な最適化手法では修正できず、各トレーニングウィンドウからのデータの影響を受けるモデル容量をめぐる競争として現れます。研究者らは、これらのダイナミクスを活用して、より適切な事前学習チェックポイントの選択や、安定した一般化のためのデータキュレーション、および LM の振る舞いを予測する指標の評価を行うことを提案しています。
原文を表示
Language models (LMs) undergo unpredictable switches between parroting patterns and exhibiting adaptive intelligence during pre-training, a phenomenon termed "mode-hopping." This behavior cannot be corrected by standard optimization techniques and presents as a competition for model capacity, influenced by data from each training window. Researchers propose leveraging these dynamics to better select pre-training checkpoints, curate data for stable generalization, and evaluate metrics predicting LM behavior.
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み