ニューラル正接カーネルの数学的背景
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Lilian Weng
記事は、過剰パラメータ化されたニューラルネットワークがゼロに近い学習損失でデータを適合させつつ、テストデータでも良好な汎化性能を発揮する現象を説明する。ランダム初期化から始まり、パラメータ数がデータ数を上回る場合でも最適化プロセスが一貫して良好な結果をもたらす理由について、ニューラル正接カーネル(NTK)の数学的基盤に焦点を当てて解説している。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るSource Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
ニューラルネットワークは、過剰パラメータ化されていることでよく知られており、テストデータセット上で decent な汎化性能を維持しながら、訓練損失をほぼゼロにまで抑えてデータを容易に適合させることができます。これらのすべてのパラメータがランダムに初期化されていても、最適化プロセスは一貫して同様に良好な結果をもたらします。これは、モデルのパラメータ数が訓練データポイントの数を超えている場合でも同様です。
ニューラルタンジェントカーネル (NTK) (Jacot et al. 2018) は、勾配降下法による学習中のニューラルネットワークの進化を説明するためのカーネルです。これにより、十分な幅を持つニューラルネットワークが経験的損失を最小化するように訓練された際に、なぜ一貫して大域的最適解に収束するのかという点について、深い洞察をもたらします。本記事では、NTK の動機と定義、および無限の幅を持つニューラルネットワークにおける異なる初期化条件下での確定的な収束の証明(この設定において NTK を特徴づけることにより)を詳しく掘り下げていきます。
原文を表示
Neural networks are well known to be over-parameterized and can often easily fit data with near-zero training loss with decent generalization performance on test dataset. Although all these parameters are initialized at random, the optimization process can consistently lead to similarly good outcomes. And this is true even when the number of model parameters exceeds the number of training data points.
Neural tangent kernel (NTK) (Jacot et al. 2018) is a kernel to explain the evolution of neural networks during training via gradient descent. It leads to great insights into why neural networks with enough width can consistently converge to a global minimum when trained to minimize an empirical loss. In the post, we will do a deep dive into the motivation and definition of NTK, as well as the proof of a deterministic convergence at different initializations of neural networks with infinite width by characterizing NTK in such a setting.
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み