実データを超えて:正則化の観点から見た合成データ
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Apple Machine Learning
研究者らは、実データが不足する場合に合成データが汎化性能を向上させるが、過度な依存は性能低下を招く可能性があると指摘し、合成データと実データのトレードオフを定量化する学習理論的枠組みを提案した。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
実データが不足している状況では合成データは汎化性能を向上させる可能性があるが、過度な依存は分布のミスマッチをもたらし、パフォーマンスを低下させる恐れがある。本論文では、合成データと実データの間のトレードオフを定量化するための学習理論的枠組みを提示する。我々のアプローチはアルゴリズム安定性を利用し、汎化誤差の上限を導出することで、実分布と合成分布間のワッサーシュタイン距離を関数として、期待されるテスト誤差を最小化する最適な合成データ対実データの比率を特徴づける。本枠組みの動機付けはカーネルリッジ…の文脈において行われる。
原文を表示
Synthetic data can improve generalization when real data is scarce, but excessive reliance may introduce distributional mismatches that degrade performance. In this paper, we present a learning-theoretic framework to quantify the trade-off between synthetic and real data. Our approach leverages algorithmic stability to derive generalization error bounds, characterizing the optimal synthetic-to-real data ratio that minimizes expected test error as a function of the Wasserstein distance between the real and synthetic distributions. We motivate our framework in the setting of kernel ridge…
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み