大規模トランスフォーマーモデルの推論最適化
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Lilian Weng
記事は、主流となった大規模トランスフォーマーモデルの推論コスト(時間・メモリ)が実世界での大規模適用におけるボトルネックであると指摘し、その最適化手法について解説している。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るSource Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
2023-01-24 更新:[蒸留に関する小セクションを追加。]**
大規模トランスフォーマーモデルは現在主流となり、さまざまなタスクで最先端(SoTA)の結果を生み出しています。これらは強力ですが、トレーニングおよび利用には非常に高額なコストがかかります。時間とメモリにおける推論コストが極めて高いことは、現実世界のタスクをスケールして解決するために強力なトランスフォーマーを採用する際の大きなボトルネックとなっています。
なぜ大規模トランスフォーマーモデルの推論実行は難しいのでしょうか?最先端モデルのサイズ増大に加え、推論の課題に寄与する主な要因として 2 つあります(Pope et al. 2022):
原文を表示
Updated on 2023-01-24: add a small section on [Distillation.]**
Large transformer models are mainstream nowadays, creating SoTA results for a variety of tasks. They are powerful but very expensive to train and use. The extremely high inference cost, in both time and memory, is a big bottleneck for adopting a powerful transformer for solving real-world tasks at scale.
Why is it hard to run inference for large transformer models?** Besides the increasing size of SoTA models, there are two main factors contributing to the inference challenge (Pope et al. 2022):
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み