独占的自己注意(XSA)の独自紹介
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Apple Machine Learning
研究者はTransformerの自己注意を改良した「独占的自己注意(XSA)」を発表した。これはトークン自身の情報を除外し、直交する情報のみに焦点を当てる手法で、最大27億パラメータのモデルにおいて言語モデリング性能を向上させる。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
私たちは、自己注意(SA)の単純な修正である排他的自己注意(XSA)を導入します。これは Transformer の系列モデリング性能を向上させるものです。その核心となるアイデアは、注意機構がトークン自身の値ベクトルに直交する情報のみを捉えるように制約し(したがって自己位置の情報を除外)、より優れた文脈モデル化を促すことにあります。標準的な言語モデリングタスクで評価した結果、XSA は最大 27 億パラメータまでのあらゆるモデルサイズにおいて SA を一貫して上回り、系列長が長くなるほどその性能向上幅はさらに大きくなることが示されました。
原文を表示
We introduce exclusive self attention (XSA), a simple modification of self attention (SA) that improves Transformer’s sequence modeling performance. The key idea is to constrain attention to capture only information orthogonal to the token’s own value vector (thus excluding information of self position), encouraging better context modeling. Evaluated on the standard language modeling task, XSA consistently outperforms SA across model sizes up to 2.7B parameters and shows increasingly larger gains as sequence length grows.
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み