ページを読み込み中…
ページを読み込み中…
6件の記事
Zartbot は Kimi K3 の技術報告書を分析し、KDA(知識駆動アテンション)が Gated MLA や AttnRes とどのように協調して動作するかについて詳述した。
Flex-Forcing は、時間方向とノイズ除去ステップのチャンキングを柔軟に切り替えることで、双方向生成と自己回帰生成を切り替えられるビデオ拡散モデルを訓練する手法であり、計算リソースに応じて推論速度・画質・長期安定性を向上させる。
Apple Machine Learning は、拡散大規模言語モデル(dLLMs)において、破棄されたトークンの計算を再利用する手法を示し、並列デコードの効率性を向上させる研究を発表した。
TLDR AI は、大規模言語モデルの内部仕組みと動作原理を解説する記事を発表しました。
HRM アーキテクチャに基づく 10 億パラメータのテキスト生成モデル「HRM-Text」が公開され、基盤モデルより計算量や学習データを最大数百倍削減可能で、8〜16 台の H100 GPU で数日・数千ドルで学習できる。
Transformerモデルの長文処理の非効率性を解決する、状態空間モデルに基づく新たなAIモデル「マンバ」が登場。