ページを読み込み中…
2件の記事
HRM アーキテクチャに基づく 10 億パラメータのテキスト生成モデル「HRM-Text」が公開され、基盤モデルより計算量や学習データを最大数百倍削減可能で、8〜16 台の H100 GPU で数日・数千ドルで学習できる。
GitHub上で公開されている「Expert Upcycling」は、大規模言語モデルの知識を効率的に転移・再利用するための手法を提供するオープンソースプロジェクトである。