ページを読み込み中…
ページを読み込み中…
825件の記事
Cactus Needle は、Gemini 3.1 を基に蒸留された 2600 万パラメータの Simple Attention Network モデルであり、Mac や PC でローカルファインチューニングが可能。このモデルは Cactus 上で秒間 6,000 トークンのプレフィルと 1,200 トークンのデコード速度を達成し、スマホやウェアラブル端末向けに AI を再定義する目的で開発された。
研究者らは、4B パラメータのモデルに強化学習を適用し、親と子の両方の再帰型言語モデル(RLM)で共有ポリシーを訓練する手法を開発しました。これにより、Claude Sonnet 4.6 と同等のパフォーマンスを維持しつつ、モデルサイズとコストを大幅に削減することに成功しています。
研究者が約 1,300 個のモデルを訓練し、バイト数ベースのスケーリングが計算効率を向上させることを示した。従来の「パラメータ数あたりのトークン数」に基づく手法は特定のトークナイザーに依存しており、多言語対応にはバイト単位での調整が必要である。
Modal は、推論ワークロードの変動に対応するため、新しいレプリカの起動時間を数キログ秒から数十秒に短縮し、真のサーバーレス GPU スケーリングを実現した。