Cactus Compute、45M パラメータの軽量モデル「Needle 2」公開
本文の状態
日本語全文あり
詳細モードで約8分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
MarkTechPost
Cactus Compute はツール呼び出しと構造化抽出に特化したオープンモデル「Needle 2」を公開し、14MB のバイナリで動作し、GPU なしのデバイスでも高速推論を実現する。
記事の3ポイント
極小サイズと低消費電力の実現
Cactus Compute が発表した Needle 2 は 45M パラメータで構成され、14MB の単一バイナリとして提供される。このモデルは 28MB の RAM でフルセッションを実行可能であり、GPU や NPU を必要としないハードウェアでの稼働を前提としている。
多様なプラットフォームへの展開
同社によると、Needle 2 は macOS、Linux、Windows、Android、iOS、WebAssembly など主要な OS およびアーキテクチャに対応した事前ビルドバイナリと静的ライブラリとして提供される。これにより、オフラインでの音声アクションやローカル推論が可能となる。
独自の軽量アーキテクチャ
Needle 2 は「Simple Attention Network」と呼ばれる構造を採用しており、FFN を Hadamard MLP に置き換え、ハッシュされた n-gram テーブルからのメモリ機能を追加している。この設計により、トークンあたりの計算コストを 70 MFLOPs に抑えている。
なぜ重要か・誰に関係するか
この発表が重要なのは、LLM の導入を GPU やクラウド依存から解放し、エッジデバイス上での完全なローカル推論を現実的なコストで可能にするからだ。開発者や企業の AI 導入担当者は、リソース制約の厳しい環境でも動作する軽量モデルの選択肢が増えたことを確認し、オフライン機能やプライバシー保護が必要なユースケースへの適用を検討すべきである。
背景や根拠まで確認しますか?
元記事の内容を、読みやすい日本語で続けて確認できます。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み