フリートークン、個人端末向けエッジネイティブ MoE 推論システムを公開
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
フリートークン(FreeToken)は、エッジデバイスを小規模なGPUとして扱うのではなく統合的な推論プラットフォームと見なし、動的なリソースマッピングによりローカル環境で超大規模モデルの動作を可能にするシステムである。
AI深層分析を開く2026年8月20日 22:01
AI深層分析
キーポイント
エッジネイティブなアーキテクチャ設計
FreeToken は個人用マシンを単なる小型GPUとして扱うのではなく、エージェントワークロードの変化やハードウェアの異種混合リソースに対応する統合的な推論プラットフォームとして再定義している。
動的なリソースマッピングとオフローディング
固定されたオフローディング戦略に依存せず、利用可能な実際のハードウェア資源に基づいて計算とモデル状態を継続的にマッピングする手法を採用している。
大規模モデルのローカル実行の実現
8GB のラップトップ GPU からワークステーション GPU まで幅広いハードウェアで動作し、ラップトップでは 35B モデル、ゲーミングデスクトップでは 284B モデル、単一のワークステーション GPU では 753B の GLM-5.2 を実行可能とする。
分散並行計算分野への提出
本論文は分散、並列、およびクラスターコンピューティング(cs.DC)の分野に分類されている。
2026年8月の初版提出
Shuo Yang によって 2026 年 8 月 17 日に arXiv に初めて提出された。
重要な引用
FreeToken, an edge-native MoE serving system that treats a personal machine not as a small GPU, but as a unified, elastic inference platform.
Rather than committing to a fixed offloading strategy, FreeToken continuously maps computation and model state onto the resources actually available.
FreeToken turns open weights into deployable local software, making the machines users already own a practical platform for frontier-scale intelligence.
Subjects: Distributed, Parallel, and Cluster Computing (cs.DC)
編集コメントを表示
編集コメント
フリートークン(FreeToken)は、エッジデバイスにおける大規模モデルの運用課題に直面する開発者にとって極めて有望な解決策となる。このシステムにより、ユーザーが所有する既存のハードウェアを最大限活用して高度な AI エージェントを実行できる可能性が開かれる。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
著者:Yang Shuo、Fan Xiaoze、Pan Melissa、Xi Haocheng、Wang Zhe、Sun Shanlin、Keutzer Kurt、Han Song、Zaharia Matei、Xu Chenfeng、Stoica Ion
抽象:最先端のオープンウェイトモデルがますます利用可能になる一方で、それらの推論サービスは依然としてデータセンターインフラを前提としたものになりがちです。私たちは「FreeToken」というエッジネイティブな MoE(Mixture of Experts)推論システムを発表します。このシステムは、個人用マシンを単なる小型の GPU として扱うのではなく、統合された弾力的な推論プラットフォームとして捉え直します。
FreeToken は、モデルレイアウトやロード方法、エキスパートの定着性、CPU と GPU の協調実行、エージェント状態の再利用、ランタイム時のメモリ管理など、推論スタック全体を共設計しています。このアプローチは、ローカル AI における2つの現実に基づいています。1 つ目は、エージェントワークロードが実行パターンを絶えず変化させるという点です。2 つ目は、エッジハードウェアが多様なリソースを提供しており、そのバランスがマシンごとに異なるという点です。
FreeToken は、固定されたオフローディング戦略に固執するのではなく、利用可能な実際のリソースに対して計算とモデル状態を継続的にマッピングします。このシステムは、8GB のノート PC GPU からワークステーション用 GPU まで幅広いハードウェアで動作し、20 以上の MoE モデルや、リアルタイムのコーディング・ツール使用型エージェントをサポートしています。
さらに重要なのは、これらのマシンが実際に提供できるサービスの範囲を変えた点です。FreeToken を導入することで、ノート PC では 35B パラメータモデルを、ゲーミングデスクトップでは 284B モデルを、そして単一のワークステーション GPU では 753B の GLM-5.2 を推論可能にしました。
FreeToken はオープンウェイトを実用的なローカルソフトウェアへと変え、ユーザーがすでに所有しているマシンを最先端の知能を実現するプラットフォームとして活用できるようにします。本システムは以下の URL で公開されています:http://flashml.ai
| 対象: | 分散、並列、およびクラスターコンピューティング (cs.DC) |
|---|---|
| 引用形式: | arXiv:2608.16157 [cs.DC] |
| (またはこのバージョンは arXiv:2608.16157v1 [cs.DC]) | |
| https://doi.org/10.48550/arXiv.2608.16157 arXiv-issued DOI via DataCite |
提出履歴
送信者:Shuo Yang [メールを表示] [v1]
2026年8月17日(月)UTC 06:22:53 (1,344 KB)
原文を表示
Authors:Shuo Yang, Xiaoze Fan, Melissa Pan, Haocheng Xi, Zhe Wang, Shanlin Sun, Kurt Keutzer, Song Han, Matei Zaharia, Chenfeng Xu, Ion Stoica
Abstract:Frontier open-weight models are increasingly available, but serving them still largely assumes datacenter infrastructure. We present FreeToken, an edge-native MoE serving system that treats a personal machine not as a small GPU, but as a unified, elastic inference platform. FreeToken co-designs the full serving stack, including model layout and loading, expert residency, CPU--GPU execution, agentic state reuse, and runtime memory management, around two realities of local AI: agent workloads continuously change their execution pattern, and edge hardware exposes heterogeneous resources whose balance differs from machine to machine. Rather than committing to a fixed offloading strategy, FreeToken continuously maps computation and model state onto the resources actually available. FreeToken supports more than 20 MoE models and real coding and tool-using agents across hardware ranging from an 8GB laptop GPU to a single workstation GPU. More importantly, it changes what these machines can practically serve, from a 35B model on a laptop to a 284B model on a gaming desktop and the 753B GLM-5.2 on a single workstation GPU. FreeToken turns open weights into deployable local software, making the machines users already own a practical platform for frontier-scale intelligence. We release the system at this http URL.
| Subjects: | Distributed, Parallel, and Cluster Computing (cs.DC) |
|---|---|
| Cite as: | arXiv:2608.16157 [cs.DC] |
| (or arXiv:2608.16157v1 [cs.DC] for this version) | |
| https://doi.org/10.48550/arXiv.2608.16157 arXiv-issued DOI via DataCite |
Submission history
From: Shuo Yang [view email] [v1]
Mon, 17 Aug 2026 06:22:53 UTC (1,344 KB)
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み