動画記事 · AI Engineer
iPhone で LLM を実行:MLX 搭載の Gemma 4 が 40 tok/s を達成
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
Locally AIのAdrien Grondinが、Apple Silicon最適化フレームワークMLXを用い、iPhone上でGemma 4を40tok/sで動作させる実証と開発手法を紹介。
iPhone で LLM が爆速!MLX と Gemma 4 で実現するローカル AI の未来
Apple Silicon 向けに最適化されたフレームワーク「MLX」を活用すれば、最新の iPhone でも大規模言語モデル(LLM)を驚異的な速度で実行できるようになりました。Locally AI の創設者である Adrien Grondin 氏がデモンストレーションした通り、Gemma 4 を量子化してローカルで動かすことで、クラウド依存なしのプライバシー重視な AI アプリケーションが現実のものとなります。
Apple Silicon 最適化フレームワーク「MLX」と Locally AI の登場
まず押さえておくべきは、この技術の基盤となっているのが Apple が開発した MLX というフレームワークです。これは iPhone や Mac に搭載されたチップ(Apple Silicon)のために特別に設計され、ハードウェアの性能を最大限引き出すように最適化されています。
Adrien 氏が開発した「Locally AI」というアプリは、この MLX を活用して iOS デバイス上で動作するチャットボットです。完全にネイティブで動作し、Foundation の機能とも連携しながら、iPhone や iPad、Mac OS 上でモデルをローカル実行します。
「MLX は Apple Silicon 向けに最適化されており、デバイス上の可能な限り高いパフォーマンスを発揮するように構築されています」
このフレームワークの恩恵を受けられるのはテキスト生成だけではありません。音声から音声への変換や画像生成、動画生成など、多様なタスクに対応するエコシステムが急速に拡大しています。
Gemma 4 を量子化して iPhone で 40 トークン/秒を実現
実証された最も注目すべき成果は、Google の「Gemma 4」モデルを iPhone 上で動作させた際の速度です。通常、大規模なモデルを端末で動かすには膨大なリソースが必要ですが、MLX を用いて 8-bit 量子化(モデルの重みを圧縮する技術)を施すことで、劇的な高速化が実現しました。
最新の iPhone では、Gemma 4 を 8-bit で量子化し、さらに 4-bit 版を試すことで、毎秒 40 トークンというストリーミング生成速度を達成しています。これはオフラインでリアルタイムに動作しており、UI が数秒間待機する従来のアプリとは一線を画す滑らかさです。
「毎秒 40 トークンは、多くのユースケースにおいて十分に許容範囲の速度です」
量子化のビット数については、モデルの品質と速度のバランスが重要です。Adrien 氏は以下の基準を推奨しています。
- 3〜4 ビット: モデルのサイズは小さくなりますが、出力品質への影響が大きくなるため下限として扱います。
- 4〜8 ビット: 最も推奨される範囲です。4-bit が下限、Gemma のような大規模モデルでは 8-bit が上限となります。
- 300 億パラメータの小型モデル: ショートカット処理や自動化タスクには、このサイズでも十分な速度と精度を発揮します。
古い iPhone でも動作しますが、速度は毎秒 20 トークン程度になります。それでも多くのアプリケーションにおいて有用なパフォーマンスです。
開発者向け:GitHub と Hugging Face を活用した導入ガイド
iOS や macOS アプリを開発するエンジニアにとって、MLX の導入は驚くほど簡単です。GitHub に公開されている「MLX Swift LM」リポジトリをインストールし、Hugging Face からモデルを取得するだけで、10 分程度で実装が完了します。
具体的な手順は以下の通りです。
- リポジトリの入手: GitHub の MLX Swift LM リポジトリからパッケージをインストールします。Python アプリや Mac OS アプリ向けには「MLX VLM」も利用可能です。
- モデルの選定: Hugging Face のコミュニティページにある「MLX」セクションを訪れます。ここには 4,000〜5,000 以上の量子化されたモデル(4-bit、6-bit、8-bit など)がアップロードされています。
- 統合の実行: モデルの ID を取得し、フレームワークに渡すだけで、Hugging Face と直接連携してモデルをダウンロード・実行できます。
「モデルがリリースされてから 30 分もあれば、量子化されたバージョンがコミュニティにアップロードされていることも珍しくありません」
API は非常にシンプルで、エージェント機能やツール呼び出し(外部機能をモデルから呼び出す仕組み)にも対応しています。1 年前よりもモデルの能力が向上しており、システムを呼び出す際にもスムーズに動作します。
エコシステムの拡大と LM Studio の連携
開発者だけでなく、一般ユーザーもこのエコシスームに参加できます。App Store で提供されている Locally AI アプリを使えば、特別な設定なしで任意のオープンソースモデルを選択して試すことができます。ただし、モデルによっては iPhone 上で正しく動作しない場合もあるため、自己責任での利用が前提となります。
また、ローカル環境での AI 開発を支援するツール「LM Studio」も注目すべきポイントです。これはローカルモデル用のスタジオのようなもので、Hugging Face から直接モデルをダウンロードし、MLX エンジンや Llama CPP エンジンを選んでサーバーを起動できます。Open API や Anthropic のストリーミング応答タイプなど、さまざまなレスポンスタイプに対応しており、アプリとホストサーバーを接続する際の柔軟性を高めています。
まとめ:プライバシー重視のローカル AI 時代へ
モデルサイズが小さくなり、iPhone の性能が向上するにつれ、エッジデバイスでの LLM 実行は実用レベルに達しました。クラウドへの依存を減らし、オフラインでも高速に動作する AI アプリケーションが、開発者だけでなく一般ユーザーにも身近なものになりつつあります。
「次の iPhone では、すべてが非常に優れた使いやすさに達しているでしょう」
40 トークン/秒という速度は、対話型アプリケーションの実装を可能にし、プライバシーを重視したローカル AI の利用を加速させる重要な転換点です。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。