動画記事 · AI Engineer
Google DeepMind のオープンモデル「Gemma」シリーズ
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
Google DeepMindは、Apache 2.0ライセンスの下でGemma 4シリーズを公開し、モバイルデバイスからエンタープライズまで対応する高性能なオープンモデルエコシステムを推進している。
Google DeepMind が放つ「Gemma 4」:スマホでも動く高性能 AI エージェントと、オープンソースの新たな基準
Google DeepMind は先週、次世代オープンモデル「Gemma 4」シリーズを正式にリリースしました。20 億パラメータから 310 億パラメータまでをカバーするこのモデル群は、単なるチャットボットではありません。Android や iPhone、さらには Raspberry Pi といった端末上でオフライン動作し、コード生成や画像理解、高度なエージェント機能を実現する「オンデバイス AI」の新たな基準を示しています。
特に注目すべきは、計算効率を最大化する新アーキテクチャ「E(Per-layer embeddings)」の採用と、Apache 2.0 ライセンスへの完全移行です。これにより、データプライバシーが最優先される企業や、リソース制約のあるエッジデバイスでも、高性能な AI を自由に活用・カスタマイズできる環境が整いました。
Gemma 4 シリーズ:消費者向け GPU で動く「ポケットの中の知能」
Gemma 4 は、Google がこれまで発表したオープンモデルの中で最も能力が高いファミリーです。2B(20 億)から 31B(310 億)パラメータまでの多様なサイズを用意しており、すべてが単一の消費者向け GPU で動作可能に設計されています。
「すべてのモデルは開発者に優しいサイズであり、これは非常に重要です」
以前リリースされた Gemma 3 でも小規模ながら高性能でしたが、Gemma 4 ではその性能をさらに向上させつつ、より小さなデバイスでの実行を可能にしました。最小のモデル(2B〜4B)は Android スマートフォンや iPhone、Raspberry Pi で直接動作します。これらは単なるテキスト生成だけでなく、マルチモーダル理解や推論能力を持ち、オフライン環境下で自律的なエージェントとして振る舞うことができます。
一方で、31B の大規模モデルは「最も生きた知能」を求めるユースケース向けです。デスクトップ PC やノートパソコンでも動作するため、ローカル環境で最高性能の AI を利用したい開発者にとって最適な選択肢となっています。実際、Nintendo Switch への llama.cpp 導入事例など、驚くほど多様なデバイスでの実行も既に確認されています。
「E アーキテクチャ」の革新:メモリ効率と速度を両立する新設計
Gemma 4 の技術的ブレイクスルーは、従来の Transformer 構造とは異なる「E(Per-layer embeddings)」アーキテクチャにあります。これは昨夏に発表された革新的な設計で、各レイヤーに埋め込み(embedding)を持つことで、計算負荷を劇的に軽減します。
通常、Transformer モデルではすべてのパラメータを GPU の高速メモリに読み込む必要がありますが、E アーキテクチャでは実行時に必要な計算の一部を「ルックアップテーブル」として扱います。これにより、GPU への負荷を減らしつつ、CPU やディスク上の低速メモリを活用した推論が可能になります。
例えば、50 億パラメータのモデルでも、GPU に読み込むのは実質的に 20 億パラメータだけで済み、残りはより低速なメモリに配置できます。llama.cpp のようなツールを使えば、簡単な設定変更でこのアーキテクチャを有効化でき、モバイル端末でも秒間約 100 トークンという高速な推論を実現しています。
エージェント機能とマルチモーダル:オフラインで完結する高度なタスク
Gemma 4 の真価は、オンデバイスでの「エージェント機能」にあります。アプリ内でモデルが自律的にスキルを選択し、実行する完全なセットアップが可能です。
例えば、Android アプリ上で「ピアノ演奏」というスキルを選べば、Gemma はオフラインで即座に演奏を開始します。また、コード生成においては、API 呼び出しを一切行わず、スマートフォン内部だけで完結してコーディング支援を行います。複数のモデルを並列実行し、異なる SVG 画像を数秒で生成するといった高度な処理も、デバイス上で可能になっています。
さらに、最小サイズのモデルでも画像・動画・音声のマルチモーダル理解に対応しています。音声認識から翻訳テキストへの変換、写真内の物体検出、あるいは「ラクダがどこを指しているか」といった詳細な位置特定まで、オフラインでこれらのタスクを処理できます。
140 カ国以上の言語と Apache 2.0 ライセンス:オープンエコシステムの拡大
Gemma 4 は、Gemini ベースのトークナイザーを採用し、140 以上の言語に対応しています。このトークナイザーは多言語ユースケースのために特別に設計されており、ケチュア語やインドの公用語など、リソースが限られた言語でも初期状態から良好な動作を示します。
「Gemma の基本的な能力とは独立して、単に tokenizer の設計により初期状態から非常に良好に動作する傾向があります」
また、ライセンス面では大きな転換点を迎えました。以前のバージョンで懸念されていたライセンスの制限を解消し、Apache 2.0 ライセンスへ完全移行しました。これにより、企業や開発者は自由にモデルを商用利用し、ファインチューニングして独自のユースケースに適用できるようになりました。
このオープン化は、Hugging Face、llama.cpp、vLLM、Unsloth などのエコシステムと完全に互換性を持ち、Keras や Transformers を使ったファインチューニングもそのまま可能です。リリースから数日でダウンロード数が 1,000 万回を超え、コミュニティによる量子化やカスタマイズを含めると総計 5 億回に達しています。
多様なユースケースとコミュニティの力:医療から主権 AI まで
Gemma のエコシステムは、Google が提供する公式モデルだけでなく、世界中の開発者によって支えられています。Android Studio でのエージェントモードや、医療分野で X 線解析を行う「Med-Gemini」、東南アジア諸語を学習する「AI Singapore」の取り組みなど、多岐にわたる応用が生まれています。
特に注目すべきは、データサーバー外に出したくない金融・法務レビューや、飛行機内などのオフライン環境での利用です。また、DeepMind の研究者らが Gemma を活用してがん治療法のパスウェイを提案し、実験室で検証された事例のように、単なるチャットを超えた実社会への貢献も始まっています。
まとめ:デバイス上で完結する AI の未来へ
Gemma 4 は、高性能な大規模言語モデルをローカル環境やエッジデバイスで実行可能にする新たな基準を示しました。Apache 2.0 ライセンスとオンデバイスエージェント機能の実装は、データプライバシーを重視する企業にとって重要な選択肢となり、オープンソース AI エコシステムの拡大に大きく寄与しています。
「今後 1〜2 年後には、高性能なモデルが私たちのポケットの中で直接動作するようになるでしょう」
API ベースのモデルが必要な場面もまだありますが、デバイス上で完結し、カスタマイズ可能な「生きた知能」を求めるなら、Gemma 4 はまさにその答えです。ぜひ最新のモデルを触り、独自のユースケースで何かを作り、共有してみてください。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。