Gemma 4とオープンモデルの成功要因
本文の状態
日本語全文を表示中
詳細モードで約11分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Interconnects
著者は、2026年におけるGemma 4の公開モデル評価が困難な理由を分析する。過去のLlamaやQwenシリーズとの比較を通じて、オープンモデルが成功し研究コミュニティを活性化させるための条件について考察している。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
多くのモデルリリースに関するブログ記事を書いてきた中で、特に 2026 年において、クローズドモデルに対してオープンモデルがリリースされた際のレビューは、非常に難しいものとなっています。ここ数年はオープンモデルが極めて少なかったため、Llama 3 がリリースされた際も、多くの人々はまだ Llama 2 の研究を行っており、アップデートを入手できたことに大変満足していました。Qwen 3 がリリースされた際には、ちょうど Llama 4 の失敗事件があり、Qwen 2.5 における RL(強化学習)の研究を行う新しい研究コミュニティが形成されつつあったため、アップグレードすることは自明の理でした。
今日、オープンモデルがリリースされる際、それは Qwen 3.5、Kimi K2.5、GLM 5、MiniMax M2.5、GPT-OSS、Arcee Large、Nemotron 3、Olmo 3 などと競合しています。この領域は既に多くの存在で満たされていますが、なおも隠された機会に満ちているように感じられます。オープンモデルの潜在能力は暗黒物質のようであり、その規模が巨大であることは確かなのですが、それを解き放つための明確なレシピや事例はまだほとんどありません。エージェント型 AI(Agentic AI)や OpenClaw、そしてこの領域で進行中のあらゆる取り組みは、Claude や Codex といった既存のモデルを代替するのではなく、それらを補完するためにオープンモデルにおける大規模な実験を促すものとなるでしょう。
特にオープンモデルにおいては、リリース時のベンチマークは極めて不完全な物語に過ぎません。ある意味ではこれは興奮を呼びますが、新しいオープンモデルははるかに高い分散性と驚きをもたらす能力を持っていますが、同時に、オープンモデルを中心にビジネスや優れた AI 体験を構築することが、クローズドな代替案よりも困難であるという構造的な理由も示唆しています。新しい Claude Opus や GPT が登場した際、私のエージェントワークフローで数時間それらと向き合うことは、本質的に良い雰囲気テストとなります。しかし、オープンモデルに対してこのテストを行うことは、カテゴリの誤りです。
エージェントの時代におけるオープンモデルについて言えるもう一つの点は、これらが統合(integration)、ハーンセス(harnesses)、およびツールに関する議論から抜け出し、単なるモデル自体が持つ能力が具体的に何であるかを地面に近いレベルで私たちに示してくれることです。もちろん、検索機能のような一部の機能をテストするには何らかのツールが必要ですが、モデル単体の進歩のペースを正確に測定できることは、体系的に不透明な AI 空間に対する歓迎すべき簡略化です。
私が投資を検討している新しいオープンウェイトモデル(open-weight model)を評価するために用いる要因のリストには以下が含まれます:
モデル性能(およびサイズ)— 私が関心を持つベンチマークでのこのモデルのパフォーマンスと、同サイズの他のモデルとの比較。
発行国 — 一部の企業は出自に深くこだわり、そのモデルが中国で構築されたかどうかを気にします。
モデルライセンス — モデルの使用に法的承認が必要な場合、中堅・大企業における採用は遅くなります。
リリース時のツールサポート — 多くのモデルは、アーキテクチャやツールの限界に挑戦する結果として、vLLM、Transformers、SGLANG などの人気ソフトウェアにおいて、不完全な実装、あるいは少なくとも大幅に遅い実装を伴ってリリースされます。
モデルのファインチューニング性 — 実際に使用しようとした際、与えられたモデルを自らのユースケースに合わせて修正することが容易か困難かを指します。
核心的な問題は、これらの要素の一部(例えば一般性能、ライセンス、起源など)はリリース直後に即座に確認可能である一方、ツールサポートのようなものは安定化までに数日から数週間を要し、さらに他の要素は未解決の研究課題であり、ファインチューニング性を体系的に監視する組織が存在しないことです。
オープンモデルの初期時代、Llama 2 や 3、Qwen の v3.5 以前の時期には、アーキテクチャは比較的単純で、モデルは箱から出してすぐに動作することが多かったです。これは一部、Llama、Qwen、Mistral などの開発チームによる極めて困難な努力の結果でした。また、新しいモデルが実際に扱いにくいものであるという事実も一因です。Qwen 3.5 や Nemotron 3 のように、ハイブリッドモデル(ゲート付きデルタネットまたは Mamba レイヤーを含む)の場合、リリース時のツールサポートは非常に荒削りな状態です。「すぐに動作するはず」と期待される機能でも、実際にはそうならないことがよくあります。
私は、同様のアーキテクチャを持つ Olmo Hybrid をリリースして以来、この分野を注視してきました。Qwen 3.5 は、RL(強化学習)研究のためにすべてのオープンソースツールが協調して動作する必要がある場面で、ようやくうまく機能し始めています。これはリリースからわずか 1.5 ヶ月後のことです。これは、モデルの挙動を理解するために本格的に投資を始めるための第一歩です。もちろん、他の企業や研究者は、より多くのエンジニアリングリソースを投入したり、部分的にクローズドなソフトウェアに依存したりすることで、これらのモデルへの取り組みを先行して開始しました。完全にオープンで分散型のエコシステムが、新しいモデル上で動き出すには長い時間がかかります。
これらすべては、オープンモデルにとって最も重要な問いへとつながる導入部分です——それは「特定のユースケースに適応させることがどれほど容易か」という問いです。これはモデルのサイズによって異なる問題となります。大規模な MoE(Mixture of Experts:エキスパート混合)オープンウェイトモデルは、ドメイン内で複雑な機能が必要な Cursor などのエンティティによって利用される可能性があります。例えば、Kimi K2.5 をベースにトレーニングされた Composer 2 がその一例です。一方、他のアプリケーションは、GPT-OSS 20B(Open Source Software:オープンソースソフトウェア)を基盤とした Chroma の Context-1 モデルのように、はるかに小規模なモデル上で構築することも可能です。
「どのモデルがファインチューニング可能か」という問いは、業界のエンジニアたちにとってほぼ既知の背景知識です。この分野には、オープンエコシステムモデルを支えるための活発な研究領域が存在すべきです。最初のステップは、異なるベースモデルやポストトレーニング済みモデルの特徴を理解し、それらがどのような性質を持っているかを把握することです。2 つ目のステップは、オープンモデル向けに事前学習(pretraining)のレシピを調整し、より柔軟性を持たせることです。
Interconnects AI は読者支援型の出版物です。購読をご検討ください。
ATOM プロジェクトやその他の Interconnects の取り組みにおいて、オープンエコシステムにおける採用動向の測定に多大な努力を払ってきました。モデルが初めて公開されてからその展開には長い時間がかかるものであり、その理由は適応性にあります。現在、Qwen がリリースを通じて着実に強固さを増している中で確かなことは、業界全体で技術スタッフが Qwen モデルとの作業に慣れ親しんでいるということです。無数の研究手法やデータセットが Qwen との互換性を確保するために調整されました。他のモデルファミリーがこの段階に至るには忍耐が必要ですが、多くのオープンモデル開発者がその忍耐を持てるかどうかは疑問です。
これが私たちが Gemma 4 に至る背景です。Gemma 4 は Google の最新オープンモデルです。Gemma 3 は 2025 年 3 月、1 年以上前にリリースされましたが、やや過小評価されている傾向があります。現在の Gemma 4 は 4 つのサイズで提供されており、総パラメータ数が 1000 億を超える大規模な MoE モデルも噂されていますが、まだ正式にはリリースされていません。現在利用可能なモデルは、約 5B の密型(dense)、8B の密型、26B 総パラメータで 4B アクティブな MoE、そして 31B の密型のサイズです。
私が最も興奮しているのは、ついに標準的な Apache 2.0 オープンソースライセンスを採用したことです。これにより、採用が劇的に加速するでしょう。強力なオープンウェイト大規模言語モデル(LLM)に対するより良いライセンスの基準は、過去 1〜2 年の間に主に中国のオープンモデルラボによって設定され、現在では米国の企業もそれに追随しています。もし恐ろしい Llama のライセンスや Gemma の利用規約が、業界が強力なオープンモデルをリリースすることに対して神経質になっていた時期(約 18 ヶ月)の一時的な動向に過ぎなかったとしたら、私は個人的にとても喜ぶでしょう。
Gemma 4 のスコアは非常に堅牢で、小規模モデルは驚異的なベンチマークスコアを示しています(特に LMArena などの一般ドメインにおいて)。また、31B モデルは直近の Qwen 3.5 27B と互角であり、これはそのクラスにおけるリーダー的存在です。約 30B のサイズ範囲は極めて重要で、研究者だけでなく、実際のユースケースでモデルを展開したい企業にとってもアクセスしやすい規模です。7B モデルスケールが試作や研究のデフォルトであるのに対し、30B モデルはオープンモデルが特定のワークフローにおいて実質的な価値を引き出せるかどうかを確認するためのデフォルトとなります。これは、知能性、低価格、下流トレーニングへの扱いやすさなど、優れたバランスを備えています。

出典:Sebastian Raschka, Ahead of AI
これは、私がオープンモデルに対して前述した採用基準に戻り、より大きな問い——Gemma 4 が圧倒的な成功を収めると思うか——へと繋がります。過去の Gemma モデルは、ツールリングの問題や、ファインチューニング時の性能低下に悩まされてきました。
Gemma 4 の成否は、使いやすさによって完全に決定されます。ベンチマークでの数%〜10%程度の差が全く問題にならないほどです。それは十分に強力であり、小さく、適切なライセンスを持ち、米国由来であるため、多くの企業がこれを採用するでしょう。
私は、Gemma 4 がここでより良く機能することを慎重に楽観視しています。アメリカで構築されたオープンモデルを取り巻く風向きが変わりつつあります。私たちは GPT-OSS が荒れた立ち上げを経て圧倒的な成功を収めた様子を目撃しました。Reflection, Arcee, Nemotron, Gemma, Olmo といった名前やその仲間たちを取り巻く集合的なエネルギーは、オープンモデルを中心に新たなスタックを構築する需要が実証されていることを示しています。モデルを含むすべてのものに対する所有権をより多く望む人々によって、経済全体に AI スタックへの投資資金が投入されるでしょう。
ATOM プロジェクトを立ち上げてから 240 日が経過し、議論は次の段階へと移行しています。2025 年の夏は危機的瞬間であり、米国の AI シーンは AGI を構築した後にオープンモデルについて考え始める余裕はないと認識しました。この二つの市場は異なる領域を捉え、並行して進展していきます。現在、米国ではより多くの企業が強力なモデルを公開しているため、これらのモデルが使いやすく、理解しやすく、価値創造の基盤となりやすいようエコシステムを改善する必要があります。私が一貫して更新してきた採用曲線において新たな転換点を築くことは困難な作業ですが、まさにそれが取り組むべき課題です。ぜひ一緒に取り組みましょう。
詳細データは近日公開予定です!まずは一部をチラ見せします:

News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み