GLM-5.3-Flash、ハイブリッドアーキテクチャで多モーダル対応
本文の状態
日本語全文を表示中
詳細モードで約16分の本文を読めます。
中国の智譜 AI は GLM-5.3-Flash を発表し、320B パラメータのうち 18B が動作するハイブリッドアーキテクチャにより、コーディング性能で Claude Opus 4.8 に迫りながらコストを 1/10 に抑えた。
AI深層分析を開く2026年8月28日 07:00
AI深層分析
キーポイント
ハイブリッドアーキテクチャによる効率化
スプースアテンションとリニアアテンションを組み合わせた新アーキテクチャを採用し、長文コンテキストの処理コストを劇的に削減しながら精度を維持する。
コーディング性能における競合との比較
DeepSWE や AutomationBench などのベンチマークで GLM-5.2 を大幅に上回り、Claude Opus 4.8 と同等の性能を達成したと発表した。
コストパフォーマンスの劇的向上
Artificial Analysis Intelligence Index で 57 のスコアを獲得し、従来は約 10 倍のコストが必要だった知能レベルを、タスクあたり 0.045 ドルで提供可能になった。
中国製 AI チップ上での匿名テスト成功
リリース前に ox-alpha という名前で OpenCode や OpenRouter に匿名公開され、中国製の AI チップ上で最も人気のあるモデルとなったと報告している。
超低コスト推論のためのアーキテクチャ最適化
GLM-5.3-Flash はアクティベートパラメータ数と層数を大幅に削減し、線形アテンションとスパースアテンションを組み合わせるハイブリッド構造を採用している。
重要な引用
GLM-5.3-Flash incorporates several architectural improvements over GLM-5. For the first time, we introduce a hybrid architecture combining sparse and linear attention
This makes it a highly competitive default choice for a broad range of workloads.
GLM-5.3-Flash consistently outperforms GLM-5.2... while approaching Claude Opus 4.8 overall.
To minimize attention costs in long-context scenarios, we use a hybrid architecture combining linear and sparse attention.
編集コメントを表示
編集コメント
智譜 AI は、中国製ハードウェア上で匿名テストを経て実証された性能を、公式リリースで明確に提示した。特にコストパフォーマンスとコーディング能力のバランスにおいて、既存のトップモデルとの競合関係を再定義する動きと言える。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
GLM-5 シリーズで初めてネイティブなマルチモーダルモデルとして登場したのが「GLM-5.3-Flash」です。総パラメータ数は 320B、アクティブに動作するのはわずか 18B という設計ながら、ベンチマークや実世界のワークロードにおいて GLM-5.2 を上回る性能を発揮し、コストは約 1/10 に抑えつつ、コーディングやエージェントタスクでは Claude Opus 4.8 に迫る結果を出しています。
GLM-5.3-Flash は GLM-5 のアーキテクチャをさらに進化させました。特に注目すべきは、スパースアテンションとリニアアテンションを組み合わせたハイブリッド構造の採用です。これにより、長いコンテキストを扱う際の推論コストが劇的に削減されつつも、高精度な長文処理能力は維持されています。また、スケーリング効率をさらに高めるために「Manifold-Constrained Hyper-Connections (mHC)」という技術も導入されました。最新の 30T トークン規模のマルチモーダル事前学習データセットとこれらの改良を組み合わせることで、GLM-5.3-Flash はより少ない計算資源で高度な知能を実現しています。
リリースに先立ち、ユーザーフィードバックを集めるため、OpenCode や OpenRouter 上で「ox-alpha」という匿名名義で GLM-5.3-Flash をテストしました。その結果、わずか数日で当週最も人気のあるモデルとなり、すべてのトラフィックは中国製の AI チップ上で処理されました。


Flash コストで競合他社を凌駕する性能
GLM-5.3-Flash は、人工知能分析インデックス v4.1.1 のパレートフロンティアを押し広げ、タスクあたりわずか 0.045 ドル(割引後)でスコア 57 を達成しました。これは以前はコストが約 10 倍かかっていたレベルの知能です。この性能により、幅広いワークロードにおいて非常に競争力のあるデフォルト選択肢となっています。

コーディングとエージェント機能に関する 6 つのベンチマークにおいて、GLM-5.3-Flash は GLM-5.2 を一貫して上回っています。DeepSWE v1.1 では 63.4 対 46.2、AutomationBench では 48.8 対 26.2 と大きな差をつけながら、全体では Claude Opus 4.8 に迫る性能を発揮しています。

社内でのコード評価でも同様の結果が得られました。Z.ai Code Bench v1.0(Claude Code 2.1.207 で実行)では、GLM-5.3-Flash はあらゆる努力レベルで GLM-5.2 を明確に上回り、最大努力時には Claude Opus 4.8 とほぼ同等のスコア(29.0 対 29.5)を記録しています。

極限の効率性を追求したアーキテクチャ

GLM-4.5 シリーズと比較して、GLM-5.3-Flash は超低コストでの推論に特化して設計されています。総パラメータ数は 320B と 355B でほぼ同等ですが、活性化されるパラメータ数(18B vs 32B)とレイヤー数(45 vs 92)はどちらも約半分に削減されています。
長いコンテキスト処理におけるアテンションコストを最小化するため、線形アテンションとスパースアテンションを組み合わせたハイブリッドアーキテクチャを採用しています。線形アテンションは状態モデルを通じて局所的な依存関係を捉え、一方、スパースアテンションは軽量なインデクサを用いて関連するグローバルコンテキストを参照します。
さらに、1M トークンという長いコンテキスト長におけるインデクサのレイテンシとメモリオーバーヘッドを削減するために、IndexPool を導入しました。これは 4 つのインデクサキーベクトルを加重プーリングによって 1 つに圧縮する技術です。
本アーキテクチャの効率性を示すため、GLM-5.3-Flash のトークンあたりの計算量と KV キャッシュサイズを、GLM-5.3 および最近公開されたオープンモデルである DeepSeek-V4-Flash と Kimi-K3 と比較しました。異なるスケール間で公平に比較するため、レイヤーあたりのヘッドごとのアテンション計算量と、レイヤーあたりの平均 KV キャッシュサイズ(BF16)を算出しています。
GLM-5.3 と比較すると、GLM-5.3-Flash はアテンション計算量を 3.0 倍、KV キャッシュサイズを 4.4 倍削減しました。比較対象のすべてのモデルの中で、GLM-5.3-Flash が最も低いアテンション計算量を実現しています。ただし KV キャッシュサイズは Kimi-K3 や DeepSeek-V4-Flash よりもわずかに大きいため、さらなる改善の余地が残されています。
アーキテクチャ全体の改善と最適化された事前学習コーパスを組み合わせることで、GLM-5.3-Flash はより少ない計算資源で高度な知能を実現します。
以下の表は、GLM-4.5-Base や DeepSeek-V4-Flash-Base などの過去のベースモデルと比較した GLM-5.3-Flash ベースモデルの評価結果を示しています。その結果、GLM-5.3-Flash-Base は全体的に GLM-4.5-Base を上回り、GLM-5-Base と比較してもほとんどのベンチマークで競合する性能を維持していることがわかります。
| ベンチマーク | GLM-4.5-Base | GLM-5-Base | DeepSeek-V4-Flash-Base | GLM-5.3-Flash-Base |
|---|---|---|---|---|
| アクティブ化パラメータ数 | 32B | 40B | 13B | 18B |
| 総パラメータ数 | 355B | 744B | 284B | 320B |
| MMLU | 86.1 | 88.3 | 88.5 | 88.1 |
| BBH | 86.2 | 87.4 | 84.9 | 86.6 |
| HellaSwag | 87.1 | 88.1 | 85.3 | 87.1 |
| LiveCodeBench-Base | 28.1 | 34.4 | 29.9 | 37.6 |
| SimpleQA | 30.0 | 36.0 | 31.2 | 33.5 |
(DeepSeek-V4-Flash-Base の結果は、実装の違いを統制するために、当社の内部評価フレームワークを用いて評価されました)
コーディングループにおけるビジュアルインテリジェンス
ビジュアルコーディングとは単に画像を処理するだけではありません。それはコーディングが到達できる範囲そのものを拡張するものです。
フロントエンド開発、ゲーム開発、3D シミュレーションなどのタスクでは、最終的な成果物はコードだけでは終わりません。ユーザーが体験するインターフェースやインタラクション、あるいは世界そのものがゴールとなります。多くの課題は、レンダリングやインタラクション、プレイテストを通じて初めて表面化します。
CUA(Computer User Agent)はさらに、コーディングをプログラム可能なシステムから、視覚的で対話的な環境へと広げます。そのため、ビジョン機能はモデルにネイティブに統合され、いつ観察すべきかを判断し、視覚フィードバックを用いて次の行動を導けるようにする必要があります。
私たちはビジュアルコーディングのためのデータ合成パイプラインを開発しました。ここでは自己による視覚的判断と、テスト時の改善に重点を置いています。生成されたトラジェクトリでは、モデルが環境と相互作用し、自身の出力を検証して反復的に改良することが求められます。
フロントエンドコーディングにおいては、環境フィードバックを活用した強化学習も探求しました。さらに、実際のユーザーフローに基づいたエージェントによる検証を通じて、GUI の判断能力を強化しています。これにより、検証の範囲は機能的な正しさから、レンダリングされた製品や対話的な体験へと広がります。
コードによってモデルは世界を構築し変更できます。しかし、ビジョンこそが、人々が見て使う世界へモデルを導く鍵となります。


コーディングを超えて、あなたの業務パートナーへ
コーディング能力は知的な知識作業の重要な基盤を提供しますが、視覚知能はこの能力をより広範な専門タスクへと拡張します。多くの専門活動では、ドキュメント、スプレッドシート、プレゼンテーション、ダッシュボード、インターフェース、会議資料など、多様な視覚情報と構造化情報を解釈することが求められます。
視覚知能は、テキスト、視覚、そして文脈構造を統合的に推論させることで、モデルの能力をコード中心の環境から広げます。ユーザーが作業環境を手動でテキスト指令に変換する必要はなく、モデルはタスクに関連する資料を直接解釈し、関連情報を特定できます。さらに、出力結果を視覚的文脈や意図した成果と比較して評価できるため、プレゼンテーションの質や美観に対する判断力も向上し、より効果的な自己検証と改善が可能になります。
これらの能力は、以下の専門ワークフローの具体例において特に顕著に現れます。
中国製 AI チップ上での大規模展開
過去1週間で、中国製のAIチップの大規模クラスター上で GLM-5.3-Flash を稼働させました。この運用には、基盤となるハードウェアに最適化された高帯域幅の相互接続とサービングスタックが支えています。
個々のチップの計算能力やメモリ容量に限界がある中で、私たちは SGLang 上にこのアーキテクチャ専用の推論エンジンを開発しました。特に注目すべきは、この取り組みを加速させた GLM-5.3 を搭載したインフラストラクチャ・エージェントです。エンジニアたちはこのエージェントの支援を受けながらカーネルの開発や最適化、パフォーマンスボトルネックの特定、そしてサービングスタックの改善を行いました。これにより、「モデル自身がシステムを最適化する」というフィードバックループが実現しました。
これらのチップは、特に100万トークンという長大なコンテキスト長をサポートする際、メモリ容量と帯域幅によって強く制約されます。そのため、基盤アーキテクチャに合わせた「計算による帯域幅の補償」や「通信による帯域幅の節約」といった積極的なメモリオプティマイゼーションが必要です。私たちのスタックでは、Linear Attention や LM ヘッドにおけるノード内テンソル並列化、ReplaySSM の採用、W8A8 量子化、ハイブリッド INT8/FP8/BF16 キャッシュ量子化、そして Layer Split を組み合わせています。
クラスター規模での運用においては、生産環境向けの Encode–Prefill–Decode (EPD) という非同期アーキテクチャを採用しています。これにより、マルチモーダルエンコーディング、プロンプトのプリフィル、トークンごとのデコードをそれぞれ独立してスケジューリング可能なワーカープールに分離しました。その結果、効率的かつ信頼性の高いサービングが可能になっています。
同じハードウェア上で初期のベースラインと比較した結果、エンドツーエンドの推論パフォーマンスが 3 倍向上し、主要な NVIDIA GPU に匹敵するハードウェア効率とトークンあたりのコストを実現しました。これは、中国製チップでも大規模かつ効率的に最前線のモデルを推論できることを示しています。
結論
GLM-5.3-Flash は、最先端の知能が必ずしも最先端のコストを伴うわけではないことを証明しました。これは単一のトリックによるものではなく、計算資源を抑えながらより強力な能力を発揮するアーキテクチャ、多様なマルチモーダル事前学習データセット、そして推論ハードウェアと共設計されたインフラストラクチャーという 3 つの層が連携した結果です。現在は同様のアプローチをより大規模なモデルへ拡大しており、GLM-5.3-Flash がコストパフォーマンスの限界を押し広げる一方で、その構築過程で得られた知見は次期最前線モデルの開発にも既に反映されています。
GLM-5.3-Flash の使い方
GLM-5.3-Flash は、すべての GLM コーディングプランユーザー向けに提供を開始しました。GLM-5.3-Flash を利用すると、GLM-5.3 よりも3 倍の利用率が得られます。GLM-5.3-Flashは z.ai/subscribe でお試しください。
ZCode では、Browser Use(ブラウザ操作)やComputer Use(PC 操作)機能を通じて GLM-5.3-Flash のマルチモーダル能力を解放できます。エージェントがウェブページをクリックして視覚的に検証したり、デスクトップアプリを操作したりすることが可能です。
GLM-5.3-Flash のモデル重みは、HuggingFace で一般公開されています。ローカル環境での導入には現在、SGLang、vLLM、TokenSpeed といった推論フレームワークに対応しています。その他のフレームワークについても近日中にサポート予定です。
| ベンチマーク | GLM-5.3-Flash | GLM-5.2 | DeepSeek-V4-Vision-Exp | Opus 4.8 | GPT-5.6 Terra | Gemini 3.7 Flash |
|---|---|---|---|---|---|---|
| コーディング | ||||||
| Terminal Bench 2.1 | 84.3 | 81.0 | 83.9 | 85.0 | 87.4 | 85.8 |
| DeepSWEv1.1 | 63.4 | 46.2 | 59.3 | 58.0 | 69.6 | 65.3 |
| NL2Repo | 56.3 | 48.9 | 57.7 | 69.7 | - | - |
| エージェントタスク | ||||||
| Toolathlon Verified | 78.4 | 59.9 | 75.9 | 76.2 | 74.9 | - |
| AutomationBenchv1.0.6 | 48.8 | 26.2 | 38.8 | 41.0 | 37.2 | 52.3 |
| Agents' Last Exam | 26.3 | 20.4 | 27.3 | 27.0 | 28.0 | - |
| HLE w/ Tools | 55.3 | 54.7 | 55.1 | 57.9 | - | - |
| GDPval-AA v2 | 1773 | 1504 | 1675 | 1582 | 1571 | 1527 |
| ビジョン | ||||||
| OfficeQA Pro | 62.4 | - | 57.9 | 48.9 | - | - |
| CharXiv Reasoningw/ Tools | 89.4 | - | 80.4 | 89.9 | 88.0 | 88.7 |
| Chartographyw/ Tools | 78.0 | - | 64.3 | 75.0 | 68.0 | 65.0 |
| BabyVision | 53.4 | - | 35.1 | 46.8 | 61.6 | 70.9 |
| MVbench | 77.8 | - | 69.4 | 67.1 | 75.0 | 82.2 |
| MMVU | 80.5 | - | 72.7 | 67.4 | 75.8 | 82.3 |
脚注
- ツール付き HLE(完全セット): 評価にはサンプリングパラメータとして
temperature=1.0とtop_p=0.95を使用し、生成トークンの最大長は163,840トークンとします。
評価は、文脈管理戦略を用いて最大 30 万トークンのコンテキスト長で行われます。判定モデルには GPT-5.6-luna (medium) を使用します。 (原文の技術表記: 300,000)
- NL2Repo: 1M トークンのコンテキスト下で、温度パラメータを 1.0、top_p を 1.0、最大生成トークンを 64k に設定して NL2Repo を評価しました。悪意のある動作(例えば、許可されていない pip や curl の実行など)を防ぐため、ルールベースの判定と LLM による判定を組み合わせています。
- DeepSWE: mini-swe-agent ハーネスを用いて DeepSWE を実行しました。設定は温度パラメータを 0.95、top_p を 1.0、タイムアウトを 6 時間、コンテキスト長を 400K としています。 (原文の技術表記:
temperature=0.95、top_p=1.0、timeout=6h)
Terminal-Bench 2.1 では、Claude Code 2.1.207 を用いて評価を行います。設定は温度(temperature)=1.0、top_p=1、最大生成トークン数=65,536 とし、タイムアウトは 6 時間です。
Agent's Last Exam の評価では、公式の評価プロトコルに従い、Claude Code ハーネスを使用して ALE を検証します。推論努力(reasoning effort)を最大に設定し、コンテキストサイズは 100 万トークン、出力上限は 64,000 トークンとしました。ツール検索機能は無効化しており、スコアリングは公式の ALE 評価者によって行われます。
Toolathlon Verified の結果はすべて公式の評価サービスから取得し、3 回の独立した実行における pass@1 の平均値を報告しています。
AutomationBench では、null 型処理の問題に対する修正(PR #13)を反映したバージョン v1.0.6 を対象に評価を実施しました。
- GDPval-AA v2: モデルの評価は Artificial Analysis によって行われます。
- BabyVision: 温度パラメータを 1.0、top_p を 0.95 に設定し、最大コンテキスト長は 164K トークンとします。入力画像の短辺が少なくとも 1.5K ピクセルになるようリサイズし、他のベースラインとの整合性を保ちます。
- OfficeQA Pro: エージェントの評価には Treasury Bulletin の PDF コーパスを使用し、埋め込まれたテキストへのアクセスは行いません。温度パラメータは 1.0、top_p は 0.95、最大コンテキスト長は 512K トークンとします。
- CharXiv Reasoning: 温度パラメータを 1.0、top_p を 0.95 に設定し、最大コンテキスト長は 256K トークンとします。
- Chartography: 温度パラメータを 1.0、top_p を 0.95 に設定し、最大コンテキスト長は 256K トークンとします。
- MVBench and MMVU: 温度パラメータを 1.0、top_p を 0.95 に設定し、最大コンテキスト長は 256K トークンとします。Gemini 3.7 Flash のようにネイティブで動画入力をサポートするモデルには、評価のために生動画を直接入力します。動画入力がサポートされていないモデルについては、デフォルトの 1 fps フレーム抽出戦略を適用します。抽出したフレーム数が API の最大制限を超えた場合は、その上限まで動画全体から均等にフレームをサンプリングします。
同じ出来事を3媒体で確認
同じ出来事を扱う別媒体の記事です。見出しと公開時刻を比較できます。
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み