智譜 AI、GLM-5.3-Flash を公開し前沿智能の普及を宣言
本文の状態
日本語全文を表示中
詳細モードで約11分の本文を読めます。
智譜 AI は GLM-5.3-Flash を発表し、320B 総パラメータながら低コストで Anthropic の Claude Opus 4.8 と同等の性能を実現する新世代モデルをリリースした。
AI深層分析を開く2026年8月27日 19:20
AI深層分析
キーポイント
高性能と低価格の両立
GLM-5.3-Flash は AA 指数で 57 点を記録し、Claude Opus 4.8 と同等の評価を得ながら、同社の上位モデルより 1/10 の価格で提供される。
革新的な混合アーキテクチャ
線形注意力と稀疏注意力を組み合わせることで計算コストを大幅に削減し、長文コンテキスト処理においても効率的な動作を実現する。
ネイティブ多模態機能の強化
GLM-5 系列初の原生多模态モデルとして、視覚情報を直接理解・判断する能力を備え、コーディングやデザイン作業における自己修正機能を強化した。
国内チップによる大規模テスト
匿名モデル「Ox-Alpha」として OpenCode や OpenRouter でテストされた際、中国製チップのみの環境で高頻度利用を記録し、実用性を証明した。
視覚的推論と自己改善の強化
データ合成パイプラインによりモデルが環境と相互作用し、出力を検証・反復する能力を獲得した。これにより機能正しさだけでなく、レンダリング品質やインタラクション体験の評価が可能になった。
重要な引用
GLM-5.3-Flash は GLM-5 系列初の原生多模态モデルである
AA 総合智能指数で 57 点を取得し、Claude Opus 4.8 と同点となる
線形注意力と稀疏注意力を混合したアーキテクチャを採用した
「GLM-5.3-Flash 自主运行16个小时搭建了一套约400平方米的专业主厨自宅与测试厨房」
編集コメントを表示
編集コメント
智譜 AI は今回、パラメータ規模と計算効率のバランスを最適化する新アーキテクチャにより、業界標準である他社トップモデルとの性能差を解消した。特に長文処理や視覚理解におけるコスト削減は、実運用環境での導入ハードルを下げる重要な一歩となる。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
智谱 2026-08-26 22:11 北京
本日、GLM-5.3-Flash (320B-A18B) の公開とオープンソース化を開始しました。これは GLM-5 シリーズ初のネイティブ多模態モデルです。
一般には「最先端の知能は、最先端の価格を伴うもの」と考えられがちで、それが技術進歩に不可欠なコストだと受け入れられています。しかし、本日登場した GLM-5.3-Flash はその常識を覆します。総パラメータ数は 320B で、能力は GLM-5.2 を上回ります。また、世界の権威ある Artificial Analysis Intelligence Index(AA 総合知能指数)では 57 点を獲得し、最先端モデルの域に達しました。これは Anthropic の人気モデル Claude Opus 4.8 と同点です。さらに、自社開発の評価基準である Z.ai Code Bench における体感評価でも、プログラミング能力は Claude Opus 4.8 に匹敵しています。
一方、GLM-5.3-Flash の価格設定は GLM-5.3 の 1/10 です。さらに期間限定の割引適用時には、GLM-5.3 の 1/20、Claude Opus 4.8 の 1/40 という破格の料金となります。同じ知能レベルで、価格は 1/40。最先端の知能が、もはや「節約して使う」必要はありません。
広範かつ専門的なユーザーフィードバックを収集するため、正式リリース前に匿名モデル「Ox-Alpha」(中国語圏では「牛来」と呼ばれています)を OpenCode と OpenRouter で大規模テストしました。その結果、Ox-Alpha はわずか数日で当週最も人気のあるモデルとなり、両プラットフォームで過去最高の利用回数を記録しました。なお、これらのリクエスト処理にはすべて国内製のチップが提供した計算資源を活用しています。
GLM-5.3-Flash は各種ベンチマークテストおよび実運用において、パラメータ数が約2倍多い GLM-5.2 を全面的に上回る性能を発揮しながら、その料金は後者の10分の1です。この驚異的なコストパフォーマンスを実現したのは、同モデルが採用した新世代のアーキテクチャによるものです。GLM-5.3-Flash は極限まで低コスト化を追求して設計されており、総パラメータ数は GLM-4.5 と同等(355B vs 320B)ですが、アクティブになるパラメータ数(32B → 18B)と層数(92 → 45)はほぼ半減しています。最新の 30T トークン規模の多言語・多モーダル事前学習データと組み合わせることで、より少ない計算資源で高い性能を達成可能になりました。
GLM-5.3-Flash はさらに複数のアーキテクチャ改良を加え、オープンソースの最先端モデルとして初めて「スパースアテンション」と「リニアアテンション」を混合したアーキテクチャを採用しました。これにより、正確な長文コンテキスト処理能力を維持しつつ、長文コンテキスト対応サービスの大幅なコスト削減を実現しています。また、スケーリング性能向上のために「Manifold-Constrained Hyper-Connections(mHC)」という手法も採用されています。詳細な技術解説は以下のブログ記事をご覧ください:https://z.ai/blog/glm-5.3-flash。
極限まで低コスト化したアーキテクチャ
モデルの長文コンテキスト処理におけるアテンションコストを削減するため、リニアアテンションとスパースアテンションを組み合わせた混合アーキテクチャを採用しました。具体的には、リニアアテンションが再帰機構を通じて局所的な依存関係を捉え、スパースアテンションが軽量なインデクサによってグローバルなコンテキストを効率的に呼び出します。さらに、1M トークンという超長文コンテキストにおけるインデクサのレイテンシとメモリ使用量を削減するため「IndexPool」を導入しました。これにより、インデクサが保持する4つのキャッシュベクトルを加重プーリングで圧縮し、1 つに統合しています。
アーキテクチャの効率性を示すため、GLM-5.3-Flash を GLM-5.3、DeepSeek-V4-Flash、Kimi-K3 と比較しました。主な評価指標は、トークンあたりの計算量と KV キャッシュサイズです。規模の異なるモデルを公平に比較するため、各ヘッドごとのアテンション計算量、層ごとの計算量、および層平均の KV キャッシュサイズ(BF16 形式)をそれぞれ示しています。GLM-5.3 と比較すると、GLM-5.3-Flash のアテンション計算量は約3.01倍、KV キャッシュサイズは約4.44倍削減されています。
すべての比較対象モデルの中で、GLM-5.3-Flash が最も低いアテンション計算量を実現しました。ただし、KV キャッシュサイズは Kimi-K3 や DeepSeek-V4-Flash よりわずかに大きいため、今後のさらなる最適化の課題として残っています。
コード実行時の視覚フィードバック
GLM-5.3-Flash は GLM-5 シリーズで初めてネイティブに多モーダル機能を備えたモデルです。ここでいう「ビジュアルコーディング」は単に画像を処理するだけでなく、プログラミングが到達できる領域そのものを拡張するものです。
フロントエンド開発、ゲーム開発、3D シミュレーションなどのタスクにおいて、最終的な成果物はユーザーが直接認識できるインターフェースやインタラクション、あるいは仮想世界です。これらの分野では、視覚能力をモデルにネイティブに統合することで、モデル自身が「いつ観察すべきか」を自律的に判断し、得られた視覚フィードバックに基づいて次の行動を導くことが可能になります。
私たちは視覚エンコーディングのためにデータ合成パイプラインを開発し、モデルの自己による視覚的判断とテスト時の改善に重点を置きました。最終的に生成される軌道では、モデルが環境と相互作用し、自身の出力を検証し、反復的な改良を行う必要があります。フロントエンドのコーディングにおいては、環境フィードバックに基づく強化学習も探求しており、実際のユーザーフローに基づくエージェント検証を通じて GUI 判断能力をさらに強化しました。これにより、検証の範囲は機能の正しさから、レンダリング品質やインタラクション体験のレベルへと広がりました。
驚くべきことに、コーディングはモデルが世界知識を表現し、検証するための代理手段となりました。Blender で一貫性のあるシーンを構築するには、幾何学、マテリアル、照明、空間といった知識を、あらゆる視点で整合する 3D 構造へと変換する必要があります。外部素材を一切使わずに、GLM-5.3-Flash は自律的に 16 時間稼働し、約 400 平方メートルのプロのシェフ自宅とテスト用キッチンを構築しました。
ZCode では、Browser Use Agent(BUA)と Computer Use Agent(CUA)がさらに多様な能力を拡張し、モデルがコード、ブラウザ、グラフィカルインターフェースの間で協働しながら、自身の出力を観察・検証できるようにしています。多くの問題は、レンダリングやインタラクション、試運転の過程で初めて明らかになります。以下は ZCode における GLM-5.3-Flash の実測例です。画像から実行可能なプロジェクトへ、2 時間の映画素材から 8 分の完成作品へ、そしてそのまま納品できるビジネス文書まで。
コーディングを超えたパートナー
GLM-5.3-Flash は専門業務におけるパフォーマンスが同レベルのモデルと比較して大幅に向上しました。PPTX、PDF、DOCX、XLSX といった Office およびドキュメント関連タスクでは、新たに追加された視覚理解能力により、モデルは自身の出力をチェック・最適化でき、より優れた審美性を持つ判断が可能になりました。また、モデルは自身の出力を視覚的コンテキストや期待される結果と比較することで、より効果的な自己検証と最適化を実現します。これには、より正確なプレゼンテーション品質の評価や審美性の判断も含まれます。
私たちは金融や法律といった専門業務向けに特別に最適化を行いました。金融分野では、GLM-5.3-Flash はソースに基づく金融調査からレポート作成、金融モデリングと分析に至るまでの全工程をカバーし、その過程で追跡可能な根拠を提供します。法律分野では、契約書内の費用、アカウント、責任条項の審査を行い、弁護士の実務慣習に沿って注釈を残すことができます。また、弁護士通知書や契約書、訴訟書類の起草も可能で、フォーマットとレイアウトは実務基準に準拠しており、生成直後に納品可能です。
金融レポート・業績解説
法律文書・契約書の注釈・修正
国産チップ上で動作
先週、私たちは初めて大規模なトラフィック環境において、国産の高性能チップクラスターによるサービス提供を試みました。これらのチップは、自社開発の高帯域幅相互接続ネットワークで結ばれています。
単体のチップにおける計算能力とメモリ容量が相対的に限られている課題を克服するため、SGLang を基盤に専用推論エンジンを構築しました。特筆すべきは、この構築作業全体を GLM-5.3 が駆動するインフラエージェントが大幅に加速した点です。同エージェントはエンジニアのオペレーター開発・最適化支援や性能ボトルネックの特定、デプロイメントサービススタックの改善を手助けし、「モデルによるシステム最適化、システムによるモデルの運用」という好循環を形成しました。
これらのチップにおける主なボトルネックはメモリ容量と帯域幅にあり、特に 1M トークンのコンテキスト長をサポートするのは大きな課題です。これに対応するため、私たちは基盤アーキテクチャに対して大胆なメモリ最適化を行いました。具体的には、計算能力で帯域幅を補う、通信量でビデオメモリを節約するといったカスタム最適化です。私たちの技術スタックには、線形アテンションと LM head 用のノード内テンソル並列処理、ReplaySSM、W8A8 量子化、INT8/FP8/BF16 の混合キャッシュ量子化、そして Layer Split などの技術が含まれています。
クラスターレベルでは、生産環境向けの Encode–Prefill–Decode(EPD)分離アーキテクチャを採用しました。これにより、多様なエンコーディング、プロンプトの事前充填、トークンごとのデコードを独立してスケジューリング・スケーリング可能なワークプールに分割し、国産アクセラレーションチップ上で高効率かつ信頼性の高いサービスを実現しています。
同一ハードウェア上の初期ベースラインと比較して、エンドツーエンドのサービス性能は 3 倍向上しました。ハードウェア効率とトークンあたりのコストは、主要な NVIDIA GPU と同等の水準に達しています。これは、国産チップが大規模なシナリオにおいても、最先端モデルの推論ニーズを効率的かつ経済的に支えることができることを証明するものです。
GLM-5.3-Flash が正式にグローバル向けにオープンソース化されました。ZCode などのコーディングプラットフォームへの接続も完了しており、GLM Coding Plan(毎日 10,000 枚の体験カードを数量限定で配布)にも組み込まれています。同時に API の利用も開始しています。
- 公式 API へのアクセス
BigModel 開放プラットフォーム:https://docs.bigmodel.cn/cn/guide/models/vlm/glm-5.3-flash
Z.ai:https://docs.z.ai/guides/vlm/glm-5.3-flash
GLM Coding Plan:https://bigmodel.cn/glm-coding
- オンラインでの体験
Z.ai:https://chat.z.ai
智谱清言 App:https://chatglm.cn
- エージェント活用
ZCode(コードツール):https://zcode.z.ai/cn
AutoClaw(オフィス業務向け):https://autoclaw.zhipuai.cn
- ブログ記事
https://z.ai/blog/glm-5.3-flash
- オープンソースリポジトリ
https://huggingface.co/zai-org/GLM-5.3-Flash
WeChat で開くにはこちらへ
同じ出来事を3媒体で確認
同じ出来事を扱う別媒体の記事です。見出しと公開時刻を比較できます。
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み