アリババ、Qwen4の先行版「Qwen3.8-Flash」を公開
本文の状態
日本語全文を表示中
詳細モードで約9分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
The New Stack AI
アリババは Qwen4 のアーキテクチャを先行公開するオープンウェイトモデル「Qwen3.8-Flash」を発表し、コード生成や事務作業での性能向上と計算効率の最適化を謳っている。
AI深層分析を開く2026年8月29日 03:36
AI深層分析
キーポイント
次世代アーキテクチャの先行公開
アリババは Qwen4 の設計思想を反映した「Qwen3.8-Flash」をリリースし、コミュニティに新技術の検証と事前ロードテストを促している。
ハイブリッド型計算コンポーネントの採用
同モデルは「Gated DeltaNet」と「Gated Attention」を組み合わせた設計を採用し、長文脈処理における効率性と注意機構のバランスを最適化している。
ベンチマークでの競合他社との比較
SWE-bench Pro などの評価において DeepSeek-V4-Flash や Claude-Opus-4.6 と同等かそれ以上のスコアを記録し、実用性の高さを示している。
トレーニングコストの大幅削減
Qwen3.8-Flash は学習リソースを約九分の一で済ませながら、サイズが3倍の Qwen3.7-Plus よりも優れたパフォーマンスを発揮する。これにより、トレーニングと推論のコストが大幅に削減される。
ハイブリッドアテンション機構の導入
Gated DeltaNet と Qwen Sparse Attention を組み合わせた新アーキテクチャにより、長文コンテキストにおけるアテンションコストを劇的に低減している。また、Gated Residual 機構や N-gram Embedding 技術も採用されている。
重要な引用
In this release, we are opening the weights of Qwen3.8-Flash-Next, a multimodal MoE model that also serves as an early preview of the architecture used in Qwen4
Qwen3.8-Flash-Next upgrades the model systematically along four aspects – attention, residual, embedding and optimization – improving model capability while further optimizing computational efficiency
"I just ran Qwen3.8-Flash-Next (MoE) 125B A6B with a 250,000 context window on a single 24GB RTX 4090 – 21 tokens/sec decode. 364 t/s prefill – no mtp. No dflash. No KV cache quantization! We are running datacenter models on consumer hardware," enthused Alok.
"I'd love it if local LLMs actually could replace remote ones today, and I have no reason to lie about my experience either…it's just not there (yet) for local professional software development."
編集コメントを表示
編集コメント
アリババが次世代モデルのアーキテクチャを先行公開する戦略は、開発者コミュニティとの協働を強化し、技術標準の早期定着を図る意図が見える。この手法により、Qwen4 の本格リリース前に実環境での検証データが集積される可能性が高い。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。

アリババは今週、オープンウェイトのマルチモーダル Mixture-of-Experts (MoE) モデル「Qwen3.8-Flash」を発表しました。
今月初めに登場した Qwen 3.8 Max の直後にリリースされたこの 1250 億パラメータの AI モデルは、Qwen 4 の前座として提供されています。性能とコストパフォーマンスの両面を重視した製品であり、「コーディングやオフィス業務において優れた能力を発揮する」という点に加え、機能・レイテンシ・コストの最適なバランスを実現しているとしています。
「今回のリリースでは、Qwen 4 のアーキテクチャを早期に previews するマルチモーダル MoE モデルである Qwen3.8-Flash-Next の重みを公開しました」と、アリババは公式ブログで確認しています。
なぜアリババは先行アクセス用のプレカーサーモデルを提供するのか?
Qwen3.8-Flash でアーキテクチャの変更点を早期に公開することで、コミュニティがその仕組みや構成要素を検証し、完全な Qwen 4 ファミリーが構築される前に実地テストを開始することを期待しています。
Qwen3.8-Flash が Qwen 4 の道を開くものであると明言したことで、アリババは次期モデルに引き継ぐ設計思想を明らかにしました(そして何より、それをオープンに共有しました)。これにより、開発者は次のコードベースの構築や計画を早期に進めることが可能になります。
アリババは、Qwen3.8-Flash が Qwen3-Next で Qwen3.5 に対して果たしたのと同じ役割を担っていると明言しています。具体的には、このモデルが「ハイブリッド Gated DeltaNet + Gated Attention」というアーキテクチャ(推論・学習時に文脈効率と注意機能のバランスを実現する計算コンポーネント)を開発者に紹介した点です。その後、この設計は Qwen3.5 から Qwen3.8 シリーズ全体で採用されました。
アリババは「Qwen3.8-Flash-Next は、アテンション(注意)、リジューアル(残差)、エンベディング(埋め込み)、最適化の 4 つの側面を体系的に強化し、モデル能力を向上させると同時に、計算効率・モデル容量・学習安定性をさらに高めています」と述べています。
競合他社とのベンチマーク結果
エージェントによるコーディング、長期ホライズンのエージェントタスク、マルチモーダル知能の各分野で Qwen3.8-Flash を評価したところ、SWE-bench Pro(エージェントによるコーディング)、CoWorkBench(長期的なオフィス業務)、Toolathlon Verified(実世界でのツール利用)、MathVision(視覚的な数学問題解決)、AndroidWorld(モバイル端末でのエージェント活用)、ERQA(具身知能)といったテストにおいて、DeepSeek-V4-Flash や Claude-Opus-4.6 などの競合モデルと比較して十分な性能を発揮していることが確認されました。
「Qwen3.8-Flash-Next は、アテンション、リジューアル、エンベディング、最適化の 4 つの側面を体系的に強化し、モデル能力を向上させると同時に、計算効率・モデル容量・学習安定性をさらに高めています」
SWE-bench Pro を用いたエージェント型コーディングのテストでは、Qwen3.8-Flash-Next が 62.5 のスコアを記録しました。これは Qwen3.8-27B の 61.7 や Qwen3.7-Plus の 55、DeepSeek-V4-Flash-0731 の 56.0、そして Claude-Opus-4.6 (Max) の 53.4 を上回る結果です。
重要なのは、Qwen3.8-Flash が Alibaba が「トレーニングリソースの約九分の一」とする少ない資源で、より優れたパフォーマンスを発揮している点です。同社によれば、これは Qwen3.7-Plus(本モデルの 3 倍のサイズ)と比較して、トレーニングと推論のコストを大幅に削減できることを意味します。
Qwen3.8-Flash-Next と Qwen3.8-Flash の違いは何でしょうか?
命名規則について説明すると、Qwen3.8-Flash-Next は Hugging Face AI デベロッパーハブと Alibaba の ModelScope コミュニティポータルで開発者に公開されているオープンウェイトの最先端研究モデルです。同じ基盤アーキテクチャを採用していますが、Qwen3.8-Flash は QwenCloud API を通じて提供されるプロダクションバージョンであり、デフォルトで 100 万トークンと公式に組み込まれたツールを備えています。
Qwen3.8-Flash-Next は、125B パラメータのメインモデルを基盤とし、追加で 51B の N-gram エンベディングをサポートします。トークンごとに 6B パラメータが活性化されます。ネイティブで 262,144 トークンのコンテキスト長に対応し、YaRN を使用することで 100 万トークンまで拡張可能です。
アーキテクチャにはどのような更新が行われたのでしょうか?
前述の通り、Qwen3.8-Flash はアテンション機構、残差接続、埋め込み層、最適化手法などにおいてアーキテクチャ上の拡張を導入しています。そのハイブリッド型アテンション構造は、過去の情報を圧縮する Gated DeltaNet (GDN) と、軽量な圧縮インデクサを用いて関連コンテキストを選択する革新的な設計である Qwen Sparse Attention (QSA) を組み合わせたものです。これにより、長文シーケンスにおけるアテンションコストを大幅に削減しています。
アリババは、Gated Residual (GR) 機構が層間のデータ経路を広げると同時に、層間での情報伝達とトレーニングの安定性を強化すると説明しています。また、N-gram Embedding 技術は追加計算量を最小限に抑えつつモデルの容量を拡張し、Muon Optimizer は大規模モデルのトレーニング効率を高めています。
「もしローカル LLM が今日すでにリモート LLM を代替できるならいいのですが、私の経験から言えば、まだそこには至っていません。特に専門的なソフトウェア開発においてはね。」
開発者たちは Qwen3.8-Flash をどう評価しているのでしょうか?
現時点での開発者の反応は賛否両論です。
メカトロニクスエンジニアの Alok 氏は X で、ビデオ RAM の壁(モデル量子化により長文コンテキスト推論を可能にしようとする中で、LLM のメモリ管理のために物理的な高速 GPU メモリが必要となる課題)が公式に消滅したと述べています。
「24GB の RTX 4090 1 枚で、Qwen3.8-Flash-Next (MoE) 125B A6B を 25 万トークンのコンテキストウィンドウで動かしました。デコード速度は 21 トークン/秒、プリフィルは 364 トークン/秒です。MTP も dflash も KV キャッシュ量子化も使っていません。データセンター向けモデルをコンシューマーハードウェア上で動かせるのです」と、Alok は興奮気味に語っています。
しかし、マルチディシプリンなソフトウェア開発者である Embedding Shapes は、この話にはあまり乗り気ではありません。
彼らは Hacker News で、モデルが基本的なタスクで何度も失敗する様子について辛辣な言葉で投稿し、「ローカル LLM が今日のリモート LLM を完全に置き換えられるようになればいいのですが。私の経験に基づけば、そうなる理由はありません。Qwen 3.8 に関するネット上の熱狂的な反応を見て期待しましたが、ローカルでのプロフェッショナルなソフトウェア開発にはまだ届いていません」と述べています。
価格とアクセス方法
Qwen3.8-Flash は、アリババの AI ネイティブクラウドプラットフォームである Model Studio や Qwen Cloud から API 経由で利用可能です。100 万トークンあたりの料金は、入力側が 0.16 ドル、出力側が 0.47 ドル(中国国内の開発者の場合は 3 ラン)です。
また、アリババの職場用 AI エージェントプラットフォーム「QwenWork」でも利用できます。ここでは再設計された「スタンダードモード」が採用されており、現在のモードと比較してタスクあたりのトークン消費量を 75% 削減し、生成速度を約 2 倍に向上させています。
アリババはこれにより、フラッグシップ級の能力が日常のワークロードでも利用可能になり、開発者がすでに所有しているハードウェアでこのモデルを実行できると主張しています。
アリババの Qwen4 はいつリリースされるのでしょうか?
アリババは Qwen4 の正式な発売日についてはまだ発表していません。しかし、この話題に関する一般的なウェブ検索では、多くの評論家や市場関係者が、Qwen4 は年内に登場する可能性が高いと一致して見解を示しています。最も早い場合、9 月にもリリースされるかもしれません。
業界内での推測では、次期モデルファミリーが高度な空間モデリングにおける複雑な 3D コーディングやデザインタスク向けに最適化されるのではないかという指摘もあります。また、Mixture-of-Experts (MoE) アーキテクチャの拡張や、ネイティブなマルチモーダル処理能力の強化が特徴として盛り込まれる可能性も考えられています。
本件に関するより広範なコメントを求めてアリババに問い合わせましたが、取材には応じませんでした。
Qwen という名称は繁体字で「通義千問」と書き、発音は「トンイー・チエンウェン」です。英語では「一般的な意味についての千の質問」という意味になります。今週末の地元のクイズ大会で使ってみてはいかがでしょうか。
本記事「アリババが Qwen3.8-Flash をリリース:『Qwen4 のアーキテクチャの初期プレビュー』」は、The New Stack に最初に掲載されました。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み