データセンターへの攻撃、Qwen3.5 の全サイズ展開、DeepSeek とファーウェイの連携、Apple のマルチモーダルトークナイザー
本文の状態
日本語全文を表示中
詳細モードで約23分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
The Batch
データセンターが攻撃にさらされる中、アリババ傘下の通義千問「Qwen3.5」が全サイズで公開され、DeepSeek がファーウェイと提携。また、Apple が新しいマルチモーダルトークナイザーを発表した。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
親愛なる皆様、
私はあらゆる階層の方から、雇用に対する不安を感じているという声を聞いています。高校生たちは自分たちのために仕事があるのかと疑問を持ち、エンジニアたちは追いつけるか心配し、経営幹部たちは AI を活用して自社の変革を成功させられるかどうかを懸念しています。AI の進歩がめまぐるしく進む中、地政学的な不確実性も複数の要因として存在しており、この瞬間の未来は私が記憶するどの時よりも不透明に感じられます。このような時には、先にある素晴らしい可能性を活かすために何を作れるかを考えます。同時に、コミュニティやスキルなど、私が頼りにできる安定したものは何かとも考えます。不確かな環境を歩んでいる皆様の心の支えになれば幸いです。
AI の進歩の速いペースは、仕事の未来や多くの企業の将来に不確実性をもたらしています。ビジネス面では、ベンチャー投資家のチャマス・パリハピティヤが、企業が AI による破壊的変化に直面する中で株価がどのように影響を受けるかについて、考え深い 記事 を執筆しました。要約すると、多くの企業の価値は長期的に生成すると予想されるキャッシュフローにあります。もし AI による破壊的変化によってそのキャッシュフローが損なわれる可能性があるなら、企業価値は大幅に低下します。
さらに、最先端 AI ラボの代表者たちは将来について自信に満ちた予測をよく行いますが、私がかつて彼らと個人的に話した際、彼らは実際には数年後に何が本当に起こるのかを全く分かっていないと共有してくれました。ソフトウェア分野ではいくつかのトレンドが明確です:高度な自律型コーディングシステムはさらに改善され続けるでしょう;すでに深刻な製品管理のボトルネックはより悪化します;そしてコーディングを行う人々はさらに増えるでしょう。しかし、これらのトレンドにもかかわらず、将来のソフトウェアエンジニアリングがどのような姿を呈し、ソフトウェアエンジニアリングチームがどのように組織されるのかは、ゆっくりとではあるが明確になりつつあります。
AI の進展速度とは別に、多くの火種が将来にリスクをもたらします:イランでの戦争による悲劇的な民間人の犠牲者やホルムズ海峡の封鎖;台湾における平和の行方に関する不確実性と半導体供給への影響;AI インフラストラクチャに対する潜在的な過剰投資;そして中国によるレアアース金属の支配。私たちの相互接続された世界において、これらのいずれも世界中の人々に大きな影響を与える可能性があり、結果としてすべての人のリスクを高めることになります。
ジェフ・ベゾスは有名に、「今後 10 年間で変わらないことを知ることが、ビジネスを構築するための安定した基盤となる」と述べています。世界の多くのことは 10 年後も現在と同じままです。しかし、職の安定性を心配する個人のために、その期間中に安定し続けるであろうと私が考える二つのものを提案します:コミュニティとスキルです。
まず、10年後も私の友人や家族は私を支えてくれると確信しています。また、どんなことがあっても私が彼らを支え続けることも確信しています。人間関係は驚くほど耐久性があります。パンデミックの間、多くのコミュニティが結束し互いに支え合いました。だからこそ、不確実な状況において、コミュニティ——つまり人間関係のネットワーク——を持つことは皆にとって助けとなります。そのため、関係を築く機会は非常に価値があり、より多くの成果を上げるとともに、下振れリスクから身を守る手立てにもなります。そこで私は、新しい友人を作り、既存の関係を刷新できる対面での集まりを特に貴重だと考えています。イベントに参加したい方は、4月28日から29日にサンフランシスコで開催される AI Dev へお越しください。
さらに、特定の企業がうまくいくかどうかは別として、多くのスキルは今後も価値を持ち続けます。あなたのスキルはいつでも持ち運べるものであり、一度身につけたスキルを他人が奪うことはできません。具体的にどのスキルが価値あるものかは変化していくため、より多くの選択肢を得るために幅広いスキルに投資し、すぐに役立つとは限らないスキルも学ぶ価値があります。さらに、スキルは互いに積み重なっていきます(例えば、コーディングエージェントを活用するにはプロンプトの理解が重要であり、AI の構成要素を理解することは特定のアプリケーションをアーキテクチャ化する仕組みを知る上で重要です)。したがって、スキルを築くことは追加の知識を得ることを容易にし、幅広いスキル構築に今投資しておくことで、いかなる状況になっても多様な価値ある成果を達成し続けることができます。
私たちが目にする多くのリスクが好転し、私たちの集合的な AI の未来が今日よりもはるかに明るくなることを私は楽観視しています。私がここにいてあなたや AI コミュニティをサポートするよう努めることは間違いありません。この急速に変化し不確実な世界を乗り切るにあたり、互いに助け合い、コミュニティを築き、価値あるスキルを身につけるための支援を続けていきましょう。
作り続けましょう!
アンドリュー
A MESSAGE FROM DEEPLEARNING.AI
最新のコースでは、Oracle との共同制作により、LLM がセッションを超えて知識を保存・検索・洗練させる完全なエージェントメモリシステムを構築します。これにより、状態を持たないエージェントが、時間とともに学習し改善するエージェントへと進化します。こちらから登録
News

ドローンがペルシャ湾のデータセンターを攻撃
イランは中東にある少なくとも 3 つの Amazon データセンターを攻撃しました。これは、米国によるイランに対する戦争において AI が果たす決定的な役割を示すものであり、戦時中にこのような施設が標的にされたのはおそらく初めてのことです。
何が起きたか: イランのドローンがバーレーンの Amazon Web Services (AWS) 施設とアラブ首長国連邦 (UAE) の2つの施設を損傷させ、銀行業務、決済、ライドシェアリング、食品配達、ビジネスソフトウェアを含むオンラインサービスの運用を妨害しました。米軍は非機密版の Anthropic Claude およびおそらく他のコンピューティングシステムを実行するために AWS を利用していますが、攻撃が自社の運用に影響を与えたかどうかについては明らかにしていません。
ドローン攻撃: 3月1日の早朝、UAEにある2つのAWSデータセンターにドローンが襲撃され、直後にバーレーンのデータセンターも被害を受けました。Amazonはバーレーンでの攻撃について「当社の施設の近くで行われたドローン攻撃である」と述べていますが、イラン側はTelegramによるメッセージングサービスを通じて、イラン国営のファルス通信社によると、「これらの施設が敵対する軍事・諜報活動を支える役割を特定するため」に標的とされたと発表しています。
- データセンターは構造的損傷、停電、および消防活動による水害を受け、サービス停止と通常より高いエラー率を引き起こしました。3月3日現在、Amazon はクラウドコンピューティング顧客に対し、データをバックアップし、AWS 中東リージョンからのワークロードを米国、欧州、またはアジア太平洋地域へ移行するよう推奨しています。
- ニューヨーク・タイムズ紙によると、これらの攻撃はペルシャ湾地域における AI ハブ構築への兆候となる兆しで、数兆ドル規模の投資が危険にさらされています。
- ガルフ協力会議(GCC)加盟国であるバーレーン、クウェート、オマーン、カタール、サウジアラビア、アラブ首長国連邦からなる経済同盟かつ軍事同盟は、2.0ギガワットのデータセンター容量を有しており、さらに 0.4ギガワットが計画されています。これはビジネスインサイダー紙の報道によるものです。
ニュースの背景: データセンターへのリスクは、戦争における AI の役割の高まりと類似しています。米軍が最近、Anthropic の大規模言語モデル Claude を防衛用途に使用することを 禁止 したにもかかわらず、米軍はイランやその他の地域で Claude や他のシステムを多目的に日常的に使用しています。一方、イランは一定の自律性を備えた兵器化されたドローンを使用しています。
- クロードは、米国によるイラン戦争の最初の24時間以内に1,000以上の標的を選定するシステムの一部として機能し、米軍が攻撃のペースを大幅に加速させることを可能にしたと、ワシントン・ポスト紙が報じています。Claude は Palantir 社によって構築された標的選定および物流用のシステムである Maven Smart System (MSS) に統合されています。誤りを避けるため、生死に関わる状況では人間の分析官がシステムの出力を確認します。演習において、MSS は標的選定プロセスを12時間から1分未満に短縮し、以前は2,000人の要員が必要だったものを20人のスタッフで達成したと、Army Times 紙は伝えています。Claude/MSS はベネズエラのアンドレス・マドゥロ大統領を拘束した1月の作戦にも関与しましたが、イランでの行動は「大規模な戦争作戦」における初の使用となります。
- 安価なドローンの利用は、最近の米イラン戦争の特徴的な要素となっています。イランは米国の初期爆撃キャンペーンに対し、地域インフラ、軍事施設、および米国資産を標的とした大量の攻撃ドローン群で応酬しました。その多くは自律航行し、命令に応じて攻撃を行う低コストの「自爆型」設計です。これに対して米国も、イランのシャヘド136をモデルにした LUCAS システムを含む独自のワンウェイ攻撃ドローンを投入しました。このような戦争様式は、ロシア・ウクライナ戦争中に開発されたウクライナの革新に大きく依存しており、そこではソフトウェアや AI と連携したドローン群が戦車、砲兵隊、物流目標などを破壊してきました。
ただし: AI が軍事的意思決定のペースを上げる一方で、致命的な過ちのリスクも高まります。例えば、イランに対する初期空爆の一斉攻撃中、ある爆弾が学校を破壊し、170 人以上(ほとんどが子供)が死亡しました。その後の調査では、予備的な結果 示唆 されているように、米軍が爆弾を投下した可能性が高いとされています。標的選定に使用された建物のデータが古かったことが一因となった可能性があります。なぜなら、その学校は約15年前には近くの海軍基地の一部だったからです。
なぜ重要なのか: AI を活用した戦争の急激な台頭は、戦闘のペースが人間から機械速度へと移行する兆候を示しています。AI は、成功に最もつながる行動を特定するために膨大な数のシミュレーションを実行することで、任務計画を現実的なものに変えます。また、戦場での判断と行動を加速させつつ、戦場の現実を曖昧にするいわゆる「戦争の霧」を軽減する可能性があります。以前は人間の注意不足により分析が制限されていた、戦場の通信、画像、その他の情報の洪水に対処するために実行不可能だった任務も、現在では実現可能になります。この加速化は紛争の一部の段階を短縮する可能性がありますが、壊滅的な結果をもたらす可能性のある即断を迫る圧力を高めます。
私たちが考えていること: AI によって生成された推奨事項は、情報の検証や仮定の疑問視、武力行使の道徳的・戦略的結果の衡量という必要性を排除するものではありません。

Qwen3.5 が大型モデルを上回り、ビジョンベンチマークで首位に立つ
オープンウェイトのビジョン・言語モデルである Qwen3.5 ファミリーには、印象的な大型モデルが含まれるほか、OpenAI のオープンウェイトモデル(その 10 倍の規模)よりも性能に優れた小型モデルも含まれています。
何の新情報: Alibaba は、8 つのオープンウェイトビジョン言語モデルからなる Qwen3.5 ファミリーをリリースしました。最大規模のモデルは、オープンウェイトを提供する Qwen3.5-397B-A17B(パラメータ数 3,970 億個、トークンあたりアクティブなパラメータ数 170 億個)と、Qwen3.5-397B-A17B のホスト版である Qwen3.5-Plus です。後者は、より大きな入力コンテキスト(文脈)と自律的に選択可能な組み込みツールを提供することで、エージェントアプリケーションをサポートします。中規模モデル 4 つには、オープンウェイトの Qwen3.5-122B-A10B、Qwen3.5-35B-A3B、Qwen3.5-27B と、エージェントアプリケーション向けに最適化された Qwen3.5-53B-A3B のホスト版である Qwen3.5-Flash が含まれます。ファミリー内の小規模モデル群 — Qwen3.5-9B、Qwen3.5-4B、Qwen3.5-2B、および Qwen3.5-0.8B — において、90 億パラメータおよび 40 億パラメータのバリエーションは、はるかに大規模なモデルのパフォーマンスに匹敵します。
- 入力/出力:テキスト、画像、動画(オープンウェイトモデルは254,000 トークンまで対応可能で100万トークンへ拡張可能、ホスト型モデルはデフォルトで最大100万トークン)、テキスト出力(最大64,000 トークン)
- アーキテクチャ:Mixture-of-experts または密結合トランスフォーマーに混合アテンションとゲートドールタネット層を組み合わせたもの、視覚エンコーダーの詳細は未公表
- パフォーマンス:全体的に優れた視覚性能;Qwen3.5-9B(90億パラメータ)は多くの言語タスクにおいて gpt-oss-120B(1200億パラメータ)を上回る。
- 利用状況:オープンウェイトは Apache 2.0 ライセンスの下で無料で利用可能;Alibaba Cloud Model Studio を介したホスト型オープンウェイトモデルの API は、特定のモデルにより価格が異なり、100万トークンあたりの入力/出力で$0.20〜$0.60(約30円〜90円)、Qwen3.5-Plus の API は 100万トークンあたり入力$0.4、キャッシュ$0.04、出力$2.4、Qwen3.5-Flash の API は 100万トークンあたり入力/キャッシュ/出力でそれぞれ$0.1/$0.01/$0.4。
- 機能:201 か国語対応、ツール利用、ウェブ検索、思考連鎖推論
- 非公開情報:視覚エンコーダーの詳細、トレーニングデータおよびその手法
仕組みについて: Alibaba は Qwen3.5 ファミリーの構築方法についてはほとんど情報を開示していない。
- Qwen3.5 は、Qwen3-Next アーキテクチャを基盤に構築されており、これは Qwen3-30B-A3B アーキテクチャおよびトレーニング手法の変種であり、トレーニングの効率性と安定性を向上させるために修正が加えられています。
- Qwen3.5 は、Qwen3 と比較して「視覚テキストトークンの規模が大幅に拡大されたデータセット」でトレーニングされました。
結果: Alibaba によるテストでは、すべての Qwen3.5 モデルがビジョンタスクにおいて卓越した性能を発揮し、はるかに大規模なモデルを上回りました。また、一部のモデルは言語タスクでも競争力のある結果を記録しました。Qwen3.5-9B と Qwen3.5-4B は、全体的に最も印象的なパフォーマンスを示し、はるかに大規模なモデルと比較しても、ビジョンおよび言語の両方のタスクで輝かしい成果を収めました。一方、2 つの最小サイズの変種については比較指標が用意されていません。
- Qwen3.5-397B-A17B は、パラメータ数が非公開だが明らかに遥かに大きいと推測される GPT-5.2、Claude 4.5 Opus、Gemini-3 Pro を上回る性能を、44 のビジョンベンチマークのうち 28 で示しました。多様な言語タスクにおいては、Qwen3.5-397B-A17B は GPT-5.2、Claude 4.5 Opus、または Gemini-3 Pro のいずれかを上回りましたが、一般的にはこれら 3 つすべてを同時に上回ることはありませんでした。
- テストされた言語およびビジョンベンチマークのほとんどにおいて、Qwen3.5-122B-A10B と Qwen3.5-27B は GPT-5-mini(パラメータ数非公開)を上回りました。一般的に、トークンあたり 100 億のパラメータを活性化させる混合専門家(Mixture-of-Experts: MoE)アーキテクチャである Qwen3.5-122B-A10B は、270 億パラメータの密着型(Dense)アーキテクチャである Qwen3.5-27B よりも優れた性能を示しました。Qwen3.5-35B-A3B は、より小規模な Qwen3.5-27B や Qwen3.5-122B-A10B に比べて全体的に劣る結果となりましたが、それでもテストされた 74 のベンチマークのうち 58 で GPT-5-mini を上回りました。
- Qwen3.5-9B は、推論およびコーディングタスクを除く、テストされた言語ベンチマークのほとんどで、OpenAI の言語モデル gpt-oss-120b(Qwen3.5-9B より 10 倍以上大きい)を圧倒しました。同様に、Qwen3.5-4B は推論およびコーディングタスクを除くテストされた言語ベンチマークのほとんどで、OpenAI の言語モデル gpt-oss-20b を上回りました。テストされたビジョンベンチマークのほとんどにおいて、Qwen3.5-9B と Qwen3.5-4B はどちらも、ビジョン・ランゲージモデルである GPT-5-nano や Gemini-2.5-Flash-Lite よりも優れた性能を示しました。
ニュースの背景: Qwen3 ファミリーのリリース直後、チームの技術責任者でありモデルの主要なアーキテクトである Lin Junyang 氏が、X(旧 Twitter)上の投稿で「さようなら、愛する qwen」と記述し、突然退任しました。中国のテックニュースサイト 36kr.com はその後、彼の退任に続いてチームの他の 4 名も辞任したと報じました。1 月の公の場での発言で、Lin 氏は「我々は手一杯だ — 納期要件を満たすだけでリソースのほとんどが消費されている」と述べており、*Bloomberg* がこのように報じています。アリババはこれに対し、Qwen プロジェクトを上級経営陣によるより厳格な監督下に置き、AI 開発へのさらなる投資を行うことを約束しました。
なぜ重要なのか: すべての Qwen3.5 モデルは、そのサイズに対して卓越したビジョン性能を発揮しますが、特に Qwen3.5-9B といった小規模モデルは、消費者向けのラップトップで実行できるほど小さくながら、以前には Nvidia H100 のような 80GB GPU を必要としていたパフォーマンスを提供します。
私たちが考えていること: ローカルで実行可能な推論機能を備えたビジョン・ランゲージモデルとは、コスト削減、プライバシーの向上、そしてビジョン・ランゲージアプリケーションにおける新たな可能性を意味します。

DeepSeek が Nvidia を退けて Huawei を選択
優れたオープンウェイトモデルを開発する中国のデベロッパーである DeepSeek は、自社のフラッグシップモデルの今後のアップデートを米国のチップメーカーから差し控えるという動きに出ました。これは、米国と中国間の AI 競争を激化させる一因となっています。
何が変わったか: DeepSeek は、開発最終段階にある次期モデル「DeepSeek-V4」が自社のチップ上で円滑に動作することを保証するために、Nvidia や AMD に機会を与えていない。これは主要なモデル更新前の典型的な慣行からの逸脱である。ただし、同社は中国の半導体メーカーである Huawei に対して、このモデルの事前リリース版を共有し、ハードウェア向けソフトウェアの最適化に数週間を割くことを可能にしたと *Reuters* が報じているが、DeepSeek がこの決定を下した理由については報告されていない。
仕組み: *Reuters*によると、チップメーカーは通常、新しいモデルを調査してハードウェア上で推論が効率的に実行されるかを確認します。過去には、DeepSeek は Nvidia と密接に協力してモデルのトレーニングを行ってきました。
- 匿名のトランプ政権高官は、米国による輸出規制にもかかわらず、DeepSeek-V4 が中国で Nvidia の最も先進的なチップを使用してトレーニングされたことを Reuters が報じたと述べましたが、その情報がどのように入手されたかは確認できませんでした。
- 米下院対中特別委員会の委員長は今年1月、Nvidia は DeepSeek-V3 のトレーニング時に広範な技術支援を提供し、「主要なトレーニング効率の向上」を達成したと述べています。
背景: 長年にわたり、米国は先進的なチップおよびその製造に必要な機器の輸出制限を通じて、中国の AI 開発を遅らせようとしてきました。しかし、この取り組みはむしろ中国に国内チップ産業の構築を促す結果となり、中国政府も同国の企業が国内チップを使用することを奨励または義務付ける措置を講じています。
- 中国で生産されたチップはまだ、Nvidia が設計し台湾積体電路製造会社(TSMC)が生産したものに匹敵するものではありませんが、中国企業、特に華為(ファーウェイ)は近年歩みを進めています。
- 2022 年以降段階的に規制を強化してきた後、米国政府は今年1月、高機能 AI チップの輸出を個別事例に基づき許可し始めましたが、その販売には25% の課税が適用されます。しかし当局者は新たな輸出制限を検討しています。
- 昨年、中国政府は中国市場向けに設計された Nvidia の H20 チップについてセキュリティ審査を義務付けました。同時に、中国の AI 企業に対し、必要な場合にのみ外国製チップを購入するよう要請しました。
なぜ重要か: DeepSeek が米国チップメーカーへの DeepSeek-V4 の事前リリースアクセスを制限した決定は、象徴的な意味合いが大きい可能性がありますが、これは米国に拠点を置く AI コミュニティの一部と中国に拠点を置く一部との間の分断を深めるものです。この決定は、中国の長年の技術的自立という目標に沿うものであり、敵対国がそれを阻止しようとしても、重要な AI 機能は常に利用可能となります。
私たちが考えること: DeepSeek が最新のモデル訓練に Nvidia チップを使用した可能性は、輸出規制だけでは国際的な競争相手が米国製チップへのアクセスを得るのを止めることができないことを示す複数の指標の一つです。世界は、交渉による制限、相互協力、およびアイデア・技術・貿易の自由な交換によってより大きな恩恵を受けるでしょう。
imageマルチモーダルモデルは通常、異なるメディアタイプを埋め込むために異なるトークナイザーを使用し、分類ではなくメディア生成を行うためのトレーニング時には異なるエンコーダーを使用します。Apple のチームは、画像や動画だけでなく 3D オブジェクトもこれらの視覚メディアのいずれかに対して共有トークン空間にマッピングする多次元トークナイザーと、そのようなオブジェクトの識別および生成の両方で高い性能を発揮する共有エンコーダーを作成しました。
何が変わったか: Apple の Jiasen Lu、Liangchen Song、および同僚らは、汎用ビジュアルトクナイザーを備えたトランスフォーマーモデル「AToken」AToken を訓練しました。この新モデルは、画像・動画・3D データの両方の生成と分類が可能であり、それぞれの入力・出力タイプに特化した既存モデルに匹敵する性能を達成しています。
重要な洞察: 画像生成モデルは、視覚的な詳細(猫やボールの表面がオレンジ色か?)を保持する一方、意味情報(それが猫かボールか)を捨て去るエンコーダー(VAE や VQ-VAE など)を使用するため、分類モデルほど物体を認識できません。一方、画像分類モデルは、物体の種類(例えば「猫」や「ボール」)を捉えるエンコーダー(CLIP や SigLIP など)を使用しますが、視覚的な詳細を見逃すため、生成においては劣ります。静止画から動画や 3D へ移行すると、事情はさらに複雑になります。エンコードされる前に、動画と 3D は通常、画像をエンコーダーが処理できるデータに分解するための個別のトークナイザーを必要とし、それぞれ独自のアーキテクチャと埋め込み空間を持ちます。もしこれら 3 つのメディアタイプを単一のフォーマットで同じトークナイザーを用いて分析すれば、1 つのトランスフォーマーがすべてに対応して学習できるようになります。さらに、これらのメディアタイプを再構築し、対応するテキスト記述にアライメントさせるようにモデルを訓練することで、埋め込みは微細な視覚的詳細と意味的な参照の両方を保持することになり、個別の生成モデルと分類モデルが必要なくなります。
仕組み: AToken は、事前学習された SigLIP2
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み