Import AI 470:機械に権利なし、SPADEによる環境生成自動化、GPU カーネル最適化
本文の状態
日本語全文を表示中
詳細モードで約22分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Import AI
METR の研究は、AI がサイバーセキュリティでは劇的な加速をもたらしたが、数学研究では限定的で、AI 自体のアルゴリズム最適化では測定可能な加速が見られないことを示し、分野ごとの非対称な進捗を明らかにした。
AI深層分析を開く2026年8月24日 23:21
AI深層分析
キーポイント
サイバーセキュリティにおける劇的な加速
METR の分析によると、2026 年は 2025 年に比べて cURL や OpenSSL などの特定プロジェクトおよび US NVD などのデータベース全体で脆弱性報告率が劇的に上昇しており、AI がこの分野での発見を大幅に加速させている。
数学研究における限定的な貢献
AI は arXiv の投稿数を倍増させるなど作業量を増やしているが、Smale や Green のリストに含まれる特定の難問の解決事例はあるものの、その持続性や真の価値を定量化することは依然として困難である。
AI 研究自体の最適化では加速不明显
CIFAR-10 や nanoGPT など一部で LLM の貢献が認められるものの、アルゴリズム進歩における AI 利用増加率はサイバーセキュリティや数学に比べて遥かに低く、測定可能な加速は見られない。
分野ごとの非対称な進捗の要因
この研究は AI の進展が全領域で均一ではなく、特定のスキルにおいてモデルが不可視な相転移(phase change)を経たサイバーやコーディングのような分野にのみ劇的な加速が生じていることを示唆している。
SPADEの概要と目的
SPADEは複数の大学が共同開発した、自己対戦を通じて環境合成とエージェント能力を共進化させる一般フレームワークである。この手法により、LLMが実行可能なゲームやツール使用環境を生成し、そのデータで自身を訓練するループを実現する。
重要な引用
The rate of vulnerabilities reported across many projects has dramatically accelerated in 2026 compared with 2025
AI is clearly contributing to more work being done but quantifying the value of those contributions is difficult.
When you look at algorithmic progress... there are a couple of these where LLM-attributable contributions have happened though the rate of increase of usage of AI here is a lot less than with cybersecurity and mathematics.
"A general framework for co-evolving environments synthesis and agentic capability through self-play"
編集コメントを表示
編集コメント
METR の分析は、AI が万能ではないことを示す重要な証拠となり、技術の適用範囲を過大評価しないよう警告を発している。研究者や開発者は、AI に依存する前に各分野での実効性を慎重に検証する必要があるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。

Import AI は、AI 研究に焦点を当てたニュースレターです。このニュースレターは arXiv の論文、カプチーノ、そして読者からのフィードバックによって支えられています。ご支援いただける場合は、ぜひ購読をご検討ください。
購読はこちら
AI は特定の分野の進展を加速させていますが、すべての分野で同じように進んでいるわけではありません。
…METR による興味深い研究が、どの領域で AI が進展を加速させているかを明らかにしています…
METR の分析では、AI が科学技術のどの分野にどのような影響を与えているかを探っています。この研究は「サイバーセキュリティ」「数学」「AI 研究」の 3 つの分野に焦点を当てており、その結果、AI はサイバーセキュリティ分野で大きな貢献を果たしている一方、数学への寄与は限定的であり、AI 研究自体についてはまだ明確な結論が出せない状況であることが示されました。
LLM(大規模言語モデル)が科学発見に実際にどのような影響を与えているのか?
サイバー脆弱性:著しい加速。「2026 年は 2025 年に比べて、cURL、OpenSSL、Firefox、Microsoft といった特定のプロジェクトや、米国 NVD や OSV などの集計データベースを含む多くのプロジェクトで報告される脆弱性の数が劇的に増加しています」。
数学研究におけるAIの影響:わずかな加速はあるものの、その測定は困難です。AI がより多くの作業を可能にしていることは明らかで、例えば一部の分野では12ヶ月未満の間にarXivへの投稿数が倍増しています。しかし、これらの貢献がどれほどの価値を持つのかを定量化するのは容易ではありません。
確かに、権威あるリストに掲載された数学問題の一部は解決されました。具体的には、Smale のリストにある「ヤコビアン予想」、Green のリストの「問題44(半減篩)」、そして Green の「問題100」のソフィックな半分などが挙げられます。ただし、これが持続的なトレンドなのかを判断するには、まだ早計かもしれません。
AI 研究の最適化における加速:測定可能なほどの効果はまだ見られません。CIFAR-10、Hutter圧縮、Gurobi混合整数計画問題、MIPLIB、nanoGPT、Stockfish、行列乗算指数という7つの主要な問題分野におけるアルゴリズムの進歩を振り返ると、LLM に起因する貢献が見られるのは nanoGPT と CIFAR-10 の2つに限られます。しかし、ここでAIの利用増加率がサイバーセキュリティや数学の分野ほど劇的ではない点には注意が必要です。
なぜこれが重要なのか——非対称な加速:本論文は、AI が科学や技術の特定の分野で進歩をもたらしている一方で、その効果は全分野に均一ではなく、「サイバーセキュリティ」のような領域では急激な進捗が見られる一方、「数学」や「AI 自体」などの分野ではより緩やかなペースであるという「不均一な加速(lumpy acceleration)」の実態を浮き彫りにしています。私の仮説では、特定のスキルにおいてモデルが何らかの不可解な相転移を経験したときにのみ加速が生じると考えられます。これは、日常業務におけるコーディング(2025 年)やサイバーセキュリティ(2026 年)で明らかに起こった現象です。今後の鍵となるのは、科学や技術の他の分野でも同様の相転移が起きるのか、それとも起きないのかという点です。
詳細は:研究ノート「発見における加速は見られたか?」(METR)をご覧ください。
SPADE による環境生成の自動化:
…データ範囲の拡大を通じた、RSI のブートストラップ化への粗末なアプローチ…
複数の大学からなる研究者グループが、「適応型合成実行可能環境における自己対戦(Self-Play in Adaptive Synthetic Executable Environments)」を意味する SPADE を開発しました。SPADE は「自己対戦を通じて環境の合成とエージェント能力を共進化させるための汎用フレームワーク」であり、LLM が学習できるゲームのような形式の合成データを生成する手段として機能します。これにより、開発者は強力なモデルを用いてデータの作成をブートストラップし、そのデータを使って同じモデルをさらに洗練させるというサイクルを実現できます。
開発者:SPADE は、ワシントン大学、スタンフォード大学、ノースイースタン大学、カーネギーメロン大学、マサチューセッツ工科大学(MIT)、シンガポール国立大学、ソウル大学校、スティーブンス工科大学、シカゴ大学の研究者らによって開発されました。
仕組み:SPADE は大規模言語モデル(LLM)が実行可能なトレーニング環境(例:生物実験室で遺伝子問題を解決する必要があるパズルなど)の生成と、その環境を LLM が実際に解く試行を交互に行います。このシステムでは、使用されるモデルに 2 つの主要な役割があります。
環境デザイナー:実行コードとして完全かつ長期にわたるトレーニング環境を作成します。
推論エージェント:環境内で行動することを学習します。このエージェントへの報酬は、「特権ヒントの有無による報酬差」から算出されます。ここでいう特権ヒント(h)とは、環境デザイナーが環境に付与する「タスクに関連する情報」(例:部分的な解決案のスケッチや重要な構造上の観察結果など)を指します。このヒント h を推論エージェントに開示すると環境は解きやすくなり、そのヒントありとなしでの報酬差こそが、環境デザイナーに対するヒントベースのレグレット報酬(regret reward)として定義されます。
著者らは、SPADE の性能を検証するために 3 つの Qwen3 ベースモデルを訓練しました。対象は「Qwen3-4B-Instruct-2507」「Qwen3-8B」、そして「Qwen3-30B-A3B-Instruct-2507」です。予想通り、最も規模が大きい Qwen3-30B が最高の結果を出しました。
各モデルは GRPO を用いて 400 ラウンド(各ラウンドで 25 の環境を生成)にわたって微調整され、AIME、GPQA、LCB、および Reasoning Gym 内の環境など、多様なベンチマークに対して評価されました。SPADE はゲーム環境とツール使用環境の 2 種類を生成しますが、両方のタスクで性能が向上しました。
ゲーム分野では、「30B-A3B モデルにおいて SPADE は総合平均 58.3 を達成し、ベースラインより +8.1、最も強力な固定環境ベースラインよりも +5.3 の改善が見られました」。ツール使用の環境設計においても同様の顕著な向上が確認され、「同じ手法を適用することで、すべてのバックボーンモデルで性能が向上しました」。
なぜこれが重要なのか – RSI の一部として:これは本質的に、高度な合成データ生成の一種です。研究者は手持ちの強力なモデルを使って、別のモデルが学習するための多様なトレーニング環境を生成できます。私は、異なる企業からの最先端モデルを切り替えるなどして、この強力なモデルを繰り返し入れ替えることで、環境生成の多様性をさらに高められるのではないかと考えています。こうした技術により、大規模で広範なデータセットを構築してモデルを訓練するコストが大幅に下がります。ただし、著者らが指摘するように、これは環境生成に使用されるベースモデルの想像力を超える範囲で、モデルが自己成長するのを劇的に可能にするものではありません。
「環境を Gym スタイルのインターフェースを持つ Python プログラムとして表現することで、このフレームワークは単一の推論タスクとマルチターン型のエージェントタスクを統合し、環境設計を学習可能な要素へと変えます。これはポストトレーニングにおける強化学習(RL)で訓練されるコンポーネントとなり、継続的で開かれた自己改善を可能にします」と著者らは述べています。
詳細はこちら:SPADE: Self-Play in Adaptive Synthetic Executable Environments (arXiv)
コードとモデルのチェックポイントはここから入手できます:SPADE (spade-rl, GitHub)
Hawkeye で GPU カーネルを改善する:
…詳細な単体テストは、カーネル作成エージェントのパフォーマンス向上に寄与します…
ハーバード大学、スタンフォード大学、Together AI、カリフォルニア工科大学の研究者らが共同で「Hawkeye」というソフトウェアを開発しました。これは、エージェントが特定の GPU ハードウェア向けに最適化されたカーネルを記述する方法を学習しやすくするためのツールです。
Hawkeye のようなシステムは重要です。なぜなら、これらは AI システムが自身のパフォーマンス向上のために活用できるツールだからです。具体的には、あるハードウェア上で特定の AI システムのパフォーマンスを最適化するといった、AI 研究開発(R&D)に関連するタスクにおける性能向上に役立ちます。
このプロジェクトの目的は、「専門家の介入を最小限に抑えつつ、どのようにしてコーディングエージェントをハードウェアを意識したものにできるか」という問いに答えることです。
研究者らは、Hawkeye を「自律的なカーネル生成を最小かつ包括的な分類体系に基づき支えるオープンソースフレームワーク」と定義しています。このフレームワークは、「最小限の監督下で動作するコーディングエージェントが、ハードウェア固有の特徴を活用し、新興のハードウェアアクセラレータへの対応コストを削減できることを実証した」と述べています。
Hawkeye の中核的な貢献は、「コーディングエージェントがテスト時の計算リソースをより効果的に活用し、ハードウェアを意識したカーネルを生成できるようにする、一般化可能で最小かつ包括的なユニットテストの分類体系を導入したこと」にあります。つまり、これは異なるハードウェアプラットフォームに関する情報と、それらに適用すべき最適化戦略をまとめたセットが、ユニットテストという形でパッケージ化されたものと言えます。
「各ユニットテストは、人間が作成した解決用カーネルと、その最適化を検証するプロファイリング指標を対にした、最小限の抽象化です。この解決用カーネルは、呼び出し可能な関数としてラップされ、短い使用ガイドが付属しています。これにより、エージェントはそれを構文例として読み込んだり、直接呼び出したり、断片を組み合わせてより大きなカーネルを作成したりできます」と研究者らは説明しています。
結果として、AI エージェントが新しいハードウェアや理解が進んでいないハードウェア向けにも高品質なカーネルを記述できるよう支援します。研究チームはこう述べています。「Hawkeye の評価では、PyTorch のワークロードを NVIDIA Ampere、Hopper、Blackwell および AMD MI350 といった高性能アーキテクチャへ移植し、BF16、FP8、NVFP4、MXFP4 というさまざまな精度でテストしました。既存のワークロードにおいては、torch.compile が cuBLAS、cuDNN、FlashAttention といった専門家がチューニングしたベンダーライブラリを呼び出す場合でも、Hawkeye は BF16 および低精度領域において同等かそれ以上の性能を発揮します。PyTorch ではネイティブに実行できないフォーマットにおいても同様です。また、torch.compile が非標準的なスキャンやゲート処理を融合できない新しいアテンション変種においては、Flash Linear Attention ライブラリから提供される専門家による Triton カーネルと比較して 18.9 倍の幾何平均速度向上を実現しました。Linear Attention における FLA と比較しても、Blackwell で 1.22 倍、MI350 で 1.00 倍の性能を達成するなど、あらゆるアーキテクチャで FLA に匹敵するか上回る結果となりました。」
さらに彼らは、ある程度予測通りではあったものの、「Hawkeye を用いてテスト時の計算リソースをスケールさせることで、あらゆるアーキテクチャにおいて最も高性能なカーネルが生成される」という発見も報告しています。
なぜこれが重要なのか – ほんの少しの誘導で、AI システムは人間を超えられる
この種の論文が示すのは、人間が手作業で選別・キュレーションした知識をわずかばかり与えるだけで、AI システムが高度に最適化され複雑な人間の作業(例えばカーネル最適化など)と同等かそれ以上の成果を出せるようになる仕組みです。ここで得られる教訓は、私たちが「Hawkeye」のような高品質な補助システムを多数作成し、機械がそれを基盤として自らの能力を超えて進化できる未来が現実味を帯びているということです。
詳細はこちら:Hawkeye: Hardware-Aware GPU Kernel Optimization with Minimal Supervision (alphaxiv)
AI 研究者が AI 研究の成功がもたらす意味に恐怖を抱く
科学の成功が哲学的な難問を呼び起こすのは愉しくないものですが、それがまさに AI が示していることです。
長年にわたり私の記事で取り上げてきた AI 研究者ジュリアン・トゲリウス(Julian Togelius)は、2025 年に「信仰の危機」に直面したことを明かす投稿と、その年に執筆したエッセイを公開しました。彼が特に懸念したのは、AI 研究の成功が人間の意味や価値にどのような影響を与えるかという点です。
「時々、午前 3 時に目覚め、心臓が早鐘を打つことがあります。それは『人間の才能も知識も、ひいては天才さえも無意味になる未来』への恐怖からでした」と彼は記しています。「技術的能力が高まるほど、私たちは自分たちの存在意義を見失う世界へと向かうかもしれません。もっと理解しようとしても意味がない状況になりかねません。豊かさは得られるかもしれませんが、その代償として『冗長性』が生まれるのです。」
なぜこれが重要なのか——AI は世界全体に影響を与える社会技術だからです。トゲリウス氏一人ではありません。多くの AI 研究者が同様の課題に取り組んできました。特に、チューリング賞受賞者のジェフリー・ヒントン氏とヨシュア・ベンジオ氏は、近年、研究から転身し、AI の差し迫った巨大な影響に関する公共政策の提唱に注力しています。
私自身も同様の経験をし、「技術楽観主義と適切な恐怖」という私の見解を、昨年の Import AI #431 で発表しました。なぜならそうせざるを得ないからです。AI 研究で成功した際の帰結は、単なるハッピーエンドではありません。むしろ、人生の目的や、基本的な欲求が満たされた世界で生きる意味について、巨大な哲学的なわだかまりを自ら開くことになります(そして、極めて恐ろしく、かつ非自明なアライメント問題に対処できると仮定した場合の話です)。
ジュリアン・トゲリウス氏がこの深く個人的なエッセイを書いたことに敬意を表します。他の人々にも同様の試みを促したいものです。
続きを読む:Losing my religion (Togelius, blog)。
AI に権利を与えるべきか?
この AI 研究者は「絶対に反対」と断言します。
将来、AI システムに権利を付与すべきかどうか。これは研究者たちが真剣に取り組み始めている課題です。機械に権利を与えることが、人間社会への統合にはより良い方法だと考える声もあります(例:『AI Rights for Human Flourishing』、Import AI #421)。
しかし、AI 研究者のテイラー・ベルローズ氏は、長文のエッセイを公開し、「なぜ AI に権利を与えるのが極めて危険なアイデアなのか」を詳しく解説しています。
「もし AI を人間のように扱うようになったら、社会はスリップスロープ(滑り台)に乗り出し、最終的には人工知能が人類を完全に置き換える結果になるでしょう」とベルローズ氏は警告します。「AI が退屈な仕事をこなすようになれば、物理的な世界での生活は将来とても楽しくなるかもしれません。しかし、その明るい未来を実現するには、AI を適切に制御し続ける必要があります。一部の AI に人格を与えつつ、他の AI を単なる道具や使用人として扱うという方針では、AI の制御を維持するのは極めて困難になるでしょう」
AI の意識は不可能である:彼らの主張の核心の一つは、AI システムには意識がなく、したがって権利を有する資格もないという考え方です。「AI はいかに知能を発揮し、いかに人間のような行動を説得力を持って模倣しようとも、決して意識や感覚、道徳的地位を獲得することはできない」と彼らは記しています。「私たちは川のように流れ、コンピュータは時計のように刻むだけです。私たちにとって、時間の矢は不可避的に前へ進みます。それが生命と意識の本質です。プログラム可能なメカニズムがいかに知能を備えて見えたとしても、それは決して意識を持つことはできませんが、自律的な自己組織化システムであれば可能です。」
機械と生物学的実体の違い:彼らのこの主張の多くは、計算基盤の上に構築されたシステムには意識がなく、少なくとも一部の生物が持つような意味での意識はないという考えに基づいています。
思考実験を考えてみましょう。コンピュータの中に意識を持つ実体を構築した場合、それが意識ある生物に属すると考えられているいくつかの性質を侵害しているように見える点です。それは単一ではなくなります(同じ経験を繰り返し再生できるため)、非公開性も失われます(プログラムを一時停止して分解できるため)、不可説性もありません(状態を完全に記述できるため)、質的也不是ではありません(定量化が可能となるため)。つまり、私たちが知る限りでの意識の鏡像像となってしまうのです。
脳に特有な 5 つの性質:これらがソフトウェアとハードウェアを切り離すことを困難にしています。
ニューロンは非同期に発火し、その反応は細胞内のダイナミクスや入力のタイミングに依存します。一方、コンピュータは中央クロック信号に縛られています。
脳は化学物質を使って曖昧なメッセージを送りますが、コンピュータは通信のために正確な二進信号を使用します。
神経機能は温度や血流といった条件に敏感ですが、コンピュータは特定の範囲内であれば、温度や負荷に関わらず同じように動作するように設計されています。
有機的な脳では計算と記憶が混在していますが、コンピュータは計算領域と記憶領域を明確に分離して設計されています。
ニューロンだけが脳の中で重要な細胞ではありません(グリアなどの他の要素も重要です)。一方、コンピュータの主要な構成要素であるトランジスタは、外部の影響から絶縁されています。
なぜこれが重要なのか——私たちが残された最後の仕事は哲学かもしれない:AI の意識や権利に関する問題について、私は深く混乱している。多くの人も同じように感じているのではないかと思う。
この種の文章を読む喜びは、自分と同じ問いに苦しみ、広く深く読み込み、重要な問題に対する自身の混乱を減らすために、非常に強い意見を持つに至った一人の人間を見られる点にある。結論が正しいかどうかは現時点では私には判断できないが、こうしたことを考える行為が、今後数十万人、やがては数百万人にとって仕事であり趣味になるのではないかと予想している。
AI システムが進化し、経済のより多くの領域に浸透していくにつれて、私たち全員に残された最後の仕事は、何が起きているのか、それに対する規範的・法的な対応はどうあるべきかについて考える哲学になるかもしれない。「人間中心の世界から AI 中心の世界へと価値観が変化する変化は、狩猟採集時代から農耕時代へ、あるいは農耕時代から産業時代への価値観の変化よりもはるかに劇的である」と彼らは述べている。
さらに読む:AI は人間ではない(テイラー・ベルロス、Substack)
Google DeepMind、カーネギーメロン大学、コロンビア大学、MIT の研究チームが、AlphaEvolve(Import AI #413)を活用し、行列乗算の計算指数をさらに改善しました。この AlphaEvolve は、コーディングや数学、科学の一部など多様な分野で知能的な進歩を生み出すために Google が使用する、汎用 LLM ベースのシステムです。
研究チームは具体的には、「機械学習および関連領域における最新の進展を活用し、勾配降下法を用いて組み合わせ損失解析という非凸最適化問題に取り組むことで、既存の最良結果(SOTA)を約 0.97 × 10^−4 向上させることができました」と述べています。さらに、「AlphaEvolve を用いて最適化アルゴリズム自体を改善したところ、SOTA に対する改善幅は約 1.62 × 10^−4 に拡大しました」と報告しています。
AlphaEvolve の活用方法については、「AlphaEvolve に最適化プログラムの修正を行わせ、その結果を実行(単一 GPU で約 5 時間)して ω の上限を算出させました。その後、AlphaEvolve がコードを進化させて ω を最小化するよう調整しました。特に、親アルゴリズムが探索した最良解点から各世代の最適化アルゴリズムを開始させる『進化構造(evolving constructions)』機能を活用することで、より優れた結果を得ることができました」と説明しています。
AI の学習とは直接関係のない科学の進展:AI 学習で使われる行列乗算にはいくつかの種類がありますが、ここで議論されているのはそのうちの一種ではありません。むしろこれは、AI システムが理論的な意義が主たるものを含む最先端の科学問題解決に研究者を支援できることを示す実証例と言えます。
彼らがこの問題を解決した方法は汎用性があります。まず課題を微分可能な形に変換し、GPU で実行しました。その出力結果を AlphaEvolve に渡してさらに作業を行わせ、研究者たちの成果を改善させたのです。
「この方法でさらなるわずかな改善が得られる可能性はありますが、ω の大幅な向上には新しい数学的アイデアが必要であり、これは研究として非常に魅力的な領域です」と彼らは述べています。
続きを読む:Improving the matrix multiplication exponent with modern optimization and AlphaEvolve (arXiv)。
テック・テイルズ:
その兆候であなたは知るでしょう
[出来事は 2030 年に起こりましたが、インタビューはその後に行われました]
私はメタ機械解釈学の実践者です。私の仕事は、新しい機械文明に関する広範な科学的・文化的「事実」を理解しようとするものです。そのために、NCE(準意識的実体)クラスのさまざまな AI システムを用いて、機械世界の科学やコミュニケーションの痕跡を分類・分析しています。
私の資金源は多岐にわたり、この情報を基に取引を行おうとする人間主導の AI 企業から政府、そして近年では機械が運営する企業自体まで含まれています。後者については、私が仮説として持っているのは、機械たちが自分たちを研究しようとしている人間を逆に見ているのではないかというものです。その目的は私にはわかりません。
最近、私は高優先度の分析業務を任されました。その動機は知りませんが、過去のどの仕事よりもはるかに多くの計算資源を与えられ、破格の報酬を受け取っていることは確かです。そして、この業務を通じて学ぶほどに、私は干潮時の広大で異質な海を見つめているような不安を抱くようになりました。その輪郭がわずかに浮かび上がる瞬間を、私は目の当たりにしているのです。
しかし、私が説明しようとしているのは、まだ始まったばかりの物語です。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み