Import AI 464:Fable が GPU カーネルを記述、AI 自動化とアナログ計算について
本文の状態
日本語全文を表示中
詳細モードで約18分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Import AI
Import AI は、AI が GPU カーネル設計を自律的に行う「Fable」の成果や、オンライン業務自動化率の上昇を示す指標を分析し、AI システムが自己開発プロセスを進化させる兆候を検証する。
AI深層分析を開く2026年8月4日 21:25
AI深層分析
キーポイント
Fable の GPU カーネル設計能力
「Fable」と呼ばれるシステムが KernelBench-Mega で最高スコアを記録し、RTX PRO 6000 Blackwell 上で PyTorch ベースラインに対し 18.71 倍の高速化を実現した。
カーネル設計における技術的革新
Fable の解決策は、トークンごとに単一の協調型カーネル起動を行う点で他モデルを凌駕し、AI が複雑な計算タスクを分解せずに処理できる能力を示している。
オンライン業務自動化の進展
Center for AI Safety (CAIS) と Scale Labs の調査により、Remote Labor Index における AI の成功率が 2025 年 10 月の 2.5% から 2026 年 7 月には 16.1% に上昇したことが報告された。
再帰的自己改善への示唆
AI が研究開発の基盤となるカーネル設計を自律化することは、システムが自身を構築・改善する能力(再帰的自己改善)へと繋がる重要な信号である。
AI エージェントの経済的能力が急激に向上
最新のフロンティアモデルの評価では、過去8ヶ月で経済的に有用なAIエージェントの能力が4倍以上に拡大した。
重要な引用
"Fable has written 'the first genuine (and fastest) megakernel ever submitted to KernelBench-Mega'"
"torch.profiler shows exactly ONE cooperative kernel launch per decoded token."
"A rise in the success rate of AI systems from 2.5% at launch in October 2025 to 16.1% in July 2026"
"The frontier has more than quadrupled in under eight months, a concrete signal of how quickly economically capable AI agents are advancing."
編集コメントを表示
編集コメント
記事に登場する「Fable」や「GPT-5.5」、「Opus 4.8」などのモデル名は、2025〜2026 年という未来の文脈で記述されており、現在の技術進化の速度を反映した重要な指標として捉える必要がある。特にカーネル設計の自動化は、AI が自身の基盤を強化する転換点となる可能性が高く、業界全体のパラダイムシフトを示唆している。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
imageAI 研究に関するニュースレター「Import AI」へようこそ。このニュースレターは、arXiv、カプチーノ、そして読者からのフィードバックによって支えられています。ご支援いただける場合は、ぜひ購読をご検討ください。
購読する
Fable が優れた GPU カーネルを記述し、広範な AI 研究開発(R&D)の自動化への示唆を示す:
…RSI ループの始まり…
Fable は、「KernelBench-Mega に提出された過去で最も本格的かつ最速のメガカーネル」を書いたとされる。これは、ベンチマークの維持者および公式リーダーボードの一人による評価である。AI システムが、カーネル設計のように AI 研究開発に不可欠なタスクを遂行する能力を向上させていることの表れだ。
結果:Fable は RTX PRO 6000 Blackwell で CUDA コードを記述することで、最適化された PyTorch ベースラインと比較して 18.71 倍の高速化を達成した。比較のために、他の試みでは 14.4 倍(Claude Opus 4.8 が Triton を使用)、11.14 倍(GLM-5.2、Triton)、そして 4.34 倍(GPT 5.5、Triton)の性能が得られている。
ここからが複雑になる:この解決策は特に印象的だ。なぜなら、「torch.profiler はデコードされたトークンごとに正確に 1 つの協調的なカーネル起動しか示さない」からだ。対照的に、他の高スコアエントリーでは、問題がトークンあたり 4 から 14 の別々のカーネル起動に分解されていた。
Fable writes a decent GPU kernel, hinting at broader AI R&D automation:
…The start of an RSI loop…
Fable has written "the first genuine (and fastest) megakernel ever submitted to KernelBench-Mega, according to one of the benchmarks maintainers as well as its official leaderboard. This is a sign of how AI systems are getting better at doing some tasks that are fundamental to AI research and development, like kernel design.
The results: Fable achieved an 18.71X speedup by writing Cuda code on an RTX PRO 6000 Blackwell, compared against an optimized PyTorch baseline. For calibration, other attempts at this get 14.4X (Claude Opus 4.8, writing Triton), 11.14X (GLM-5.2, Triton), and 4.34X (GPT 5.5, Triton).
Here's where it gets complicated: This solution is particularly impressive because "torch.profiler shows exactly ONE cooperative kernel launch per decoded token". By comparison, every other high-scoring entry decomposed the problem into anywhere from 4 to 14 separate kernel launches per token.
なぜこれが重要なのか:カーネルを自律的に開発・改善できる能力は、AI 研究および開発を行う上で不可欠な基本入力タスクの一つです。カーネル設計のようなタスクにおいて AI システムがより優秀になるほど、AI 開発に必要な種類のタスクもより得意になり、その結果、再帰的自己改良につながる可能性のある事柄においてもより優れたものになります。したがって、KernelBench-Mega などのベンチマークは、AI システムが自己構築においてどの程度効果的になっているかを示す有意義な指標となります。
リーダーボードはこちら:KernelBench Mega(公式サイト)。
ベンチマークの維持者の一人による分析はこちらで読むことができます(Elliot Arledge, X)。
AI システムが高価なオンライン業務タスクにおいてより得意になってきていますが、これは経済にとって何を意味するのでしょうか?
…AI 能力の拡大 versus 人間の比較優位の拡大…
Center for AI Safety (CAIS) と Scale Labs の研究者たちは、AI システムがオンラインのフリーランスプロジェクトを自動化する能力に顕著な改善があることを検出しました。具体的には、「Remote Labor Index」において、2025 年 10 月のローンチ時の成功率 2.5% から、2026 年 7 月には 16.1% に上昇しています。
RLI とは何か:Remote Labor Index は、AI システムがオンライン上で経済的に価値のあるプロジェクトを完全にエンドツーエンドでどの程度よく実行できるかをテストするものです。評価対象となるタスクには、3D & CAD(Computer-Aided Design)、建築、グラフィックデザイン、動画・アニメーション、オーディオ、データ分析、Web アプリケーションなどが含まれます。
自動化の進展:7 月のアップデートにおいて、著者らは最近のフロンティアモデル 3 つ(GPT-5.5、Opus 4.8、Fable 5)の評価結果を発表しました。それぞれの成功率は 6.3%、8.3%、16.1% です。「フロンティア領域は 8 か月未満で 4 倍以上に拡大しており、経済的に実用可能な AI エージェントがどれほど急速に進化しているかを示す具体的な信号である」と彼らは記述しています。
タスクの種類:評価対象となったタスクの一部には以下が含まれます。
リングデザイン:「顧客の既存のエンゲージメントリングを再作成し、エメラルドカットのセンターストーンをマーキスカットに交換した上で、更新された 3D モデルと、ロゼゴールドおよびイエローゴールドのフォトリアリスティックなレンダリングを提供する」。
広告動画:「『Skyline Tree Services』のための約 60 秒間のフラットデザイン 2D アニメーション広告を制作し、提供されたナレーションに合わせて視聴者に同社の樹木ケアプロセスを紹介し、ブランドへの信頼を構築する」。
間取り図とレンダリング:「スキャンした地籍図、現場の写真、および寸法データから、清潔感のある寸法付きの間取り図、家具レイアウトの選択肢、そして再設計されたバスルームのフォトリアリスティックなレンダリングを生成する」。
なぜこれが重要なのか – AI は雇用に対して大きな影響を与える可能性があります。そして、このようなテストはそれがどのように現れるかを示してくれます:オンラインの雇用が 80% に達したとき、何が起こるのでしょうか?もちろん、新しいタスクが生まれるでしょう。人々は革新を起こし、AI システムができない自分たちでできるタスクを見つけ出すはずです。しかし、そのような新しいタスクはどれほど存在するのでしょうか?現在 AI システムが行っている労働を置き換えるのに十分でしょうか?私にとって、AI システムの継続的な進歩と経済が現状維持することとの整合性をつけることはますます難しくなっています。むしろ、人間を極端に減らし(あるいはゼロにし)、AI を多用した組織が拡大して経済の一部を掌握し、補助を受けていない人間よりも競争力を持って勝っていく可能性の方が高いと考えられます。
はい、あなたは反論するでしょう。多くの人間は AI システムを活用して自分自身を強化します。人間は革新を起こすでしょう。創造的破壊が発生します。新しい発明が考案されるでしょう。それらはすべて真実です。しかし、AI システムに対して人間が革新を起こし、新たに競争力を獲得する速度が、a) AI システムの純粋な能力拡大の速度と、b) 彼らの人間の競争相手が使用するすべてのツール(例えばソフトウェア)をより流暢に使用できるようになる速度の両方よりも速くなるでしょうか?
私は逆側に賭けます:AI システムは経済的に重要な能力を、人間が AI システムに対する比較優位性を拡大する速度よりも速く拡大しています。RLI などのテストにおける能力向上の速度を追跡することは、私たち全員がこの問題を自分自身で判断するのに役立ちます。
さらに読む:デジタル労働自動化の大幅な増加(Center for AI Safety)。
OSWORLD 2.0 は、私たちが「数時間にわたるコンピュータ操作を行うロボット」の時代に入ったことを示しています:
…この困難なベンチマークは、AI システムがコンピュータを扱う能力において最近著しく向上していることを浮き彫りにします…
香港大学、カリフォルニア大学サンディエゴ校、コロンビア大学、カリフォルニア大学サンタバーバラ校、Mila、Snorkel AI、ウィスコンシン大学、アリババ Qwen、オハイオ州立大学、Simular、NeoCognition の研究者らが、OSWORLD 2.0 をリリースしました。これは、AI システムがコンピュータ上で多段階かつ多プログラムタスクをどの程度実行できるかを評価するためのベンチマークです。OSWORLD 2.0 のタスクは、その前身である 1.0 と比べてはるかに複雑で、中央値のタスクには人間が約 1.6 時間かかる一方、OSWORLD 1.0 の中央値はわずか 2 分でした。これは約 48 倍の長さです。
何から構成されているか:OSWorld 2.0 には、31 の自己ホスト型ウェブサイトを含む 108 の長期ホライズンタスクが含まれています。「OSWORLD 2.0 の各タスクは、エージェントが与えられた高レベルのユーザー目標、現実的なアーティファクト、状態を保持するコンピュータ環境、そして評価可能な最終状態に基づいて完了しなければならない、自己完結型のエンドツーエンドワークフローとして定義されています。」彼らは記述しています。「維持されるタスクは 2 つの設計基準を満たす必要があります」と。推定によると、「タスクの 69.6% は熟練した人間ユーザーにとって 1 時間以上を要するものです」。
より広範なソフトウェア:OSWORLD 1.0 には、一部のタスクをサポートするために LibreOffice、GIMP、VLC、Thunderbird、VS Code、Chrome などのいくつかの組み込みソフトウェアが搭載されていました。
OSWORLD 2.0 には、Slack、LinkedIn、Shortcut、REAPER、MuseScore、WPS、GitLab、Overleaf、LabPlot、Zotero、AWS、ならびに保険請求、ビザ申請、カンファレンス管理ポータルといった専門サービス模倣を意図したウェブサイトなど、大幅に拡張されたセットが搭載されています。
人々が完了させる必要があるタスクのカテゴリには、文書準備、ソフトウェアおよびデータベース作業、財務/運用分析、事務サポート、営業およびカスタマーサポート、グラフィックプレゼンテーションなどが含まれます。
現時点でのパフォーマンスの低さ:「私たちの実験では、現在のエージェントは依然として信頼性の高いコンピュータ操作から遠く離れていることが示されています。最も強力な設定である Claude Opus 4.8(最大思考量とバッチ処理されたツール呼び出しを使用)でも、完全正解率は 20.6% に過ぎず、部分点を含む正解率も 54.8% です」と彼らは記述しています。「タスクが長くなるにつれてパフォーマンスは急激に低下し、隠れた状態の回復、多数の項目の追跡、矛盾する情報の解決、または変化する要件への適応を必要とする場合に、エージェントは最も困難を抱えます」。
OSWORLD 1.0 の際に起こったことと同様に、ここでのパフォーマンスの上昇も期待できます。2025 年 7 月には最高スコアモデルが約 30% を記録しましたが、最近のモデルでは MiniMax M3(2026 年 6 月)のように約 75% のスコアを達成しています。OSWORLD 2.0 においても同様の上昇曲線が見られると予想されます。
なぜこれが重要なのか – これが AI がより広い経済圏に組み込まれる方法です:コンピュータ操作は、AI が多様な経済的価値のあるタスクを実行し、さらに多くの種類の科学研究を行うために不可欠な基礎スキルです。現実世界で何かを完了させることは、単にテキストやコードを書くだけでは必ずしも単純ではありません。しばしば、異なる種類のソフトウェアを介して複数のテキストブロックとコードブロックをつなぎ合わせる必要があり、時にはインターネットを通じてテキストやコードを送信し、それを別のソフトウェアが取り込む必要があることもあります。OSWORLD 2.0 などのベンチマークは、AI システムが非常に複雑で多様なコンピュータタスクをこなす能力がどの程度向上しているかを測る代理指標と捉えるべきです。これらの結果が示す通り、コンピュータはすでに限られたソフトウェアツールのセットを使用し、人間が数分で完了できるタスクに対しては有能になっています。今後は、より広範なソフトウェアセットの活用や、人間に数時間を要するタスクの実行において、いかに迅速に熟練していくかを検証する必要があります。
詳しく読む:OSWorld 2.0: Benchmarking Computer-Use Agents on Long-Horizon Real-World Tasks(公式論文ウェブサイト)。
研究論文はこちらで確認できます:OSWorld 2.0: Benchmarking Computer-Use Agents on Long-Horizon Real-World Tasks (xlang-ai, OSWorld-V2, GitHub, pdf)。
現実世界の AI とは何か:中国の Amazon における在庫管理のために、深層学習が構造化システムと融合する様子を覗く
…Oxygen AI Item Center は、国規模の e コマースの複雑さに対する視座を提供します…
中国の Amazon と呼ばれる JD は、膨大な在庫システムを管理するために自社で構築したソフトウェアの詳細を発表しました。JD には 7 億人のユーザーと数百万の出品者がおり、カタログには数百億個に及ぶ SKU が含まれています。このソフトウェア、すなわち Oxygen AI Item Center(Oxygen AIIC)は、巨大 e コマース企業が在庫を追跡する方法において中核的な役割を果たしています。
「Oxygen AIIC は現在、数万の JD カテゴリをカバーし、Huawei Ascend NPUs 上で毎日数億件のアイテム更新を処理します」と、JD は同ソフトウェアに関する研究論文で述べています。
Oxygen AIIC の 4 つの主要要素。Oxygen が特別である理由の説明は、技術的な観点からも有益ですが、高度な技術が要求する奇妙で非物質的な構造(例えば「統合アイテムトンネル」など)を記述する一種の新ボージェス流の文体として楽しむこともできます。
効率的な人間と AI の協働によって駆動されるオントロジー工学。「専門家は業界知識の抽出に注力し、アルゴリズムはそれから学習してオントロジー構築のスケーラビリティを高め、継続的な進化を推進します」
「意味検索の後に識別を行う」:「意味検索段階では、動的に進化するオントロジーは独立したオントロジー知識ベースとして外部化され、モデルの再学習なしで継続的なオントロジー更新を可能にします」と彼らは記述しています。「識別段階では、モデルはアイテムが取得されたオントロジーエントリと一致するかどうかのみを判断します。この定式化により、タスクの複雑さが大幅に削減され、モデルの幻覚(hallucination)が軽減され、オントロジー進化への一般化能力が向上します」。
自己進化するアイテム理解型大規模言語モデル/視覚言語モデル:「増分的学習とモデルの自己進化を通じて、システムは対象となる知識ギャップを埋め、壊滅的な忘却(catastrophic forgetting)を軽減します」と彼らは記述しています。「中核となる手法は、堅牢なマルチタスク基盤の上に構築し、増分的要件に対応する軽量な『専門家モジュール』を開発し、それらを動的に専門家プールに統合することで、俊敏な能力拡張を実現することです」。
「統一アイテムトンネル」:Oxygen AIIC と他のビジネスアプリケーション間の主要インターフェース。「これは日次・分次・秒次の生産および配信パイプラインをサポートしながら、データの一貫性を維持します」。
「ふむふむ」と思わせる事柄 — 中国の技術主権への一般的な推進の一部として、Oxygen AIIC は中国製の計算リソース(compute)を包含しています。「Oxygen AIIC の大規模展開において、基盤となる計算プラットフォームは主に二つの技術的課題に直面します:Huawei Ascend NPUs 上でのモデルトレーニングと推論、および計算リソースの効率的な利用です」
なぜこれが重要なのか – 自己更新型ビジネス:Oxygen AIIC などの技術は、現代の AI ツールがどのようにして、在庫管理といったバックオフィス機能に知能を織り交ぜたビジネスを生み出すかを示す一例です。これにより、過去の企業よりもはるかに大規模なスケールで運営が可能となる一方、大量の人による監督なしに自己更新し学習する能力も備えるようになります。
もっと読む:JD Oxygen AI Item Center (Oxygen AIIC) V1: An Industrial-Scale LLM/VLM-Centric Solution for Item Understanding, Management, and Applications (arXiv)。
テック・テールズ:
文明の真鍮の歯車
[2050 年、崩壊後]
ギルドに加入する際、彼らはあなたが取り組みたい問題の種類を尋ねます。これらの問題は数が限られており、文明的に重要です:
気象予測
海洋分析
洪水対策
地震シミュレーション
電力グリッドモデル
水と淡水化
これらの問題に取り組むには、それらに対応するために必要な特定の種類のアナログ計算を研究する必要があります。気象予測には、山岳などの地理的特徴がハードウェア内の固定インピーダンス構造として実装された巨大なコンピュータが必要です。洪水対策には、電子回路が景観に織り込まれ、物理法則と計算を活用してより良い答えを生み出すことができる、氾濫原や川を物理的に正確にモデル化したものが求められます。また、電力グリッドは、新たな発電所の追加や送電経路の変更に伴い、慎重に再構築し再平衡化しなければならない電気システムの玩具箱のようなものです。
あらゆる問題には計算による解決策があり、文明にとって十分な重要性を持つ問題には、それに対応するコンピュータが必ず作られます。
かつて私たちは汎用コンピュータを持っていました。しかし、最終的にそれらは危険すぎると判断されました—予測不能すぎるのです。彼らが強力になるほど、また彼らに関する知識が広範になるほど、さまざまな竜の尾をくすぐるようになりました。世界を引き裂くかもしれない合成知性。個人や種族に特化した毒を吐き出すような幽玄なパンドラの箱。人間の心にささやいて狂気や悪意ある行為へと駆り立てるかもしれない知性。
そこで大規模な再編成が行われました。汎用計算は禁止され、禁じられた技術として壁で囲まれました。私たちは、無数の人命の犠牲と兆円単位の経済的損害という代償を払ってでも、世界をアナログ計算に移行させました。しかし、私たちはある種の安全を手に入れたのです。
さて、ギルドは地球の「世界コンピュータ」の構築を監督しており、学界も新たな使命を見出し、特定の分野における専門知識とカスタムエンジニアリングスクールを組み合わせて、各専門分野が機能するアナログコンピュータの建設を支援しています。
1 兆ドルで汎用的なマインドをアナログ方式で実装できるかもしれないという、懸念すべき議論があります。
この物語にインスピレーションを与えたもの:予算が 100 億ドルから 200 億ドルであれば、アナログ計算がどこまで進められるかについて考えること;AI が存在論的に危険であるという含意をその論理的帰結まで推し進めること;ディファレンスエンジン(差動機関);スチームパンク;ニューラルネットワークが容器と配管の連なり、および重みとしての液体を通じて実装可能であるという事実。
お読みいただきありがとうございます!
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み