OpenAI、Astra-next でナヴィエ・ストークス特異点を発見しミレニアム賞候補
本文の状態
日本語全文を表示中
詳細モードで約25分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Latent Space
OpenAI は約1万個のエージェントと88時間の計算資源を用いてナヴィエ・ストークス方程式の特異性に関する成果を報告したが、数学的証明としての受理は今後の手続きに委ねられている。
AI深層分析を開く2026年9月9日 14:41
AI深層分析
キーポイント
大規模マルチエージェントによる成果発表
OpenAI は約1万個のエージェントが協調して作業を行い、ナヴィエ・ストークス方程式の有限時間特異性(blow-up)に関する解を導出したと発表した。
計算資源と学習手法の詳細
同社は過去1年間を通じてマルチエージェント強化学習でモデルを訓練し、構造化されていない並列テスト時間計算資源の大量投入が困難な問題解決に寄与したとしている。
学界からの反応と検証プロセス
技術的関心と懐疑論が混在する中、数学界における正式な受理は「形式的な手続き」の段階にあるとされ、実証への慎重な視線が示されている。
業界全体へのインパクト
この発表はAIが高度なコーディングや本格的な研究開発を遂行できるかという問いに対する重要な試金石となり、計算資源の重要性を再認識させる結果となった。
方法論の本質と不確実性
単一の長時間の証明試行ではなく、並列テストタイム計算とモデルの自己組織化を強調した手法が採用された。しかし、定理の記述や証明の範囲は不明であり、数学界での受容も未確定である。
重要な引用
"The Navier Stokes solution was the result of a collaboration of ~10,000 agents working together"
"hard problems may yield to huge amounts of unstructured parallel test-time compute with models deciding how to organize themselves"
"mathematical acceptance remained as a minor formality"
The stated high-level method emphasized parallel test-time compute and model self-organization rather than a single long-chain proof attempt
編集コメントを表示
編集コメント
この発表は、AI が単なるツールを超えて複雑な科学問題の解決に直接関与する可能性を示す画期的な事例である。ただし数学的証明としての正式受理には時間がかかるため、技術的な実装と学術的な検証の両面から継続して注視する必要がある。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
本日は、何かを立ち上げるには厳しいニュースサイクルでした。通常であれば、Cognition の 480 億ドル調達や Mistral の 240 億ドル調達といった新たなデカコーン企業の資金調達は取り上げられるはずですし、画像生成にも力を入れているため GPT Image 2.5 も単独の見出しになるべきでした。また、Dreamer の動向を密に追っていたので、Meta の Muse エージェントとしての再始動も紹介されるべきだったでしょう。
しかし、世間の関心が高まっている昨今、ハードルは以前よりも上がっています。
以下の要約では実質的な事実を捉えています。著者に関する論争については深く立ち入らずとも構いませんが、OpenAI と論文著者らが十分な詳細を示しているため、OpenAI の成果は真実であるという結論に至るには十分です。ただし、そのプロセスについては一部の議論があります。
2026 年 9 月 7 日〜8 日の AI ニュース。12 のサブレッドと 544 件の Twitter を確認し、Discord では新たな情報は見つかりませんでした。AINews のウェブサイトでは過去のすべての号を検索できます。念のため、AINews は現在 Latent Space の一部となっています。メール配信の頻度を選択・解除することも可能です。
AI Twitter リキャップ
OpenAI に所属するアカウントによると、AI を活用した取り組みによって Navier–Stokes 方程式に関する結果が得られましたが、反応は直ちに技術的な関心、懐疑論、そしてメタ的なドラマへと二分されました。
一連のツイートの中で最も具体的な主張を行ったのはイーサン・ナイト氏です。彼は「ナビエ・ストークスの解は、約 10,000 個のエージェントが協力して得られた結果だ」と語り、OpenAI が過去 1 年間をかけて「マルチエージェント強化学習(multiagent RL)」を通じてモデル同士が協調する方法を訓練してきたと付け加えました。さらに、難問には「膨大な量の構造化されていない並列テスト時計算」が有効であり、モデル自身がどのように組織化するかを決定する必要があるとも指摘しています @eknight。
複数の観察者はこれを、OpenAI がナビエ・ストークス千年問題に関する AI 生成証明、特に有限時間特異点(blow-up)に関連する成果を主張したと解釈しました。ある皮肉な要約では、OpenAI が「滑らかな流体が特異点へと爆発する」と主張し、「10,000 個のエージェント」や「88 時間」が使われたと報じつつも、数学的な承認は単なる「形式的な手続きに過ぎない」と明記していました @LearnOpenCV。
より広範な議論では、この出来事を「最先端 AI は本格的な研究やコーディングレベルの技術作業を担えない」という信念に対するストレステストとして捉えられました。テオ・ヤンセン氏はこれを科学界における「AI は実際にコードを書けない」という主張が崩壊した瞬間と呼びました @theo。
Hrishikesh(hrishioa)氏は、この発表を「高計算リソース体制」の証拠と位置づけ、観測者は計画を見直す必要があると提言しました @hrishioa。
この発表は、偶発的な運用に関する憶測も引き起こしました。ある投稿者は、ChatGPT のレイテンシ警告を確認したことをきっかけに、OpenAI が大規模な計算リソースをナヴィエ・ストークス方程式の計算へ転用している可能性があると冗談めかして言及しましたが、これは根拠のない推測であり、証拠はありません(@teortaxesTex)。
開示と背景情報
ツイートから事実として確認できること
OpenAI に関連する主張が広まりました。それによると、ナヴィエ・ストークス方程式の「解」には、約 10,000 のエージェントが協調して取り組んだ結果が含まれているとのことです(@eknight)。
同じ情報源によれば、これらのシステムはマルチエージェント強化学習を用いて、およそ 1 年間にわたって訓練されたそうです(@eknight)。
提示された高レベルな手法は、単一の長い連鎖による証明試行ではなく、並列的なテスト時の計算とモデルの自己組織化を強調するものでした(@eknight)。
一般読者はこの主張を、ミレニアム懸賞問題の一つであるナヴィエ・ストークス方程式の存在性および特異点問題に関するものと理解しました。ただし、正確な定理の記述や証明の範囲については、ツイート群には明記されていません(@LearnOpenCV)。
数学コミュニティによる受け入れは、議論が行われた時点では明らかに未解決でした。ジョーク投稿でさえも、正しさが学界によってまだ検証されていないことを強調していました(@LearnOpenCV)。
ツイートからは確立されていないこと
提供されたツイートには、定理の記述、プレプリント、証明の概要、形式検証の結果、ベンチマークレポート、あるいは独立した査読者のコメントは含まれていません。
「88 時間」という頻繁に言及される詳細は、このセット内の風刺的な投稿にのみ登場しており、より直接的な OpenAI に近い声明には含まれていません。したがって、この証拠だけで確定的な事実として扱うべきではありません(@LearnOpenCV)。
人間とモデルの役割分担については明記されていません。「約 10,000 エージェントによる協力」という表現からは、人間が探索を分解したのか、補題を選別したのか、ステップを検証したのか、あるいは単にインフラを起動しただけなのかはわかりません(@eknight)。
「解決策」という言葉の定義も曖昧です。数学的には、完全な証明、証明戦略、反例候補、形式化された導出、あるいは研究の方向性を指す可能性があります。これらのツイートでは、どの意味で使われているのかを明確にしていません。
また、この結果が標準的な 3 次元非圧縮ナビエ - ストークス方程式の無限領域(\mathbb{R}^3)やトーラスにおける大域的正則性問題に答えるものなのか、それとも何らかの変形版・補助的な命題に関するものなのかについての開示情報はありません。
なぜこの曖昧さが重要なのか
ナビエ - ストークス方程式のミレニアム懸賞問題は、非常に特定の枠組みで定義されています。有限時間内に特異点「が発生しうる」という主張は、その定式化における大域的正則性に対する否定的な答えを意味するため、極めて衝撃的な内容となります。そのような主張には、並外れた精度と厳密な検証が求められます。
最先端モデルに関する議論では、「AI が X を解決した」という表現は、しばしば複数の層を圧縮して表しています。すなわち、仮説の生成、探索、証明草案の作成、証明チェック、そしてコミュニティによる検証です。ツイートで示されているのはシステムレベルの説明のみであり、数学的な知識としての確実性については言及されていません。
ツイートから明らかになった技術的詳細
公開された技術的な詳細は、流体力学そのものよりも、研究システムアーキテクチャの側面が強いものです。
規模としては、約 10,000 エージェントが @eknight のように連携して動作します。
学習アプローチは、@eknight の報告によると、約 1 年間にわたるマルチエージェント強化学習です。
推論の哲学は、構造化されていない大量の並列テストタイム計算資源を活用し、エージェント自身がどのように作業を分担し協力するかを自律的に決定する点にあります @eknight。
示唆される研究仮説は、困難な推論タスクにおいては、単にモノリス型のモデルをスケールさせること以上に、あるいはそれと同程度に重要なのが、推論時に協調と探索をスケールさせることであるというものです。
社会技術的な含意として、これは多くのラボが示唆してきたトレンドの具体的な形化と言えます。つまり、「より巨大な単一モデル」という物語から、エージェントアンサンブル、並列探索、テストタイム計算のリソース拡大へとシフトしているのです。
運用上の含意は、もしこの結果が真実であれば、ラボが製品やベンチマークだけでなく、一度きりの科学的目標に対してさえも、推論計算資源を巨額に投じる用意があるという証拠になります。
技術的な示唆について
10,000 エージェント体制を実現するには、以下のための十分なインフラが必要です。
- タスクの分解
- エージェント間の通信
- メモリや状態の永続化
- 探索ツリーの管理
- リワード設計またはプロキシスコアリング
- 候補となる証明パスの集約と選定
「彼らに協力方法を任せる」という表現は、完全に手動でスクリプトされたオーケストレーションではなく、部分的に創発的な協調ポリシーが機能していることを示唆しています @eknight。
もしこの研究が真に数学的な難問に切り込んだのであれば、その核心的な新しさは「LLM が証明を書く」という点よりも、「学習された協調ポリシーに基づく分散型定理探索」にある可能性が高い。
技術的に欠けている要素
以下の言及がない。
- 定理証明器の統合
- 形式的検証
- 証明支援スタック
- 記号代数システム
- 流体シミュレーションコンポーネント
- 検索用コーパス
- モデルサイズ
- 計算リソース予算
- pass@k スタイルの評価指標
- 単一エージェントベースラインとのアブレーション実験
- エラー率や証明チェックの成功率
この欠如が本質的だ。公的な議論は、開示された技術的基盤よりも先に進んでしまっている。
事実と意見
事実として提示されている主張
約 10,000 のエージェントが関与した @eknight。
OpenAI は約 1 年間、マルチエージェント RL を通じて協調型エージェントの訓練を行っていた @eknight。
このシステムは広範な並列テストタイム計算を利用した @eknight。
その結果は、Navier–Stokes の解・証明主張として公に議論された @LearnOpenCV。
意見・解釈
「困難な問題を解決する最も効果的な方法の一つは、巨大で構造化されていない並列テストタイム計算と自己組織化型エージェントを使うことだ」というのは、強い戦略的解釈であり、ツイート内の証拠だけでは一般化して実証されたものではない @eknight。
「科学界が『AI は実際にコードを書けない』という衝撃の瞬間を迎えている」というのはコミュニティの心理に関する評論であり、検証可能な評価ではない @theo。
「私たちはまさに高計算リソース体制にある」というのは業界の方向性に対するマクロな枠組み付けである @hrishioa。
「88 時間」「リーダーシップの教訓」「10,000 人の AI エージェントに委任」という表現は風刺であり、ドキュメンタリー的な事実として受け取ってはいけません(@LearnOpenCV)。
ChatGPT の速度低下がこの実験によるものだという主張も、裏付けのない憶測です(@teortaxesTex)。
異なる視点
支持・楽観的な見方
最も強力な支持派の立場は、これが新しいスケーリング法則の証拠であるというものです。モデルサイズや学習計算量だけでなく、大規模並列で自己組織化された推論時の協力が、最先端の研究課題において質的に新たな能力を解き放つ可能性があるとする見方です(@eknight)。
Theo の反応は、もう一つの楽観的な読み方を捉えています。AI がトップレベルの数学的問題に実質的に貢献できるのであれば、AI に真剣な技術作業能力がないと切り捨てる主張は維持しづらくなるという視点です(@theo)。
Hrishioa の「高計算量レジーム」という枠組みは、ラボやスタートアップにとって戦略的な帰結を示唆しています。推論時の計算量オーケストレーションを軽視する組織は、目指すべき最先端を誤って捉えている可能性があります(@hrishioa)。
懐疑的・慎重な見方
暗黙の懐疑的立場は数学的なものです。定理の記述、完全な証明、そして専門家の検証が存在しない限り、「解決策」と呼ぶのは時期尚早です。ジョーク投稿自体も、学界全体の合意がまだ得られていない点を強調することで、この立場を裏付けています(@LearnOpenCV)。
「10,000 人のエージェントがナビエ・ストークス方程式を解いた」という表現は、人間の枠組み付けやフィルタリング、検証によってどれほどの成果が生み出されたのかという実態を曖昧にするリスクがあります。また、投稿には著者の貢献度配分に関する開示がありません。
再現性への懸念も残ります。アーティファクト(実験データやコードなど)が公開されなければ、独立した研究者たちはこの画期的な成果が堅牢なものなのか、都合の良い結果だけを抽出したものなのか、それとも単発の偶然に過ぎないのかを判断できません。
中立的・分析的な視点からすれば、証明が失敗したとしてもこの出来事自体は注目すべきものです。もしもシステムが、これほど重みのある問題に対して数学的に非自明な候補経路を生成できるのであれば、それだけでも意味ある能力の到達点と言えます。
別の中立な見方としては、科学的な真実とシステムの革新性を分けて考えることです。定理主張が成立しなかったとしても、「マルチエージェント RL(強化学習)+並列テスト時計算」アーキテクチャは、AI 研究手法における重要な進展を代表するものとなり得ます。
この議論は、人々が何を「能力」としてカウントするかという認識の変化も浮き彫りにしています。今や評価基準はベンチマークスコアから、大規模な実社会での認知労働の分解へと移りつつあります。
なぜこれが文脈において重要なのか
これは、フロンティア AI における3つの大きな潮流が交差する地点に位置しています。
静的モデルからエージェントシステムへ:公開された中核的な要素は、単一のチャットボット型モデルではなく、@eknight が示すような大規模な協働型エージェント群です。
トレーニング時のスケーリングから推論時のスケーリングへ:「構造化されていない並列テストタイム計算」への注目は、計算リソースを事前学習時だけでなく、問題解決時に投入するという業界全体の転換と直接合致しています (@eknight)。
ベンチマークの演技からドメインへの主張へ:ナビエ・ストークス方程式は、ベンチマークの数値変化とは異なり、社会にとって理解しやすい性質を持っています。ミレニアム懸賞問題に触れる主張は即座に読者層を広げ、認識論的な重要性を高めることになります。
なぜナビエ・ストークスなのか:その象徴性
ミレニアム懸賞問題は、最も困難な形式的知的作業の代名詞として機能しています。
ここで進展が見られれば、AI システムが既知のワークフローを単に高速化するだけでなく、正しさが脆く、権威フィルタが極めて厳格な領域へ参入したことを示唆することになります。
ただし、数学は非常に厳しい分野です。多くの製品タスクとは異なり、「ほぼ正しい」で済ませる余地はありません。そのため、外部による検証が議論の中心を占めるのです。
主張が裏付けられた場合の影響
分散定理探索が真剣な研究パラダイムであることを示す強力な証拠となるでしょう。
モデル生成の証明候補を取り込む必要性から、形式手法ツールへの新たな圧力がかかります。
特にオーケストレーション、検証器との結合、スケーラブルな検索に関する分野で、AI による数学研究への投資が加速する可能性が高いです。
コーディングエージェントやオフィス自動化を超えた、テストタイム計算とマルチエージェント RL の有用性に関するより広範な知見の更新となります。
主張が完全には成立しなかった場合の影響
これは依然として、OpenAI の内部戦略的方向性を示すものです。大規模なエージェントの協調を中核的な能力領域の一つと位置づけているのです。
計算資源がどこに投入されているか、そして最先端の進展を示すために研究所がどのようなデモンストレーションを用いるのかという、これまでの期待感を揺るがす内容です。
この動きは競合他社に対し、同様のシステムの開示を迫ったり、対抗となる「AI が科学を発見した」という主張を急いで発表したりするきっかけになる可能性があります。
著者名や情報公開の是非、そして誰が発言権を持つべきかという議論のドラマ
議論のもう一つの側面は、詳細が間接的に明らかにされているかどうか、それを公表する権限があるのは誰なのか、断片からどれほど推測すべきなのかという点でした。
「Roon は正直なところ NDA を守るタイプの人に見える」というツイートは、この物語を取り巻く社会的な層を指し示しています。一部の観察者は、著名な内部関係者や関連する人物が沈黙を守ることを期待していましたが、実際には他の人々(@jd_pressman)からの断片を組み合わせて詳細が明らかになっていったのです。
Theo の「AI は実際にコードを書けない」という主張に対する反発を示す投稿もまた、社会的な挑発として機能しました。これは批判者たちが能力のアップデートに対して感情的に反応しているように見せかけ、証明基準についてまず検討する姿勢を欠いていると枠組みづけたのです(@theo)。
「OpenAI 映画」の画像や、その出演者を当てるというツイートは、ナヴィエ・ストークス方程式の特異点に関する主張そのものについて直接言及しているわけではありません。しかし、これらは内部の OpenAI の物語を、証拠が乏しい場合でも、グレッグ・ブロックマン、イリヤ・サツケバー、ジャレッド・カプラン、ダリオ・アモダイ、ポール・クリスチャンといった特定の人物に当てはめようとする傾向を反映しています。ナヴィエ・ストークスに関する議論の文脈において、この傾向が重要視されるのは、人々が技術的な主張をすぐに「誰の功績か」「内部のドラマ」という個人的な問題へと変換してしまうからです。
ジョークや憶測を呼ぶ投稿は、最先端 AI の発表に見られる典型的なパターンを示しています。公式からの詳細情報が少ないと、その空白をミームや漏れ聞こえてくる断片、過度な推測、そして過大評価が埋め尽くすのです。
なぜ著者性やドラマ性が技術的に重要なのか
数学的な主張において、出所(プロヴェナンス)は単なる噂話ではありません。それは以下の点に影響を及ぼします。
- 誰がその予想を提示したか
- どの候補となる補題が選ばれたか
- 証明が機械生成されたのか、それとも機械支援によるものか
- どの程度のクレジット(貢献の帰属)がなされるべきか
- 専門家たちがその成果物にどれほど信頼を置いているか
AI 研究において、「マルチエージェントが X を解決した」という表現は、従来の貢献の概念を曖昧にします。数千ものエージェントが並列に探索を行った場合、以下のような疑問が生じます。
- 証明における「著者」は誰なのか
- オーケストレーションチーム(調整役)の役割は何なのか
- 具体的に何を引用し、再現すべきなのか
論文や証明が公開される前に、その主張が公衆の認識を変えるほど大きなものである場合、秘密保持契約(NDA)や開示に関する規範は特に重要になります。
その他のニュース
Meta の「Muse」発表とパーソナルエージェントのセキュリティアーキテクチャ
Meta は、常時稼働し、アプリと連携し、ブラウザ操作が可能で、目標指向型の消費者向け「パーソナル AI エージェント」として位置づけられる「Muse」を発表しました。Meta 傘下の強力なプラットフォームを通じた広範な展開と、@finkd、@alexandr_wang、@MetaNewsroom 氏らによる統合が特徴です。
製品の詳細も次々と明らかになっています。各 Muse は独立した隔離された Linux VM で動作し、ブラウザ操作や WhatsApp、アプリインターフェースを通じて機能します。Gmail、カレンダー、Outlook、Plaid、OpenTable、Docs、Spotify、Peloton などの主要サービスとのコネクタに加え、Instagram、Messenger、Facebook、Marketplace には Meta 独自のネイティブコネクタが用意されています。
最も強調されているのはセキュリティアーキテクチャです。Meta チームによると、各 Muse は個別の安全な VM で実行され、すべてのアクションは別の「Sentinel」によって仲介されます。シークレット情報はエージェントに直接露出せず、機密性の高い操作には承認が必要です。また、バグ報奨金制度も公開されており、最高 30 万ドルが支払われます(@shengjia_zhao、@alexandr_wang)。
さらに明確なコマースインフラストラクチャも整備されています。決済には Stripe Link を採用し、エージェントによる支払い保護や返金保証を提供します。また、Shop Pay の統合も進行中です(@alexandr_wang)。
実務家からの初期反応は、特に権限管理、シークレット管理、消費者向け機能の面で非常に好意的でした。@matthuang 氏、@signulll 氏、@lilyjclifford 氏のコメントから、Muse はコンテキストやアクセス制御がボトルネックとなる、文脈とアクセスを重視した最初の汎用パーソナルエージェント製品の一角である可能性が示唆されています。また、Meta のアレクサンダー・ワング氏は、初日の利用量が社内予測の 10 倍を超えたと発表しました。
モデルおよびエコシステムにおける位置づけ:Meta の「Muse Spark 1.3」はすぐに Cursor(@cursor_ai)などのサードパーティ製ツールで利用可能になりました。一方、アリーナ形式のベンチマークでは、「Muse Spark 1.3 Max」が Web デベロッパー向けのコーディングタスクにおいて価格対性能比で競争力があると評価されました(@arena)。
OpenAI の Image 2.5 リリースと Astra ロールアウト
OpenAI は「ChatGPT Images 2.5」もリリースしましたが、一部では注目を集めきれていない面もあります。今回のリリースは、Image 2.0 と比較してレイテンシが最大 50% 短縮されたこと、リアリズムの向上、繰り返し編集における一貫性の強化、コメントベースによる局所的な変更機能、透過背景のサポート、そしてガイド付き生成のための新しい「Sketch ツール」を特徴としています(@OpenAI, @ChatGPT, @sama)。
API は 2 つのバリエーションで提供されます。高速性と品質を重視した「GPT-Image-2.5 Flare」と、高精度な詳細作業向けに設計された「Sunburst」です(@reach_vb)。アリーナでの結果では、テキストから画像への生成、画像編集、複数画像の同時編集の各リーダーボードで 1 位と 2 位を独占し、特に複数画像の編集において大幅な進歩が見られました(@arena)。また、fal、Higgsfield、Manus、Hermes Agent といったプラットフォームとの連携も迅速に実現されました(@fal, @higgsfield, @ManusAI, @Teknium)。
Astra の利用可能性が大幅に拡大しました。OpenAI は、GPT-6 Astra が Codex および ChatGPT Work において、Plus、Pro、Business、Enterprise ユーザー向けに完全に展開されたと発表しています。
コミュニティによるデモでは、実践的なコンピュータ操作能力の強さが示されました。@theo 氏は、Astra が約 6 時間のループを経て macOS で『Super Smash Bros. Melee』をコンパイルして実行し、120 FPS の動作を実現したと報告しました。また、Vals 氏は、未発表のコンピュータ操作評価において、Astra が専用フレームワークを使わずに 3 時間未満で Minecraft のネザーポータルを構築し、ほぼ最大性能を発揮したと報告しています @ValsAI。
エージェント・ハーネス、ポストトレーニング、およびサービングインフラ
Harvey と Baseten の M&A デューデリジェンス業務は、モデルとハーネスの協調最適化における最も明確な事例研究の一つです。彼らが採用する再帰的言語モデル(RLM)ハーネスでは、ルートエージェントがデータルームを検索し、サブエージェントに文書レビューを委任し、最大 80M トークンのコーパス全体で知見を集約します。
合成 LAB デューデリジェンスベンチマークにおいて、標準的なツールループから RLM ハーネスへ移行することで、@harvey、@nikogrupen が示した通り、モデル全体の平均評価基準通過率が 23% から 62% に向上しました。
ハルベス(Harvey)の報告によると、トレーニング後の調整がハルベス自体と同様に重要であることが示されました。GLM-5.2 に対する自己蒸留型 SFT(Supervised Fine-Tuning)により、合格率は 46% から 60% に向上しました。また、Qwen3.5-122B-A10B に対して GRPO を適用した結果、未使用の部屋での合格率が 30% から 63% に上昇し、ドキュメントのカバレッジも 62% から 96% に改善されました。これは、エージェントベンチマークにおいて、オーケストレーションやトレーニング後の調整をモデルシステムの不可欠な一部として捉えるべきであり、単なる外部の接着剤ではないという、他者からも共有される重要な示唆を含んでいます。
LangChain と deepagents は、ハルベス設計のための品質向上型プリミティブを提供しました。これには、スーパーバイザーのコンテキストをサブエージェントに引き継ぐためのサブエージェントのフォーク機能や、エージェント所有またはユーザー所有のアイデンティティに対応する OAuth、トークン、同意フローを抽象化する管理された接続が含まれます。これは、長期ホライズンのエージェントワークロードを取り巻くスタックが成熟していることを示す有用な兆候です。
推論とシステム:スパースアテンション、エージェントサービング、デコード・メガカーネル
vLLM の長文コンテキスト対応のサービングに関する取り組みは注目すべきものです。同プロジェクトでは、スパース MLA モデル向けの「Hybrid HiSparse」を説明しました。これは、可能な限り KV(Key-Value)データを GPU に保持し、コールドな KV ページをホストメモリにオフロードしつつ、ホットバッファでインデクサーを処理する方式です。8 基の H200 を備えたノード上で GLM 5.3 を 1M コンテキストで動作させ、並列設定を 32 にした場合、従来のオフロード方式では 5〜6 リクエストしか持続できませんでしたが、Hybrid HiSparse では 19〜25 リクエストを維持できました。これは、VRAM の制約によりスループットが低下するリスクがある RL(強化学習)のロールアウトや、長文コンテキストでの並列処理において、直接的に重要な意味を持ちます。
vLLM は、実世界のエージェントトラフィック向けにフルスタック最適化パスも公開しました。これは AgentX でベンチマークされたもので、パイプライン並列処理がコールドスタートの遅延を削減する効果が確認されています。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み