Fugu-Ultra v1.1、コーディング・推論性能向上
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
Sakana AI は、Gemini 2.5 Pro や o4-mini などの複数の最先端モデルを協働させる推論時スケーリングアルゴリズム「AB-MCTS」を発表し、ARC-AGI-2 ベンチマークで単一モデルを大幅に上回る性能を示した。
AI深層分析を開く2026年7月27日 02:07
AI深層分析
キーポイント
AB-MCTS アルゴリズムの発表
Sakana AI は、複数の最先端モデルが協力して試行錯誤を行う「Adaptive Branching Monte Carlo Tree Search (AB-MCTS)」という推論時スケーリングアルゴリズムを公開した。
複数モデルの協働による性能向上
o4-mini、Gemini-2.5-Pro、DeepSeek-R1-0528 の 3 つのモデルを組み合わせた AB-MCTS は、ARC-AGI-2 ベンチマークにおいて個々のモデルを大幅に上回る結果を出した。
進化と集合知へのアプローチ
同社は、既存の強力な AI を混合して「作る」のではなく、「使う」ことに焦点を移し、人間の集合知のように多様なモデルが協力することで複雑な課題を解決する未来を目指している。
オープンソースの実装公開
Sakana AI は AB-MCTS の実装コードと ARC-AGI-2 実験データを GitHub でオープンソース化し、コミュニティでの検証や利用を促している。
AB-MCTSの実装をオープンソース化
SakanaAIはAB-MCTSのコードを実装し、GitHub上で公開した。
重要な引用
Our new inference-time scaling algorithm enables collective intelligence for AI by allowing multiple frontier models to cooperate.
AB-MCTS combining o4-mini + Gemini-2.5-Pro + R1-0528, current frontier AI models, significantly outperforming individual models by a substantial margin.
We believe this work represents a step toward a future where AI systems collaboratively tackle complex challenges, much like a team of human experts.
Many ARC-AGI-2 examples that were unsolvable by any single LLM were solved by combining multiple LLMs.
編集コメントを表示
編集コメント
Sakana AI が提案する「ミックス・トゥ・ユース」の概念は、単なるモデルの並列化を超え、各モデルの特性を補完し合うことで新たな知能を生み出すアプローチとして注目される。特に ARC-AGI-2 での大幅な性能向上は、複雑な推論タスクにおけるマルチモデル協働の実用性を示唆する重要な一歩である。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
AB-MCTS の発表です!
この新しい推論時のスケーリングアルゴリズムは、Gemini 2.5 Pro や o4-mini、DeepSeek-R1-0528 といった複数の最先端モデルが連携することで、AI における集合知を実現します。
ブログ: sakana.ai/ab-mcts
人類の集合知が、多様な思考を持つ人々の協働によって最大の成果を生み出すように、AI にも同じ原理が適用できると考えています。ChatGPT、Gemini、DeepSeek といった個々の最先端モデルは非常に高度ですが、それぞれ学習データに由来する独自の強みやバイアスを持っています。これらは集合知による問題解決において貴重なリソースと捉えています。
AB-MCTS(Adaptive Branching Monte Carlo Tree Search)は、こうした各モデルの個性を活用し、複数のモデルが協力して効果的な試行錯誤を行うことで、単一の AI には難しい課題を解決します。ARC-AGI-2 ベンチマークでの初期結果は有望で、o4-mini、Gemini-2.5-Pro、R1-0528 という現在の最先端モデルを組み合わせた AB-MCTS は、個々のモデルを大幅に上回る性能を示しました。
本研究は、2024 年に発表した進化的モデル統合に関する知見を踏襲しつつ、「混ぜて新しいものを作る」アプローチから、「既存の強力な AI を混ぜて活用する」アプローチへと焦点をシフトしました。Sakana AI では引き続き、進化や集合知といった自然に着想を得た原理を応用し、革新的な AI システムの開拓に取り組んでいきます。本成果は、AI システムが人間の専門家チームのように協力して複雑な課題に取り組み、新たな問題解決能力を開花させ、単一モデルの限界を超えていく未来への一歩だと考えています。
アルゴリズム(TreeQuest): github.com/SakanaAI/treeq…
ARC-AGI 実験: github.com/SakanaAI/ab-mc…
o4-mini、Gemini-2.5-Pro、R1-0528 という現在の最先端 AI モデルを AB-MCTS で組み合わせることで、ARC-AGI-2 ベンチマークにおいて強力なパフォーマンスを発揮し、単独モデルと比較して大幅に上回る結果となりました。
AB-MCTS の実装コードをオープンソース化しました:
LLM 1 つでは解決できなかった ARC-AGI-2 の多くの例題も、複数の LLM を組み合わせることで解決できました。あるケースでは、o4-mini が最初に誤った試行を行った結果を、R1-0528 と Gemini-2.5-Pro がヒントとして活用し、正解へと導くことができました。
ARC-AGI-2 のコード: github.com/SakanaAI/ab-mc…
AI算出
主要ニュースainew評価高い
AI モデルの主要な能力強化(コーディング、エージェント、推論)と価格据え置きという明確な新事実が含まれており、新規性が高い。ただし、日本固有の情報や企業事例は含まれていないため、日本の関連性は低めとする。
6つの評価軸を見る
- AI関連度
- 100
- 情報源の信頼性
- 50
- 新規性
- 75
- 調べる価値
- 75
- 重複の少なさ
- 100
- 日本での有用性
- 25
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み