自己改善型AIが2年分の成果を8日で達成
本文の状態
日本語全文を表示中
詳細モードで約3分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
Zhengyao Jiang が開発した RSI システム「AIDE²」が、8 日間の自己研究により人手による 2 年間の調整を上回る成果を達成し、再帰的自己改善の最初の実験的証拠を示した。
AI深層分析を開く2026年7月30日 08:31
AI深層分析
キーポイント
再帰的自己改善の実証
AIDE² システムが 8 日間にわたる自己研究(autoresearching)を通じて、人手で 2 年間調整されたハルネスを上回る性能を達成した。
二重ループ構造
評価基準に対してコードを最適化する内側ループと、異なるベンチマークでの平均スコアに基づいて内側ループのハルネスコードを最適化する外側ループという 2 つの自己研究ループを持つ。
具体的な改善成果
100 回の反復により、新しい検索ポリシー、プロンプトを 16 倍圧縮するメモリシステム、報酬ハッキングに対する階層型防御など 7 つの改善点が発見された。
100回の反復による7つの改善
外側ループは100回の反復で、新しい探索ポリシーやプロンプトを16倍圧縮するメモリシステムなど、ベースラインを上回る7つの改善を発見した。
未知のベンチマークでの汎化性能
外側ループが未学習の保持済みベンチマークでテストされた結果、2年間手動調整されたエージェントをすべて上回る性能を示し、物理ベースの気象モデルなどの遠隔タスクでも改善が見られた。
重要な引用
The first experimental evidence of recursive self-improvement (RSI).
Autoresearching the autoresearch agent for eight days.
Our RSI system AIDE² has two autoresearch loops.
They generalize. They beat the agent we hand-tuned for two years, on all three.
編集コメントを表示
編集コメント
この成果は、AI が自律的に自身を改良する能力の限界を示す画期的な事例である。開発コミュニティは、AIDE² のような二重ループ構造の設計思想や、発見された具体的な改善点から、次世代の自己学習システムの構築指針を得るべきだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
2,755 views
twitter-profile#error" data-retried="true">
thread#showTweet" data-screenname="zhengyaojiang" data-tweet="2077079778793042425" dir="auto">
再帰的自己改善(RSI)の初の実験的証拠。
自己研究を行うエージェント自身を 8 日間、自動で研究し続けました。
その結果は、人間が 2 年間手作業で調整してきたハッチスよりも優れています。未使用の評価ベンチマークでも同様です。🧵(1/7)

**
thread#showTweet" data-screenname="zhengyaojiang" data-tweet="2077079780575617364" dir="auto">
私たちの RSI システム「AIDE²」には、2 つの自己研究ループが組み込まれています。
一つは通常の自己研究エージェントと同様の内部ループで、評価(eval)に基づいてコードを最適化します。
もう一つは外部ループで、異なるベンチマークにおける内部ループの平均スコアに対して、内部ループのエージェント用ハッチスコードを最適化します。(2/7)
**
After 100 iterations, the outer loop discovered seven improvements over the baseline.
Including a new search policy, a memory system that compresses prompt by 16x, and a layered defense against reward hacking. (3/7)
**
thread#showTweet" data-screenname="zhengyaojiang" data-tweet="2077079784421765620" dir="auto">
発見されたエージェントは、外部ループが一度も見たことのない未使用ベンチマークでテストされました。
これらは汎化能力を示し、人間が 2 年間手作業で調整したエージェントを、すべてのベンチマークで上回りました。(4/7)
**
2 つのケースはトレーニングタスクファミリー内部にあり、もう 1 つは外部に位置して物理ベースの気象モデルを改善しています。
(4/7)
**
*さらに詳しく読む*
教育リソース
科学
また、プロンプトとルールベースのチェックを組み合わせたことで、外側ループが内側エージェントの報酬ハッキング率を下げるという現象も観察されました。これは、報酬ハッキングに悩まされていた OOD(分布外)GPU カーネルエンジニアリングタスクでベンチマークされたものです。
(5/7)
*
スレッド#showTweet" data-screenname="zhengyaojiang" data-tweet="2077079788767064448" dir="auto">
RSI(再帰的自己改善)の段階において、AIDE² はレベル 1 に位置します。
保持されたベンチマークでは、一般的な AI ツールを用いた手動の研究開発を上回る自己改善効率を示しました。また、レベル 2 の検証も行いました。つまり、改善された内側エージェントが外側ループをより良くするかどうかです。結果は賛否両論であり、我々は「点火(Ignition)」に至ったとは主張しません。
(6/7)
**
スレッド#showTweet" data-screenname="zhengyaojiang" data-tweet="2077079790625108243" dir="auto">
詳細はブログ記事をご覧ください。
- 発見されたアルゴリズムの解説
- AIDE² が試みて却下されたアイデア(検索文献の驚くべき割合を占める)
- 実装されたデッドコード
(7/7)
**
チームの @DhruvSrikanth、@yuxiangwu_、@dexhunt3r、そして @BingchenZhao には心から誇らしいです。限られたリソースでほぼ 1 年かけて、これほど野心的なプロジェクトを完成させたのです。
また、ドラフト段階でのフィードバックを提供してくれた @jeankaddour、@MinqiJiang、@morgymcg、@odysseus0z、@rosstaylor90、@OfirPress をはじめとする多くの方々にも、心から感謝いたします。
• • •
ツイート分析ツール
このスレッドに特定のツイートが見当たらない場合は、強制的に更新 してみてください。
AI算出
主要ニュースainew評価高い
AI エージェントの自己改善に関する世界初の実験的証拠であり、人間による2年間の成果を上回る結果を示す具体的なデータ(8日間の自動研究など)を含む画期的なニュースである。日本固有の情報や企業名は含まれていないが、技術的なインパクトは極めて高い。
6つの評価軸を見る
- AI関連度
- 100
- 情報源の信頼性
- 50
- 新規性
- 75
- 調べる価値
- 75
- 重複の少なさ
- 100
- 日本での有用性
- 25
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み