AutoDesign: 長期ホライズン型エージェント設計の最適化フレームワーク
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
Meta は、人間の設計前提に合致しメタ・ハーネス最適化器がコードエージェントを再帰的に改善する「AutoDesign」を発表し、学術論文からポスター生成タスクで Claude Design を上回る性能を示した。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るAI深層分析を開く2026年8月14日 15:00
AI深層分析
キーポイント
メタ・ハーネス最適化による再帰的改善
既存の静的なパラダイムに代わり、ロールアウトフィードバックに基づいてコードエージェントがハルネスを再帰的に改善する AutoDesign 枠組みを導入した。
PosterBench ベンチマークでの高性能達成
5 つの分野にわたる 100 件の論文からなる PosterBench Main Track で 78.32 の最高スコアを記録し、クローズドソースの商用システム Claude Design を 7.45 ポイント上回った。
自律的な長距離ループの実現
完全自律的な長距離ループにおいて、40 分以内に 253 回のツール呼び出しと 11 回の編集ターンを実行し、3 ドル未満で会議用ポスターの平均品質を達成した。
人間評価における最上位の選好
システム盲検の人間調査において、AutoDesign は評価されたすべてのシステムの中で最も高い人間の選好度を示した。
重要な引用
In this paper, we present AutoDesign, a framework that aligns with human design priors, where a meta-harness optimizer guides a code agent to recursively improve harness based on rollout feedback.
On the PosterBench Main Track, AutoDesign achieves the highest score of 78.32, surpassing the closed-source commercial system Claude Design by 7.45 points.
A system-blind human study further demonstrates that AutoDesign achieves the highest human preference among evaluated systems.
編集コメントを表示
編集コメント
本研究は、単なる生成タスクの自動化を超え、エージェントが自身の作業環境(ハルネス)を改善する再帰的学習能力を実証した点で画期的である。特に Claude Design を凌駕する結果は、オープンソース研究が商用システムと対等に戦えることを示唆しており、今後の AI エージェント開発の方向性を示す重要な指標となる。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
多様な情報源を凝縮し構造化されたメディア出力に変換するプロセスは、モデル・ハーネスシステムを中心とした長期ホライズンのエージェント処理として本質的に捉えることができます。理想的なハーネスシステムは人間の設計上の前提と整合し、実証的な探索を通じて再利用可能な経験を蓄積することで再帰的な自己改善を促すべきですが、既存のパラダイムは静的でこの能力に達していません。
本論文では、AutoDesign と呼ぶフレームワークを発表します。これは人間の設計上の前提と整合するものであり、メタハーネス最適化子がコードエージェントを導き、ロールアウトフィードバックに基づいてハーネスを再帰的に改善します。このフレームワークの具体化と評価のため、学術論文からポスター生成を行うタスクに焦点を当て、5 つの分野にわたる 100 件の論文を含むメイントラック「PosterBench」と、統制された評価用の共有 10 件サブセット「PosterBench-mini」を導入しました。
PosterBench のメイントラックにおいて、AutoDesign は最高スコア 78.32 を達成し、クローズドソースの商用システムである Claude Design よりも 7.45 ポイント上回りました。7 つの統制されたコードエージェント・モデル構成全体で、学習済みの DesignHarness を統合することでパフォーマンスが一貫して向上し、平均 PosterBench スコアは 54.99 から 67.39(+12.4%)に引き上げられました。
完全自律的な長期ホライズンのループでは、40 分未満で 253 のツール呼び出しと 11 回の編集ターンを実行し、コストは 3 ドル未満で抑えながら、人間の評価において平均して会議用ポスターの品質に達しました。
さらに、システムを盲検した人間による評価実験でも、AutoDesign が評価対象のすべてのシステムの中で最も高い人間の支持を得ていることが示されています。
原文を表示
Transforming multimodal sources into condensed and structured media outputs can be fundamentally conceptualized as a long-horizon agentic process centered on a model-harness system. While an ideal harness system should align with human design priors and accumulate reusable experience through empirical exploration to drive recursive self-improvement, existing paradigms remain static and fall short of this capability. In this paper, we present AutoDesign, a framework that aligns with human design priors, where a meta-harness optimizer guides a code agent to recursively improve harness based on rollout feedback. To instantiate and evaluate this framework, we focus on the academic paper-to-poster generation task and introduce PosterBench, comprising a 100-paper Main Track spanning five disciplines and PosterBench-mini, a shared 10-paper subset for controlled evaluation. On the PosterBench Main Track, AutoDesign achieves the highest score of 78.32, surpassing the closed-source commercial system Claude Design by 7.45 points. Across seven controlled code-agent-model configurations, integrating the learned DesignHarness consistently improves performance, increasing the average PosterBench Score from 54.99 to 67.39 (+12.4%). In a fully autonomous long-horizon loop, it executes 253 tool calls and 11 editing turns within 40 minutes for under $3, reaching average conference-poster quality in human evaluation. A system-blind human study further demonstrates that AutoDesign achieves the highest human preference among evaluated systems.
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み