Hugging Face、自律型エージェントの長期課題を評価する「OneDayAgent」を発表
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
OneDayAgent は、LLM エージェントが長期的で複雑なタスクを処理する際に必要な目標維持や文脈管理を統合的に解決するハッチスであり、104 のタスクで新記録となる 0.821 のスコアを達成した。
AI深層分析を開く2026年8月6日 18:25
AI深層分析
キーポイント
長期的タスクの統合的管理
OneDayAgent は、目標のドリフトや状態の喪失といった個々の失敗モードに対処するだけでなく、これらを単一のハッチスで同時に管理し、効果的な実行を可能にする。
タスク分解とメモリ維持
同システムはオープンエンドな要求を管理された実行プロセスに変換し、タスクを制限付きのサブタスクに分解するとともに、文脈圧力下でも実行メモリを維持する。
バックエンド非依存の汎用性
Three model families に属する 5 つの異なる LLM バックエンドで同一のハッチスを実行可能であり、モデル固有の実行スタイルの違いに影響されずに動作することが示された。
高い評価スコアの達成
GLM-5.2 バックエンドを用いた AgentIF-OneDay ベンチマークの 104 タスクにおいて、全体スコア 0.821 を記録し、新たな最先端(state of the art)を樹立した。
重要な引用
OneDayAgent, a long-horizon harness for autonomous agents.
With the GLM-5.2 backend, OneDayAgent sets a new state of the art with an overall score of 0.821.
The same harness runs across five backend LLMs from three model families, indicating the harness generalizes across backends without tuning.
編集コメントを表示
編集コメント
この研究は、単一の LLM モデルの性能向上だけでなく、エージェントが複雑なタスクを安定して遂行するためのアーキテクチャ的アプローチに焦点を当てている点が注目される。バックエンドモデルを選ばずに動作する汎用性は、実環境での導入コスト削減に寄与する可能性が高い。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
LLM エージェントは、仕事や学習、日常生活にわたるオープンエンドな日常タスクへの適用が広がっています。これらのタスクは長期にわたり、複数の環境を跨ぎ、多様なモダリティを含みます。エージェントは多くのステップを通じて目標と制約を維持しながら、異質なツールや添付ファイルをナビゲートする必要があります。先行研究では、目標の逸脱、状態の喪失、コンテキストのオーバーフローといった個々の失敗モードへの対処がなされてきましたが、単一のハネスでこれらを同時に管理し、バックエンドを超えて効果的に機能できるかどうかについては、まだ十分な検討が行われていません。
そこで私たちは、自律型エージェント向けの長期タスク用ハネス「OneDayAgent」を発表します。OneDayAgent はオープンエンドな要求を管理された実行プロセスに変換し、タスクを限定されたサブタスクに分解します。また、コンテキストの圧力下でも実行メモリを維持し、最終的な成果物の検証と修復を行います。
OneDayAgent を AgentIF-OneDay 上の 104 のタスクで評価した結果、GLM-5.2 バックエンドを使用した場合、総合スコア 0.821 で新たな最高記録を達成しました。同じハネスは、3 つのモデルファミリーに属する 5 つの異なるバックエンド LLM でも動作します。これは、ハネスがチューニングなしでバックエンド全体に一般化できることを示しています。同じワークフロー下でも、異なるモデルが独自の実行スタイルを引き起こす状況においてもです。
原文を表示
LLM agents are increasingly applied to open-ended everyday requests that span work, study, and life. These tasks are long-horizon, cross-environment, and multimodal, forcing the agent to preserve goals and constraints across many steps while navigating heterogeneous tools and attachments. While prior work has addressed individual failure modes such as goals drift, states loss, and context overflow, whether a single harness can manage them jointly and remain effective across backends has received less study. We present OneDayAgent, a long-horizon harness for autonomous agents. OneDayAgent turns an open-ended request into a managed execution process that decomposes tasks into bounded subtasks, maintains execution memory under context pressure, and verifies and repairs the final deliverable. We evaluate OneDayAgent on AgentIF-OneDay across 104 tasks. With the GLM-5.2 backend, OneDayAgent sets a new state of the art with an overall score of 0.821. The same harness runs across five backend LLMs from three model families, indicating the harness generalizes across backends without tuning, even as different models induce distinct execution styles under the same workflow.
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み