Hugging Face、長期タスク実行を改善する「LongHorizon-Harness」を発表
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
LLM エージェントの長期タスク実行における状態管理の課題を解決するため、外部で状態を保持し環境から検証された事実のみを更新する「LongHorizon-Harness」が提案され、複数のベンチマークで性能が大幅に向上した。
AI深層分析を開く2026年8月4日 15:17
AI深層分析
キーポイント
長期タスク実行のパラダイム転換
既存の手法がコンテキスト内で状態を維持する問題点を指摘し、タスク実行を「タスク状態管理問題」として再定式化した。
MEA ループによる新しいアーキテクチャ
マネージャーが状態とサブタスクを決定し、新鮮なコンテキストのエクゼキューターが実行し、読み取り専用のオーディターが環境状態を検証する「Manage-Execute-Audit」ループを採用した。
汎用性の高いアダプター機能
軽量な AgentAdapter を実装することで、ネイティブエージェントループを修正せずにモデルやハッチバックエンドを交換可能にした。
ベンチマークにおける性能向上の実証
WeaveBench や Terminal-Bench などの主要ベンチにおいて、Qwen や Claude Opus のような異なるモデルで著しい成功率の向上を確認した。
重要な引用
existing agent harnesses maintain task execution, task state, and completion assessment within a growing context
We reformulate long-horizon execution as a task-state management problem
Its Manage-Execute-Audit(MEA) loop uses a manager to maintain the task state
編集コメントを表示
編集コメント
長期タスク実行における状態管理の課題を、外部検証とループ構造で解決するアプローチは実用化への重要な一歩となる。既存の複雑なコンテキスト依存問題を解消し、より堅牢なエージェントシステムの実現に寄与する技術である。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
大規模言語モデル(LLM)エージェントは、持続的な推論やツールの活用、そして多数の相互依存するステップにわたる修正を必要とする長期ホライズンタスクを担うことが増えています。しかし、既存のエージェントハルネスでは、タスクの実行、状態管理、完了評価が拡張し続けるコンテキスト内に維持されるため、状態の追跡が困難になり、誤った自己評価が後の意思決定にまで波及するリスクがあります。
私たちは長期ホライズン実行を「タスク状態管理問題」として再定義し、LongHorizon-Harness を提案します。このシステムは、タスクの状態を実行の外で明示的に維持し、環境から独立して検証された事実のみを用いて状態を更新します。その Manage-Execute-Audit (MEA) ループでは、タスク状態を維持して次のサブタスクを決定する「マネージャー」、それを実行するための「新鮮なコンテキストを持つエグゼキューター」、そして次のラウンド前に結果の環境状態を検証する「読み取り専用オーディター」が連携します。軽量な AgentAdapter により、ネイティブのエージェントループを変更せずに、モデルやハルネスのバックエンドを自由に交換可能にしています。
LongHorizon-Harness は、WeaveBench において Qwen~3.7-Plus のスコアを 51.8% から 80.7% に向上させました。また、Terminal-Bench~2.1 では 69.7% から 77.2%、OSWorld~2.0 では 2.8% から 8.3% と大幅な改善を実現しています。さらに、OSWorld2.0 のサブセットでは Claude Opus~4.7 も 20.0% から 34.3% に引き上げられ、モデルやハルネス、インタラクションのドメインを超えて一貫した性能向上を示しました。
原文を表示
Large language model (LLM) agents increasingly undertake long-horizon tasks that require sustained reasoning, tool use, and revision across many interdependent steps. However, existing agent harnesses maintain task execution, task state, and completion assessment within a growing context, making the state difficult to track and allowing incorrect self-assessments to propagate into later decisions. We reformulate long-horizon execution as a task-state management problem and propose LongHorizon-Harness, which maintains the task state explicitly outside execution and updates it only with facts independently verified from the environment. Its Manage-Execute-Audit(MEA) loop uses a manager to maintain the task state and determine the next subtask, a fresh-context executor to perform it, and a read-only auditor to verify the resulting environment state before the next round. A lightweight AgentAdapter supports interchangeable model and harness backends without modifying their native agent loops. LongHorizon-Harness improves Qwen~3.7-Plus from 51.8% to 80.7% on WeaveBench, from 69.7% to 77.2% on Terminal-Bench~2.1, and from 2.8% to 8.3% on OSWorld~2.0. It also raises Claude Opus~4.7 from 20.0% to 34.3% on an OSWorld2.0 subset, demonstrating consistent gains across models, harnesses, and interaction domains.
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み