ページを読み込み中…
ページを読み込み中…
3件の記事
NVIDIA の研究プロジェクト「AVO」は、長期多段階タスクで信頼性を示すエージェントシステムとして機能する基盤アーキテクチャである。
TLDR AI は、重要な状態を追跡し、関連情報が失われるリスクがある際に行動エージェントに選択的にリマインドする別個のメモリエージェントを提案しました。この手法は、基盤となる行動モデルを変更せずに Terminal-Bench 2.0 やτ2-Bench の合格率を向上させます。
筆者は、従来のTD学習に依存せず「分割統治」パラダイムに基づく強化学習アルゴリズムを提案し、長期タスクへのスケーラビリティを実現した。