Hugging Face、エージェントの記憶・再生用「Activity Frames」技術を発表
本文の状態
日本語全文を表示中
詳細モードで約3分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
研究者らは、モデルを介さない決定論的パイプラインを用いて画面操作記録を構造化する「Activity Frames」を開発し、コンテキスト圧縮率86倍と回答精度98.4%の実証結果を発表した。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るAI深層分析を開く2026年8月12日 12:01
AI深層分析
キーポイント
モデル非依存の決定論的コンパイル
この手法はAIモデルをループに含めず、ローカルキャプストリームを型付きフレームに分割するゼロモデルパイプラインであり、出力はバイト単位で同一かつ機械的に監査可能である。
劇的なコンテキスト圧縮と高精度
128,756フレームのデータセットにおいて、1日の記録を68ミリ秒で86倍に圧縮し、独立したオラクルに対して98.4%という高い精度で質問に応答する能力を実証した。
コスト計算のための新パラメータ提供
このコンパイラはエージェント運用コストモデルが仮定する「ルーチンオーバーヘッド比」と「ルーチン再発率」を初めて測定し、実データに基づく数値を提供する。
オープンソース化と透明性
スキーマ、コンパイラ、評価ハッチはすべて公開されており、モデルなしでの決定論的リプレイが実証されたことで、開発者による検証と利用が可能である。
重要な引用
compile passively captured screen activity into agent memory with a deterministic, zero-model pipeline
reduces a day of raw capture to a prompt-ready context block 86x smaller in 68 ms
answers questions about the day at 98.4% accuracy ... versus 66-80% for an LLM summary
編集コメントを表示
編集コメント
本研究は、AIエージェントの記憶機構における「モデル依存」からの脱却と、コスト効率の劇的向上を提示した画期的な成果である。特に、実運用環境でのコスト計算パラメータを実測値として初めて示した点は、今後のエージェント設計において重要な指針となるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
現在のコンピューター操作エージェントは、ユーザーが既に実行した手順を再構築するために、最前線の推論リソースをフル活用しています。これは、今日のエージェントの記憶が「ユーザーが何を言ったか」しか記録せず、「ユーザーが何をしたか」を捉えていないからです。
私たちは、受動的にキャプチャされた画面活動を、モデルを介さない決定論的なパイプラインでエージェントの記憶へコンパイルします。このシステムは、ローカルのキャプチャストリームを型付きの「アクティビティフレーム」に分割します。各フレームは、アプリケーション、サイト、タイミング、入力量、そして生データ行への参照ポインタを含む境界付きのエピソードとして定義されます。モデルがループに含まれないため、出力はバイト単位で同一であり、キャッシュ可能で、機械的に監査可能です。
ある専門家の51日間にわたる128,756フレームからなる単一ユーザーのデータセットにおいて、このコンパイラは1日の生キャプチャを68ミリ秒で処理し、プロンプト用のコンテキストブロックへ変換します。そのサイズは元のデータの86分の1に縮小されます。また、このブロックを読み込んだエージェントが、独立したオラクルに対して「その日に何があったか」という質問に答える精度は98.4%(Wilsonの95%信頼区間 91.7-99.7%)でした。これに対し、同じキャプチャデータを要約するLLMの精度は66〜80%にとどまりました。さらに、ミドルティアのモデルが同ブロックを読み込んだ場合でも、最前線のモデルと同等の結果を得ることができました。
同じコンパイラは、需要側のコスト計測ツールとしても機能します。エージェントのロールアウトではなく、事前委任された人間の受動的な活動を読み取ることで、エージェントコストモデルが前提としているものの、これまで測定されていなかった 2 つのパラメータを供給します。それが「ルーチンオーバーヘッド比 R」と「ルーチンの再発率 h」です。
我々は、R の最初の値(モデル化された上限)として 60〜343 倍を報告し、サンプル内での委任可能な再発率は 9.0%、サンプル外では 7.7% となりました。これにより、現実的な全艦隊のトークン上限は約 8% となります。
コンパイルされたルーチンは、モデルをループから除外して決定論的に再生されます。これは、ガード条件に一致するヒットにおいて、モデルのトークンをゼロにしてライブデモンストレーションされました。
スキーマ、コンパイラ、評価ハーンはオープンソースです。
原文を表示
Computer-use agents pay full frontier inference to re-derive routines their user has already performed, because an agent's memory today records what the user said, not what the user did. We compile passively captured screen activity into agent memory with a deterministic, zero-model pipeline: it segments a local capture stream into typed activity frames, bounded episodes carrying application, site, timing, input volume, and evidence pointers back to the raw rows, with no model in the loop, so the output is byte-identical, cacheable, and mechanically auditable. On one professional's single-user corpus of 128,756 frames over 51 active days, the compiler reduces a day of raw capture to a prompt-ready context block 86x smaller in 68 ms, and an agent reading that block answers questions about the day at 98.4% accuracy (Wilson 95% CI 91.7-99.7%) against an independent oracle, versus 66-80% for an LLM summary of the same capture, a mid-tier model reading the block matching a frontier one.
The same compiler doubles as a demand-side cost instrument. Read off passive, pre-delegation human activity rather than agent rollouts, it supplies two parameters that agent-cost models assume but, to our knowledge, have not measured: the Routine Overhead Ratio R and the routine recurrence h. We report first values of R, a modeled upper bound, at 60-343x, and a delegable recurrence of 9.0% in-sample and 7.7% out-of-sample, for a realistic all-fleet token ceiling near 8%; a compiled routine replays deterministically with the model out of the loop, demonstrated live at zero model tokens on a guard-matched hit. Schema, compiler, and evaluation harness are open.
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み