Harness-1 の紹介:gpt-oss-20b を基盤とし、状態管理型検索ハネス内で強化学習を用いて訓練された 20B パラメータの検索サブエージェント
本文の状態
日本語全文を表示中
詳細モードで約14分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
MarkTechPost
イリノイ大学アーバナ・シャンペーン校や UC バークレーなどの研究者チームは、既存の検索エージェントが検索判断と記憶管理を同時に最適化しようとする課題に対し、Harness-1 と呼ばれる 20B パラメータの検索サブエージェントを開発した。このモデルは gpt-oss-20b を基盤とし、状態管理型検索ハネス内で強化学習を用いて訓練されている。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
ほとんどの検索エージェントは、成長するトランスクリプト上のポリシーとして訓練されています。モデルはどのように検索するかを決定します。また、自分が何を見たか、どの証拠が重要かを記憶し、どの主張を検証したかも覚えていなければなりません。しかし、イリノイ大学アーバナ・シャンペーン校、カリフォルニア大学バークレー校、および Chroma の研究者チームは、これは要求が多すぎると指摘しています。強化学習(Reinforcement Learning)は結果として、検索の決定と日常的な事務処理の両方を同時に最適化してしまいます。
彼らの答えが Harness-1 です。これは gpt-oss-20b を基盤とした 20B パラメータの検索サブエージェントで、状態保持型の検索ハッチ(Stateful Search Harness)内で強化学習によって訓練されました。このハッチが事務処理を担い、ポリシーは意味的な決定を担当します。重みとハッチのコードは一般公開されています。
imagehttps://arxiv.org/pdf/2606.02373
Harness-1 とは実際何なのか
Harness-1 は、下流の回答モデルに対して文書のランク付けされたセットを生成します。自身で質問に答えるわけではありません。これは、エピソードごとの WORKINGMEMORY(作業記憶)を中心とした状態機械ハッチ内で動作します。
各ターンはループとして機能します。ハッチは最近のアクションとともにコンパクトな検索状態をレンダリングし、モデルは構造化されたアクションを 1 つ出力します。その後、ハッチがそれを実行して状態を更新し、次の観測結果をレンダリングします。
状態保持型ハッチ:ポリシーから外れるもの
研究チームは、この原則を「状態保持型認知オフローディング」と呼んでいます。ポリシーは、何を検索し、キュレーションし、検証するか、そしていつ停止するかを決定します。ハーンズ(harness)は、これらの意思決定の周囲に回復可能な状態を維持します。
その状態にはいくつかの要素が含まれます。候補プールには、圧縮され重複が排除されたドキュメントが保持されます。重要度タグ付けされたキュレーションセットが最終出力となり、30 ドキュメントまでと制限されています。タグは「very_high(非常に高い)」、「high(高い)」、「fair(普通)」、「low(低い)」の 4 つの値を取ります。フルテキストストアには、プロンプト外のすべての取得チャンクが保存されます。
証拠グラフが構造を追加します。正規表現抽出器が各チャンクから固有名詞、年号、日付をスキャンします。ハーンズはその後、頻出エンティティ、橋渡しドキュメント、単一出現エンティティ(singleton)をレンダリングします。橋渡しドキュメントには 2 つ以上の頻出エンティティが含まれています。単一出現エンティティは 1 つのドキュメントにのみ現れ、追加の調査线索を示唆します。
ポリシーは 8 つのツールを通じて機能します。これらは「fan_out_search(扇状検索)」、「search_corpus(コーパス検索)」、「grep_corpus(コーパスグレッピング)」、「read_document(ドキュメント読取)」、「review_docs(ドキュメントレビュー)」、「curate(キュレーション)」、「verify(検証)」、「end_search(検索終了)」です。検索出力は sentence-BM25 で圧縮され、上位 4 つの文のみが保持されます。2 レベルの重複排除により、チャンク ID とコンテンツ指紋に基づいて重複が除去されます。
ある設計上の選択は「コールドスタート」への対応です。最初の成功した検索は、重要度が「fair(普通)」の 8 つの再ランク付け結果でキュレーションセットを自動シードします。その後、ポリシーが強力なドキュメントを昇格させ、弱いドキュメントを削除します。これにより、ゼロからの構築というタスクが、洗練・改良へと転換されます。
研究チームは、訓練可能なハーン(harness)に対して3つの要件を定義しています。これらは、ウォームスタートされたキュレーション、コンパクトな派生状態のレンダリング、そして多様性を維持するインセンティブです。Harness-1 はこの 3 つすべてを実装しています。
How It is Trained
トレーニングはハーンと同じラインに沿って分割されます。教師あり微調整(Supervised fine-tuning)により、モデルがインターフェースを操作する方法を学習します。強化学習(Reinforcement learning)は、維持される状態に基づいて検索判断を改善します。
単一のティーチャーである GPT-5.4 が、フルハーン内でライブ実行されます。フィルタリング後、SFT(Supervised Fine-Tuning)用に 899 のトラジェクトリーが残り、モデルは rank 32 で LoRA を使用して 3 エポック訓練します。RL(Reinforcement Learning)の初期化には step-550 のチェックポイントを使用します。
RL は、40 ターン制限とターミナルのみでの報酬を持つオンポリシー CISPO を使用します。SEC クエリのみで訓練され、同じ報酬を持つグループは勾配から除外されます。訓練は Tinker 上で行われました。
報酬は発見と選択を分離し、さらにツール多様性ボーナスを追加しています。このボーナスがない場合、エージェントは繰り返し検索に収束してしまいます。その結果、キュレーションされたリコール(recall)は約 0.53 で頭打ちになります。一方、ボーナスがある場合は多様性が安定し、リコールは約 0.60 に達します。
The Benchmark Case
Harness-1 は、ウェブ、金融、特許、マルチホップ QA を含む 8 つのベンチマークで評価されました。主要な指標はキュレーションされたリコール(curated recall)であり、最終セット内の関連文書の網羅性を示します。トラジェクトリーリコール(trajectory recall)は、エピソード中のどこかで遭遇した証拠をカウントするものです。
ModelTypeAvg Curated RecallAvg Trajectory Recall
Harness-1 (20B)Open small0.7300.807
Tongyi DeepResearch 30BOpen small0.6160.673
Context-1 (20B)Open small0.6030.756
Search-R1 (32B) Open small 0.289 0.289
GPT-OSS-20B Open small 0.262 0.590
Qwen3 (32B) Open small 0.216 0.446
Opus-4.6 Frontier 0.764 0.794
GPT-5.4 Frontier 0.709 0.752
Sonnet-4.6 Frontier 0.688 0.725
Kimi-K2.5 Frontier 0.647 0.794
GPT-OSS-120B Frontier 0.496 0.769
これは論文の図 1 に基づく 8 つのベンチマークにわたる平均値です。フロンティアモデルは、Context-1 ハーネス(注:検索用環境枠組み)の下でゼロショット検索器として実行されます。
Harness-1 は、0.730 の平均キュレーションされたリコール(注:関連文書の回収率)を達成しました。これは、次のオープンなサブエージェントである Tongyi DeepResearch 30B を 11.4 ポイント上回っています。テストされたフロンティア検索モデルの中で、平均でこれより高いスコアを獲得したのは Opus-4.6 のみです。
転移パターンがメカニズムの最も明確なシグナルとなっています。SFT(注:教師あり微調整)では 4 つのベンチマークファミリーを使用しましたが、RL(注:強化学習)では SEC のみを採用しました。これらのソースファミリータスクにおいて、Harness-1 は最良のオープンベースラインに対して 7.9 ポイント向上しました。一方、4 つのホールドアウト(学習データに含まれない)ベンチマークでは 17.0 ポイント向上しており、これはトレーニングデータから最も遠いタスクにおいて 2.2 倍の大きな改善であることを示しています。
アブレーション実験はハーネスの有効性を支持する結果となりました。すべてのハーネスメカニズムを無効化すると、BrowseComp+ におけるリコール(注:関連文書の回収率)が相対的に 12.2% 低下します。学習済みのポリシーは検索を継続しますが、発見した情報を適切にランク付けすることができなくなります。
image https://arxiv.org/pdf/2606.02373
ユースケース
本手法は、文書が回答を裏付ける証拠探索型検索を対象としています。この形状に適合するいくつかのワークフローが存在します。
一つ目は文献および特許レビューです。証拠グラフと厳選されたセットは、多数のソースを整理するのに役立ちます。二つ目は財務書類分析です。SEC の事例研究では、複数の 8-K 文書にまたがる正確な経営陣交代日を特定しています。
三つ目は多段事実検証です。fan_out_search および verify ツールは、コミットする前に曖昧なエンティティを解決します。四つ目はモジュラー RAG(Retrieval-Augmented Generation)です。厳選されたセットが凍結された生成器に供給され、より質の高いセットが回答精度の向上をもたらします。
Strengths and Weaknesses
Strengths
テストされたオープンモデルの中で最高平均の厳選リコールを達成し、全体では Opus-4.6 に次ぐ成績です。
保持されたベンチマークでも性能が維持され、ドメインに依存しない検索操作が可能であることを示唆しています。
4,352 件のユニークアイテムで訓練されており、これはいくつかのベースラインと比較してはるかに少ない数値です。
オープンなチェックポイントとハーン(harness)コードを提供しており、一般的なランタイムで実行可能です。
Weaknesses
証拠グラフは正規表現抽出を使用しており、完全なエンティティリンキングではありません。
verify ツールは LLM プロキシであり、曖昧な主張に対して誤りを犯す可能性があります。
Sentence-BM25 の圧縮により、談話構造に関連する文脈が失われる恐れがあります。
研究チームは信頼区間を明示せず、点推定値のみを報告しています。
Key Takeaways
Harness-1 は 20B パラメータの検索エージェントであり、検索の事務処理を環境側に移し、意味的な判断をポリシーに委ねています。
8 つのベンチマーク全体で平均 0.730 の厳選リコールを達成し、次点のオープンサブエージェントより 11.4 ポイント上回っています。
テストされた検索エージェントの中で、平均的な厳選リコールにおいて Opus-4.6 より高いスコアを記録したのは Harness-1 だけです。
保持されたベンチマークにおける改善幅は最も大きく(+17.0 ポイント対 +7.9 ポイント)、学習した検索操作が転移していることを示唆しています。
重みとハネスコードは公開されており、vLLM、SGLang、または Transformers を介して提供可能です。
Marktechpost のビジュアル解説
#mtp-harness1-slider{
--mtp-bg:#f4f6f8!important;
--mtp-card:#ffffff!important;
--mtp-ink:#10243a!important;
--mtp-muted:#5a6b7b!important;
--mtp-line:#e2e8ef!important;
--mtp-accent:#0e9f6e!important;
--mtp-accent-dk:#0a7d56!important;
--mtp-soft:#e8f6f0!important;
--mtp-chip:#eef2f6!important;
background:var(--mtp-bg)!important;
color:var(--mtp-ink)!important;
border:1px solid var(--mtp-line)!important;
border-radius:18px!important;
padding:0!important;
max-width:860px!important;
margin:24px auto!important;
font-family:-apple-system,BlinkMacSystemFont,"Segoe UI",Helvetica,sans-serif!important;
line-height:1.55!important;
overflow:hidden!important;
box-shadow:0 10px 40px rgba(16,36,58,.08)!important;
}
#mtp-harness1-slider .mtp-h1-head{
display:flex!important;align-items:center;justify-content:space-between;
padding:16px 24px!important;border-bottom:1px solid var(--mtp-line)!important;
background:var(--mtp-card)!important;
}
#mtp-harness1-slider .mtp-h1-kicker{
font-size:11px!important;letter-spacing:.16em;text-transform:uppercase;
font-weight:700;color:var(--mtp-accent-dk)!important;
}
#mtp-harness1-slider .mtp-h1-count{
font-size:13px!important;color:var(--mtp-muted)!important;font-variant-numeric:tabular-nums;font-weight:600
}
#mtp-harness1-slider .mtp-h1-slide{
min-width:100%!important;padding:32px 36px 30px!important;
}
#mtp-harness1-slider .mtp-h1-eyebrow{
font-size:12px!important;letter-spacing:.08em;text-transform:uppercase;color:var(--mtp-accent-dk)!important;font-weight:700;margin-bottom:10px
}
#mtp-harness1-slider .mtp-h1-slide h2{
font-family:Georgia,"Times New Roman",serif!important;
font-size:clamp(24px,4.4vw,34px)!important;line-height:1.18;color:var(--mtp-ink)!important;
font-weight:700;margin-bottom:14px!important
}
#mtp-harness1-slider .mtp-h1-slide h3{
font-family:Georgia,serif!important;font-size:clamp(20px,3.4vw,26px)!important;
color:var(--mtp-ink)!important;font-weight:700;margin-bottom:14px!important
}
#mtp-harness1-slider .mtp-h1-chip{
font-size:12.5px!important;background:var(--mtp-chip)!important;color:var(--mtp-ink)!important;
border:1px solid var(--mtp-line)!important;border-radius:999px!important;padding:5px 12px!important;font-weight:600
}
#mtp-harness1-slider .mtp-h1-box{
background:var(--mtp-card)!important;border:1px solid var(--mtp-line)!important;border-radius:12px!important;padding:16px 18px!important
}
#mtp-harness1-slider .mtp-h1-box .mtp-h1-lab{
font-size:11px!important;letter-spacing:.1em;text-transform:uppercase;color:var(--mtp-accent-dk)!important;font-weight:700;margin-bottom:8px
}
#mtp-harness1-slider ul.mtp-h1-list li{
font-size:15px!important;color:var(--mtp-ink)!important;padding:8px 0 8px 22px!important;
border-bottom:1px solid var(--mtp-line)!important;position:relative
}
#mtp-harness1-slider ul.mtp-h1-list li:before{
content:"";position:absolute;left:2px;top:15px;width:7px!important;height:7px!important;
border-radius:50%;background:var(--mtp-accent)!important
}
#mtp-harness1-slider .mtp-h1-tool{
background:var(--mtp-soft)!important;border:1px solid #cdeadd!important;border-radius:10px!important;
padding:12px 10px!important;text-align:center;font-family:ui-monospace,SFMono-Regular,Menlo,Consolas,monospace!important;
font-size:12.5px!important;color:var(--mtp-accent-dk)!important;font-weight:600
}
#mtp-harness1-slider .mtp-h1-note{
margin-top:16px!important;font-size:13.5px!important;color:var(--mtp-muted)!important;
background:var(--mtp-card)!important;border-left:3px solid var(--mtp-accent)!important;
border-radius:0 8px 8px 0!important;padding:10px 14px!important
}
#mtp-harness1-slider .mtp-h1-bignum{
font-family:Georgia,serif!important;font-size:clamp(40px,8vw,58px)!important;color:var(--mtp-accent-dk)!important;font-weight:700;line-height:1
}
#mtp-harness1-slider .mtp-h1-kv div{
font-size:14.5px!important;color:var(--mtp-ink)!important;background:var(--mtp-card)!important;
border:1px solid var(--mtp-line)!important;border-radius:9px!important;padding:9px 13px!important
}
#mtp-harness1-slider .mtp-h1-nav{
display:flex!important;align-items:center;justify-content:space-between;
padding:14px 24px!important;border-top:1px solid var(--mtp-line)!important;background:var(--mtp-card)!important
}
#mtp-harness1-slider .mtp-h1-btn{
background:var(--mtp-accent)!important;color:#fff!important;border:none!important;cursor:pointer;
border-radius:9px!important;padding:9px 16px!important;font-size:14px!important;font-weight:700;
transition:background .2s
}
#mtp-harness1-slider .mtp-h1-dot{
width:9px!important;height:9px!important;border-radius:50%;background:#c9d3dc!important;border:none!important;
cursor:pointer;padding:0!important;transition:all .2s
}
#mtp-harness1-slider .mtp-h1-foot{
text-align:center!important;padding:13px 20px!important;background:var(--mtp-ink)!important;
}
@media (max-width:640px){
}
状態管理型検索エージェント
1 / 7
リサーチガイド
Harness-1:帳簿管理を行う状態管理型のハッチを備えた 20B 規模の検索エージェント
本稿では、帳簿管理機能を持つ検索ハッチ内で強化学習によって訓練された検索サブエージェントについて解説します。
20B · gpt-oss-20b ベースモデル
UIUC · UC バークレー · Chroma
arXiv:2606.02373
オープンウェイト & コード
核心となるアイデア
ポリシーとハッチの役割分担
従来の検索エージェントは、検索に関する意思決定と日常的な帳簿管理を一つの成長するトランスクリプトに詰め込んでいます。一方、Harness-1 はこれらを分離します。論文ではこれを「状態管理による認知オフローディング」と呼んでいます。
ポリシーが決定
何を検索するか
どの文書を保持するか
どの主張を検証するか
いつ停止するか
ハッチが維持
候補プール
選別された証拠
検証記録
コンテキスト予算
ハッチ内部の仕組み
環境側のワーキングメモリ
候補プール — 圧縮され重複排除された文書
選別セット — 重要度タグ付き、最大 30 件(very_high / high / fair / low)
証拠グラフ — 正規表現抽出によるエンティティ、ブリッジ、およびシングルトン
検証キャッシュ — 主張から文書への yes/no の判定結果
フルテキストストア — 取得した各チャンクはプロンプト外に保持される
圧縮 — sentence-BM25 が上位 4 つの文を維持する
ポリシーアクション
8 つのツールが状態を編集する
fan_out_search
search_corpus
grep_corpus
read_document
review_docs
curate
verify
end_search
最初の成功した検索は、公平な重要度で 8 つの再ランク付けされたドキュメントをもって、キュレーション済みセットを自動シードします。その後、ポリシーが強力なドキュメントを昇格させ、弱いドキュメントを削除します。
トレーニング
インターフェース操作には SFT(Supervised Fine-Tuning: 教師あり微調整)、検索には RL(Reinforcement Learning: 強化学習)
SFT: ハーネス内の GPT-5.4 ティーチャー · 899 トラジェクトリ · LoRA rank 32 · step-550 チェックポイント
RL: on-policy CISPO(Constrained Importance Sampling Policy Optimization)· SEC クエリのみ · 40 ターン制限 · 終端報酬 · Tinker でトレーニング
データ規模:4,352 個のユニークなトレーニングアイテム(899 SFT + 3,453 RL)
3 つの訓練要件:ウォームスタートされたキュレーション、コンパクトな派生状態レンダリング、多様性を維持するインセンティブ。
結果
数値が示すもの
0.730
8 つのベンチマーク全体での平均キュレーションリコール
次点のオープンサブエージェントである Tongyi DeepResearch 30B より +11.4 ポイント向上
テストされた検索エンジンの中で、平均スコアで Opus-4.6 以外に上回るものはない
転移学習:未見データで +17.0、同族ファミリーで +7.9(2.2 倍の差)
アブレーション:すべてのハーン機構を除去すると、リコールは相対的に 12.2% 低下します
始め方
ご自身で実行する
サーバー: vLLM, SGLang, または Transformers
チェックポイント: pat-jj/harness-1 (Hugging Face, 21B パラメータ, BF16)
コード: github.com/pat-jj/harness-1
論文: arXiv:2606.02373
Harness-1 は、下流の回答モデルのために厳選された文書セットを返します。自身で質問に答えるわけではありません。
← 前へ
次へ →
Marktechpost がキュレーション — エンジニア向けの実践者ファーストな AI/ML 研究、ニュース、および開発ツール。
記事 Meet Harness-1: A 20B Retrieval Subagent Trained With Reinforcement Learning Inside a Stateful Search Harness on gpt-oss-20b (続き 11/11) は、MarkTechPost で最初に公開されました。
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み