Hugging Face、多エージェント強化学習による教師なし推論手法「Co-RL」を論文公開
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
Co-RL は、複数の非パラメータ共有モデルが相互に報酬を生成・評価する多エージェント強化学習フレームワークであり、ラベルフリーで推論能力と多様性を大幅に向上させる。
AI深層分析を開く2026年8月20日 14:35
AI深層分析
キーポイント
自己報酬の限界克服
単独モデルによる自己報酬学習はバイアス強化や同質化を招くが、Co-RL は他者からのフィードバックを用いることでこれを回避する。
多様性によるエラー低減
異種モデルファミリーやサイズ、再記述されたトレーニングサンプルの組み合わせにより、相関した誤差を減少させる。
性能向上の実証
テキストおよびマルチモーダル領域でラベルなしながら既存手法を上回り、LLM で最大 8.6%、VLM で最大 7.2% の改善を示す。
重要な引用
training solely on self-generated feedback can reinforce existing biases and suboptimal behaviors
increasing cohort diversity... reduces the correlated errors that drive self-reinforcing feedback loops
Co-RL consistently outperforms the base models and prior label-free approaches
編集コメントを表示
編集コメント
人間による評価ラベルの不足が課題となる中、モデル同士の相互作用で学習を完結させるこのアプローチは実用性の観点から極めて興味深い。コードがオープンソース化されているため、実装検証へのハードルも低い。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
強化学習(RL)は、言語モデルや視覚・言語モデルの推論能力を向上させる強力な手法として注目されていますが、その最大の成功例はいまだに正解ラベルに基づく監督学習(例えば、検証可能な報酬など)に強く依存しています。しかし、こうした注釈を取得するのはコストがかかり、推論能力が人間の信頼できる評価を超えて高度化するにつれて、その供給はますます限られていきます。
自己報酬型強化学習はこの依存度を下げる手法として提案されています。これはモデル自身が生成した出力から報酬信号を導き出す仕組みです。しかし、自己生成フィードバックのみで学習を進めると、既存のバイアスや非最適な行動が強化され、応答の多様性が失われる恐れがあります。その結果、回答が画一化し、最終的にはトレーニングが崩壊するリスクがあります。
本研究では、協調型マルチエージェント訓練を通じて教師なし推論が自然に出現することを示します。我々は「Co-RL」という枠組みを提案しました。これは複数のモデルがパラメータを共有せず独立して存在しつつ、互いの出力から得られる報酬を用いて強化学習で同時に最適化される仕組みです。
さらに、異種族のモデルファミリーや異なるサイズ、書き換えられたトレーニングサンプルなどを通じてコホートの多様性を高めることで、自己強化フィードバックループを引き起こす相関誤差を低減できることも示しました。この多様性は、推論性能の一貫した向上と行動の多様性の維持、そしてトレーニング崩壊の抑制に寄与します。
テキストのみおよびマルチモーダル領域の両方で、Co-RL は基盤モデルや既存のラベル不要手法を常に上回り、教師あり手法と同等かそれ以上の性能を発揮します。これは、正解ラベルに一切アクセスしなくても達成される結果です。
具体的には、LLM 向けのテキストのみベンチマーク7つで平均3.0〜8.6%の向上をもたらしました。また、VLM 向けのマルチモーダルベンチマーク4つでは2.3〜7.2%の改善を確認しています。
コードは https://github.com/DrStranded/Co-RL で公開されています。
原文を表示
Reinforcement learning (RL) has emerged as a powerful approach for improving reasoning in language and vision-language models, yet its strongest successes still depend heavily on ground-truth supervision (e.g., verifiable reward). Such annotations are costly to obtain and become increasingly scarce as reasoning capabilities advance beyond what humans can reliably evaluate. Self-rewarding RL reduces this dependence by enabling models to derive reward signals from their own completions. However, training solely on self-generated feedback can reinforce existing biases and suboptimal behaviors, reduce response diversity, and ultimately lead to homogenized responses and training collapse. In this work, we show that unsupervised reasoning can emerge through cooperative multi-agent training. We introduce Co-RL, a framework in which multiple decoupled models, sharing no parameters, are simultaneously optimized through RL using rewards derived from their peers. We further show that increasing cohort diversity, through heterogeneous model families, sizes, and rephrased training samples, reduces the correlated errors that drive self-reinforcing feedback loops. This diversity consistently improves reasoning performance, maintains behavioral diversity, and mitigates training collapse. Across text-only and multimodal domains, Co-RL consistently outperforms the base models and prior label-free approaches, while matching or surpassing supervised methods, without access to any ground-truth labels. Concretely, Co-RL yields average gains of 3.0-8.6% across seven text-only benchmarks for LLMs and 2.3-7.2% across four multimodal benchmarks for VLMs. Code is available at https://github.com/DrStranded/Co-RL.
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み