ページを読み込み中…
ページを読み込み中…
3件の記事
Meta社がComposerにオンライン強化学習を適用し、本番環境でモデルチェックポイントを提供し、実際のユーザーインタラクションを報酬信号として使用して、1日に複数回改善されたチェックポイントをリリースした。
プリンストン大学の研究者が開発したOpenClaw-RLフレームワークは、チャットや端末コマンド、GUI操作からのリアルタイム信号を継続的な学習データに変換し、AIエージェントの訓練を可能にする。数十回のインタラクションで顕著な改善が見られるという。