ページを読み込み中…
ページを読み込み中…
5件の記事
強化学習のポストトレーニングにおけるボトルネック「ロールアウト」を、適応型推論特定デコーディング(DAS)により最大50%高速化する。この手法は報酬品質の低下なしに処理速度を向上させる。
MIT CSAILの研究者は、AIモデルの過剰な自信の原因を特定し、不確実性を表現するよう学習させる手法を開発した。
Auroraは、推論効率を1.25倍向上させるオープンソースの強化学習フレームワークです。これは、推論を単なるオフライン設定から、リクエストごとに自己改善するシステムへと変革します。
PLaMo事後学習チームが国産生成AI基盤モデル「PLaMo 3.0 Prime β版」をリリースした。日本初のReasoning対応フルスクラッチモデルで、アーキテクチャを一新し、モニター企業を募集している。
プリンストン大学の研究者が開発したOpenClaw-RLフレームワークは、チャットや端末コマンド、GUI操作からのリアルタイム信号を継続的な学習データに変換し、AIエージェントの訓練を可能にする。数十回のインタラクションで顕著な改善が見られるという。