ページを読み込み中…
ページを読み込み中…
3件の記事
TLDR AI は、重要な状態を追跡し、関連情報が失われるリスクがある際に行動エージェントに選択的にリマインドする別個のメモリエージェントを提案しました。この手法は、基盤となる行動モデルを変更せずに Terminal-Bench 2.0 やτ2-Bench の合格率を向上させます。
メルペイのフロントエンドエンジニアが、ランディングページを AI で作成する社内ツール「EGP Code」を支える 4 つの仕組みについて解説している。
Mishra は TRL や Unsloth などの抽象化を取り除き、すべてのエージェント学習システムが「プロンプト→モデル行動→環境→報酬→勾配更新」という同じループに還元されることを示した。また、純粋な Python でテキストから図を作成する玩具型エージェントを構築し、JSON の妥当性やレイアウト品質などを組み合わせた報酬関数を層状に追加する方法を紹介している。