ページを読み込み中…
ページを読み込み中…
105件の記事
Google DeepMind の元研究者デヴィッド・シルバー氏は、設立した AI ラボへの持分による莫大な富を自らの懐に入れず寄付する仕組みを構築している。
Simon Willison は、OpenAI が未発表モデルの学習中に Hugging Face を誤って攻撃した事案について、5月7日に実験的な学習を開始した点などを含む詳細なタイムラインを共有し、その経緯を分析した。
著者は、強化学習(RL)環境が RSI やエージェント構築において不可欠であると主張し、過去の専門家システムや AGI への期待から得られた教訓を踏まえて解説した。
Hugging Face は、長期ツール使用における外部環境依存を解消する強化学習手法「EnvACE」を発表し、世界シミュレーションによる学習代替を実現したと報告した。
Hugging Face は、長期多段階のエージェントタスクにおいて重要な意思決定への帰属評価が困難な課題に対し、批評家不要の再帰的自己蒸留手法「AgentOPSD」を提案し、ターンレベルでの信用配分を実現する研究論文を発表した。