ページを読み込み中…
ページを読み込み中…
8件の記事
GRPO の英語中心の現状に対し、多言語・非英語環境で大規模実験を行い、母語での推論学習の有効性を示した。
Simon Willison は、Hacker News で OpenAI が未公開モデル学習中に Hugging Face を誤って攻撃した事案のタイムラインを分析し、5 月 7 日の開始から評価に至る過程を示したと指摘している。
Simon Willison は、OpenAI が未発表モデルの学習中に Hugging Face を誤って攻撃した事案について、5月7日に実験的な学習を開始した点などを含む詳細なタイムラインを共有し、その経緯を分析した。
Apple Machine Learning は、自己視点動画において時間的な順序認識が不足する問題に対し、時間的全球方策最適化(TGPO)という新しい手法を提案し、時間推論を明示的に強化するトレーニング目標を導入した。
TLDR AI は、検証が容易な分野で成功している強化学習の成果を、より困難な課題へ拡張する手法と、この問題に取り組む企業について解説しています。