ページを読み込み中…
ページを読み込み中…
105件の記事
AWS は、大規模言語モデルの学習における報酬信号の信頼性問題を解決するため、SageMaker AI で動作する検証可能な報酬に基づく強化学習手法「GRPO」を紹介した。この手法は、隠れたバイアスや曖昧な成功基準による学習の破綻を防ぎ、モデルがより正確に学習・判断できるようにする技術である。
Google の AI 部門 DeepMind は、人気 SF シミュレーションゲーム『EVE Online』の開発元 CCP Games に少数株を取得し、複雑で動的なプレイヤー駆動システムにおける知能の研究を目的としたパートナーシップを開始した。
イタリア出身の研究者ガブリエーレ・ファリーナは、幼少期から数学や科学に没頭し、14 歳で戦略的思考の研究に焦点を当てた。この研究は AI の発展に重要な役割を果たす。
IBM は、15 トリオントークンで学習した Granite 4.1 系列のオープンソース大規模言語モデルを公開しました。このシリーズは 3B、8B、30B パラメータの Dense アーキテクチャを採用し、特に 8B モデルは多段階強化学習により前世代の 32B モデルに匹敵する性能を実現しています。