ページを読み込み中…
ページを読み込み中…
16件の記事
言語推論の曖昧さに対し潜在画像再構築で視覚ロジックを整合させる ChronoVision を提案し、教師あり微調整で時系列推論能力を向上させた。
Apple Machine Learning は、自己視点動画において時間的な順序認識が不足する問題に対し、時間的全球方策最適化(TGPO)という新しい手法を提案し、時間推論を明示的に強化するトレーニング目標を導入した。
OpenAIは長年推測されてきた画像生成モデル「GPT-Image-2」をAPIおよびChatGPTで正式公開した。思考機能付き・なしの両バリアントを提供し、競合モデルを凌駕する性能を示している。
研究チームが、マルチモーダル事前学習のための計算効率的なデータ混合最適化フレームワーク「MixAtlas」を提案した。従来の単一視点の手法を超え、不確実性を考慮した混合最適化により、サンプル効率と下流タスクの汎化性能を向上させる。
NVIDIAが最新のマルチモーダル・多言語モデル「Gemma 4」を発表し、クラウドからエッジデバイスまで幅広い展開に対応するモデルを提供した。