ページを読み込み中…
ページを読み込み中…
496件の記事
SpaceXAI は新 AI モデル「Grok 4.5」をリリースし、同社の創業者であるイーロン・マスク氏はこれを「オプス級の性能を持つモデル」と表現した。
Google は Android アプリ開発における大規模言語モデルの性能を評価するベンチマーク「Android Bench」を更新し、多数の新モデルを追加した。しかし、同社の Gemini モデルは依然として他社製モデルに劣る結果となっている。
LangChain Blog は、Deep Agents というエージェントが NVIDIA の NemoClaw プラットフォーム上でコードを実行する機能について発表した。
OpenAI が、コーディング能力の評価において有用な指標(信号)と誤解を招く要因(ノイズ)を区別する手法について議論した。
JetBrains は、AI エージェントが Kotlin の課題解決から検証通過までの一連のタスクをどの程度信頼性高く完了できるかを評価するための公式ベンチマーク「Kotlin Benchmark」を公開した。