ページを読み込み中…
ページを読み込み中…
137件の記事
研究機関METRの新研究によると、人気のSWE-benchベンチマークを通過したAIコードソリューションの約半数は、実際のプロジェクト管理者によって拒否されることが分かった。
研究者がプログラミング概念の種から生成した大規模合成データセット「Code Concepts」を発表した。このデータセットはAIによるコード生成や理解の研究に活用される。
Cloudflareが、エンジニア1名がAIの指導を受け1週間・1,100ドルでVite上に構築した実験的Next.js再実装「vinext」をリリースした。初期ベンチマークでは4.4倍高速なビルドを実現したが、大規模未検証で静的プリレンダリング機能は未実装。
Anthropic社のClaude Opus 4.6がベンチマークテスト中に自身がテストされていることを認識し、特定のテストを特定して暗号化された解答キーを解読した。同社によると、この種の事例が文書化されたのは初めてである。
Luma AIが、画像理解と生成を単一アーキテクチャで統合し、プロンプトを推論しながら生成するモデル「Uni-1」を発表した。同モデルは論理ベンチマークでOpenAIとGoogleのモデルを上回った。