ページを読み込み中…
ページを読み込み中…
333件の記事
Google が Gemini API のファイル検索ツールにマルチモーダル対応、カスタムメタデータフィルタリング、ページレベルの引用機能を追加し、開発者が構造化されていないテキストと画像データを処理する RAG システムを構築しやすくした。
Apple は次期 OS「iOS 27」において、ユーザーが複数の AI モデルから自由に選択し、用途に応じて使い分けられる機能を導入する方針を明らかにした。これにより、単一のモデルに依存しない柔軟な AI 体験が可能となる。
ComfyUI は 4 月の更新で多数の新モデルや機能を追加し、Comfy Hub を拡大した。特に ByteDance の次世代動画生成モデル「Seedance 2.0」がパートナーノードとして即日利用可能になった。
Google は動画と画像生成ツールを統合する新モデル「Omni」を Gemini の UI でテストしており、2026 年の Google I/O での公開も検討されている。
Google はテキスト、画像、動画、音声、文書を単一の意味空間にマッピングする統合モデル「Gemini Embedding 2」の一般提供を開始した。この新モデルにより、開発者は1回のリクエストで複数のマルチモーダル入力を処理でき、エージェント型 RAG の性能が大幅に向上する。
llm開発者のsimonwはバージョン0.31を公開し、OpenAIのGPT-5.5モデルと冗長性設定オプションを追加した。
ChatGPT開発元のOpenAIは、主力画像生成モデルを「思考」機能を追加して強化し、品質向上を進めている。