- 何が起きた: DeepSeek の V4 Flash はリーダーボード上位だが、Composio による実環境テストでは複雑なエージェントタスクの成功率が 53.8% に留まり、6 つのワークフローのみが成功した。
- なぜ重要: リーダーボード上位だが実環境では成功率 53.8% に留まり、価格も最大 1,100% 引き上げられる。オーケストレーションや設定の違いで結果が変動し、コストと性能のバランス再検討が必要となる。
- 誰に関係するか: 自社の技術スタックにモデルを配置する企業担当者。ピーク時・オフピーク時の料金構造やキャッシュヒットに応じた階層型料金を確認し、代替手段を検討すべき。
- 出典: VentureBeat AI
ページを読み込み中…