ページを読み込み中…
ページを読み込み中…
18件の記事
NVIDIA は GPT-oss-120b に匹敵する性能を持つ小型オープンウェイトモデル「Nemotron 3.5 Lightning」を発表し、前世代から知能とエージェント性能を大幅に向上させた。
大規模言語モデルの生産環境導入に伴い、リアルタイムでのサービス提供が課題となる中、推論遅延を低減するための7 つの実践的アプローチについて解説している。
Baseten のフィリップ・キリーとアリ・ターハが、推論工学に関するマスタークラスを開催し、同社が 2026 年のオープンウェイト議論の最前線に位置していることを示した。
Cloudflare は Workers AI で Kimi K シリーズと GLM を GPU 上で効率的に実行し、メモリ制約下での事前処理とデコードの分離により大規模モデルの高速・安全な提供を実現した。
PrismML フォークの llama.cpp で Q1_0_g128 GGUF 形式の Bonsai-27B を GPU で検証し、OpenAI 互換サーバーとして起動する。