OpenBMB、26 億パラメータの推論モデル「MiniCPM5-2B」を公開
本文の状態
日本語全文を表示中
詳細モードで約5分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Artificial Analysis
OpenBMB が公開した推論特化型モデル「MiniCPM5-2B」は、40億パラメータ未満のオープンウェイトモデルとして最高スコアを記録し、軽量ながら強力なエージェント性能を発揮する画期的な成果である。
AI深層分析を開く2026年9月7日 23:07
AI深層分析
キーポイント
小型モデルにおける新基準の確立
MiniCPM5-2B は Artificial Analysis のインテリジェンス指数で 15 を獲得し、40億パラメータ未満のオープンウェイトモデルの中で最高位を記録した。
推論とエージェント性能の優位性
同モデルは GDPval-AA や τ³-Banking などの評価で上位に位置し、軽量サイズでありながら強力なエージェント機能を実証している。
特定領域における課題の明示
知識、コーディング、長期コンテキスト処理においては他モデルに劣る結果を示しており、特に CritPt では 0% のスコアにとどまった。
ハルシネーション抑制戦略
AA-Omniscience 評価において回答を控えることで非ハルシネーション率 78% を達成し、精度よりも安全性を優先する設計思想が反映されている。
推論モデルとしてのトークン効率性
MiniCPM5-2Bは知能指数タスクあたり19kの出力トークンを使用し、Granite 4.2 3Bと並んで最低レベルを記録した。Ling 3.0 Tinyが1ポイント多く取得するために約3倍の56kトークンを要するのと対照的である。
重要な引用
"MiniCPM5-2B scores 15 on the Artificial Analysis Intelligence Index v4.2, the highest of any open weights model under 4B total parameters"
"Its AA-Omniscience score of -12 is earned by abstaining from answering rather than accuracy."
"On τ³-Banking it is joint-first with Ling 3.0 Tiny at 21%, compared to 8% for the next best model, Granite 4.2 8B."
Agentic capability is MiniCPM5-2B's edge at this size.
編集コメントを表示
編集コメント
小型モデルの性能向上は、エッジデバイスやローカル環境での AI 活用を加速させる重要な転換点となる。特に回答を控えることで安全性を担保するアプローチは、実社会への導入において信頼性を高める有効な戦略と言える。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
OpenBMB の MiniCPM5-2B が、総パラメータ数 40 億未満のオープンウェイトモデルの中で最高となる Artificial Analysis Intelligence Index v4.2 でスコア 15 を記録
OpenBMB は、効率的な小型モデルである MiniCPM シリーズを開発したオープンソース AI グループです。MiniCPM5-2B はテキスト入力と出力に対応する 26 億パラメータの密着型推論モデルで、Apache 2.0 ライセンスの下で公開されています。
Intelligence Index でスコア 15 を獲得した MiniCPM5-2B は、総パラメータ数が約 3 倍ある Ling 3.0 Tiny(スコア 16)に次いで 1 ポイント差です。総パラメータ数 40 億未満のオープンウェイトモデルの中で、次に高いスコアを記録したのは Granite 4.2 3B(スコア 11)でした。
主要な結果:
➤ 総パラメータ数 40 億未満のオープンウェイトモデルとして最高となる Intelligence Index を達成し、「知能指数と総パラメータ数」の関係において新たなパレート最適点を設定しました。 スコア 15 は、Granite 4.2 3B(スコア 11)を 4 ポイント上回っています。総パラメータ数は 26 億ですが、これは推定値である Qwen3.5 4B(Reasoning, スコア 14)より 1 ポイント高く、かつパラメータ数が約 44% 少ないことになります。また、サイズが約 4 倍の Qwen3.5 9B(Reasoning, スコア 15)と同等のパフォーマンスを達成しています。密着型モデルであるため、このサイズ優位性は計算リソースではなく、メモリ使用量の削減という点に現れています。
➤ このサイズ域における強力なエージェント性能: GDPval-AA v2 Elo 831 は <4B モデル群をリードし、τ³-Banking では Ling 3.0 Tiny と並んで 21% を記録。一方、次点の Granite 4.2 8B は 8% に留まります。AA-Briefcase では比較セット内の測定モデル中 2 位(Elo 438)で、Granite 4.2 8B(324)を上回り、Ling 3.0 Tiny(485)にわずかに及ばない成績です。
➤ 知識・コーディング・長文コンテキストでは他モデルに譲る部分も。 MiniCPM5-2B は「Humanity's Last Exam」で 9%(16% を記録した Gemma 4 12B (Reasoning) に次ぐ 7 位)、「Terminal-Bench v2.1」で 9%(29% の Qwen3.5 9B (Reasoning) に次ぐ 8 位)、CritPt では 0% です。SciCode では測定された 5 モデル中 2 位(26%)で、Granite 4.2 8B(31%)に次ぎます。AA-LCR v1.1 では 59% を記録しセット内 5 位(Ling 3.0 Tiny の 60% に 1 ポイント差)。新設の専門ドキュメント推論評価「GDP.pdf」では、gpt-oss-20b (high) が 2% で上回る中、1% を達成しました。
➤ AA-Omniscience スコア -12 は、回答を控えることで得た結果です。 MiniCPM5-2B は AA-Omniscience の質問に 29% しか挑戦せず、その結果ハルシネーション回避率は 78% に達します。正答率 8% は Ling 3.0 Tiny(9%)より 1 ポイント低く、Qwen3.5 9B (Reasoning) の 16% の半分です。多くの質問に挑戦する競合モデルは厳しく評価され、Qwen3.5 9B (Reasoning) は -53、gpt-oss-20b (high) は -63 となっています。
推論モデルとしてトークン効率が優れています。MiniCPM5-2B はインテリジェンス・インデックスのタスクあたり 19k トークンの出力で済み、Granite 4.2 3B(19k)と並んで比較対象の中で最低コストでした。一方、Ling 3.0 Tiny は 1 つインデックスポイント高めるために 56k トークンを消費しており、約 3 倍の量が必要です。
モデルの詳細:
- パラメータ数: 2.6B(Dense)
- コンテキストウィンドウ: 131k トークン
- 入力モダリティ: テキストのみ
- ライセンス: Apache 2.0

このサイズ帯における MiniCPM5-2B の強みは、エージェント機能です。AA-Briefcase(エージェントによる知識作業の評価)では、Elo 評価が 438 で、Ling 3.0 Tiny(485)に次ぐ第 2 位となり、Granite 4.2 8B(324)を上回りました。Agentic Index は、インテリジェンス・インデックスに含まれる 3 つのエージェント評価(AA-Briefcase、GDPval-AA v2、τ³-Banking)の加重平均値です。

GDPval-AA v2 では、実世界の業務タスクを 1,000 人の人間ベースラインに対して評価するテストが行われますが、MiniCPM5-2B は Elo 831 を達成しました。これは Ling 3.0 Tiny(718)より約 110 ポイント、Granite 4.2 8B(647)より約 180 ポイント上回ります。同規模のモデルは通常これよりも大幅に低いスコアにとどまり、LFM2.5-2.6B は 204、Gemma 4 E4B (Reasoning) は 178 です。

推論モデルとしてもトークン効率が優れています。Artificial Analysis Intelligence Index のタスクでは、1 回の実行あたり出力トークンを 19k(そのうち推論に使用されるのが 11k)消費するのみで、同様のタスクを処理する Ling 3.0 Tiny が 56k、Granite 4.2 8B が 33k を必要とするのと比較して非常に少ないです。オンデバイスやエッジ環境での展開が想定される 2.6B モデルにとって、このトークン消費量は重要な指標となります。


MiniCPM5-2B は、直近で更新された Artificial Analysis Intelligence Index v4.1.1 で 23 点を獲得しました。v4.2 におけるスコア 15 は、評価項目の構成と重み付けが変更されたことによるもので、両バージョン間のスコアを直接比較することはできません。

MiniCPM5-2B の重みファイルは、Apache 2.0 ライセンスの下で https://huggingface.co/openbmb/MiniCPM5-2B から入手可能です。
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み