Moonshot AI、コーディング特化モデル「Kimi K2.7-Code」をリリースし、ベンチマークで前作より +21.8% の性能向上を達成
Moonshot AI は長期的なソフトウェアエンジニアリングに特化したエージェント型コードモデル「Kimi K2.7-Code」を公開した。このモデルは Hugging Face で利用可能であり、Kimi Code ベンチ v2 において前バージョン K2.6 よりも +21.8% の性能向上を示している。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
今週、Moonshot AI はコーディングに特化したエージェント型モデルである Kimi K2.7-Code をリリースしました。このモデルの重みは、Modified MIT ライセンスの下で Hugging Face で入手可能です。また、Kimi API や Kimi Code 経由でも利用できます。
K2.7-Code は一般的なチャットではなく、長期にわたるソフトウェアエンジニアリングを目的としています。このモデルは計画を立て、編集を行い、ツールを実行し、複数のステップにわたってデバッグを行います。Moonshot は、このモデルを中心にサブスクリプション型のコーディングプラットフォームを提供しています。
Kimi K2.7-Code
K2.7-Code は Mixture-of-Experts モデル(専門家混合モデル)です。総パラメータ数は 1T で、トークンあたり 32B が活性化されます。設計では 384 のエキスパートを持ち、トークンごとに 8 つが選択され、1 つが共有されます。層数は 61 層で、そのうち 1 層は密結合層です。
アテンション機構には MLA(Multi-head Latent Attention)を採用し、フィードフォワードパスには SwiGLU を使用しています。MoonViT ビジョンエンコーダーが画像および動画入力を処理するために 400M パラメータを追加します。このモデルはネイティブの INT4 量子化に対応しており、コンテキストウィンドウは 256K トークン(262,144)です。
重要な制約として、思考モード(Thinking mode)は必須であり、これを無効にすると API エラーが返されます。サンプリング設定は固定されており、温度は 1.0、top_p は 0.95、n は 1、ペナルティは 0.0 です。デフォルトの最大出力トークン数は 32,768 です。
vLLM、SGLang、または KTransformers を使用してセルフホスト可能です。Hugging Face のリポジトリは非常に大きく、ディスク上では約 595 GB に相当します。これはサーバークラス向けのデプロイメントターゲットであり、ノートパソコン用のモデルではありません。
ベンチマーク
Moonshot チームは 6 つのベンチマーク結果を公開しました。K2.7-Code を K2.6、GPT-5.5、Claude Opus 4.8 と比較しています。K2.7-Code はすべての項目で K2.6 を上回っています。最も大きなコーディング性能の向上は Kimi Code Bench v2 で、スコアが 50.9 から 62.0 に上昇しました。
ベンチマーク
Kimi K2.6 | Kimi K2.7-Code | GPT-5.5 | Claude Opus 4.8 | K2.7 vs K2.6
Kimi Code Bench v2: 50.9 | 62.0 | 69.0 | 67.4 | +21.8%
Program Bench: 48.3 | 53.6 | 69.1 | 63.8 | +11.0%
MLS Bench Lite: 26.7 | 35.1 | 35.5 | 42.8 | +31.5%
Kimi Claw 24/7 Bench: 42.9 | 46.9 | 52.8 | 50.4 | +9.3%
MCP Atlas: 69.4 | 76.0 | 79.4 | 81.3 | +9.5%
MCP Mark Verified: 72.8 | 81.1 | 92.9 | 76.4 | +11.4%
K2.7-Code は MCP Mark Verified(検証済み MCP マーク)において Opus 4.8 を上回っており、スコアはそれぞれ 81.1 と 76.4 です。また、MLS Bench Lite では GPT-5.5 に迫る結果を記録しました。K2.7-Code は Kimi Code CLI で実行され、GPT-5.5 は Codex xhigh、Opus 4.8 は Claude Code xhigh でそれぞれ評価されました。
推論トークン効率:コスト主張であり、単なる品質ではない
Moonshot チームは、K2.6 と比較して推論トークンの使用量が約 30% 削減されたと報告しています。これは「過剰な思考の回避」として位置づけられています。
推論トークンは、多くの価格プランにおいて出力トークンとして請求されます。エージェントによるコーディングでは数百から数千ものステップが実行されます。各計画(プラン)、再試行、検証のたびに思考コストが再度発生します。30% の削減は、長い実行期間を通じて複利効果をもたらします。
この効果は同時に三つの場所で現れます。第一に、タスクあたりの出力トークンコストの低下です。第二に、ステップ処理速度の向上により、対話型 CLI セッションが支援されます。第三に、コンテキスト制限に達する前に実行可能なステップ数の増加です。
ユースケースと具体例
リポジトリ規模のリファクタリングが主要なユースケースです。エージェントに対して失敗しているテストスイートへの参照を指示します。エージェントはファイルを読み込み、モジュール間Acrossして編集を行い、緑色(合格)になるまでテストを再実行します。
コードレビューも第二の適用例です。プルリクエストの差分(diff)を入力し、リスク分析を依頼します。256K のウィンドウにより、大規模な差分、ログ、関連ファイルをまとめて保持することが可能です。
MCP ツール使用ワークフローは三つ目の適応分野です。K2.7-Code は MCP Mark Verified で 81.1 のスコアを記録しました。このスイートは、モデル・コンテキスト・プロトコル(Model Context Protocol)を通じてツール呼び出しの正しさを検証します。CI チェック、チケット更新、ファイル編集などを一つのループ内で実行するケースが対象です。
長文コンテキスト分析は四つ目の適応分野です。本モデルはテキスト、画像、動画の入力を受け付けます。ドキュメント、スクリーンショット、記録された再現手順を一つのプロンプトで共有できます。
Marktechpost のインタラクティブ・エクスプローラー
#mtp-k27-demo{
background:#111!important;color:#e7e7e7!important;
font-family:-apple-system,BlinkMacSystemFont,"Segoe UI",Roboto,Helvetica,Arial,sans-serif!important;
border:1px solid #222!important;border-radius:14px!important;
padding:22px!important;max-width:920px;margin:0 auto;line-height:1.5;
}
#mtp-k27-demo .k27-tab{
background:#181818!important;color:#cfcfcf!important;border:1px solid #2a2a2a!important;
padding:9px 14px;border-radius:9px;cursor:pointer;font-size:13px;font-weight:600;transition:.15s
}
#mtp-k27-demo .k27-pill{
display:flex;align-items:center;gap:7px;background:#181818!important;border:1px solid #2a2a2a!important;
padding:7px 11px;border-radius:20px;cursor:pointer;font-size:12px;color:#bdbdbd!important;user-select:none
}
#mtp-k27-demo .k27-fill{height:100%;border-radius:6px;width:0;transition:width .7s cubic-bezier(.22,1,.36,1);
display:flex;align-items:center;justify-content:flex-end;padding-right:8px;font-size:11px;font-weight:700;color:#0a0a0a}
#mtp-k27-demo .k27-save{background:#13210a!important;border:1px solid #2f4d14!important;border-radius:9px;
padding:10px 12px;font-size:12px;color:#aadd72!important;margin-top:12px}
@media (max-width:640px){
}
Kimi K2.7-Code — インタラクティブ・エクスプローラー
企業報告によるベンチマークと公式 API 価格。2026 年 6 月 12 日リリース。2026 年 6 月 12 日検証済み。
ベンチマーク
コスト・カルキュレーター
スペック
ソース:Moonshot AI Kimi K2.7-Code モデルカード。K2.7-Code は Kimi Code CLI で実行、GPT-5.5 は Codex xhigh、Claude Opus 4.8 は Claude Code xhigh で実行。一次データであり、独立したリーダーボードではありません。
入力トークン/ラン:50,000
出力トークン/ラン:8,000
キャッシュヒット率:50%
ラン/月:1,000
出力における推論の割合:40%
入力コスト$0.00
出力コスト$0.00
月額合計見積もり$0.00
$0.00
レート:キャッシュ済み入力 $0.19/1M、キャッシュミス入力 $0.95/1M、出力 $4.00/1M(公式 Kimi 価格)。節約ラインは、K2.7-Code が報告する K2.6 比で推論トークン使用量が約 30%低下していることを示しており、出力の推論割合に適用したものです。見積もり値のみです。
出典:Kimi K2.7-Code Hugging Face モデルカードおよび Kimi API ドキュメント。
// ---- データ(検証済み、企業報告に基づく)----
var models = [
{key:'k27', name:'K2.7-Code', color:'#76B900'},
{key:'k26', name:'Kimi K2.6', color:'#5a7fb5'},
{key:'gpt', name:'GPT-5.5', color:'#c98a3a'},
{key:'opus', name:'Opus 4.8', color:'#b070c9'}
];
var active = {k27:true,k26:true,gpt:true,opus:true};
var benches = [
{name:'Kimi Code Bench v2', k27:62.0, k26:50.9, gpt:69.0, opus:67.4},
{name:'Program Bench', k27:53.6, k26:48.3, gpt:69.1, opus:63.8},
{name:'MLS Bench Lite', k27:35.1, k26:26.7, gpt:35.5, opus:42.8},
{name:'Kimi Claw 24/7 Bench',k27:46.9, k26:42.9, gpt:52.8, opus:50.4},
{name:'MCP Atlas', k27:76.0, k26:69.4, gpt:79.4, opus:81.3},
{name:'MCP Mark Verified', k27:81.1, k26:72.8, gpt:92.9, opus:76.4}
];
var specs = [
['Architecture','専門家の混合 (Mixture-of-Experts)'],
['Total parameters','総パラメータ数:1T'],
['Activated parameters','活性化パラメータ数:32B'],
['Experts','専門家 384 個(8 個がアクティブ、1 個が共有)'],
['Layers','61 層(1 層は密結合)'],
['Attention / activation','アテンション/活性化関数:MLA / SwiGLU'],
['Context length','コンテキスト長:256K (262,144)'],
['Vision encoder','ビジョンエンコーダ:MoonViT (400M)'],
['Inputs','入力:テキスト、画像、動画'],
['Thinking mode','思考モード:必須'],
['Default max output','デフォルト最大出力:32,768 トークン'],
['Quantization','量子化:ネイティブ INT4'],
['Deployment','展開環境:vLLM, SGLang, KTransformers'],
['License','ライセンス:修正 MIT']
]
// ---- tabs ----
root.querySelectorAll('.k27-tab').forEach(function(t){
t.addEventListener('click',function(){
root.querySelectorAll('.k27-tab').forEach(function(x){x.classList.remove('on')});
root.querySelectorAll('.k27-panel').forEach(function(x){x.classList.remove('on')});
t.classList.add('on');
root.querySelector('[data-panel="'+t.dataset.tab+'"]').classList.add('on');
if(t.dataset.tab==='bench') setTimeout(renderBars,30);
});
});
// ---- benchmark pills ----
var pills = root.querySelector('#k27-pills');
models.forEach(function(m){
var p=document.createElement('div');
p.className='k27-pill';
p.innerHTML=''+m.name;
p.addEventListener('click',function(){
active[m.key]=!active[m.key];
p.classList.toggle('off',!active[m.key]);
renderBars();
});
pills.appendChild(p);
});
// ---- benchmark charts ----
var charts = root.querySelector('#k27-charts');
benches.forEach(function(b,i){
var wrap=document.createElement('div');wrap.className='k27-bench';
var h=''+b.name+'\n';
models.forEach(function(m){
h+='\n' + ''+m.name+'\n'
+'\n';
});
wrap.innerHTML=h;charts.appendChild(wrap);
});
function renderBars(){
benches.forEach(function(b,i){
models.forEach(function(m){
var el=root.querySelector('#f-'+i+'-'+m.key);
var parent=el.closest('.k27-row');
if(!active[m.key]){parent.style.display='none';el.style.width='0';return;}
parent.style.display='flex';
el.style.width=b[m.key]+'%';
el.textContent=b[m.key].toFixed(1);
});
});
}
setTimeout(renderBars,60);
// ---- specs ----
var sp=root.querySelector('#k27-specs');
specs.forEach(function(s){
var d=document.createElement('div');d.className='k27-spec';
d.innerHTML=''+s[0]+'\n'+s[1]+'\n';
sp.appendChild(d);
});
// ---- calculator ----
var R_CACHE=0.19, R_MISS=0.95, R_OUT=4.00; // per 1M tokens
function fmt(n){return '$'+n.toLocaleString('en-US',{minimumFractionDigits:2,maximumFractionDigits:2});}
function comma(n){return n.toLocaleString('en-US');}
var I={inp:root.querySelector('#k27-in'),out:root.querySelector('#k27-out'),
cache:root.querySelector('#k27-cache'),runs:root.querySelector('#k27-runs'),
think:root.querySelector('#k27-think')};
function renderBars(){
benches.forEach(function(b,i){
models.forEach(function(m){
var el=root.querySelector('#f-'+i+'-'+m.key);
var parent=el.closest('.k27-row');
if(!active[m.key]){parent.style.display='none';el.style.width='0';return;}
parent.style.display='flex';
el.style.width=b[m.key]+'%';
el.textContent=b[m.key].toFixed(1);
});
});
}
setTimeout(renderBars,60);
// ---- specs ----
var sp=root.querySelector('#k27-specs');
specs.forEach(function(s){
var d=document.createElement('div');d.className='k27-spec';
d.innerHTML=''+s[0]+'\n'+s[1]+'\n';
sp.appendChild(d);
});
// ---- calculator ----
var R_CACHE=0.19, R_MISS=0.95, R_OUT=4.00; // per 1M tokens
function fmt(n){return '$'+n.toLocaleString('en-US',{minimumFractionDigits:2,maximumFractionDigits:2});}
function comma(n){return n.toLocaleString('en-US');}
var I={inp:root.querySelector('#k27-in'),out:root.querySelector('#k27-out'),
cache:root.querySelector('#k27-cache'),runs:root.querySelector('#k27-runs'),
think:root.querySelector('#k27-think')};function calc(){
var inp=+I.inp.value, out=+I.out.value, cache=+I.cache.value/100,
runs=+I.runs.value, think=+I.think.value/100;
root.querySelector('#k27-in-v').textContent=comma(inp);
root.querySelector('#k27-out-v').textContent=comma(out);
root.querySelector('#k27-cache-v').textContent=(cache*100).toFixed(0)+'%';
root.querySelector('#k27-runs-v').textContent=comma(runs);
root.querySelector('#k27-think-v').textContent=(think*100).toFixed(0)+'%';
var inRate=cache*R_CACHE+(1-cache)*R_MISS;
var inCost=runs*inp*inRate/1e6;
var outCost=runs*out*R_OUT/1e6;
var total=inCost+outCost;
// illustrative 30% reasoning-token reduction on the reasoning share of output
var reasonOut=out*think;
var saved=runs*(reasonOut*0.30)*R_OUT/1e6;
root.querySelector('#k27-r-in').textContent=fmt(inCost);
root.querySelector('#k27-r-out').textContent=fmt(outCost);
root.querySelector('#k27-r-total').textContent=fmt(total);
root.querySelector('#k27-r-big').textContent=fmt(total)+' /mo';
root.querySelector('#k27-r-save').innerHTML=
'≈ '+fmt(saved)+'/mo saved vs K2.6-style reasoning, from ~30% fewer reasoning tokens.';
}
Object.keys(I).forEach(function(k){I[k].addEventListener('input',calc);});
calc();
})();
A Minimal Quickstart
Kimi API は OpenAI と互換性があります。モデル文字列は kimi-k2.7-code です。固定されたサンプリングパラメータを上書きすると、リクエストエラーが発生します。
コードをコピーしました。別のブラウザを使用してください。
import os
from openai import OpenAI
Base URL and key per the Kimi API docs at platform.moonshot.ai
client = OpenAI(
api_key=os.environ.get("MOONSHOT_API_KEY"),
base_url="https://api.moonshot.ai/v1",
)
messages = [
{"role": "system", "content": "You are a coding agent."},
{"role": "user", "content": "Refactor utils.py to remove duplicate code."},
]
resp = client.chat.completions.create(
model="kimi-k2.7-code",
messages=messages,
max_tokens=32768, # default cap; also the maximum
# thinking is enabled by default and cannot be disabled.
# temperature (1.0), top_p (0.95), n (1), and penalties (0.0) are
# fixed server-side. Passing any other value returns an error.
)
msg = resp.choices[0].message
print(msg.content)
Multi-step tool calls: append the full assistant message so that
reasoning_content is preserved. Dropping it errors on the next turn.
messages.append(msg.model_dump())
2 つのツール使用ルールがドキュメントから導かれます。現在のターンからの reasoning_content(推論コンテンツ)をコンテキスト内に保持してください。また、tool_choice は "auto" または "none" のみに設定してください。
K2.7-Code の比較
モデル | ライセンス | パラメータ | コンテキスト | API 価格 (1M トークンあたり/入力・出力)
---|---|---|---|---
Kimi K2.7-Code | Modified MIT (オープン) | 合計 1T / アクティブ 32B | 256K | $0.95 / $4.00
Kimi K2.6 | オープンウェイト | 1T クラス MoE | 256K | ~$0.67–0.95 / ~$3.39–4.00
GPT-5.5 クローズド非開示—Moonshot の表に含まれず
Claude Opus 4.8 クローズド非開示1M$5.00 / $25.00
Qwen3-Coder-480B-A35BOオープン(Qwenライセンス)480B / アクティブ35B 256K ネイティブホストにより変動
K2.7-Code は、キャッシュされた入力に対して1Mあたり$0.19をリストしています。
強みと弱み
強み:
変更版MITライセンスの下でオープンな重みを持ち、実用的なセルフホスティングの道筋があること。
コーディングおよびエージェント評価においてK2.6と比較して広範かつ一貫した向上が見られること。
クローズド型最前線モデルと比較してAPI価格が低いこと。
MCP Mark Verified ベンチマーク(企業報告)においてOpus 4.8を上回ること。
弱み:
すべての主要数値はローンチ時の自社データであること。
思考モードを無効化できないこと。
サンプリング制御が固定値にロックされていること。
多段階ツール呼び出しでは reasoning_content を保持する必要があること。
595 GB の重みサイズは、セルフホスティングにおいて真剣なコミットメントを要すること。
主なポイント
すべての主要ベンチマークはベンダー実行であり、独立した結果は未発表です。
K2.7-Code はオープンウェイトでコーディングに特化し、Kimi K2.6 を基盤として構築されています。
Moonshot によると、Kimi Code Bench v2 においてK2.6と比較して+21.8%の向上を報告しています。
このモデルは、K2.6 と比較して推論トークンを約30%削減して使用します。
Moonshot AI が Kimi K2.7-Code をリリース:Kimi Code Bench v2 において K2.6 より +21.8% の性能を記録したコーディングモデル
この投稿は、MarkTechPost で最初に公開されたものです。
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み