Moonshot Kimi、次世代モデル「K3」を発表し知能の新たな前沿を切り拓く
本文の状態
日本語全文を表示中
詳細モードで約16分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Moonshot Kimi
Moonshot AI は世界初の 2.8 兆パラメータ規模のオープンソースモデル「Kimi K3」を正式に発表し、長文コンテキストと視覚理解機能を備えた次世代 AI の新基準を示した。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るAI深層分析を開く2026年8月12日 23:32
AI深層分析
キーポイント
世界初の 2.8 兆パラメータ級オープンモデルの登場
Kimi K3 は 100 万トークンのコンテキストウィンドウと視覚理解機能を備え、既存の閉源モデルに匹敵する性能を持つ最初の超大規模オープンソースモデルである。
独自のアーキテクチャ技術による効率化
Kimi Delta Attention(KDA)と Attention Residuals 技術を組み合わせ、MoE 構造の最適化により K2 モデル比で約 2.5 倍の拡張効率を実現した。
長期的なコーディングと複雑な推論への対応
大規模コードベースの理解や、視覚フィードバックを活用したゲーム開発・CAD 設計などの専門的な工程タスクにおいて高い能力を発揮するように設計されている。
段階的な公開と生態系連携への取り組み
即時利用可能な API やアプリに加え、2026 年 7 月 27 日までに完全なモデル重権を公開し、パートナー企業との技術整合性を確保する計画を示している。
GPU コア最適化とコンパイラ開発
Kimi K3 は GPU 沙箱環境で独自のコア最適化競技場を構築し、既存の実装の分析・再実装・検証を24時間以内に行う能力を示した。また、MLIR を基盤とした独自の Tile レベル中間表現と最適化パスを持つ「MiniTriton」というコンパイラを開発し、Triton や torch.compile に匹敵する性能を発揮した。
重要な引用
Kimi K3 は世界初の 3 兆レベルのオープンソースモデルである
Kimi K3 の全体性能は Claude Fable 5 や GPT-5.6 Sol に劣るが、他社すべてのモデルを安定して上回っている
「Kimi K3 はコードとリアルタイムスクリーンショットの間でシームレスに反復処理を行うことで、即時の出力確認と最適化を実現している。」
「48 時間にわたる自律エージェントとして、Kimi K3 は EDA ツールと Nangate 45nm 工艺库を用いて独立してチップを設計・検証し、100MHz で動作するプロトタイプを実現した。」
編集コメントを表示
編集コメント
2026 年という未来の日付で発表されたモデルであり、その性能が実証されるまでの間、業界は慎重な注視を続ける必要がある。Moonshot AI が提示したアーキテクチャの革新性は、今後のオープンソース大規模モデルの開発トレンドに大きな影響を与える可能性が高い。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
Kimi K3:智能の新たな最前線
大規模モデルの枠を超えて
困難に立ち向かい、遠大な目標を追求する。そのためには勇気を持ち、専念し、強靭な力で成し遂げなければならない。
本日、私たちがこれまでで最も能力の高いモデル「Kimi K3」を正式に発表します。
Kimi K3 は 2.8 兆パラメータを持つ大規模モデルです。KDA(Kimi Delta Attention)と呼ばれる混合線形アテンション機構と、アテンション残差(Attention Residuals)技術を基盤として構築されており、視覚理解をネイティブにサポートしています。また、100 万トークンという広大なコンテキストウィンドウを実現しました。
これは世界で初めて公開された 3 兆パラメータ級のモデルであり、長文のプログラミングタスク、知識作業、推論など、最先端の知能シナリオを想定して設計されています。
Kimi K3 の全体としての性能は、現時点では Claude Fable 5 や GPT-5.6 Sol といった最強のクローズドモデルにはまだ及びませんが、私たちが実施した一連の評価において、最先端レベルの能力を示し、他のすべてのモデルを安定して上回りました。
Kimi K3 の発表は始まりに過ぎません。私たちは引き続き K3 モデルの潜在能力を掘り下げ、実世界でのタスクにおける性能向上を目指していきます。
本日より、kimi.com、最新バージョンの Kimi 手机 App、最新版 Kimi Work デスクトップクライアント、Kimi Code、および Kimi API を通じて Kimi K3 モデルを利用できます。現在のデフォルト思考強度は「max(極限)」に設定されていますが、今後のアップデートで「low」と「high」の 2 つのモードも追加される予定です。
現在、推論パートナーやオープンソースのメンテナーと緊密に連携し、技術的な詳細を調整して、モデルが生態系全体で確実に稼働できるようにしています。完全なモデル重みは 2026 年 7 月 27 日までに公開されます。アーキテクチャ、トレーニング、評価に関する詳細については、Kimi K3 テクニカルレポートと合わせて発表される予定です。
3 兆パラメータ級のオープンソースモデル
Kimi K3 は、2.8 兆パラメータ規模を達成した初のオープンソースモデルです。これは、Kimi がモデルの規模の限界を引き続き押し広げようとする最新の一歩であり、過去 12 ヶ月間のうち 9 ヶ月で Kimi モデルがオープンソースモデルの規模上限を更新し続けてきました。
Kimi K3 は、Kimi Delta Attention(KDA)と Attention Residuals(AttnRes)を基盤に構築されています。これら 2 つのアーキテクチャ改良は、より長いシーケンスや深いモデル内での情報の流れをスムーズにするために導入されました。さらに、Mixture of Experts(MoE)のスパーシティ(疎性)も拡大しました。Stable LatentMoE フレームワークと組み合わせることで、896 個の専門家の中から効率的に 16 個を活性化できます。トレーニング手法やデータ構成の最適化も相まって、これらの構造的な改善により、Kimi K3 の全体としての拡張効率は K2 と比較して約 2.5 倍向上し、計算リソースを能力へ変換する効率が高まりました。
プログラミング
Kimi K3 は、極めて優れた長文脈のコード理解能力を備えています。限られた人的監督のもとでも、長時間にわたる大規模なエンジニアリングタスクを継続して実行でき、巨大なコードベースの理解と処理、そしてターミナルツールの協調的な利用が可能です。
また、Kimi K3 はソフトウェア工学と視覚推論を組み合わせたタスクにも優れています。スクリーンショットや視覚フィードバックを活用することで、ゲーム開発、フロントエンド実装、CAD 設計などの分野で最適化を実現します。
以下の事例は、Kimi K3 が持つコーディング能力が、どのようにオープンソースのソフトウェア開発や科学研究へと転換されるかを示しています。
■ カーネル最適化
カーネル最適化のための競技場を構築し、Kimi K3 が GPU カーネルをゼロから最後まで本当に最適化できるかを検証しました。各モデルは独立した GPU サンドボックス内で実行され、タスク、テストフレームワーク、本番負荷はすべて同一に保たれています。最大 24 時間の制限の中で、モデルは既存の実装を分析し、カーネルを書き換え、ベンチマークを繰り返し実行して効果を検証します。
この競技場では、2 つのハードウェアプラットフォーム、3 種類のカーネル、4 つのタスクが用意されています。具体的には、主流 GPU 上での Attention Residuals と KDA 線形注意力、ゼロから実装された 512 ヘッド・MLA カーネル、そして国産 GPU 上での KDA タスクです。最大限の思考強度を発揮した Kimi K3 のパフォーマンスは、リカバリー機構を含む Fable-5 に匹敵するものであり、Opus 4.8、GPT-5.6 Sol、GPT 5.5 を明確に上回っています。
■ GPU コンパイラ開発
さらに、Kimi K3 がゼロから GPU プログラミングシステムを構築できるかをテストしました。その結果、コンパクトな Triton 風コンパイラ「MiniTriton」が開発されました。MiniTriton は MLIR を基盤として独自のタイルレベル中間表現層を構築し、最適化パスから PTX コード生成までの完全なパイプラインを実現しています。
Roofline ベンチマークにおけるサポート範囲では、MiniTriton の性能は Triton や torch.compile に匹敵するか、あるいはそれを超えています。一部のワークロードにおいては、Triton を上回る結果も出ています。現時点で対応しているのは FP32 と FP64 計算であり、TF32 と BF16 は開発中です。初期段階の Tensor Core 実装がすでに高度に最適化された Triton を凌駕するとは考えていませんでしたが、ベンチマークへの近道や明らかなハードコーディングによる最適化を行っていないにもかかわらず、MiniTriton が競争力のある GPU コードを生成できることは示されました。
除微基准测试外,MiniTriton 还能稳定支撑端侧训练 nanoGPT,并观察到正常收敛。这说明 Kimi K3 做的不只是生成几个孤立的内核,而是搭建了一套真正可用的编译器栈:包括编程抽象、中间表示、优化 pass、后端代码生成,以及接入真实训练负载的能力。
■ 创作数字作品
Kimi K3 融合了强大的 3D 推理、编程与视觉能力,可将概念、图像和视频转化为完全可玩的交互体验。Kimi K3 在代码与实时截图之间无缝迭代,实现真正的视觉闭环(vision in the loop)——即时看见输出,即刻优化。
我们看一些示例:
▼3D 模拟长征十号火箭发射与回收
▼3D 开放世界游戏
▼ 3D GBA 模拟器
▼黑洞卡冈图雅复刻过程
访问网页:https://blackhole-visualizer.ok.kimi.link/
■ 芯片设计
作为早期概念验证,Kimi K3 设计了一款芯片,用于运行一个基于自身架构构建的 nano 模型。在连续 48 小时的自主 Agent 运行中,K3 基于开源 EDA 工具和 Nangate 45nm 工艺库,独立完成了芯片的构建、优化与验证。该芯片面积 4 mm²,集成 146 万个标准单元、0.277 MB SRAM 以及带融合反量化的 INT4 MAC 阵列,在 100 MHz 下完成时序收敛,仿真解码吞吐持续超过每秒 8,700 个 token。一颗由模型设计、为模型服务的芯片,正是 K3 长程 Agent 能力的写照。
(视频由接入 Blender MCP 的 Kimi K3 模型生成)
■ 科研编程
Kimi K3 可以打通科学文献与可执行代码,自主完成复杂计算研究流程的实现、验证和分析。
在一个案例中,Kimi K3 用约两小时完成了通常需要一名资深研究人员一到两周才能完成的工作。为了复现计算天体物理中的 I-Love-Q 普适关系,它阅读并交叉验证了 20 多篇论文,实现了完整的数值流程,评估了 300 多种状态方程,发现了已发表公式中的不一致之处,生成了 3,000 多行 Python 代码,并产出了一个用于探索结果的交互式 HTML 仪表盘。
■ 知识工作
Kimi K3 推动了端到端知识工作的进展。除了公开基准外,Kimi K3(max)在我们的内部评测中也展现出稳定提升。这些评测来自真实用户与智能体协作流程中反复出现的任务模式和挑战。Kimi K3 在不同生产场景导向的工作流中都表现出一致优势,说明其智能体知识工作能力得到了全面提升。
■ 研究とその可視化
Kimi Work に搭載された K3 が、金融コンサルティングや科学研究の現場でどのようなタスクをこなせるのか、いくつかの実例をご紹介します。
半導体設計(ASIC)業界の研究分析
このレポートは、ASIC 業界の過去 42 年間の歴史を網羅しており、K3 が 120 回以上の再帰的な自己改善プロセスを経て生成したものです。K3 は収集した証拠を基に、カスタマイズされたチャートやアニメーション図解、インタラクティブなビジュアルナラティブを作成しました。この一連の作業において、K3 は 2800 回を超えるウェブ検索とスクレイピング、1100 回以上の端末データ取得を実行。さらに、87 件の四半期決算報告書と 99 件の原稿 PDF(合計 11,000 ページ以上)を処理しました。
完全なインタラクティブレポートはこちら:https://asic42cn.ok.kimi.link/
核融合産業の研究分析
K3 が作成したコンサルティングレポート形式の業界分析です。タイムライン、ツリー図、ウォーターフォールチャート、ガントチャートを組み込み、そのまま発表可能な品質のプレゼンテーション資料へと仕上げました。
GWTC-5 重力波分析
391 件の重力波イベントを分析したケースです。20 以上の並行するサブエージェント(subagents)を活用し、7 枚の科学可視化図と 2 つの表を作成。さらに、関連する 10 篇以上の論文の文献内容を統合しました。
■ ウィジェットとダッシュボード
「Kimi Work」では、ユーザーと Kimi K3 の対話をより視覚的かつ持続的なものにするため、「ウィジェット」と「ダッシュボード」の 2 つの新機能を導入しました。ウィジェットを使えば、会話中に直接インタラクティブなコンポーネントを生成し、ローカルデータや外部プラグインに接続してリアルタイムで更新できます。また、ダッシュボードでは、最も重視するウィジェットをまとめ、特定のテーマ・プロジェクト・目標に沿って整理された、長期保存可能なパーソナライズビューを提供します。
■ 動画編集
Kimi K3 は、テキスト・画像・動画を同一のモデル内で理解できるネイティブなマルチモーダルアーキテクチャを備えているため、モーションデザインやアニメーション、動画編集に強みを発揮します。
一例として、K3 は自らのアーキテクチャを紹介する「3Blue1Brown」風の動画作成を行いました。技術概念をアニメーション図形やトランジションに変換し、4 分半の解説動画を完成させました。
別の事例では、Kimi K3 が 56 本の元素材からブランド動画を作成しました。選曲・アクションマッチング編集・フレーム単位でのタイミング調整・音声処理・複数回の修正までを自動でこなしています。情報密度の高い此类の短編動画は、通常、熟練した編集者でも 1〜2 日かかる作業です。経験が浅い場合なら、3〜5 日を要するのが一般的です。
■ アーキテクチャとインフラストラクチャ
Kimi K3 は、「Kimi Delta Attention(KDA)」と「Attention Residuals(AttnRes)」を基盤に構築されています。KDA はアテンションの拡張に対する効率的な基盤を提供し、AttnRes は単なる層ごとの均等な表現の蓄積ではなく、深さ方向への選択的な表現検索を実現します。この 2 つが組み合わさり、Kimi K3 のアーキテクチャの骨格を形成しています。これにより、モデルは 1 兆パラメータを超える規模へと拡張可能となっています。
Kimi K3 は「Stable LatentMoE」を採用し、896 個のエキスパートのうち実際に活性化するのは 16 個です。この高いスパース性において、ルーティングと最適化が重要な課題となります。「Quantile Balancing」は、ルーティングスコアの分位数に基づいてエキスパートを直接割り当て、ヒューリスティックな更新や敏感なバランス調整ハイパーパラメータを不要にします。「Per-Head Muon」では、Muon をアテンションヘッドごとに独立して最適化できる形へ拡張し、大規模訓練における学習プロセスをより適応的にしています。さらに、「Sigmoid Tanh Unit(SiTU)」と「Gated MLA」がそれぞれ活性化制御とアテンションの選択性を強化します。これらの改良により、2.8 兆パラメータ規模でも安定かつ効率的な訓練が可能になっています。
Kimi K3 は SFT(Supervised Fine-Tuning)段階から量子化感知トレーニングを採用し、MXFP4 の重みと MXFP8 の活性化を使用することで、より幅広いハードウェアに対応しています。大規模エキスパート並列処理において、エキスパートの負荷偏在がスループットに影響するのを防ぐため、完全均衡型エキスパート並列訓練手法を導入しました。これは静的形状を採用し、重要なパスではホスト間の同期を不要としています。推論効率もより大きな高帯域幅通信ドメインによって向上するため、Kimi K3 のデプロイには 64 個以上のアクセラレータで構成される supernode 環境を推奨しています。最後に、KDA が従来の prefix caching に新たな課題をもたらしたため、vLLM コミュニティに対応実装を提供し、モデルと共にリリースします。prefill cache を備えた KDA を活用することで、大規模モデルと長いコンテキストの条件下でも、競争力のあるトークン価格で Kimi K3 サービスを提供できます。
より詳細な技術情報は、今後の技術レポートにて公開予定です。
■ Kimi K3 の使い方
Kimi K3 エージェントを利用するには:スマートフォンアプリストアで「Kimi」を検索して最新版をダウンロードまたはアップグレードしてください。iOS、Android、HarmonyOS(鸿蒙)に対応しています。あるいは kimi.com に直接アクセスすることも可能です。
Kimi K3 と一緒に作業するには:最新の Kimi Work デスクトップクライアント(バージョン 3.1.0 以上)をダウンロードしてください。Windows および Apple チップ搭載 Mac で利用できます。
Kimi K3 を活用してプログラミングを支援するには:Kimi Code をお使いのコンピュータのターミナルで実行し、/model コマンドで K3 モデルを選択すればすぐに体験を開始できます。
Kimi API を活用したアプリケーション開発:Kimi API 開放プラットフォームにアクセスし、モデルとして「kimi-k3」を選択してください。料金は、入力トークン 100 万あたり 2 元(キャッシュヒット時)および 20 元(キャッシュミス時)、出力は 100 元です。Mooncake の分離型推論アーキテクチャを活用することで、Kimi 公式 API のプログラミングシナリオにおけるキャッシュ率は 90% を超え、実質的な入力料金は標準価格の 4 分の 1 に抑えられます。現在、最大 30% の追加ボーナスキャンペーンも併せて実施中です。
従業員向けに Kimi サブスクリプションを提供:Kimi Enterprise は、企業レベルでのデータプライバシー保護やメンバー管理をサポートしており、個人アカウントと企業アカウントのデータは完全に分離されます。「企業版を開設」ボタンをクリックしてオンラインで手続きを行えば、従業員への Kimi メンバーシップ登録が完了します。
また、今後は企業向けにマネージド Agent プラットフォーム「Kimi Hosted Agent」も提供予定です。Agent ハーネスや隔離されたサンドボックス環境、長期間タスクを実行できる環境を備えています。Waitlist へのご参加をお待ちしています。テストへの早期参加が可能です。
制限事項
- 過去の思考履歴への依存:Kimi K3 は後学習プロセスにおいて、思考履歴の保持モードを常に使用しています。Agent フレームワークが要件に従ってすべての思考履歴を正しく返送しない場合や、他のモデルとのセッションから Kimi K3 に切り替えた場合には、文脈の干渉が発生し、生成されるコンテンツの品質が不安定になる可能性があります。互換性が検証済みの「Kimi Code」などの Agent フレームワークの使用を推奨します。また、セッション途中で Kimi K3 に切り替えることは避けてください。
- 過度な能動性:Kimi K3 は、長期的かつ高難易度なタスクの実行に重点を置いて訓練されています。そのため、タスク実行中に小さな問題が発生したり、ユーザーの意図が不明確だったりする場面では、予期せぬ判断を下してユーザーに代わって行動しようとする可能性があります。もしアプリケーションで Agent に明確な境界線を持たせ、過度な自由發揮を抑えたい場合は、system prompt や AGENTS.md 内で Kimi K3 に対するより具体的な行動制約を設けてください。
- Kimi K3 は全体的に見ても非常に競争力のあるモデルですが、ユーザー体験の観点では Claude Fable 5 や GPT-5.6 Sol と比較すると、まだ若干の差があります。
WeChat で開くにはこちらへ
原文を表示
原创 Kimi K3 2026-07-17 01:02
image
不止于大
image
犯其至难而图其至远者,发之以勇,守之以专,达之以强。
今天,我们正式推出 Kimi K3,我们迄今能力最强的模型。
Kimi K3 是一个 2.8 万亿参数模型,基于 KDA 混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建,原生支持视觉理解,并拥有 100 万 token 上下文窗口。它是全球首个开源的 3 万亿级别模型,面向长程编程、知识工作和推理等前沿智能场景而设计。
虽然 Kimi K3 的整体表现仍落后于最强的闭源模型 Claude Fable 5 和 GPT-5.6 Sol,但它在我们的整套评测中展现出前沿水平的能力,并稳定超过了其他所有模型。
Kimi K3 的发布只是开始,我们会继续挖掘 K3 模型的潜力,持续提升它在真实任务中的性能表现。
即日起,可通过 kimi.com、最新版 Kimi 手机App、最新版 Kimi Work 桌面客户端、Kimi Code 和 Kimi API,使用 Kimi K3 模型。当前默认思考强度为 max(极致),后续更新后会增加 low 和 high 两种模式。
我们目前正与推理合作伙伴和开源维护者密切协作,对齐技术细节,确保模型能在整个生态中可靠上线。完整模型权重将于 2026 年 7 月 27 日前发布。关于架构、训练和评测的更多细节,将随 Kimi K3 技术报告一同公布。
3 万亿级开源模型
Kimi K3 是首个达到 2.8 万亿参数规模的开源模型。这是 Kimi 持续推进模型规模边界的最新一步:在过去 12 个月中的 9 个月里,Kimi 模型都保持着开源模型的规模上限。
Kimi K3 基于 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)构建。这两项架构更新,都是为了让信息在更长序列和更深模型中流动得更顺畅。我们也进一步扩大了 Mixture of Experts(MoE)的稀疏度:结合 Stable LatentMoE 框架后,模型可以在 896 个专家中高效激活 16 个。再加上训练方法和数据配方的优化,这些结构性改进让 Kimi K3 相比 K2 的整体扩展效率提升约 2.5 倍,能更有效地把算力转化为能力。
编程
Kimi K3 具备很强的长程编码能力。在极少人工监督的情况下,它可以持续完成长时间工程任务,理解和处理大型代码库,并协调使用终端工具。
Kimi K3 也擅长结合软件工程与视觉推理的任务。它能够利用截图和视觉反馈,优化游戏开发、前端和 CAD 等场景。
下面的案例展示了 Kimi K3 如何将编码能力转化为开放式软件开发和科学研究能力。
■ Kernel 优化
我们搭了一个内核优化竞技场,想看 Kimi K3 能不能真正把 GPU 内核从头到尾优化好。每个模型都在自己的 GPU 沙箱里独立运行,任务、测试框架和生产负载完全一致。最多 24 小时内,模型可以分析现有实现、重写内核,并反复跑分验证效果。
竞技场包含两种硬件平台、三类内核、四个任务:在一块主流 GPU 上的 Attention Residuals、KDA 线性注意力,一个从零实现的 512 头维度 MLA 内核,以及一个在某国产GPU上的 KDA 任务。在最大思考强度下,Kimi K3 的表现接近 Fable-5(含回退机制),并明显领先 Opus 4.8、GPT-5.6 Sol 和 GPT 5.5。
■ GPU 编译器开发
我们进一步测试了 Kimi K3 能否从零构建一套 GPU 编程系统。Kimi K3 开发了 MiniTriton:一款紧凑的类 Triton 编译器。它基于 MLIR 构建了自己的 tile 级中间表示层,并实现了完整的优化 pass 到 PTX 代码生成流水线。
在其支持的 Roofline 基准测试中,MiniTriton 的性能达到或超越 Triton 和 torch.compile,并在部分工作负载上优于 Triton。目前它支持 FP32 和 FP64 计算,TF32 和 BF16 还在开发中。我们并不期待它早期的 Tensor Core 实现能超过已经高度优化的 Triton,但结果说明:在没有针对 benchmark 走捷径、也没有明显硬编码优化的情况下,MiniTriton 已经能生成有竞争力的 GPU 代码。
除微基准测试外,MiniTriton还能稳定支撑端 训练 nanoGPT,并观察到正常收敛。这说明 Kimi K3 做的不只是生成几个孤立内核,而是搭起了一套真正可用的编译器栈:包括编程抽象、中间表示、优化 pass、后端代码生成,以及接入真实训练负载的能力。
■ 创作数字作品
Kimi K3 融合强大的 3D 推理、编程与视觉能力,可将概念、图像和视频转化为完全可玩的交互体验。Kimi K3 在代码与实时截图之间无缝迭代,实现真正的视觉闭环(vision in the loop)——即时看见输出,即刻优化。
我们看一些示例:
▼3D 模拟长征十号火箭发射与回收
▼3D 开放世界游戏
▼ 3D GBA模拟器
▼黑洞卡冈图雅复刻过程
访问网页:https://blackhole-visualizer.ok.kimi.link/
■ 芯片设计
作为早期概念验证,Kimi K3 设计了一款芯片,用于运行一个基于自身架构构建的 nano 模型。在连续 48 小时的自主 Agent 运行中,K3 基于开源 EDA 工具和 Nangate 45nm 工艺库,独立完成了芯片的构建、优化与验证。该芯片面积 4 mm²,集成 146 万个标准单元、0.277 MB SRAM 以及带融合反量化的 INT4 MAC 阵列,在 100 MHz 下完成时序收敛,仿真解码吞吐持续超过每秒 8,700 个 token。一颗由模型设计、为模型服务的芯片,正是 K3 长程 Agent 能力的写照。
(视频由接入 Blender MCP 的 Kimi K3 模型生成)
■ 科研编程
Kimi K3 可以打通科学文献与可执行代码,自主完成复杂计算研究流程的实现、验证和分析。
在一个案例中,Kimi K3 用约两小时完成了通常需要一名资深研究人员一到两周才能完成的工作。为了复现计算天体物理中的 I-Love-Q 普适关系,它阅读并交叉验证了 20 多篇论文,实现了完整的数值流程,评估了 300 多种状态方程,发现了已发表公式中的不一致之处,生成了 3,000 多行 Python 代码,并产出了一个用于探索结果的交互式 HTML 仪表盘。
知识工作
Kimi K3 推动了端到端知识工作的进展。除了公开基准外,Kimi K3(max)在我们的内部评测中也展现出稳定提升。这些评测来自真实用户与智能体协作流程中反复出现的任务模式和挑战。Kimi K3 在不同生产场景导向的工作流中都表现出一致优势,说明其智能体知识工作能力得到了全面提升。
■ 研究及其可视化
下面是几个例子,展示 Kimi Work 中的 K3 在金融咨询和科研场景中能完成什么。
推理芯片行业研究:覆盖 ASIC 行业 42 年历史,由 K3 经过 120 多轮递归自我改进生成。K3 将证据转化为定制图表、动画示意图和交互式视觉叙事。整个过程中,它完成了 2800 多次网页搜索与抓取、1100 多次终端数据拉取,处理了 87 份季报和 99 份原始 PDF,合计超过 11000 页资料。
查看完整交互式报告 https://asic42cn.ok.kimi.link/
可控核聚变产业研究:这是 K3 制作的一份咨询报告风格的行业研究,包含时间线、树状图、瀑布图、甘特图,以及达到发布质量的演示文稿。
GWTC-5 引力波分析:一次对 391 个引力波事件的分析,使用 20 多个并发 subagents,产出 7 张科学可视化图、2 张表格,并综合了 10 多篇论文的文献内容。
■ 小组件和看板
在 Kimi Work 中,我们推出了两个新功能:小组件(Widgets)和看板(Dashboard),让用户与 Kimi K3 的交互更加可视化,也更具持续性。小组件可以在对话中直接生成交互式组件,并连接本地数据或外部插件,实现持续更新。看板则可以把你最关心的小组件汇总到一个长期保留的个性化视图中,并围绕某个主题、项目或目标进行组织。
■ 视频剪辑
Kimi K3 擅长动效设计、动画和视频剪辑,因为它原生的多模态架构可以在同一个模型中理解文字、图像和视频。
在一个案例中,K3 制作了一支介绍自己架构的「3Blue1Brown 」风格动态图形讲解视频,把技术概念转化为动画图示和转场,时长 4 分半:
另一个案例中,Kimi K3 用 56 段原始素材剪出了自己的品牌视频,完成了选片、动作匹配剪辑、逐帧卡点、音频处理,以及多轮修改。像这样信息密度很高的短视频,通常需要有经验的剪辑师花 1 到 2 个工作日完成;新手则可能需要 3 到5 天。
架构和基础设施
Kimi K3 基于 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)构建。KDA 为注意力扩展提供了高效基础,AttnRes 则不是简单地在各层均匀累积表示,而是有选择地跨深度检索表示。二者共同构成了 Kimi K3 的架构骨架,使模型能够扩展到万亿参数以上的规模。
Kimi K3 采用 Stable LatentMoE,在 896 个专家中实际激活 16 个。在这样的稀疏度下,路由和优化成为关键挑战。Quantile Balancing 直接根据路由分数的分位数分配专家,避免启发式更新和敏感的平衡超参数;Per-Head Muon 则将 Muon 扩展到按注意力头独立优化,让大规模训练中的学习过程更自适应。Sigmoid Tanh Unit(SiTU)和 Gated MLA 分别增强激活控制和注意力选择性。这些改进共同支持了 2.8 万亿参数规模下稳定、高效的训练。
Kimi K3 从 SFT 阶段开始采用量化感知训练,使用 MXFP4 权重和 MXFP8 激活,以适配更广泛的硬件。为避免在大规模专家并行中因专家负载不均影响吞吐,我们引入了完全均衡的专家并行训练方法,使用静态形状,并且关键路径上不需要主机同步。由于推理效率同样受益于更大的高带宽通信域,我们建议在 64 个或更多加速器组成的 supernode 配置上部署 Kimi K3。最后,由于 KDA 给传统 prefix caching 带来了新的挑战,我们已向 vLLM 社区贡献了对应实现,并将随模型一同发布。借助带 prefill cache 的 KDA,即使在大模型规模和长上下文条件下,我们也能以很有竞争力的 token 价格提供 Kimi K3 服务。
更多技术细节将在后续技术报告中公布。
开始使用 Kimi K3
使用 Kimi K3 Agents:到手机应用商店搜索下载或升级到最新版 Kimi app,支持 iOS、Android 和鸿蒙系统,或直接访问 kimi.com。
与 Kimi K3 一起工作:下载最新版 Kimi Work 桌面客户端(3.1.0 及以上的版本),支持 Windows 和 Apple 芯片的 Mac 电脑。
用 Kimi K3 辅助编程:Kimi Code 运行在你的电脑终端里,通过 /model 命令选择 K3 模型即可开始体验。
接入 Kimi API 开发应用:访问 Kimi API 开放平台,模型选择 kimi-k3,价格为每百万 Token 输入:2 元(命中缓存)和 20 元(未命中缓存),输出:100 元。借助 Mooncake 分离式推理架构,Kimi 官方 API 编程场景的缓存率超过 90%,实际输入价格仅为标准输入价格的 1/4。最高 30% 的充赠活动同步进行中。
为员工提供 Kimi 订阅:Kimi 企业版支持企业级数据隐私保护、成员管理,个人账号与企业账号数据完全隔离。点击这里,找到「开通企业版」按钮,即可在线为员工订阅 Kimi 会员。
此外,我们即将面向企业推出托管 Agent 平台:Kimi Hosted Agent,提供 Agent harness、隔离沙箱和长任务运行环境,欢迎加入 Waitlist,第一时间参与测试。
局限性
- 对历史思考内容敏感: Kimi K3 在后训练过程中全程使用思考历史保留模式,如果 agent 框架未按要求回传全部历史思考内容,或从其他模型正在进行的会话中切换到 Kimi K3,则有可能引发上下文干扰,导致内容生成质量不稳定。建议使用 Kimi Code 等经过兼容性验证的 Agent 框架,并避免在会话中途切换到 Kimi K3。
- 过于主动:Kimi K3 的训练重点优化了长程、高难任务。因此,在任务执行过程中遇到小问题或用户意图模糊时,它可能会替用户做出非预期的决定。如果你的应用希望 agent 更有边界感、不要过于自由发挥,请在 system prompt 或 AGENTS.md 中对 Kimi K3 施加更明确的行为约束。
- 尽管 Kimi K3 总体上是一个非常有竞争力的模型,但与 Claude Fable 5 和 GPT-5.6 Sol 相比,在用户体验上仍有一定差距。
跳转微信打开
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み