Thinky が Apache 2.0 モデル「Inkling」を発表
本文の状態
日本語全文を表示中
詳細モードで約20分の本文を読めます。
同じ出来事の情報源
6媒体で確認
Vercel Blog · TechCrunch AI · MarkTechPost · TLDR AI · Latent Space · Simon Willison Blog
各社の報じ方を比較 ↓Thinky は 975B パラメータのマルチモーダルモデル「Inkling」を Apache 2.0 オープンウェイトで公開し、1M トークンのコンテキストと効率的な推論機能を備えた新基盤モデルとして業界に登場した。
AI深層分析を開く2026年7月30日 04:16
AI深層分析
キーポイント
大規模マルチモーダルモデルの公開
Thinky は 975B パラメータ(41B アクティブ)の Mixture-of-Experts モデル「Inkling」を Apache 2.0 オープンウェイトでリリースした。
広範なコンテキストと学習データ
同モデルは最大 1M トークンのコンテキストウィンドウをサポートし、テキスト・画像・音声・動画の 45 トリリオントークンで事前学習された。
軽量版モデルとコスト効率
アクティブパラメータ 12B の「Inkling-Small」も同時に公開され、低コスト・低レイテンシでの高性能な推論を可能にする。
開発者コミュニティからの評価
Mira Murati や Soumith Chintala などの著名人が、このモデルが同社の最初のフルリリース型オープンウェイト基盤モデルであると評価している。
975B-A41B モデルのアーキテクチャとライセンス
Inkling は約 9750 億パラメータを持つ混合専門家モデルで、1 トークンあたり 410 億パラメータが活性化される。Apache 2.0 ライセンスの下、テキスト・画像・音声の入力に対応し、最大 1M コンテキストをサポートする。
重要な引用
Inkling is a Mixture-of-Experts transformer with 975B total parameters, 41B active.
It supports a context window of up to 1M tokens.
It was pretrained on 45 trillion tokens of text, images, audio and video.
"Inkling is reported as 975B total parameters / 41B active parameters in most posts"
編集コメントを表示
編集コメント
Thinky の「Inkling」は、大規模パラメータ数と広範なコンテキストウィンドウを維持しつつオープンウェイトで提供される点で画期的である。特に Apache 2.0 ライセンスの採用により、商用利用を含めた開発者の活用範囲がさらに拡大すると予想される。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
Thinky は数ヶ月に一度、まるで息継ぎをするかのように姿を現しますが、そのたびに驚異的な成果を見せています。直近ではインタラクションモデルで注目を集めましたが、今回は「Inkling」を発表しました。これは単なる最良のモデル(SOTA)というわけではありませんが、アメリカ製のオープンモデルにおける堅牢な新ファミリーの基盤となるものです。

今回発表された「Inkling」は、Mixture-of-Experts(MoE)アーキテクチャを採用したトランスフォーマーモデルです。パラメータ数は合計 975B で、推論時に活性化するアクティブパラメータは 41B です。
コンテキストウィンドウは最大 100 万トークンをサポートします。事前学習には、テキスト、画像、音声、動画を含む計 45 トリリオントークンが使用されました。
Inkling は異なるサイズのモデル群のファミリーの先駆けです。これに併せて、より軽量な「Inkling-Small」のプレビューも公開しています。アクティブパラメータは 12B で、同様の学習レシピを用いていますが、コストとレイテンシをさらに抑えながら強力なパフォーマンスを発揮します。

Inkling は、テキスト、画像、音声をネイティブに推論処理できます。また、効率的で制御可能な「思考の努力」を調整することで、コストとパフォーマンスのバランスを実現しています。
Huggingface の詳細解説では、いくつかの興味深い技術的ハイライトが紹介されています。

2026 年 7 月 14 日〜15 日の AI ニュース。今回は 12 のサブレッド、544 件の Twitter(X)投稿を確認しました。Discord の情報は特に見つかりませんでした。AINews のウェブサイトでは過去のニュースをすべて検索可能です。なお、AINews は現在「Latent Space」の一部門として運営されています。メール購読の頻度設定も自由に変更できます。
AI Twitter レビュー
主な出来事
Thinking Machines Lab が、自社初の完全公開重みを持つ基盤モデルファミリー「Inkling」を発表しました。これはベンチマークで最高スコアを目指すフラッグシップモデルではなく、カスタマイズ可能なマルチモーダルなベースモデルとして位置づけられています。
Thinking Machines は Inkling を、「テキスト、画像、音声の各モダリティ間で効率的に推論を行う」オープンウェイトモデルと発表しました。重みは完全に公開されており、同社の Tinker プラットフォームや Playground @thinkymachines で即座に利用可能です。
Mira Murati 氏は Inkling を「社初のモデル」「ゼロから訓練されたもの」と表現し、オープンウェイトである点と、Tinker 上での同日微調整(fine-tuning)のサポートを強調しました @miramurati。
Soumith Chintala 氏はこれを Thinking Machines の「最初の汎用モデル」と位置づけ、オープンウェイト、975B パラメータ規模、ネイティブなマルチモーダル対応、そして Tinker や Hugging Face、パートナー企業での利用可能性を強調しました @soumithchintala。
John Schulman 氏は開発のタイムラインについて補足しました。事前学習は昨冬に開始され、1 月中旬からは小規模チームが中心となって、コーディング能力、推論機能、そしてエージェント(自律行動)トレーニングの構築を進めてきたと述べています @johnschulman2。
Lilian Weng は、Inkling を「幅広い能力カテゴリーにおいて堅牢なパフォーマンスを発揮する」ことを目指したファウンデーションモデルであり、実用性とカスタマイズ性を重視して設計されたものだと特徴づけています。
TML のスタッフは繰り返し、これは最終的な到達点ではなく、将来のバージョンへの基盤となる「Day 1 リリース」であることを強調しました。@soumithchintala, @cHHillee, @keirp1
今回のリリースでは、vLLM、SGLang、Modal、Baseten、Databricks、Hugging Face、そして量子化やコミュニティツールに至るまで、通常とは異例なほど広範な Day 0 のエコシステムサポートが提供されました。@vllm_project, @lmsysorg, @modal, @baseten, @Yuchenj_UW, @huggingface, @danielhanchen
独立した評論家たちは、即座にこれを「これまでに発表された米国発のオープンウェイトモデルの中で最強」と評価しました。ただし、一部のベンチマークでは依然として中国製のトップオープンモデルや最高峰のクローズドモデルには及ばないという見方が一般的です。@natolambert, @ArtificialAnlys, @scaling01
コアとなる事実と仕様
モデルサイズ、モダリティ、ライセンス、コンテキスト
Inkling の総パラメータ数は 975B、アクティブなパラメータは 41B と報告されています。これは @soumithchintala, @vllm_project, @ArtificialAnlys, @kimmonismus などの投稿で共通しています。
一部のツイートでは 974B(@Yuchenj_UW)や 952B(@multimodalart)という数字も見られますが、全体的なコンセンサスは約 975B です。
これは Mixture-of-Experts モデルであり、トークンごとに 41B のパラメータがアクティブになります。@VictoriaLinML
ライセンスは Apache 2.0 です。これは @natolambert, @Yuchenj_UW, @multimodalart などの反応や要約で複数の情報源から確認されています。
テキスト、画像、音声の入力をサポートし、テキスト出力が可能です。@soumithchintala, @TheRundownAI, @ArtificialAnlys
オープンウェイトのチェックポイントは最大 100 万トークンのコンテキスト長に対応しています。@vllm_project, @lmsysorg, @ArtificialAnlys
Tinker/API のコンテキスト長は 256K とされていますが、64K と 256K で価格体系が異なります。@ArtificialAnlys
トレーニングとリリースの詳細
TML によると、Inkling はゼロから学習されました。@miramurati, @LiorOnAI
コミュニティの読者がリリース資料から抽出したトレーニングトークン数は 45T とされています。@eliebakouch, @ArtificialAnlys または 48T という説もあります。@mervenoyann しかし、このデータセットで最も頻繁に言及されているのは 45T です。
Inkling は、推論の努力レベルや数値計算の負荷を制御可能に設計されています。@LiorOnAI, @TheRundownAI, @danielhanchen
Tinker の顧客は、極端なベンチマークスコアの追求よりも、簡潔な推論プロセスと強力なツール呼び出し機能を評価しています。@tinkerapi, @MichaelElabd
アーキテクチャの詳細が明らかになる
技術に詳しい人々の反応から、いくつかのアーキテクチャ上の選択が浮き彫りになりました。
ハイブリッド型またはスライディングウィンドウ型のアテンションを採用し、ローカル層とグローバル層の比率を 5:1 に設定、ウィンドウサイズは 512 です。@eliebakouch, @ariG23498
RoPE(回転位置埋め込み)ではなく、相対位置エンコーディングまたは相対アテンションバイアスを使用しています。複数の投稿者がこれを大規模モデルにおける最も革新的な選択の一つと評価しています。@stochasticchasm, @eliebakouch, @rasbt, @arohan, @ChangJonathanC
アテンションやFFNストリームの周囲に、短めの畳み込み層を追加した構成です。この手法は短めの畳み込みをこれほど大規模に使用するのは異例だと指摘するコメントが @eliebakouch, @stochasticchasm, @rasbt, @SonglinYang4 氏らから寄せられました。
共有エキスパートを2つ持つMixture of Experts (MoE) 構造も特徴的です。多くの最近の MoE モデルでは共有エキスパートは1 つが一般的ですが、この構成は特異なケースとして @eliebakouch, @ariG23498 氏らによって注目されています。
アーキテクチャに関するコミュニティの分析では、DeepSeek スタイルの補助損失なし負荷分散機構が採用されていることが指摘されました (@eliebakouch)。
学習手法については、muP や Muon/重み減衰のバリアントが論文記述から推測され、最適化器の専門家による反応で裏付けられました。Aaron Defazio 氏は、自分が提案した修正された重み減衰アプローチ「MuonC/AdamC」を採用していると明言しています (@aaron_defazio)。また、コミュニティの読者からは muP の採用も指摘されています (@stochasticchasm, @Laz4rz)。
推論速度向上のためのスペキュレーティブ・ディコーディングには、8 つの MTP ヘッドが活用されていると vLLM プロジェクト (@vllm_project) が強調しています。
バリアント
Inkling-Small は、今後登場する別モデルとして、あるいは別途議論される小規模版として @LiorOnAI, @teortaxesTex 氏らによって繰り返し言及されています。
コミュニティの要約によると、Inkling-Small のパラメータ数は合計 276B でアクティブ部分は 12B です。大規模モデルと比較しても、いくつかの評価項目で予想以上に競争力があると評価されています (@eliebakouch, @nrehiew_)。
パフォーマンスとベンチマーク
#### 独立したベンチマークの枠組み
Artificial Analysis によると、Inkling のインテリジェンス・インデックスでのスコアは 41 です。これは米国製のオープンウェイトモデルとして最高位であり、Nemotron 3 Ultra (38)、Gemma 4 31B (29)、gpt-oss-120b (24) を上回っています (@ArtificialAnlys)。
Artificial Analysis によると、Inkling は Intelligence Index のタスクで平均 25K トークンの出力を生成する一方、GLM-5.2 Max は 43K、Kimi K2.6 は 38K、DeepSeek v4 Pro Max は 37K とされています。この結果から、Inkling は相対的にトークン効率に優れていると評価されています。
Natolambert 氏はこれを「Nemotron Ultra から明確な一歩前進であり、新たな米国製モデルの最高峰」と評しましたが、「エージェントベンチでは GLM 5.2 にやや遅れ、マルチモーダル性能では Kimi K2.6 に及ばない」という見方も示しています。
Design Arena の発表によると、Inkling は Agentic Web App Arena で総合 9 位(Elo 1257)にランクインしました。これは Claude Opus 4.6 や Gemini 3.5 Flash と同程度の水準です。Design Arena はこれを「エージェントワークロードにおいて米国ベースのオープンウェイトモデルの中で最高順位」と評価しています。
また、Arena はローンチ当日から Agent Arena / Text / Vision / Code Arena に Inkling を追加しました。
引用された具体的なベンチマーク数値は以下の通りです。
Artificial Analysis より:
- GDPval-AA v2 Elo 1238。Kimi K2.6(1190)や DeepSeek v4 Flash Max(1189)を上回っています。
- τ³-Banking で 24% のスコア。Kimi K2.6(21%)を大きく上回り、DeepSeek v4 Flash Max(23%)もわずかに凌駕しています。
定性的な評価におけるポジティブな点:
- 「鋭く簡潔」な推論を行うため、冗長にならない @MichaelElabd
- エージェントタスクにおいてツール呼び出しが強く、長期にわたるエラー回復能力が高い @MichaelElabd
- 思考の質が高く、迎合的ではない (@skirano, @tinkerapi)
Alex Kirillov 氏は、多くのオムニモデルに見られる「音声入力=知能低下」という一般的な欠陥を Inkling は回避していると主張しましたが、別のユーザーはより強力な裏付けとなる証拠やベンチマークの提示を求めています @alex_kirillov, @giffmana, @alex_kirillov。
評価については賛否両論あります。
Scaling01 はベンチマークの質を「それほど高くはない」と批判し、これは「Kimi-K2.6 の別バージョン」に過ぎず、クローズドモデルや GLM-5.2 には及ばないと指摘。リリース時期が Kimi-K3 や DeepSeek-V4-GA に先駆けて設定された可能性があると推測しています @scaling01。
Stochasticchasm は「マルチモーダル性能は非常に強力だが、ターミナルベンチなどではそれほどではない」と評価しました @stochasticchasm。
JJitsev は、「オープンウェイトモデルで知識蒸留を行わずに訓練された唯一のモデル」という過剰な hype に反論。Inkling も実際にはオープンウェイトからの蒸留を利用しており、TerminalBench 形式の評価では GLM 5.2 よりも劣っていると指摘しました @JJitsev。
一方、TeortaxesTex は逆説的な見方を提示。「ベンチマークで平均的なスコアしか出さないのは、むしろ無理な最適化や蒸留による汚染が少ない証拠であり、独立したデータパイプラインが機能している可能性を示唆する」というポジティブな解釈です @teortaxesTex。
推論・システム・ローンチエコシステムについて
公式およびパートナーのインフラ情報
NVIDIA によると、Inkling は GB300 NVL72 で訓練され、リリース初日(day-0)には Hugging Face で NVFP4 チェックポイントが利用可能になりました @NVIDIAAI。
vLLM は、day-0 サポートに NVFP4 と BF16 を含み、Blackwell および Hopper 向けに最適化されていると発表。MTP(Multi-Token Prediction)を活用すれば、4 台の GB200 でユーザーあたり最大 380 トークン/秒の処理速度を達成できるとしています @vllm_project。
Inferact はシステム側の詳細を解説しました。sconv 対応のテンソル並列シャード、低遅延の融合集合通信(バッチサイズ 1 で 5 倍高速化)、そして TML の FA4 シアードバイアスカーネルとの直接統合などです @inferact。
LMSYS と SGLang は、Inkling アーキテクチャのネイティブサポートを実装しました。これには ShortConv、相対位置アテンション、共有エクスパート Sink MoE、プリフィル時のフル CUDA グラフ、MXFP8 KV キャッシュ、カスタマイズされた Megatron ベースドでの全パラメータおよび LoRA による RL(強化学習)、ルーティングの再プレイ、ランタイム間でののパラメータ同期、そして Modal からの DFlash 推測デコーディングが含まれます。
Modal は、Inkling の利用において独自の DFlash スペキュレーターを採用しており、これによりスループットと対話性が 67% 向上したとしています。
Soumith Chintala 氏は別途、Modal の DFlash スペキュレーターが「MTP(Multi-Token Prediction)よりもはるかに高速」であると強調しました。
コミュニティによる最適化の知見
Lysandre 氏は、TML の因果的 Conv1D を causal-conv1d に置き換えることでトークン処理速度が 4% 向上し、さらにアテンションを FlashAttention-4 に変更することで追加で 11% 向上したと報告しました。再学習なしでトータル約 15% のスループット増を実現しています。
Unsloth は、1-bit GGUF 量化モデルをリリースしました。これはサイズが 86% 削減(270GB vs 1.9TB)されながら、トップ 1% の精度の 74.2% を維持し、視覚・音声機能もサポートしています。
価格と利用状況
Artificial Analysis によると、Tinker での料金は以下の通りです。
64K コンテキスト:入力 100 万トークンあたり $1.87(キャッシュ済みは$0.374)、出力 $4.68
256K コンテキスト:入力 100 万トークンあたり $3.74(キャッシュ済みは$0.748)、出力 $9.36
Tinker、Hugging Face で利用可能。また、Databricks、Baseten、Modal、vLLM/SGLang スタックなどのローンチパートナーを通じて提供されています。
事実と意見
ローンチおよびパートナー企業によって直接裏付けられた事実に基づく主張
Open weights およびフルウェイトは @thinkymachines で公開されています。
ゼロからトレーニングされたモデルで、@miramurati 氏が開発に携わりました。
パラメータ総数は 975B(アクティブ部分は 41B の MoE 構造)、マルチモーダル入力はテキスト・画像・音声に対応。重みファイル上のコンテキスト長は 1M、Tinker/API では 256K です。開発には @soumithchintala 氏や @ArtificialAnlys 氏が貢献しました。
ライセンスは Apache 2.0 で、@natolambert 氏と @Yuchenj_UW 氏が主導しました。
事前学習は昨冬に開始され、エージェント機能・コーディング・推論に関する取り組みは 1 月中旬から @johnschulman2 氏の指揮下で本格化しました。
主要な推論スタックでは Day-0 サポートが提供されており、vLLM、Inferact、Modal、NVIDIA の各社から具体的な性能データも発表されています(@vllm_project, @inferact, @modal, @NVIDIAAI)。
解釈と意見
「最高の米国オープンモデル」や「米国のオープンソース最前線を救った」といった評価は、@natolambert 氏、@karinanguyen 氏、@saranormous 氏など複数の信頼できる観察者によって繰り返されていますが、あくまで主観的な判断です。
「OpenAI や Anthropic のモデルを蒸留(distill)していないため特に重要である」という主張には異論があります。Jxmnop 氏は当初、「そのような蒸行を行っていない唯一のオープンウェイトモデルだ」と述べていましたが (@jxmnop)、後に「どうやら少しは蒸留していたようだ。ただしごくわずかだが」と見解を修正しました(@jxmnop)。また、Andrew Carr 氏もこの純粋性を強調する枠組みに異議を唱え、SFT(Supervised Fine-Tuning)のトレーシングデータに Kimi 2.5 が使用されている点を指摘しています (@andrew_n_carr)。
「中国製のモデル発表より先に急いでリリースされた」という主張は批判者による推測に過ぎず、発表資料には裏付けがありません(@scaling01)。
また、「相対アテンション(relative attention)が TML に対して微調整の参入障壁をもたらすのは、逆伝播が困難だからだ」という主張も、@typedfemale 氏によって推測であるとして否定されています。
インクリングがマルチモーダル知能の損失を回避しているという主張は有望ですが、まだベンチマークでの完全な検証には至っていないというのが、@alex_kirillov 氏のツイートにおける見解です。
異なる視点
支持・楽観派
オープンウェイトと寛容なライセンスが戦略的勝利:多くの人が Apache-2.0 のリリースを、米国および西洋のオープンエコシステムに対する大きな追い風と捉えました @latkins, @saranormous, @brexton, @hyperindexed。
リーダーボード争いよりカスタマイズ性:研究者や開発者は、インクリングがベンチマーク最適化された点解決策ではなく、広範で調整可能な基盤モデルとして明確に位置づけられている点を高く評価しました @gneubig, @ben_burtenshaw, @thealexker。
高品質なリリース:複数のユーザーが、透明性のある内容、根拠に基づいたトーン、そして包括的な技術ドキュメントを称賛しました @lvwerra, @saranormous, @rasbt。
アーキテクチャへの関心:RoPE ではない位置エンコーディングの採用や、スケーリングされた短距離コンボリューションの使用は、TML が意味のあるアーキテクチャ上の賭けを行う意志があることの証拠として、@stochasticchasm, @rasbt, @ChangJonathanC 氏らから肯定的な注目を集めました。
中立・分析的視点
強力だが総合トップではない:最もバランスの取れた評価では、インクリングは新たな米国のオープンウェイトリーダーと位置づけられる一方で、GLM、Kimi、DeepSeek、あるいは一部のトップクローズドモデルには及ばないという見方が @natolambert, @ArtificialAnlys, @stochasticchasm 氏らから示されました。
基盤モデルとしての妥当性:複数のアナリストは、このリリースをシステムおよびビジネス上の動きと捉えています。堅牢で効率的なベースモデルを提供し、Tinker とその後の RL(強化学習)や微調整によって差別化を図るという戦略です @ben_burtenshaw, @kimmonismus, @tinkerapi。
批判的・懐疑派
全体としての最先端性には疑問:批評家たちは、このモデルがいまだに中国のオープンウェイトモデル群や最強のクローズドモデル(@scaling01, @JJitsev)に明確に劣っていると指摘しています。
純粋性の主張は過大評価:一部の反発は、同モデルが独自に「純粋」であるとか、知識蒸留されていないという誇張された主張に向けられました。このスレッドには過度な期待と、それに対する訂正の両方が含まれています(@jxmnop, @andrew_n_carr, @JJitsev)。
ベンチマーク結果の平凡さが懸念材料:一部の読者は、中程度のベンチマーク成績が、新たな最先端を切り開くものではなく、単に現在の中国製オープンモデルに遅れをとっている証拠だと捉えています(@scaling01)。
なぜこれが重要なのかという背景
最初の主要な TML 公開モデル:これは、元 OpenAI のリーダーや研究者らで構成された研究所への期待が数ヶ月続いた後、Thinking Machines から行われた初の真の外部モデルリリースです。この「オープンウェイト」を公開した事実自体が注目されました(@Hesamation, @TechCrunch)。
中国の勢いに対する米国のオープンウェイト回答:多くの反応は、Inkling を GLM、Kimi、DeepSeek、Qwen と比較しています。今回のリリースは、西側のオープンウェイトモデルが能力面や公開頻度で中国製に後れをとっているという懸念の中で行われたものです(@scaling01, @teortaxesTex, @sriramk)。
「オープンベース+ポストトレーニングのスタック」という論文の要旨は、TML のメッセージから読み取れるように、「まず有能なオープン基盤をリリースし、その後、カスタマイズ・ファインチューニング・RL インフラを通じて差別化を図る」という戦略を示唆しています。これは Tinker の配布方法とも整合しており、ユーザーからの反応も、単なるリーダーボードでの首位争いではなく、制御可能な推論能力、簡潔な出力、そして適応性に集中していることが示されています(@thinkymachines, @MichaelElabd, @ben_burtenshaw)。
推論エコシステムの成熟度:今回のリリースは、オープンな推論スタックがいかに進化を遂げたかを如実に物語っています。1 兆パラメータ級のマルチモーダル MoE モデルに対して、新たなアーキテクチャコンポーネントと複数のカーネルレベルの最適化を施したものを、リリース初日にサポートするといったことが、一年前であればこれほど実現可能とは考えられなかったでしょう(@vllm_project, @inferact, @LysandreJik)。
大規模なアーキテクチャ実験:RoPE の代わりに相対位置バイアスを採用したり、大規模な短距離畳み込みを活用したりといった選択は、研究者が注視するべきものです。これらがスケーリングやポストトレーニングの過程で堅牢性を示せば、今後のアーキテクチャのトレンドを示す指標となる可能性があるからです(@stochasticchasm, @rasbt, @ChangJonathanC)。
リリーススタイルが伝えるシグナル:多くの評論家が、この unusually 控えめなリリース言語を評価しています。また、「これが最強のモデルではない」という率直な認容と、詳細な技術ノートも高く評価されました。専門家層にとっては、ベンチマーク数値の最大化だけを狙った他社の発表と比較して、信頼性が格段に向上していると言えるでしょう(@eliebakouch, @lvwerra, @thealexker)。
さらに詳しく読む
AI算出
主要ニュースainew評価標準
AI モデルの具体的な新発表であり、既存ニュースと比較して詳細なパラメータ数(975B/41B)やコンテキストウィンドウ(100 万トークン)、学習データ規模などの独自情報を含んでいるため新規性は高い。ただし、日本企業との直接的な関連性や日本語圏特有の情報は含まれていない。
6つの評価軸を見る
- AI関連度
- 100
- 情報源の信頼性
- 75
- 新規性
- 75
- 調べる価値
- 75
- 重複の少なさ
- 47
- 日本での有用性
- 25
同じ出来事を6媒体で確認
同じ出来事を扱う別媒体の記事です。見出しと公開時刻を比較できます。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み