Claude モデル選定ガイド:用途別ベストモデル解説
本文の状態
日本語全文を表示中
詳細モードで約9分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Claude Blog
Anthropic は新モデル選定において、高コストでも高性能な最上位モデルから始め、必要に応じて下位モデルへ調整する戦略を推奨し、Mythos や Fable など各クラスの特性と適用範囲を明確に示した。
AI深層分析を開く2026年7月28日 10:06
AI深層分析
キーポイント
モデル選定の基本方針
Anthropic はコスト効率やレイテンシが最優先でない限り、最も知的な一般利用可能モデルから開始し、努力レベル(effort level)で性能とコストを調整するよう推奨している。
Mythos と Fable の役割分担
Anthropic は最上位クラスである Mythos を信頼できる組織向けに提供し、Fable を追加の安全装置を備えた一般公衆向けにパッケージ化している。
Opus と Fable の使い分け
両モデルともコーディングや知識作業で高い性能を発揮するが、Fable はより大きな知恵や創造性を備えており、Opus が品質基準を満たせない場合に Fabel を選択すべきである。
コスト対効果の観点
トークン単価が高額でも、高性能モデルはタスク完了に必要なターン数や思考時間が短縮されるため、トータルのタスクあたりのコストが低くなる傾向がある。
重要な引用
our default recommendation is to start with the most intelligent generally available model and use effort level to dial in performance and cost
Cost-per-task is often lower for more intelligent models, especially at lower effort levels, even if the price-per-token is higher.
Mythos is Anthropic’s most capable model class, with frontier capabilities across domains.
編集コメントを表示
編集コメント
このブログ記事は、単なるモデルの仕様紹介に留まらず、実際の運用現場でコストと性能をどうバランスさせるかという実務的な知見を提供している。特に「高性能モデルから始めて調整する」という逆転の発想は、多くの組織が直面する予算制約と品質要求の間での意思決定を支援する重要な指針となる。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
私たちのアドバイス:賢く始める
「このタスクにはどのモデルを選べばよいのか」という質問は、私たちが最も頻繁に受けるものの一つです。より多くのモデルクラスやバージョンをリリースするにつれて、その答えも次第に複雑なものとなっています。
この記事では、各モデルクラスの詳細説明に加え、モデル選定時に確認すべき主要な質問やその他のベストプラクティスについて解説します。
ただし、細かいニュアンスは一旦脇に置いておきましょう。私たちのデフォルトの推奨は、「最も賢い一般利用可能なモデル」から始めることです。その上で、必要に応じて「エフォートレベル(処理コスト)」を調整してパフォーマンスとコストのバランスを取ります。
より高度なモデルほど、トークンあたりの単価が高くても、タスクあたりのコストが低くなるケースが多いです。特に低エフォート設定ではその傾向が強まります。これは、能力の高いモデルほど、必要な対話回数や思考時間が短く済むためです。逆に、小さなモデルから始めると、モデル自体の性能不足による失敗と、セットアップの問題による失敗を区別しにくくなるというリスクがあります。
もちろん、レイテンシやコストに敏感なユースケースが発生した場合は、下位クラスのモデルも試して、最適な組み合わせを見つけることができます。
また、コスト効率の高いモデルから始め、品質基準を満たすまで上位クラスへ移行するアプローチを選ぶ組織もあります。私たちは、モデル選定に関するドキュメントで、これらの両方の方向性を紹介しています。
Claude モデルファミリー
Mythos / Fable
Mythos は Anthropic が提供する最も高性能なモデルクラスであり、あらゆる分野で最先端の能力を備えています。特にコーディング、長時間実行するエージェントタスク、そしてこれまで AI が安定して処理できなかった問題の解決において、その能力は際立っています。
この Mythos クラスには、同じ基盤モデルを用いた 2 つのパッケージが存在します。Claude Mythos は、デュアルユース(軍事転用可能性)を持つサイバーセキュリティや生物学の研究を扱う信頼できる組織向けに設計されています。一方、Claude Fable は、一般ユーザーが安全に利用できるよう追加の安全性対策を組み込んだパッケージです。どちらのモデルも、安全な利用を実現するために 限定的なデータ保持ポリシー を適用しています。
Opus
Opus は、推論を要するエンタープライズタスクに特化した強力なモデルクラスです。Opus モデルは、知識労働向けの GDPval-AA や、エージェントによるコーディング向けの Terminal-Bench 2.1 など、主要な業界ベンチマークにおいて常に上位にランクインしています。
表面上では Opus と Fable の使い分けが明確に見えないかもしれません。両者ともコーディング、長時間実行するエージェント、知識作業において卓越した能力を発揮します。しかし実際の運用環境では、Fable などの大規模モデルは、ベンチマークスコアが Opus と同等であっても、より高い知恵や創造性、そして優れた文章作成スキルを備えている傾向があります。
一般的な目安としては、評価や内部テストで Opus が特定のタスクに苦戦しているようであれば、Fable が最適解となります。一方、Opus がすでに品質基準を十分にクリアしている場合は、その速度と価格設定のバランスから、より良い選択肢となる可能性があります。
Sonnet
Sonnet は、日常的なタスクに対応する多目的なモデルクラスです。高頻度のサブエージェントが多数存在するマルチエージェント構成など、幅広い汎用ユースケースにおいて、性能・コスト・速度の最適なバランスを提供します。
Haiku
Haiku は、最も低コストかつ高速なモデルクラスです。レイテンシとコストが重要な、高頻度で動作するワークロード向けに設計されています。
Claude モデルの使い分け:どのモデルをワークロードに選ぶべきか
Claude の各モデルクラスは特定の作業タイプに特化しているわけではありません。金融分野には一つ、科学分野には別というように、用途に応じてモデルを分けることを推奨していません。すべての Claude モデルは、コーディング、エージェントタスク、知識処理といった領域で卓越するように訓練されています。
モデルクラス間の主な違いは、「どの程度の難易度の問題を確実に処理できるか」と、その能力を実現するために必要な価格と速度のバランスにあります。モデルを選ぶ際は、以下の点を自問してみてください。
このタスクはどれほど難しいですか? 多くの時間を要する、複数のステップを踏む必要がある、あるいはこれまで解決されたことのない問題である場合は、より高性能なモデルクラスが適しています。
レイテンシ要件はどうでしょうか。 モデルが高頻度で顧客と接するワークロードに組み込まれる場合、Sonnet が最適な選択肢となることが多いです。
アクセス制限はどうなっていますか?
Mythos は、Project Glasswing の対象組織にのみ提供されています。すべての組織が、すべての役割に対してあらゆるモデルクラスを公開しているわけではありません。
単位経済性はどのようになっていますか?
生産量が多い場合は、評価結果からタスクが十分に完了できていると判断される場合に限らず、より低クラスのモデルを使用する方が適しているケースがあります。トークンあたりの料金はモデルによって異なりますし、その能力や必要な処理量に応じて、1 タスクあたりのコストも変わります。
必要とされる処理量(Effort Level)は、品質・速度・コストのバランスにも影響します。高クラスのモデルを高処理量で利用すれば、最も優れたパフォーマンスが得られます。また、低処理量の設定でも、高クラスのモデルの方が小規模なモデルよりも効率的に動作する場合があります。

グラフは概略を示すものであり、ベンチマークデータからプロットされたものではありません。
image
グラフは概略を示すものであり、ベンチマークデータからプロットされたものではありません。詳しくは、Claude Code における Claude モデルと処理量の選択 をご覧ください。
アドバイザー戦略で各モデルの強みを組み合わせる
「アドバイザー戦略」advisor strategy を活用すれば、コスト効率に優れたワーカーモデルが、より高度なモデルを呼び出して計画の検証や成果物の評価を行わせることができます。これにより、パフォーマンスの向上が期待できます。
この手法では、実行役となるモデルは必要な時だけ指導を受けるため、性能が大幅に向上します。例えば、SWE-bench Pro の Sonnet 5 ベンチマークにおいて、Fable 5 をアドバイザーとして活用した場合、Fable 5 を単独で全タスクを実行する場合の約 63% のコストで、そのスコアの 90% に迫る結果を達成できます。
モデル選定における評価指標とベンチマークの役割
モデルの能力が自社のニーズを満たしているかを確認するには、主に「標準ベンチマーク」と「独自評価」の 2 つの方法があります。
ベンチマークとは、特定のドメインに特化した事前定義されたタスクやシナリオのセットで、正解が既知となっています。これらは、異なるモデルクラスやプロバイダー間での能力を方向付けるための有用な指標となります。ただし、Opus や Fable のような高性能モデルを対象とする場合、テスト問題のほとんどを正答してしまう「飽和(saturation)」現象が発生し、評価が難しくなるという課題があります。
こうしたケースでは、組織は実際の業務負荷でモデルを実行するか、自社の独自評価を用いてテストを行うことを推奨します。これにより、どのモデルが最適か判断できます。一般的に、評価とは生産現場から抽出した問題のキュレーションセットであり、既存のツールでは対応しきれない難易度の高いタスクや、チームが定義した成功基準が含まれるのが特徴です。

ここが、最先端モデルの能力や創造性が他社製品や他モデルと明確に差をつけるポイントです。私たちはこれまで、カスタムエージェントの評価を効果的に行うためのベストプラクティスについて詳しく解説してきました。
賢い選択をするために
AI モデルの選定に万能な正解はありません。だからこそ、私たちは複数のモデルクラスを用意しています。最適なモデルを選ぶためには、各モデルクラスの基礎知識を理解し、自社のユースケースを深く把握することが不可欠です。そのためには、堅牢な評価基準を構築・維持・運用する必要があります。
AI算出
技術分析ainew評価高い
Anthropic の公式ブログによる Claude モデルファミリーの特性比較と選定ガイドであり、AI モデルの実運用に関する深い分析を含んでいる。ただし、日本固有の情報や企業事例は含まれていないため、日本の文脈での関連性は低めとなる。
6つの評価軸を見る
- AI関連度
- 100
- 情報源の信頼性
- 100
- 新規性
- 75
- 調べる価値
- 75
- 重複の少なさ
- 100
- 日本での有用性
- 25
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み