Vercel AI Gateway、サービスティア対応へ
Vercel は AI Gateway にサービスティア機能を追加し、レイテンシ、スループット、コストの最適化をユースケースに応じて切り替えられるようになった。
キーポイント
3 つのサービスティアの導入
デフォルト(標準)、プライオリティ(高速・高コスト)、フレックス(低コスト・高レイテンシ)の 3 つのティアが用意され、ユースケースに応じて選択可能。
広範な API 形式とプロバイダー対応
AI SDK や Chat Completions など主要な API 形式全体で動作し、OpenAI と Gemini モデルで利用開始。
動的な課金とフォールバック機能
リクエストが実際に使用されたティアに基づいて自動課金され、プライオリティ要求が容量不足時にデフォルトにフォールバックした場合もデフォルトレートで請求される。
プロバイダーごとの細粒度制御
複数のプロバイダーからモデルが提供される場合、特定の提供者に対してのみ異なるサービスティアを設定可能。
重要な引用
Service tiers let you optimize for latency, throughput, and cost per request to match your use case.
If a priority request gets downgraded to default capacity, billing reflects the default rate, not the priority rate.
影響分析・編集コメントを表示
影響分析
この機能により、AI アプリケーション開発者はコストとパフォーマンスのトレードオフを柔軟に管理できるようになり、大規模な AI サービスの運用効率と経済性が劇的に向上します。特に、予測不能なトラフィック変動やコスト制約のある環境において、リソース配分を動的かつ効率的に行えるようになります。
編集コメント
Vercel の AI Gateway が提供するこの機能は、AI アプリケーションの運用コストとパフォーマンスを細かく制御できる画期的なツールです。特に、異なるユースケースに対して最適なリソース配分を実現する仕組みは、実務レベルでの AI サービス構築において即座に活用価値が高いと言えます。
AI Gateway にサービスティア機能が追加されました。この機能を使えば、ユースケースに合わせてレイテンシ、スループット、リクエストあたりのコストを最適化できます。
対話型ワークロードには高速なティアを選択してキューイングを減らしトークン処理量を最大化するか、多少の遅延に耐えられるバッチジョブには低コストなティアを選ぶことが可能です。
現在、この機能は OpenAI および Gemini モデルで利用可能です。
サービスティアは、AI Gateway がサポートするすべての API 形式(AI SDK、Chat Completions API、Anthropic Messages API、OpenAI Responses API、OpenResponses API)で動作します。Gateway はリクエストに使用されたティアに基づいて請求額を自動調整します。
利用可能なティア
- default: 標準的な処理モード
- priority: コストは上がりますが、より高速な処理を実現
- flex: コストを抑えますが、レイテンシが高くなる可能性があります
サービスティアを指定しない場合、リクエストは自動的に default ティアで実行されます。
基本的な使い方
providerOptions.gateway 配下に serviceTier を設定してください。このオプションは、サービスティアをサポートするすべてのモデルやプロバイダーで共通して動作するため、モデルを切り替える際にもプロバイダ固有の設定を再構築する必要はありません。
適用されたティア情報はプロバイダーのメタデータに含まれるため、どのティアがリクエストに応じたかを確認できます。これは、優先処理のリクエストがデフォルト容量にフォールバックした場合や、異なるティア間のレイテンシを比較する際に役立ちます。
サービスティアはベストエフォート(尽力の範囲)で提供されます。特定のティアを適用できない場合、リクエストはデフォルトレートで default ティアとして実行されます。エラーとなるのは、無効なサービスティア値が指定された場合のみです。
複数のプロバイダーでモデルをサービス提供する場合、一部の提供者のみでサービスティアを設定したい場合や、各提供者ごとに異なるティアを構成したい場合は、各提供者のネームスペース自体にティアを設定してください。
料金体系
AI Gateway は、リクエストが実際に使用したティアに基づき、自動的に各ティアごとの料率を適用します。例えば、優先度の高いリクエストがデフォルト容量へダウングレードされた場合、請求は優先料率ではなくデフォルト料率で計算されます。
サービスティアの比較
- default: デフォルト設定。コストは基準(Baseline)です。
- priority: 優先権を持つ設定。コストはデフォルト料金の約1.8〜2倍です。
- flex: フレキシブルな設定。コストはデフォルト料金の約0.5倍です。
プロバイダーやティアの詳細については、サービスティアのリファレンスをご参照ください。
さらに詳しく読む
原文を表示
AI Gateway now supports service tiering. Service tiers let you optimize for latency, throughput, and cost per request to match your use case. Pick a faster tier for interactive workloads (less queueing, higher token throughput), or a lower cost tier for background jobs that can tolerate more latency.
At launch, service tiering is available for OpenAI and Gemini models.
Service tiers work across every AI Gateway API format: AI SDK, Chat Completions API, Anthropic Messages API, OpenAI Responses API, and OpenResponses API. AI Gateway adjusts billing based on the tier each request used.
Tiers
default: Standard processing
priority: Faster processing at increased cost
flex: Lower cost with potentially higher latency
If a service tier is not specified, requests run on the default tier.
Basic usage
Set serviceTier under providerOptions.gateway. The same option works across all models and providers that support service tiers, so you can swap the model without restructuring provider-specific options:
The applied tier is returned in the provider metadata so you can confirm which tier served the request. This is useful when a priority request falls back to default capacity, or when comparing observed latency across tiers.
Service tier is serviced on a best-effort basis: if a tier can't be applied, the request runs on the default tier at the default rate, and only an invalid service tier value fails the request.
Per-provider control
If a model can be served by multiple providers and you only want a service tier on some of them or to configure different service tiers across each, set the tier on the provider's own namespace instead.
Pricing
AI Gateway applies per-tier rates automatically based on the tier each request actually used. If a priority request gets downgraded to default capacity, billing reflects the default rate, not the priority rate.
Tier
default
priority
flex
Cost relative to default
Baseline
~1.8-2x default pricing
~0.5x default pricing
More details about providers and tiering are in the service tiers reference.
Read more
関連記事
今日のまとめ
AI日報で今日の重要ニュースをまとめ読み