Hugging Face、ストレージバケット機能(ウェブサイト)を公開
本文の状態
日本語全文を表示中
詳細モードで約5分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
Hugging Face は AI チーム向けストレージ「Storage Buckets」を発表し、Xet デュプリケーション技術と CDN を組み合わせた従量課金モデルで、モデルやデータセットの保存コストを大幅に削減する。
AI深層分析を開く2026年7月31日 23:33
AI深層分析
キーポイント
Xet テクノロジーによる効率化
コンテンツ定義チャンキングによりファイルバイトレベルで重複排除を行い、モデル再学習時に僅かな変更分のみアップロードすることでデータ転送量を最大4割削減する。
Git 制約のないストレージ設計
従来の Git のオーバーヘッドを排除し、コミットフリーの同期と高速なオブジェクト更新を実現して ML ワークフローに最適化されている。
透明でスケーラブルな価格設定
TB 単位のシンプルな課金を採用し、エグレスと CDN コストを含めた上で AWS S3 や Backblaze よりも低価格な $8〜12 の範囲を提示している。
インクリメンタルアップロードとデータ課金
モデル再学習時に重みの一部(5%)のみが変更された場合、その差分のみが再アップロードされる。エンタープライズプランでは生データと処理済みデータを重複して保存・請求されない仕組みがある。
計算リソースに依存しないデータ管理
データは単一の中立な場所に保存され、AWS や GCP など任意のクラウドプロバイダでトレーニングや推論を可能にする。CDN が事前ウォーム化されているため、GPU の場所に関係なく高速なストリーミングが実現される。
重要な引用
Xet uses content-defined chunking to break files into byte-level chunks and deduplicates across your entire bucket.
When you retrain a model and only 5% of weights change, only that 5% is re-uploaded.
Simple per-TB pricing that scales with usage. Egress and CDN are included at no extra cost.
Your data lives in one neutral home, not inside a single cloud.
編集コメントを表示
編集コメント
Hugging Face は従来の Git ベースの管理手法に代わる、AI 固有のストレージ要件に応えた新サービスを発表した。Xet テクノロジーによる重複排除機能は、大規模モデルの頻繁な更新を伴う現場において運用コストを劇的に下げる可能性を秘めている。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
Hugging Face ストレージバケット(ウェブサイト)
モデル、データセット、アーティファクトを保存。シンプルな TB 単価課金。組み込み CDN と Xet デュプリケーション、Git のオーバーヘッドなし。
10,000 以上の AI チームに信頼されています
AI チーム向けに設計されたストレージ
モデル、データセット、アーティファクトを保存。シンプルな TB 単価課金。Xet デュプリケーション機能付き。CDN も標準装備。Git のオーバーヘッドはありません。
- 組み込み CDN と重複排除による高速化を実現する TB 単価課金
- Git の制約なし:コミット不要の同期と高速なオブジェクト更新が可能
- ML ワークフローに最適化:データセット、チェックポイント、モデルアーティファクトを扱う設計
Xet テクノロジー
###次世代の大規模ストレージ
Xet はコンテンツ定義チャンキング(内容に基づいた断片化)を採用し、ファイルをバイトレベルのチャンクに分割して、バケット全体で重複排除を行います。モデルの再学習時に重みの 5% しか変更されていない場合でも、アップロードされるのはその 5% のみです。
- 生データと処理済みデータを一度だけ保存・課金*(※同一データは重複排除により重複課金されない)
- アップロード時のデータ量が 4 分の 1 に削減(実ワークロードで検証済み)
*Enterprise または Enterprise Plus プランが必要です。
料金プラン
透明で容量に応じた課金
利用量に応じてスケールするシンプルな TB 単位の価格設定。データ転送(egress)や CDN も追加料金なしで利用可能です。
AWS S3:$23
Backblaze Overdrive:$15
HF Hub:$8–12
Data Storage
スケールにこだわらないトレーニングデータの構築
クローリング結果、注釈データ、合成出力、パートナーのデータセットなど、あらゆるソースからの生データを単一のバケットに流し込みます。Git のオーバーヘッドもコミット待ち行列もファイル数の制限もありません。トレーニング開始時にはデータはすでにそこにあり、付属の CDN を介して GPU にストリーミングされます。
- アップロード即座に利用可能。コミットの待機なし
- バッチ API で一度の呼び出しで数千ファイルを処理
- 生データと加工済みデータを重複排除(dedup)して管理。二重課金なし*
- Enterprise または Enterprise Plus プランが必要です
コンピュートに依存しないデータ管理
データは単一のクラウド内に閉じ込めず、中立の場所に保存します。トレーニングや推論を、容量があるか価格が最安かのいずれかで選んだプロバイダー向けに指向し、ペタバイト規模の再アップロードや転送料金なしで切り替え可能です。
- 1 つのバケットから AWS、GCP、Nebius、または自前のクラスタでトレーニング可能
- 特定のクラウドプロバイダーの価格や容量にロックされない
- プリウォームされた CDN がデータと GPU を近接させ、どこで実行しても高速アクセスを実現
内蔵 CDN で超高速アクセスを実現
すべてのバケットに CDN が標準搭載されています。計算リソースに近い場所にローカライズされたキャッシュを温めておくことで、超高速なストリーミングやダウンロードが可能になります。転送量(egress)は、総ストレージ容量の最大 8:1 の比率まで無料で利用できます。
必要なクラウドリージョンでキャッシュを事前読み込み
当社の CDN は GCP および AWS ネットワーク内に展開されており、ストレージ使用量の 8 倍までエグレス(転送)料金が無料です。他のプロバイダーの追加も計画中です。
コーディングエージェント
コーディングエージェントに永続ストレージを付与
コーディングエージェントは非永続的な環境で動作しますが、その出力結果が消えてしまってはいけません。チェックポイントやベンチマークの結果、生成されたデータセットなど、エージェントの Bash ツールで「hf sync」コマンドを実行するだけで保存可能です。
- 事前読み込み済みの CDN と Git のオーバーヘッドなしで高速な読み書きを実現
- 非永続的な CI ランやターミナルセッション間でもアーティファクトを保持
- 公式の HF CLI スキルをインストールすれば、エージェントはすべてのコマンドを理解します
AES-256 暗号化
保存時および転送中のエンドツーエンド暗号化に対応
監査ログ
すべてのアクセスイベントを完全に可視化
SSO & RBAC
ロールベースのアクセス制御(RBAC)を備えたエンタープライズ向け SSO を提供
US & EU リージョン
データの保存場所を選択可能
image |
image
HF Storage Buckets の利用開始
HF Storage Buckets で始めましょう。AI データを同期し、ML ワークフローに最適化されたオブジェクトストレージの利点を享受してください。
原文を表示
Hugging Face Storage Buckets Storage Buckets
Store models, datasets, and artifacts with simple per-TB pricing. Built-in CDN, Xet deduplication, and no git
overhead.
Trusted by more
than 10,000 AI teams
Storage
Storage built for AI teams
Store models, datasets, and artifacts with simple per-TB pricing. Xet deduplication. Included CDN. No
git overhead.
- Per-TB pricing with built-in CDN and deduplication speedups.
- No Git constraints: commit-free sync and fast object updates.
- Designed for ML workflows: datasets, checkpoints, model artifacts.
Xet Technology
Next-gen large-scale storage for AI
Xet uses content-defined chunking to break files into byte-level chunks and deduplicates across your
entire bucket. When you retrain a model and only 5% of weights change, only that 5% is re-uploaded.
- Raw + processed dataset: stored once, billed once*
- 4x less data per upload, verified with real-world workloads
*Requires Enterprise or Enterprise Plus plan
Pricing
Transparent, volume-based pricing
Simple per-TB pricing that scales with usage. Egress and CDN are included at no extra cost.
AWS S3
$23
Backblaze Overdrive
$15
HF Hub
$8–12
Data Storage
Assemble training data at any scale
Pour raw data from every source into a single bucket: crawls, annotations, synthetic outputs, partner
datasets. No git overhead, no commit queues, no file-count limits. When training begins, your data is
already there, streamed to GPUs via the included CDN.
- Immediate availability on upload, no queued commits
- Batch API processes thousands of files in a single call
- Raw + processed datasets with dedup = no double billing*
*Requires Enterprise or Enterprise Plus plan
Compute Agnostic
Your data, independent of your compute
Your data lives in one neutral home, not inside a single cloud. Point training and inference at
whichever provider has capacity or the best price, and switch without re-uploading petabytes or paying
egress to leave.
- Train on AWS, GCP, Nebius, or your own cluster from one bucket
- Never locked to one provider's prices or capacity
- Pre-warmed CDN keeps data next to your GPUs, wherever they run
CDN
Built-in CDN for blazing fast access
Every bucket includes a CDN. Warm localized cache close to where you compute for ultra fast streaming
and downloads. Egress is included up to a generous 8:1 ratio of your total storage.
- Pre-warm cache in any cloud region you need
- Our CDN is deployed inside GCP and AWS networks
- Egress included up to 8:1 your storage
More providers coming soon
Coding Agents
Give your coding agents persistent storage
Coding agents run in ephemeral environments, but their outputs shouldn't vanish. Checkpoints, benchmark
results, generated datasets: one hf sync command in your agent's bash tool is all it takes.
- Pre-warmed CDN and no git overhead for fast reads and writes
- Persist artifacts across ephemeral CI runs and terminal sessions
- Install the official HF CLI skill and your agent knows every command
AES-256 Encryption
End-to-end encryption at rest and in transit
Audit Logs
Full visibility into every access event
SSO & RBAC
Enterprise SSO with role-based access control
US & EU Regions
Choose where your data lives

|

Get started with HF Storage Buckets HF Storage Buckets
Start with buckets, sync your AI data, and unlock object storage built for ML workflows.
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み