腾讯混元 Hy3、2950 億パラメータを 1bit/4bit 量化で単卡対応へ
本文の状態
日本語全文を表示中
詳細モードで約4分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Tencent Hunyuan
腾讯混元はコミュニティ要望に応え、Hy3 の重みを量子化し GGUF で公開。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
腾讯混元 2026-07-14 16:56 广东
Hy3 のオープンソース化と公開以降、コミュニティからは「量化版」の提供を強く求める声が挙がっていました。特に、単一の GPU で 295B(2,950 億)パラメータという巨大な Hy3 を動かしたいという要望が強かったのです。
多くのユーザーが、「ハイエンドモデルである Hy3 でも、リソースに制約のある環境なら、精度を少し犠牲にする代わりに動かせるのではないか」と模索しています。
こうしたコミュニティの声を踏まえ、腾讯混元チームは Hy3 の重みを 1bit および 4bit に量化し、GGUF 形式でパッケージ化しました。llama.cpp エコシステムとの親和性を高めることで、もともと複数 GPU を必要としていたモデルを、最小限の推論用 GPU 1 枚、あるいはメモリ容量が豊富なローカル環境でも実行可能にしました。
腾讯混元 Hy3 は 295B パラメータを持つフラッグシップモデルで、同サイズの他モデルを凌駕する知能レベルを示す一方、より大規模なフラッグシップモデルと肩を並べる性能を発揮します。これにより、多様な製品や生産性タスクにおける実用性が大幅に向上しました。ただし、BF16 形式の重みは約 600GB に達するため、その真価を引き出すには複数 GPU を備えたサーバー環境が不可欠でした。
1bit、4bit、BF16 の Hy3 モデルによるゲームプログラミングの例示
1bit で単一 GPU に収め、4bit でほぼフルスペックを実現
まず提供するのは 1bit の極限量化版「IQ1_M」です。重みのサイズを 598GB から 85.5GiB まで圧縮し、約 6.7 倍の削減に成功しました。これにより、VRAM 容量 96GB の推論用 GPU 1 枚で Hy3 をデプロイすることが可能になります。
ハードウェアリソースが最も限定的な環境や、ローカルマシンでフラッグシップモデルを動かしたいというケースには、Hy3 の 1bit バージョンを特におすすめします。
一方、「Q4_K_M」と呼ばれる 4bit 量化版も用意しています。サイズは 169.9GiB で、推論用 GPU を 2 枚用意すれば十分です。
限られたリソースコストの中で、フルスペックモデルに近い性能を得たいという場合は、Hy3 の 4bit バージョンを選ぶのが最適解です。
さらに、vLLM を介して直接デプロイし、外部サービスとして提供できる GPTQ Int4 バージョンも用意しました。
vLLM のエコシステムが持つ高並列処理や低遅延のメリットをそのまま享受でき、サーバーサイドでのデプロイ要件に特に適しています。
圧縮しても性能は維持された
画像
量化の良し悪しを判断する最も直接的な方法は、元のモデルとの出力分布がどれだけ近いかを見ることです。4bit 版はこの点で非常に優秀で、ほとんどの位置において最優先の回答や Top-K の確率分布が BF16 版と一致しています。実際のタスクでも同様で、エージェント機能、多言語コード生成、ツール呼び出し、長文理解いずれも「フルスペック」モデルに迫る結果を出しました。また、GPTQ Int4 モデルの評価セットでの性能低下幅は非常に小さく、全体として許容範囲内です。
画像
特に驚いたのが 1bit 版です。直感的には 1bit に圧縮するとモデルが劣化すると考えがちですが、Hy3 の 1bit 版は主要タスクでも安定した性能を発揮しています。長文理解は元のモデルとほぼ同等で、エージェントやコード生成も良好な水準を維持し、わずかな低下にとどまりました。日常のコーディング支援、ツール呼び出し、長文処理、一般的な質問応答といった用途であれば、すでに十分実用可能です。
MTP による高速化
画像
Hy3 を実際にスムーズに動かすには、MTP(Multi-Token Prediction)を用いた投機型デコードが不可欠です。そこで私たちは llama.cpp に専用パッチを開発し、Hy3 の MTP 構造に対応させました。利用可能なビルドとデプロイ手順も公開しています(詳細は https://huggingface.co/AngelSlim/Hy3-GGUF を参照)。MTP を有効にすると、受け入れ率は約 60% で安定し、1bit 版のデコード速度は約 50% 向上、4bit 版ではほぼ 60% の高速化が実現しました。実際のインタラクションでも快適な体験が可能です。
関連リンク:
Hy3 モデル:https://huggingface.co/tencent/Hy3
低ビット GGUF モデル:https://huggingface.co/AngelSlim/Hy3-GGUF
GPTQ Int4 モデル:https://huggingface.co/AngelSlim/Hy3-GPTQ-Int4
llama.cpp パッチ:https://huggingface.co/AngelSlim/Hy3-GGUF/tree/main/patches
WeChat で開くにはこちらへ
原文を表示
腾讯混元 2026-07-14 16:56 广东
image
Hy3 上线并开源后,社区一直在呼吁量化版本,希望单卡跑参数量达 295B 的 Hy3。
大家都在讨论,能不能在配置有限的机器上,把 Hy3 这样的旗舰模型也跑起来,哪怕在精度上做一些让步?
为此, 腾讯混元团队针对开源社区需求,把 Hy3 的权重量化到 1bit 与 4bit 并打包成 GGUF,配合 llama.cpp 生态,让原本只能跑在多卡集群上的模型,最少一张推理显卡、乃至内存充足的本地机器也能跑起来。
从模型上看,腾讯混元 Hy3 是一个 295B 参数的旗舰模型,展现出显著强于同尺寸模型的智能水平,并比肩更大尺寸旗舰模型的效果,大幅提升了在各类产品和生产力任务中的实用价值,但是它的 BF16 权重接近600 GB,要完整发挥实力,离不开多卡服务器这样的部署环境。
1bit, 4bit 以及 BF16 Hy3模型 游戏编程示例
1bit塞进单卡,4bit接近满血
我们首先提供了 1bit 极限量化版本 IQ1_M,把权重从 598 GB 一路压到 85.5GiB,整整缩小了 6.7 倍。这意味着一张 96GB 的推理显卡就能部署。对于硬件最受限、又想在本地把旗舰模型跑起来的场景,Hy3 1bit 版本是我们所推荐的。
同时,我们也提供了 4bit 量化版本 Q4_K_M,体积 169.9GiB,两张推理显卡即可承载,如果目标是在有限资源成本内拿到更接近满血模型的效果,推荐就选 Hy3 4bit 版本。
我们还提供了 GPTQ Int4 版本,它可以直接通过 vLLM 部署对外提供服务,天然享受 vLLM 生态在高并发、低延迟上的红利,更贴合服务端部署的需求。
压下去了,能力却没塌
判断量化好不好,最直接的是看它和原始模型的输出分布有多接近。4bit 版本在这一点上表现得相当出色,绝大多数位置上给出的首选答案以及 Top-K 概率分布都和 BF16 模型保持一致。落到实际任务上同样如此,无论是Agent能力,多语言代码、工具调用,还是长文理解,成绩都贴近满血模型。除此之外,GPTQ Int4 模型在评测集上的掉点幅度也非常有限,整体完全在可接受范围内。
真正让我们有些意外的是 1bit 版本。按直觉,压到 1bit 附近模型多少会变笨,但我们的 Hy3 1bit 版本在主流任务上依然站得很稳。长文理解几乎和原始模型持平,Agent 与代码方向也保持得相当好,只有小幅回落。放到日常的编码辅助、工具调用、长文档处理和常规问答任务上,它已经完全够用。
MTP 加速解码
要让 Hy3 真正跑顺,MTP 投机解码必不可少。为此我们专门开发了 llama.cpp 的 patch,补齐了对 Hy3 模型结构的 MTP 的支持,并直接发布了可用的构建与部署指引(详见 https://huggingface.co/AngelSlim/Hy3-GGUF ),开启 MTP 后,接受率稳定在 60% 左右,1bit 版本的解码速度提升约 50% ,4bit 版本提升接近 60% ,实际交互体验依然流畅。
相关链接:
Hy3 模型:https://huggingface.co/tencent/Hy3
低比特GGUF模型:https://huggingface.co/AngelSlim/Hy3-GGUF
GPTQ Int4 模型:https://huggingface.co/AngelSlim/Hy3-GPTQ-Int4
llama.cpp patch : https://huggingface.co/AngelSlim/Hy3-GGUF/tree/main/patches
跳转微信打开
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み