腾讯混元 Hy3 正式発表、エージェント能力と製品体験が大幅向上
本文の状態
日本語全文を表示中
詳細モードで約9分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Tencent Hunyuan
腾讯は AI モデル「混元 Hy3」を正式に発表し、後訓練の質向上と RL スケール拡大により推論やエージェント能力が飛躍したことを示し、同社によると GLM5.1 や他社大規模モデルに匹敵する性能を発揮している。
AI深層分析を開く2026年8月4日 19:56
AI深層分析
キーポイント
ハイパフォーマンスな Agent と推論能力の確立
後訓練データと RL スケールを強化した結果、Hy3 は同サイズモデルを凌駕し、GLM5.1 よりも高い評価を得た。特にソフトウェア開発や金融モデリングなどの複雑なタスクで実用性が向上している。
製品体験の劇的な改善と信頼性向上
ツール呼び出しの安定性、知識の正確さ(幻觉率 12.5%→5.4%)、長文脈理解能力が大幅に強化され、生産現場で即座に使用可能なレベルに達した。
多様な内部製品への統合と実証効果
微信(元宝)、QQ 浏览器、腾讯游戏などの内部サービスへ Hy3 を導入し、タスク解決率や Token 効率の向上など具体的な数値で効果を証明した。
ゲームアシスタントでの精度向上
《流放之路:降临》のAI助手では多輪推理とツール調達の成功率が92%に達し、幻觉率が4.5%から2.8%へ低下した。
コスト削減とモデルのオープンソース化
Hy3はApache 2.0ライセンスで主要プラットフォームに公開され、API価格が大幅に引き下げられたことで利用コストが削減された。
重要な引用
Hy3 は同サイズモデルより显著に強く、GLM5.1(均分 2.51 / 4)に対して Hy3(均分 2.67 / 4)が優位性を示した。
内部評価において、幻觉率は 12.5% から 5.4% に、常識エラーは 25.4% から 12.7% に低下した。
QQ 浏览器のコード出力タスク成功率は 37.6% 向上し、「書く」から「使える」への転換が実現した。
「对玩家来说,AI的回答不再需要再验证一遍,就是好体验。」
編集コメントを表示
編集コメント
今回の発表は、モデルの性能向上が単なるベンチマークスコアの追求ではなく、実際の業務フローやツール連携における信頼性向上に直結している点を浮き彫りにした。特に「幻觉率」や「コスト効率」といった実務指標での劇的な改善は、企業導入において重要な判断材料となるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
腾讯混元 Hy3 正式发布:Agent 能力与产品体验全面跃升
今年 4 月底,我们发布了 Hy3 预览版。随后在 50 多个业务场景中收集了大量反馈,据此修复了各类体验问题,并进一步提升了后训练数据的质量与规模。今天,腾讯混元 Hy3 正式亮相。
Hy3 展现出显著超越同尺寸模型的智能水平,其效果甚至能与更大规模的旗舰模型比肩,大幅提升了在各类产品应用及生产力任务中的实用价值。
更强大的 Agent 能力
基于预览版,Hy3 进一步提升了后训练数据的质量与多样性,并扩大了强化学习(RL)的算力规模。这使得模型在推理、Agent 任务及长上下文处理等方面取得显著进步,效果足以比肩国内外参数规模为 Hy3 2 至 5 倍的旗舰模型。
在软件开发、办公生产、金融建模、前端设计及游戏制作等生产力任务中,Hy3 的进步尤为显著,已成为高性价比的可靠选择。在内部组织的盲测中,270 位专家基于真实工作场景对模型进行了评估:Hy3 获得平均分 2.67(满分 4),优于 GLM5.1 的 2.51 分。特别是在前端开发、数据存储及 CI/CD 等领域,Hy3 展现出显著优势。
例如,我们可以利用该模型设计核聚变能源引擎的概念宣传网页;
实现通过摄像头捕捉手势来控制图片粒子的融解与重组;
通过多轮交互制作一款名为“落日飞车”的游戏;
或在办公场景中,从 101 个 SKU 的销售数据中自动生成 Excel 建模分析以及一份 30 页的汇报 PPT;
将公司三个地区的数据,利用联动公式汇总成一张包含 5000 多个单元格的表格。
更可靠的产品体验
模型的实用价值并不完全取决于榜单排名。基于广泛的用户反馈与分析,我们重点定位并优化了一系列面向体验的能力,获得了产品团队一致且积极的评价:
输出格式与工具调用的稳定性:我们显著改善了一系列基础问题,确保模型在各种工具设置和输出要求下均能达到生产级标准。工具调用的错误恢复能力与效率大幅提升。此外,Hy3 增强了跨脚手架的泛化性,在 SWE Bench Verified 测试中,不同脚手架(如 Codebuddy、Cline、KiloCode)的分数标准差控制在 4 个百分点以内。
知識と常識、そして幻覚(ハルシネーション)の抑制:これらは密接に関連しており、実際の利用体験において極めて重要です。「根拠があれば回答し、なければ不足を明示し、複数の情報源は乱雑に組み合わせず、データや状態をでっち上げない」という理想像に基づき、私たちは微細なデータクリーニングと訓練制約を行いました。その結果、内部評価では Hy3 の幻覚率が 12.5% から 5.4% に、常識エラー率が 25.4% から 12.7% に低下し、「張冠李戴(他人の話を自分のものとする)」や「無中生有(ないものをでっち上げる)」、論理矛盾といった問題が大幅に改善されました。
複雑な文脈の継承と多段階での意図維持:Hy3 は SFT(教師あり微調整)と RL(強化学習)の両フェーズで、指針消去や省略された内容の復元、そして多段階会話における制約の継承といった業務上の課題を統合的に最適化しました。その結果、内部評価での多段階質問への対応率は 17.4% から 7.9% に低下(=エラー率減少)し、長文対話理解基準でも MRCR が 42.9% から 75.1% へと劇的な向上を遂げました。出力はより洗練されつつも、複雑な意図が長い対話を通じて減衰したり逸脱したりすることはありません。
WorkBuddy
Context Engineering 責任者 Elden
内部評価データによると、Hy3 preview と比較してタスク解決率は 72% から 90% へ躍進し、平均所要時間は 34% 短縮されました。トークン効率も注目すべき点です。頻繁に利用される業務タスクにおいて、Hy3 のトークン消費量は GLM5.2 を大きく下回っており、文書処理では 47.4%、PPT 作成では 49.0% も削減されています。タスクの成功率が上がり、1 回の実行あたりのコストが下がれば、ユーザーは当然ながらより多くの業務を任せるようになります。
元宝(Yuanbao)
Agent アルゴリズム責任者 Jim
Hy3 を導入した元宝 Agent の利用者が実感するのは、「Excel の書式設定を何度も繰り返す必要がない」「データ分析の結果がそのまま使える」「ウェブツールの接続も即座に実行可能」という点です。情報検索、データ処理、文書作成、生活の意思決定、ウェブ制作という 5 つの主要シナリオを対象とした内部評価では、明確な数値で裏付けられています。文書生成の総合スコアは +7% 向上し、ウェブ制作と自動化スクリプトの性能も +6% 改善されました。
ima
プロダクトマネージャー Kaycee
Agent タスクにおける Hy3 の総合評価は高く、特にツールを編成する能力が際立っています。根拠のない再試行や、停止すべきタイミングで止まらないといった無効な操作が大幅に減り、複雑な業務タスクでも少ないトークン消費で実用的な結果を得られるようになりました。また、ナレッジベースの質問応答では推論品質が約 19% 向上し、幻覚率は 15 ポイント低下。長文執筆や方案生成における構成の完全性と実用性も明らかに高まりました。
Marvis
プロダクトマネージャー Eva
マルチ Agent コラボレーションで最も懸念されるのは、「タスクを委任した後、どこかの段階で誤解が生じ、気づいた時にはすでに方向性がズレてしまっている」という事態です。Hy3 を導入したユーザーは、すべてのステップがスムーズに接続されていると感じています。ファイル生成や PC の診断・操作といった Agent シナリオでは、タスク完了率が 93.7% に達し、成果物カードや操作カードにおける指示の遵守率も 18.3% 向上しました。タスク所要時間やトークン消費量などのエンジニアリング指標においても優れたパフォーマンスを示し、コスト削減と効率化に実質的な貢献を果たしています。
QQ ブラウザ
プロダクトマネージャー Guangyun
Hy3 の導入後、QQ ブラウザの元宝アシスタントにおけるプログラミングおよびコード生成タスクの成功率は 37.6% 大幅に向上しました。HTML ページ作成やプラグイン開発などのシナリオをカバーし、ウェブ理解や経済・社会・時事に関する専門的な調査も安定して稼働しています。ユーザーが体感する体験の変化は、「起点となるものを書いてほしい」から「すぐに使えるものを完成させてほしい」というレベルへの進化です。
微信読書(WeChat Read)
アルゴリズムエンジニア Hanzhen
推薦システムの良し悪しをユーザーが感じるのは、「この本を推すのは的確か」「このタグの付け方は適切か」です。Hy3 はウェブ小説のタグ付けシナリオにおいて、preview 版と比較して高品質な人手によるラベル付けデータセット上で精度が 14.1% 向上し、総合的な分類効率は 8.4% 改善されました。タグをより正確に付けることは、コンテンツ推薦における「最初の判断」の信頼性を高めることを意味します。
微信公衆号(WeChat Official Account)
プロダクトマネージャー Astrid
ユーザーが「前回のあれ」や「確認してほしい」といった曖昧な表現しか使わず、要件を明確に伝えられないケースは少なくありません。これでは AI の理解にズレが生じやすくなります。
AI 分身と AI カスタマーサポートの専門評価において、Hy3 はこうしたシチュエーションでの認識能力が大幅に進化しました。意図認識の精度は 98.28% から 98.94% に向上し、何より重要なのは対応方法の変化です。不完全な表現に対して、Hy3 はアカウントの定位や文脈を踏まえて合理的に判断します。必要以上に推測するでもなく、機械的にテンプレートを適用するわけでもありません。
腾讯游戏(Tencent Games)
WeGame 后台研发负责人 Anlan
ゲーム内で AI に質問した際、最も懸念されるのは誤回答によってプレイヤーが罠にはまってしまうことです。『Path of Exile: Dawn』の AI ゲームアシスタントに Hy3 を導入した結果、多段階推論とツールスケジューリングの総合成功率は 92% に達し、ハルシネーション(幻覚)率は 4.5% から 2.8% まで低下しました。プレイヤーにとっては、AI の回答を再度検証する必要がなくなり、それが良好な体験につながります。
今後は WeGame でさらに多くのゲーム製品にこの機能を導入し、より多くのプレイヤーにこの体験を提供していく予定です。
Hy3 は Apache 2.0 ライセンスの下、GitHub、HuggingFace、ModelScope、GitCode でオープンソース化されています。一連のハードウェアとソフトウェアを連携させた最適化により、腾讯云(Tencent Cloud)上の API 価格や WorkBuddy などの製品における利用コストもさらに引き下げました。これにより、混元モデルはより多くのユーザーとユースケースに届くようになりました。
Hy3 API 価格(100 万トークンあたり)
入力:1 元
出力:4 元
入力(キャッシュヒット時):0.25 元
1 月末のインフラ再構築から、4 月の Hy3 プレビュー公開、そして今回の Hy3 への進化に至るまで、私たちはわずか半年で基盤から製品化までの完全な開発サイクルを確立しました。しかしこれはあくまでスタートに過ぎません。解決すべき課題は依然として多くあり、混元の再建と進歩はまだ始まったばかりです。
今後も訓練規模の拡大、データ品質の向上、体験の詳細な最適化を着実に推進し、アジャイルな反復開発と率直でオープンな姿勢を維持していきます。
オープンソースおよび体験リンク:
Github: https://github.com/Tencent-Hunyuan/Hy3
Huggingface: https://huggingface.co/tencent/Hy3
Modelscope: https://modelscope.cn/models/Tencent-Hunyuan/Hy3
Gitcode: https://ai.gitcode.com/tencent_hunyuan/Hy3
腾讯云:https://console.cloud.tencent.com/tokenhub/models/detail?modelId=hy3®ionId=1
Hy3 Blogpost: https://hy.tencent.com/research/hy3
Hy AI Studio: https://aistudio.tencent.com/
付録:モデルスコア
さらに詳しい情報は、記事末尾の【原文を読む】をクリックして腾讯混元ブログをご覧ください。
原文を読む
WeChat で開くにはこちらへ
原文を表示
腾讯混元 2026-07-06 15:11 广东
image
4 月底发布 Hy3 preview 后,我们在 50 多个业务中获得了广泛的反馈,修复了各种体验问题,进一步提升了后训练的质量和规模。今天,我们正式发布 Hy3。它展现出显著强于同尺寸模型的智能水平,并比肩更大尺寸旗舰模型的效果,大幅提升了在各类产品和生产力任务中的实用价值。
更强大的智能体能力
Hy3 基于 preview 版本进一步提升了后训练数据的质量和多样性,扩大了 RL 算力规模,在推理、智能体、长上下文等任务上显著进步,取得了比肩国内外更大尺寸旗舰模型(参数规模往往是 Hy3 的 2~5 倍)的效果。
Hy3 在软件开发、办公生产、金融建模、前端设计、游戏制作等生产力任务上的进步尤其显著,可以成为高性价比的可靠选择。在内部组织的 270 位专家基于真实工作的模型盲测中,Hy3(均分 2.67 / 4)展现出优于 GLM5.1(均分 2.51 / 4)的表现,尤其在前端、数据与存储、CI/CD等类别优势显著。
比如,我们可以用模型来设计核聚变能源引擎的概念宣传网页。
实现基于摄像头通过手势交互控制图片粒子融解重组。
通过多轮交互制作一个落日飞车游戏。
或者是在办公场景中,从 101 个 SKU 销售数据中,产出 Excel 建模分析以及 30 页汇报PPT。
把公司三个地区的数据,用联动公式汇总成一张 5000 多个单元格的表。
更可靠的产品体验
模型的实用体验不完全与榜单成绩挂钩。基于广泛的用户反馈和分析,我们定位并优化了一系列体验向能力,获得了产品侧一致且积极的评价:
输出格式和工具调用稳定性: 我们显著改善了一系列基础底线问题,确保模型在各种工具设置和输出要求下达到生产级标准,工具调用的错误恢复能力和效率大幅提升。另外,Hy3 还增强了跨脚手架泛化性,不同脚手架(如 Codebuddy、Cline、KiloCode)在 SWE Bench Verified 上的分数标准差控制在 4 个百分点以内。
知识常识和抗幻觉能力:内生知识和外部幻觉问题相互关联,且对于真实体验至关重要。基于“有依据才回答、无依据明示缺失,多来源信息不乱拼,数据和状态不乱编”的理想态,我们进行了细粒度的数据清洗和训练约束。在基于真实产品的内部评测中,Hy3 的幻觉率从 12.5% 降至 5.4%,常识错误率从 25.4% 降至 12.7%,显著改善了“张冠李戴”、无中生有、逻辑矛盾等问题。
复杂上下文承接与多轮意图保持能力:Hy3 在 SFT 与 RL 阶段联合优化了指代消解、省略还原及多轮约束继承等业务痛点问题,内部评测的多轮问题率从 17.4% 降至 7.9% 。同时 Hy3 在长对话理解基准中取得显著跨越(如 MRCR 从 42.9% 升至 75.1%),整体输出更加精炼的同时确保复杂意图在长程交互中不衰减、不跑偏。
WorkBuddy
Context Engineering 负责人 Elden
内部测评数据显示:相比 Hy3 preview,任务解决率从 72% 跃升至 90%,平均耗时缩短 34%。Token 效率同样值得一提:高频办公任务中,Hy3 Token 消耗显著低于 GLM5.2——文档处理节省 47.4%,PPT 制作节省 49.0%。任务完成率上去了,单次消耗下来了,用户自然会把更多事情交给它。
元宝
Agent 算法负责人 Jim
接入 Hy3 后,用户使用元宝 Agent 感受到的是:Excel 不用反复调格式,数据分析结果直接可用,网页工具接入即跑。覆盖信息查询、数据处理、文档办公、生活决策、网页制作五大场景的内部评测,给出数字支撑:文档生成综合分提升 +7%,网页制作与自动化脚本提升 +6%。
ima
产品经理 Kaycee
在 Agent 任务中,Hy3 综合表现优异,工具编排能力尤为突出,盲目重试、应止未止等无效操作大幅减少,复杂办公任务用更少的 Token 消耗即可获得可用结果;知识库问答场景推理质量净提升近 19%,幻觉率下降 15pp,长文写作与方案生成的结构完整度、可用性明显增强。
Marvis
产品经理 Eva
多 Agent 协作最怕情况是任务派出去后,某个环节理解错了,发现的时候已跑偏。接入 Hy3 之后,用户感受到的是,每一步都接得上。在文件生成、电脑诊断与操作等 Agent 场景中,任务完成率达到 93.7%,产物卡与操作卡指令遵循率提升 18.3%。在任务耗时、Token消耗等工程中指标上也表现优异,对降本增效带来实质性帮助。
QQ浏览器
产品经理 Guangyun
Hy3 上线后,QQ浏览器的元宝助手的编程与代码输出类任务,成功率大幅提升 37.6%,覆盖HTML网页、插件开发等场景,网页理解及财经社会时事等专项调研也在稳定运转。用户感受到体验上的变化是:从"帮我写一个起点",变成了"帮我写一个可以直接用的"。
微信读书
算法工程师 Hanzhen
推荐系统的好坏,用户感知到的是:这本书推得准不准,这个标签贴得像不像。Hy3 在网络文学标签标注场景中,相较 preview 在高质量人工标注数据集上准确率提高 14.1%,综合分类效能提升 8.4%。标签打得更准,意味着内容推荐的"第一步判断"更可靠。
微信公众号
产品经理 Astrid
不少用户沟通时只会说“上次那个”“能帮我看看吗”,没有完整描述需求,容易造成理解偏差。在AI分身和AI客服专项评测里,Hy3 针对这类场景的识别能力明显升级,意图识别准确率从 98.28% 提升到 98.94%;更关键的是应对方式的变化:面对不完整的表达,Hy3 能结合账号定位与上下文做出合理判断,不脑补过度,也不机械套模板。
腾讯游戏
WeGame 后台研发负责人 Anlan
游戏里问 AI 一个问题,最怕答错了,导致用户在游戏里踩了一个坑。《流放之路:降临》 AI 游戏助手接入 Hy3 后,多轮推理与工具调度综合成功率提升至 92%,幻觉率从 4.5% 降至 2.8%。对玩家来说,AI的回答不再需要再验证一遍,就是好体验。后续WeGame将接入更多游戏产品,把这套体验带给更多玩家。
Hy3 已以 Apache 2.0 协议在 GitHub、HuggingFace、ModelScope、GitCode开源。得益于一系列软硬协同的优化,我们也进一步降低了 Hy3 在腾讯云的 API 价格及在 WorkBuddy 等产品上的使用成本,让混元模型普惠更多用户和场景。
Hy3 API 价格 (每百万 Tokens)
输入
输出
输入(命中缓存)
1 元
4 元
0.25 元
从 1 月底重建基础设施,到 4 月发布 Hy3 preview,再到今天迭代升级 Hy3,我们用不到半年跑通了从底层基建到产品落地的完整研发链路。但这只是一个起点,还有很多问题需要解决,混元的重建和进步才刚刚开始。我们将持续踏实地扩大训练规模、提升数据质量、优化体验细节,保持敏捷迭代和坦诚开放的态度。
开源和体验链接:
Github:https://github.com/Tencent-Hunyuan/Hy3
Huggingface:https://huggingface.co/tencent/Hy3
Modelscope:https://modelscope.cn/models/Tencent-Hunyuan/Hy3
Gitcode:https://ai.gitcode.com/tencent_hunyuan/Hy3
腾讯云:https://console.cloud.tencent.com/tokenhub/models/detail?modelId=hy3®ionId=1
Hy3 Blogpost:https://hy.tencent.com/research/hy3
Hy AI Studio:https://aistudio.tencent.com/
附录:模型得分
更多内容,可点击文末【阅读原文】访问腾讯混元博客了解。
阅读原文
跳转微信打开
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み