AGENT · AI 工程

腾讯 Hy3:新旗舰拆解,我们要换吗

腾讯混元刚发布的开源权重旗舰 Hy3。这一页讲清它是什么、强在哪、短板在哪,最后把它和我们生产在用的 Qwen3-2507、DeepSeek V4 Flash 摆在一起算账。

💡
先说结论:生产两个模型槽都不换。Hy3 的卖点是 Agent 长程任务,不是更便宜的中文对话——而我们的场景恰恰是后者。想验证它的对话质量,OpenRouter 上有免费变体可以零成本跑评测。

Hy3 是什么

腾讯混元新一代旗舰 · 开源权重 · 两步走发布

2026-04-23 · PREVIEW
Hy3 preview 开源

权重上线 GitHub / Hugging Face / ModelScope / GitCode,官方定位「快慢思考融合的混合专家模型」,主打实用性与 Agent 能力。

2026-07-06 · 正式版
Hy3 正式版上架

OpenRouter 同步上架 tencent/hy3,另有零成本的 :free 免费变体。正式版与 preview 的具体差异官方未细说。

295B 总参
MoE 混合专家
21B 激活
192 专家 · top-8 路由
256K
上下文长度
3 档
推理深度:关 / 低 / 高

官方成绩单

以下均为官方自报分数(Hugging Face 模型卡),第三方独立评测还很少——看个量级就好。

87.42
MMLU
(5-shot)
95.37
GSM8K
(超 Kimi-K2 Base 的 93.46)
76.28
MATH
(4-shot)
74.4
SWE-bench
Verified
87.2
GPQA
Diamond

优点 · 缺点

基于官方材料 + 一手平台数据;社区实测反馈还在早期,保持观望。

优点
  • 为 Agent 长跑而生:官方称真实环境可稳定支撑 495 步的智能体工作流,跨框架 tool-calling 稳定,多轮约束跟踪强。
  • 快慢思考可调:推理档位关/低/高三档,简单任务直出、难题再开链式思考,一个模型覆盖两类负载。
  • 反幻觉取向:官方强调「有依据才答,证据不足就明说」,对金融分析、文档处理类场景友好。
  • 激活参数小、跑得快:295B 总参只激活 21B,官方称推理效率提升 40%、首字延迟降低 54%。
  • 开源权重 + 价格亲民:腾讯云 TokenHub 输入低至 ¥1.2 / 输出 ¥4 每百万 token;OpenRouter 还有免费变体。
缺点 · 注意
  • 正式版 API 不算便宜:OpenRouter 上 $0.20 / $0.80 每百万 token——输出价是 Qwen3-2507 的 8 倍,对话这种输出大头的场景很吃亏。
  • 许可证是自定义的:「Tencent Hy Community License」,不是 Apache/MIT。走 API 调用不受影响,但自部署权重商用前必须逐条读条款。
  • 成绩单全是自报:正式版刚发布,第三方独立评测和社区大规模实测都还没沉淀,官方 benchmark 只能当参考。
  • preview 与正式版差异不透明:两版定价差 3-4 倍,但能力差异官方没有明确对比,选型时容易踩混。
  • 能力方向和轻量对话错位:主打长程 Agent、代码、文档分析;纯中文闲聊/短对话用不到这些,等于为用不上的能力付费。

和我们在用的模型比

Akke 生产两个模型槽:中文对话(Qwen3-2507)+ 意向分析(DeepSeek V4 Flash),都走 OpenRouter。

模型架构上下文定价 $/M(入/出)特点
Hy3新发布 295B / 激活 21B 256K $0.20 / $0.80 Agent 长程、tool-calling、推理三档可调;另有 :free 免费变体
Hy3 preview 295B / 激活 21B 256K $0.063 / $0.21 4 月先行版,便宜但与正式版差异不明
Qwen3-235B-2507对话槽在用 235B / 激活 22B 262K $0.09 / $0.10 无思考模式直出、延迟低,指令遵循强——适合高频对话
DeepSeek V4 Flash分析槽在用 284B / 激活 13B 1M $0.09 / $0.18 效率优先,高吞吐批量任务的性价比之王

把输出价画出来

对话/生成类负载的成本大头在输出($/百万 token 输出价)。

Qwen3-2507对话槽在用$0.10
DS V4 Flash分析槽在用$0.18
Hy3 preview$0.21
Hy3 正式版$0.80
同样生成 100 万 token 的对话内容:Qwen3-2507 花 $0.10,Hy3 正式版花 $0.80。能力再强,也得先回答「这 8 倍差价买到了什么」。

对我们的结论

按槽位逐个过。

对话槽 · 不换
Qwen3-2507 继续留任。我们的对话是高频、短输出、要快——2507 无思考模式直出、输出价 $0.10 已经压到地板。Hy3 的长程 Agent 能力这里用不上,输出价还贵 8 倍。
分析槽 · 不换
DeepSeek V4 Flash 继续留任。意向分析是批量吞吐型任务,V4 Flash 有 1M 上下文 + $0.18 输出价,Hy3 在这两项上都不占优。
值得做 · 零成本评测
用免费变体跑一轮离线对比。OpenRouter 的 tencent/hy3:free 零成本,拿我们现成的对话评测集对打 2507:如果中文对话质量真有代差,再回来重算这笔账。免费档一般有限速和数据条款,只用于评测、不接生产。
Hy3 是「Agent 长跑选手」,我们要的是「对话短跑选手」——赛道不同,不必追新。

它确实是国产开源阵营的重要新旗舰:295B MoE、256K 上下文、三档推理,Agent 场景值得关注。但对我们:两个生产槽都不换——Qwen3-2507 和 V4 Flash 在各自赛道上依然是性价比最优解。行动项只有一个:拿 :free 变体跑离线评测,用数据说话,别凭发布会热度做迁移。