混元 Hy4 preview 实测:国产开源大模型能进第一梯队吗

新一代模型 Hy4 今天开源了。网上的关键字,是”770B 参数””49B 激活参数””百万上下文”这些数字。但参数只是一个数字,更有参考价值的,是它落到真实任务上表现如何——它比 Hy3 强了多少,Hy3 暴露的问题有没有被解决。

混元 Hy4 preview 官方预览图

参数规模:一次大幅升级

参数”770B”对一个非技术读者来说没有概念。放到对比里就清楚了:

指标 Hy3 preview Hy4 preview 升级幅度
总参数 295B 770B 约 2.6 倍
激活参数 21B 49B 约 2.3 倍
上下文长度 256K 1M+ 约 4 倍

三组数字,每一组都出现了大幅度的增长。Hy3 两个月的免费使用让用户看到了这次升级的数据,整体架构的升级。

我在 Hy3 上遇到的三件事

说说我自己的使用经历。Hy3 蹭着免费我前后用了一一个月时间,三个问题让我印象最深刻。

一、长文档处理,更像压缩而非概括

我拿它处理过一整份很长的技术文档。它确实能总结,但更像把原文压缩了一遍——总结得似是而非。我需要的是”读完帮我抓住重点”,它给我的感觉是幻觉验证。几次下来,我就换模型了,后面也不太放心让它替我读长文档。

二、面对复杂问题,容易偏向单一答案

这个最让我头疼。遇到那种没有唯一解的题目,我需要它帮我想多个可能性,可它往往只给出一个答案就停住。我试着追问,它也不太能自己拐弯。相同问题的处理往往会跑回到同一个答案,这是上下文的体量决定的。对需要处理这类问题的我来说,实在是浪费时间。只能让它处理轻量化的对话任务。

三、站内搜索能力偏弱

对于长期免费的模型,用来进行数据抓取是我认为比较合适的,毕竟付费的 token 做这种事就太不划算了,慢点也无所谓。但获取的文档不全就非常糟心了。我让它在一个指定网站上找资料,它常能找到我要的那一项,却漏掉另一项。搜索的完整性没法保证,导致我每次都得人工去核对一遍,等于多了一道工序。

我用下来的感受是,Hy3 是能干活、够实用(免费),短板是客观存在的。它是个不太靠得住的工具,看你怎么去合理地使用。所以这回换 Hy4,我最关心的,就是上面这三处它到底改得怎么样。

Hy4 preview 的改进方向

先看一份硬数据。腾讯组织了一次内部盲测:163 名内部专家、203 个真实工程任务,在看不到模型名称标注的前提下打分。结果:

模型 平均分(满分 4)
Hy4 preview 2.99
GLM 5.3 2.92
Kimi K3 2.94

三者的差距不到 0.1 分。这个结果很克制——说明 Hy4 preview 已经进入国产开源模型的第一梯队,但与第二名之间没有明显拉开差距。它不是靠堆参数取胜,而是靠真实任务一项一项做出来的。

对照我前面提到的三个问题,Hy4 preview 的改进方向很明确:

  • 长文档处理(对应问题一的短板):上下文从 256K 拉长到 1M+,扩容约 4 倍。文档越长,越需要”整本读、抓重点”的能力。
  • 复杂任务执行(对应问题二):官方说明多次提到,Hy4 preview 增强了 Agent 的长链路执行能力——更好的任务拆解、上下文承接、指令执行,专门解决”复杂问题偏向单一答案”的情况。这一点正好回应了我上面遇到的麻烦。
  • 搜索与跨文件核对(对应问题三):官方演示中,它能在 72 份财务文件里跨文档核对,找出 14 张合规报销单——把搜索、理解、对照串起来使用,这正是 Hy3 preview 偏弱的地方。需要说明的是,官方没有单独公布”站内搜索”这一项的复测结果,这块我打算自己上手验证。

此外,Hy4 preview 出现了一个此前少见的特征——它开始参与优化自己的推理流程。它会自行提出方案、运行实验、根据结果调整,端到端运行速度提升了 31.8%。这意味着它不会停留在当前水平,随着使用,它会持续变强。但是真实体验就需要长期的使用来验证了。

定价

计费项 价格(每百万 token)
输入 6 元
缓存命中 0.3 元
输出 18 元

这个价格不算最低,但处于”可以放进日常工作流长期使用”的档位。值得留意的是缓存命中只要 0.3 元——如果经常反复处理同一批长文档,这一项能省下不少成本。在 DeepSeek 涨价后的现在,Hy4 preview 的这个价格还是值得多关注一点的。

适用人群

  • 长期与长文档、报销、合同、数据表打交道的人群;
  • 需要写代码、做页面、搭工具的人群;
  • 经常让 AI 协助处理杂务的人群。

官方介绍中 Hy4 preview 是适合这些人群的,建议利用这 2 周限时免费窗口,拿一件工作中真实觉得棘手的事情,实际用它做一次。

参数和介绍放在一个月一次版本大更新的今天感知是不明显的,同类型的大模型几天发布一个,只有在真实的业务场景中跑一遍,才知道它值不值。用这两周的认真感受体验一次,无论用来做什么都不亏。

上手方式与开源

产品内直接可用——WorkBuddy、CodeBuddy 的国内版和国际版,以及元宝、ima,均已接入 Hy4 preview。目前面向用户限时免费 2 周。

开源自托管:

需要说明的是,模型采用 Apache 2.0 协议开源,但部署门槛不低——官方示例需 FP8 权重 + 8 卡并行。对多数个人开发者而言,直接调用 API 或在产品内使用更现实;开源权重的价值更多在于企业私有化、研究复现与推理框架适配。

(本文信息整理自腾讯混元官方发布、科技日报、环球网、新浪科技、网易等公开报道,以及雪球、CSDN、技术博客上的真实用户实测。价格、免费活动、盲测数据请以产品实际页面为准。)

© 版权声明

相关文章

没有相关内容!

暂无评论

none
暂无评论...