2026 itvalue文章顶部

混元Hy4 preview上线即排队,能消解腾讯的AI焦虑吗?

钛度号
混元追上来一截,腾讯的船还在“漏水”。

文 | 商业秀,作者 | 郑久宇   编 | 杨肖若

混元这次最新的发布,是没有开发布会的。

8月28日深夜,只有一篇文章加一个开源仓库,Hy4 preview就这么上线了。7700亿总参数、490亿激活和100万Token上下文,Apache 2.0全开放。

这场真正的发布会,或许是发生在三天后的8月31日上演的场景:混元Hy4 preview自8月28日在WorkBuddy首发接入后,任务队列就开始出现频繁排队的情况。

官方赶紧发公告道歉、紧急扩容,就连腾讯公关总监张军也说调用量“出奇猛增”,技术团队整个周末都在推进扩容,并将持续动态调配资源。还说,“受限于高端算力总量和高峰期并发集中,仍不排除个别时段排队。”

那更像是,一个模型用排队的方式,替自己的公司把“焦虑”说了出来。

这就有意思了。因为就在发布前三天,8月25日,腾讯高级执行副总裁汤道生刚在内刊《知点》里写过一篇长文,标题叫《和AI一起长跑:这两年的一些思考》,正面回应“腾讯做AI慢了”。

他有一句话说得挺实在,“要说一点不焦虑,那不可能。”

焦虑或许传导到了资本市场。8月28日,Hy4 preview上线当日,交易日收盘腾讯股价455.2港元,总市值为41437.52亿港元。截至发稿,8月31日收盘股价回落至452.4港元,市值约为4.12万亿港元。

看起来,技术圈一片叫好,但并未催生出二级市场的股价市值行情,市场仍在权衡AI持续高额投入带来的成本压力。

01 船是怎么“漏”的?

腾讯做AI的焦虑,不是今天才有的。

在今年5月13日的腾讯股东大会上,有人问马化腾,腾讯的AI是不是落后了?

马化腾打了个比方,“原来一年前我们以为上了船,后来发现那个船漏水了,又开始换一艘船。现在感觉站上去了,还坐不下去,还是希望船速能快一点。”

“上船”说的是2024年大模型起跑,“漏水”说的是混元,一个被内部外部都承认“落后”的模型。《财经》此前采访的某位AI研究人员说得更直白,混元此前长期“躺平”,自姚顺雨加入后,“走向正轨不少”。

姚顺雨,1998年生,清华姚班、普林斯顿博士,ReAct 和思维树(Tree of Thoughts)的共同提出者,2024年进入OpenAI参与Deep Research 和 Operator。2025年下半年回国,12月就空降腾讯首席AI科学家,向刘炽平汇报。

他接过手的更像是一个“烂摊子”,但也是个明白的摊子。2026年1月底,混元启动底层基础设施全面重建,覆盖预训练、强化学习、数据和评估。3月,腾讯撤销成立近十年的AI Lab;7月23日,大语言模型部与多模态模型部合并为基础模型部,28岁的姚顺雨统管腾讯全部底层模型研发。

根据最新财报,二季度腾讯研发支出了272.8亿元,同比涨了35%;资本开支527.8亿元,同比涨了176%,大头都进了AI算力和训练。

按他说的节奏,混元平均每两个月迭代一次大版本:4月,发布Hy3 preview,7月6日,发布Hy3 正式版,发布一周,调用量较Hy2涨了超68倍,到8月28日,Hy4 preview上线。

48小时前,或许整个行业都盯着同一个问题:这次,腾讯真的追上了吗?

02 押家底般的投入和跑分里的一些真话

先看规格。Hy3是295B总参、21B激活、256K上下文;Hy4 preview直接拉到 770B、49B和1M,注意力机制从GQA换成了Gated DSA 加上IndexCache,残差改成4路iHC。

说人话就是,从长上下文里挑重点看,信息多路并行传,模型变大了近两倍半,但每token激活的只有49B,成本可控。

有博主称,在架构层面,这是混元第一次真正摸到国内顶级模型的边。

定位也换了个说法,不再喊通用,而是为生产力而生。在软件工程、办公分析、游戏开发和科学研究四个场景,靠腾讯内部专家共建数据和 WorkBuddy/CodeBuddy 产品协同打磨。

姚顺雨之前反复讲过一个思路,不训练刷榜的做题家,关心模型在真实场景好不好用。

官方还讲了个更玄的故事,递归自我改进。说Hy4 preview是第一次参与了自己训练方法、数据策略、评估体系和底层算子的自动优化,自主做算子融合和通信优化,端到端吞吐提升了31.8%。科学方面,把3DBlaschke-Lebesgue 问题的体积下界从0.380799推到了0.41104,离Meissner四面体猜想只剩2%的差距。

顺带官方也坦白了,preview版本复杂任务容易长思考、过度自我验证。这句话后面会反复应验。

腾讯官方公布了一组12项评测的对比,对手是GLM 5.3、Kimi K3、DeepSeek V4 Pro、Qwen 3.8 Max,以及闭源阵营的 GPT 5.6 Sol 和 Claude Opus 5。

别被这一锅粥的表骗了,我们分三档来看:

第一档是跟国产开源同侪,的确是站住了。Terminal Bench 2.1 拿85.4(GLM 5.3 约88.2–88.8、Kimi K3 约85.7–88.3,不同转引会有出入);DeepSWE64.3,略低于Kimi的74.0;但SWE-bench Multilingual 82.9,是开源阵营第一;SWE Atlas Refactoring、Toolathlon-Verified 、OneMillionBench(工具)都领先。

第二档是跟闭源旗舰,差距还是比较明显的。GDPval-AA V2 上,混元 1678,Claude Opus 5 是 1831,GLM 5.3 都压它一头(1763);物理推理的 CritPt 上,混元16.9,处于全场垫底区,GPT 5.6 Sol 是 32.3,Claude 是 29.1;SWE-bench Pro 上,Claude 79.2,混元65.7;HLE 纯文本,Claude 54.9、GPT 49.5,混元 43.4。

第三档是跟自己比,的确进步惊人。DeepSWE 从28.0干到64.3,翻倍还多;ProgramBench从3.6到17.5;Terminal Bench从70.8到85.4。一个半月追回这么多,混元自己都说这是最大的代际增益,这回真不是吹。

还有两个数字,得单独拿出来捋一捋。

一个是官方盲测,有163名内部专家、203个工程任务,Hy4 preview 均分 2.99/4,略优于GLM 5.3(2.92)和 Kimi K3(2.94)。

听着很提气是吧?但仔细看胜负比,对 GLM 是胜 46.8%、负 40.4%,对 Kimi 是胜 51.2%、负 40.9%。负率四成,这就是五五开里探出一个头。而且打分的是腾讯自己的工程师,任务是自家工程任务。这个略优于的含金量,或许是要打折扣的。

另一个是第三方榜单,在Arena.ai的Code Arena WebDev 上,Hy4 preview排第5,1633分、开源模型第3,和 Grok-4.6、GPT-5.6 Sol 咬在同一区间。这是混元模型头一回出现在这种位置。

注意措辞是出现在这个位置,不是站上第一位。混元从落后到第一梯队的叙事,目前一半还靠官方自己的数据撑着,独立机构的大规模横评还没出来。

03 干活的时候,它到底行不行?

跑分归跑分,最终还是要看看实测。很多媒体的实测结果放一起,画面出奇一致:长板是真的长,短板也真的短。

我们也来亲自测试一番,既然接入了WorkBuddy,首先是在办公场景下先跑一跑吧!

我们用前几天让豆包工作的案例测试对比一下,同样抛给WorkBuddy:帮我分析一下美国大模型公司Anthropic 2026年Q2财报,整理一下核心财务数据(营收、净利润、毛利率、经营性现金流等),做同比对比、生成图表,再帮我对比国内大模型公司的行业情况,最后写一份解读报告。

前后一共等了12分钟左右的时间,它帮我输出了一版报告。但中间等待的时间确实有点久……不重要,消耗TOKEN后来看看效果对比:

(以上豆包工作给的图表)

 

(以上是WorkBuddy给的图表)

图表是各有各的风格,你想要什么样的数据和风格,总有一款适合你。我认为,如果你想要更具体精准一点的,就要把最初的问题提的精细点。我们再来试试它的一句话生成场景,比如我让它帮我生成马斯克驾着火箭登陆月球的视频。

当然,这个时间也是非常久的。我已经在等模型响应这一环节,等了超过10分钟,等我离开工位去茶水间接个咖啡做个拉伸回来,它告诉我当前模型服务器暂不可用。好家伙,运行转悠半天给我来这个。多少有点崩溃啊!

而且,它的视频生成用的是它自带的生成专家,相当于某个Skill智能体来做这个任务。

我看到,APPSO的测试结论是腾讯终于踩下油门,一句话生成可操作的实时3D月球车场景。南方都市报的测评更狠,让它做3D弹球游戏,它自己跑无头物理验证,发现球会逃逸出球台、发球冲不上去、挡板打不飞三个bug,自己定位、自己修好,全程没用人管。好吧,是我的服务器不行。

我们来试试游戏代码生成如何,一个老生常谈的项目:帮我写一个QQ农场的游戏。

这个倒是挺快的,在后台开始给我干活写代码。5分钟就给我干出一个不错的网页版。

这只是故事的一半。

测试体验后我的一个感受是:复杂任务理解确实更细致了,但是用更长的思考换来的,相同的任务下token消耗比一些模型更大;长任务偶发无限死循环,思考过程过长直接截断、任务终止。

官方承认的过度自我验证,是实打实地体现在账单和等待时间里的。

更尴尬的是,Hy4 preview是纯语言模型,没有视觉、没有多模态。你在WorkBuddy里让它生图生视频,系统会自动切到别的模型,正常扣积分,不占免费额度。官方公告写得很清楚。对着一家说自己要探索全模态智能上限的公司,这代模型先把自己摘出去了

安全披露也是空白。有第三方评测AI Tools Review指出,腾讯没有像Anthropic、OpenAI、Google那样发布 system card、风险框架或安全专项评估。一个自称能自我改进、能自主优化推理基础设施的模型,这个缺口,并不是一件小事。

04 便宜的旗舰和真实的算力

定价倒是干净利落(元/百万 tokens,各家官方定价页我们看看):

大模型

命中缓存

输入

输出

Hy4 preview

0.3

6

18

DeepSeek V4 Pro(高峰时段)

0.3

9

27

GLM 5.3

2.0

8

28

Kimi K3

2.0

20

100

在国产旗舰统一价里,Hy4是全场最低的一档,比 Kimi K3 的输入价便宜了七成。缓存命中0.3元是隐藏亮点,长上下文流水线反复读同一份材料时,第二次起几乎白送。

但这里有个对照组不能漏,那就是DeepSeek V4 Pro 自8月17日起搞峰谷定价,空闲时段 4.5/13.5/0.15,三项都比 Hy4 便宜。

算总账,便宜这件事,腾讯还不是稳赢的那个。

但免费政策还算大方。WorkBuddy/CodeBuddy 里 Hy4 preview 限免到 9 月 10 日,Hy3 顺延到 9 月 30 日,每个人每天有免费额度。想自己验证的,现在零成本。

自托管也不拦着,Apache 2.0,FP8版大约要720GB显存,8卡H200能跑,8卡H100不够。这行小字值得记住,开源免费,但跑得起它的人不多。

所以,焦虑缓解了吗?回到开头那个问题。对“混元是不是废物”这个舆论问题,答案基本翻案了。从2025年躺平的定性,到2026年8月Arena 代码榜第5、开源第3,混元用6个月证明了重建路线的成立。

这不是赢了几分的事,是这家公司还能不能做出一线模型的事,这个更根本的问题,Hy4 preview确实给出了正面回答。

对姚顺雨个人,这步棋也没走错。入职9个月,两代大版本,代际提升幅度实打实,7 月整合完基础模型部,组织理顺了,产品也跟他绑在一起(WorkBuddy 桌面办公 Agent 市场份额领跑)。至少到目前看来,腾讯请他来是对的。

但对腾讯这家公司,焦虑只减了一半,而且减的是容易的那一半。

难的那一半,Hy4 preview 用自己的三天表现亲自演了一遍:

算力问题。上线即排队,三天紧急扩容,官方明说受限于高端算力总量。二季度527.8 亿的资本开支说明腾讯知道问题在哪,但钱变算力要时间,而排队正在发生。

差距问题。CritPt 垫底区,HLE 落后 Claude Opus 5 十分以上,SWE-bench Pro 落后13.5 分。“开源第一梯队”和“全球第一梯队”之间隔着的,或许恰是腾讯最焦虑的那段距离。

更扎心的是,Claude和GPT没有站着等它。

验证问题。盲测是自家员工打的,跑分是自家 harness 跑的,独立横评还没出炉。第一梯队的叙事,一半还悬在官方数据上。

再看preview本身。过度思考、token 膨胀、死循环和截断,官方全认了。Hy3 preview 到正式版补短板有先例,但在正式版落地前,这些就是用户的真实体验。

以及8月的对手也还在跑。DeepSeek V4-Flash/V4 Pro、Qwen 3.8-Max、GLM-5.3,月底智谱和千问还深夜各发了一款 Flash 试图划斩杀线。Hy4 preview 是在别人加速时追上来的,不是别人停下等它。

马化腾说“希望船速能快一点”。Hy4 preview证明船没沉,还能加速。但漏水的问题,终究要靠算力、时间,以及下一版的正式模型来修。

对腾讯和姚顺雨来说,焦虑的总量大概没变,只是换了一种形态。从我们还行不行,变成了我们还能多快。

这算是一种升级。但升级,并不等于解决。「完」

本文系作者 商业秀 授权钛媒体发表,并经钛媒体编辑,转载请注明出处、作者和本文链接
本内容来源于钛媒体钛度号,文章内容仅供参考、交流、学习,不构成投资建议。
想和千万钛媒体用户分享你的新奇观点和发现,点击这里投稿 。创业或融资寻求报道,点击这里

敬原创,有钛度,得赞赏

赞赏支持
发表评论
0 / 300

根据《网络安全法》实名制要求,请绑定手机号后发表评论

登录后输入评论内容

扫描下载App