文 | 商业秀,作者 | 郑久宇 编 | 杨肖若
混元这次最新的发布,是没有开发布会的。
8月28日深夜,只有一篇文章加一个开源仓库,Hy4 preview就这么上线了。7700亿总参数、490亿激活和100万Token上下文,Apache 2.0全开放。
这场真正的发布会,或许是发生在三天后的8月31日上演的场景:混元Hy4 preview自8月28日在WorkBuddy首发接入后,任务队列就开始出现频繁排队的情况。
官方赶紧发公告道歉、紧急扩容,就连腾讯公关总监张军也说调用量“出奇猛增”,技术团队整个周末都在推进扩容,并将持续动态调配资源。还说,“受限于高端算力总量和高峰期并发集中,仍不排除个别时段排队。”
![]()
那更像是,一个模型用排队的方式,替自己的公司把“焦虑”说了出来。
这就有意思了。因为就在发布前三天,8月25日,腾讯高级执行副总裁汤道生刚在内刊《知点》里写过一篇长文,标题叫《和AI一起长跑:这两年的一些思考》,正面回应“腾讯做AI慢了”。
他有一句话说得挺实在,“要说一点不焦虑,那不可能。”
焦虑或许传导到了资本市场。8月28日,Hy4 preview上线当日,交易日收盘腾讯股价455.2港元,总市值为41437.52亿港元。截至发稿,8月31日收盘股价回落至452.4港元,市值约为4.12万亿港元。
看起来,技术圈一片叫好,但并未催生出二级市场的股价市值行情,市场仍在权衡AI持续高额投入带来的成本压力。
01 船是怎么“漏”的?
腾讯做AI的焦虑,不是今天才有的。
在今年5月13日的腾讯股东大会上,有人问马化腾,腾讯的AI是不是落后了?
马化腾打了个比方,“原来一年前我们以为上了船,后来发现那个船漏水了,又开始换一艘船。现在感觉站上去了,还坐不下去,还是希望船速能快一点。”
“上船”说的是2024年大模型起跑,“漏水”说的是混元,一个被内部外部都承认“落后”的模型。《财经》此前采访的某位AI研究人员说得更直白,混元此前长期“躺平”,自姚顺雨加入后,“走向正轨不少”。
姚顺雨,1998年生,清华姚班、普林斯顿博士,ReAct 和思维树(Tree of Thoughts)的共同提出者,2024年进入OpenAI参与Deep Research 和 Operator。2025年下半年回国,12月就空降腾讯首席AI科学家,向刘炽平汇报。
他接过手的更像是一个“烂摊子”,但也是个明白的摊子。2026年1月底,混元启动底层基础设施全面重建,覆盖预训练、强化学习、数据和评估。3月,腾讯撤销成立近十年的AI Lab;7月23日,大语言模型部与多模态模型部合并为基础模型部,28岁的姚顺雨统管腾讯全部底层模型研发。
根据最新财报,二季度腾讯研发支出了272.8亿元,同比涨了35%;资本开支527.8亿元,同比涨了176%,大头都进了AI算力和训练。
按他说的节奏,混元平均每两个月迭代一次大版本:4月,发布Hy3 preview,7月6日,发布Hy3 正式版,发布一周,调用量较Hy2涨了超68倍,到8月28日,Hy4 preview上线。
48小时前,或许整个行业都盯着同一个问题:这次,腾讯真的追上了吗?
02 押家底般的投入和跑分里的一些真话
先看规格。Hy3是295B总参、21B激活、256K上下文;Hy4 preview直接拉到 770B、49B和1M,注意力机制从GQA换成了Gated DSA 加上IndexCache,残差改成4路iHC。
说人话就是,从长上下文里挑重点看,信息多路并行传,模型变大了近两倍半,但每token激活的只有49B,成本可控。
有博主称,在架构层面,这是混元第一次真正摸到国内顶级模型的边。
定位也换了个说法,不再喊通用,而是为生产力而生。在软件工程、办公分析、游戏开发和科学研究四个场景,靠腾讯内部专家共建数据和 WorkBuddy/CodeBuddy 产品协同打磨。
姚顺雨之前反复讲过一个思路,不训练刷榜的做题家,关心模型在真实场景好不好用。
官方还讲了个更玄的故事,递归自我改进。说Hy4 preview是第一次参与了自己训练方法、数据策略、评估体系和底层算子的自动优化,自主做算子融合和通信优化,端到端吞吐提升了31.8%。科学方面,把3DBlaschke-Lebesgue 问题的体积下界从0.380799推到了0.41104,离Meissner四面体猜想只剩2%的差距。
顺带官方也坦白了,preview版本复杂任务容易长思考、过度自我验证。这句话后面会反复应验。
腾讯官方公布了一组12项评测的对比,对手是GLM 5.3、Kimi K3、DeepSeek V4 Pro、Qwen 3.8 Max,以及闭源阵营的 GPT 5.6 Sol 和 Claude Opus 5。
![]()
别被这一锅粥的表骗了,我们分三档来看:
第一档是跟国产开源同侪,的确是站住了。Terminal Bench 2.1 拿85.4(GLM 5.3 约88.2–88.8、Kimi K3 约85.7–88.3,不同转引会有出入);DeepSWE64.3,略低于Kimi的74.0;但SWE-bench Multilingual 82.9,是开源阵营第一;SWE Atlas Refactoring、Toolathlon-Verified 、OneMillionBench(工具)都领先。
第二档是跟闭源旗舰,差距还是比较明显的。GDPval-AA V2 上,混元 1678,Claude Opus 5 是 1831,GLM 5.3 都压它一头(1763);物理推理的 CritPt 上,混元16.9,处于全场垫底区,GPT 5.6 Sol 是 32.3,Claude 是 29.1;SWE-bench Pro 上,Claude 79.2,混元65.7;HLE 纯文本,Claude 54.9、GPT 49.5,混元 43.4。
第三档是跟自己比,的确进步惊人。DeepSWE 从28.0干到64.3,翻倍还多;ProgramBench从3.6到17.5;Terminal Bench从70.8到85.4。一个半月追回这么多,混元自己都说这是最大的代际增益,这回真不是吹。
还有两个数字,得单独拿出来捋一捋。
一个是官方盲测,有163名内部专家、203个工程任务,Hy4 preview 均分 2.99/4,略优于GLM 5.3(2.92)和 Kimi K3(2.94)。
听着很提气是吧?但仔细看胜负比,对 GLM 是胜 46.8%、负 40.4%,对 Kimi 是胜 51.2%、负 40.9%。负率四成,这就是五五开里探出一个头。而且打分的是腾讯自己的工程师,任务是自家工程任务。这个略优于的含金量,或许是要打折扣的。
另一个是第三方榜单,在Arena.ai的Code Arena WebDev 上,Hy4 preview排第5,1633分、开源模型第3,和 Grok-4.6、GPT-5.6 Sol 咬在同一区间。这是混元模型头一回出现在这种位置。
注意措辞是出现在这个位置,不是站上第一位。混元从落后到第一梯队的叙事,目前一半还靠官方自己的数据撑着,独立机构的大规模横评还没出来。
03 干活的时候,它到底行不行?
跑分归跑分,最终还是要看看实测。很多媒体的实测结果放一起,画面出奇一致:长板是真的长,短板也真的短。
我们也来亲自测试一番,既然接入了WorkBuddy,首先是在办公场景下先跑一跑吧!
我们用前几天让豆包工作的案例测试对比一下,同样抛给WorkBuddy:帮我分析一下美国大模型公司Anthropic 2026年Q2财报,整理一下核心财务数据(营收、净利润、毛利率、经营性现金流等),做同比对比、生成图表,再帮我对比国内大模型公司的行业情况,最后写一份解读报告。
![]()
前后一共等了12分钟左右的时间,它帮我输出了一版报告。但中间等待的时间确实有点久……不重要,消耗TOKEN后来看看效果对比:
![]()
![]()
(以上豆包工作给的图表)
![]()
![]()
![]()
(以上是WorkBuddy给的图表)
图表是各有各的风格,你想要什么样的数据和风格,总有一款适合你。我认为,如果你想要更具体精准一点的,就要把最初的问题提的精细点。我们再来试试它的一句话生成场景,比如我让它帮我生成马斯克驾着火箭登陆月球的视频。
![]()
当然,这个时间也是非常久的。我已经在等模型响应这一环节,等了超过10分钟,等我离开工位去茶水间接个咖啡做个拉伸回来,它告诉我当前模型服务器暂不可用。好家伙,运行转悠半天给我来这个。多少有点崩溃啊!
![]()
而且,它的视频生成用的是它自带的生成专家,相当于某个Skill智能体来做这个任务。
我看到,APPSO的测试结论是腾讯终于踩下油门,一句话生成可操作的实时3D月球车场景。南方都市报的测评更狠,让它做3D弹球游戏,它自己跑无头物理验证,发现球会逃逸出球台、发球冲不上去、挡板打不飞三个bug,自己定位、自己修好,全程没用人管。好吧,是我的服务器不行。
我们来试试游戏代码生成如何,一个老生常谈的项目:帮我写一个QQ农场的游戏。
![]()
这个倒是挺快的,在后台开始给我干活写代码。5分钟就给我干出一个不错的网页版。
![]()
这只是故事的一半。
测试体验后我的一个感受是:复杂任务理解确实更细致了,但是用更长的思考换来的,相同的任务下token消耗比一些模型更大;长任务偶发无限死循环,思考过程过长直接截断、任务终止。
官方承认的过度自我验证,是实打实地体现在账单和等待时间里的。
更尴尬的是,Hy4 preview是纯语言模型,没有视觉、没有多模态。你在WorkBuddy里让它生图生视频,系统会自动切到别的模型,正常扣积分,不占免费额度。官方公告写得很清楚。对着一家说自己要探索全模态智能上限的公司,这代模型先把自己摘出去了。
安全披露也是空白。有第三方评测AI Tools Review指出,腾讯没有像Anthropic、OpenAI、Google那样发布 system card、风险框架或安全专项评估。一个自称能自我改进、能自主优化推理基础设施的模型,这个缺口,并不是一件小事。
04 便宜的旗舰和真实的算力
定价倒是干净利落(元/百万 tokens,各家官方定价页我们看看):
大模型 | 命中缓存 | 输入 | 输出 |
|---|---|---|---|
Hy4 preview | 0.3 | 6 | 18 |
DeepSeek V4 Pro(高峰时段) | 0.3 | 9 | 27 |
GLM 5.3 | 2.0 | 8 | 28 |
Kimi K3 | 2.0 | 20 | 100 |
在国产旗舰统一价里,Hy4是全场最低的一档,比 Kimi K3 的输入价便宜了七成。缓存命中0.3元是隐藏亮点,长上下文流水线反复读同一份材料时,第二次起几乎白送。
但这里有个对照组不能漏,那就是DeepSeek V4 Pro 自8月17日起搞峰谷定价,空闲时段 4.5/13.5/0.15,三项都比 Hy4 便宜。
算总账,便宜这件事,腾讯还不是稳赢的那个。
但免费政策还算大方。WorkBuddy/CodeBuddy 里 Hy4 preview 限免到 9 月 10 日,Hy3 顺延到 9 月 30 日,每个人每天有免费额度。想自己验证的,现在零成本。
自托管也不拦着,Apache 2.0,FP8版大约要720GB显存,8卡H200能跑,8卡H100不够。这行小字值得记住,开源免费,但跑得起它的人不多。
所以,焦虑缓解了吗?回到开头那个问题。对“混元是不是废物”这个舆论问题,答案基本翻案了。从2025年躺平的定性,到2026年8月Arena 代码榜第5、开源第3,混元用6个月证明了重建路线的成立。
这不是赢了几分的事,是这家公司还能不能做出一线模型的事,这个更根本的问题,Hy4 preview确实给出了正面回答。
对姚顺雨个人,这步棋也没走错。入职9个月,两代大版本,代际提升幅度实打实,7 月整合完基础模型部,组织理顺了,产品也跟他绑在一起(WorkBuddy 桌面办公 Agent 市场份额领跑)。至少到目前看来,腾讯请他来是对的。
但对腾讯这家公司,焦虑只减了一半,而且减的是容易的那一半。
难的那一半,Hy4 preview 用自己的三天表现亲自演了一遍:
算力问题。上线即排队,三天紧急扩容,官方明说受限于高端算力总量。二季度527.8 亿的资本开支说明腾讯知道问题在哪,但钱变算力要时间,而排队正在发生。
差距问题。CritPt 垫底区,HLE 落后 Claude Opus 5 十分以上,SWE-bench Pro 落后13.5 分。“开源第一梯队”和“全球第一梯队”之间隔着的,或许恰是腾讯最焦虑的那段距离。
更扎心的是,Claude和GPT没有站着等它。
验证问题。盲测是自家员工打的,跑分是自家 harness 跑的,独立横评还没出炉。第一梯队的叙事,一半还悬在官方数据上。
再看preview本身。过度思考、token 膨胀、死循环和截断,官方全认了。Hy3 preview 到正式版补短板有先例,但在正式版落地前,这些就是用户的真实体验。
以及8月的对手也还在跑。DeepSeek V4-Flash/V4 Pro、Qwen 3.8-Max、GLM-5.3,月底智谱和千问还深夜各发了一款 Flash 试图划斩杀线。Hy4 preview 是在别人加速时追上来的,不是别人停下等它。
马化腾说“希望船速能快一点”。Hy4 preview证明船没沉,还能加速。但漏水的问题,终究要靠算力、时间,以及下一版的正式模型来修。
对腾讯和姚顺雨来说,焦虑的总量大概没变,只是换了一种形态。从我们还行不行,变成了我们还能多快。
这算是一种升级。但升级,并不等于解决。「完」








快报
根据《网络安全法》实名制要求,请绑定手机号后发表评论