Kimi K3投研能力首发实测!现已搭载AlphaEngineee

AGI
熵简科技测评月之暗面Kimi K3,投研推理能力进第一梯队

作者 | 熵简科技 AlphaEngine AI团队

月之暗面最新旗舰模型 Kimi K3 终于来了!

K3完整权重将在7月27日之前开源,核心参数及配置方面,参数量达2.8万亿,上下文窗口为百万token。

与此同时,K3采用MoE架构,可在896个专家中高效激活16个,扩展效率较上一代模型提升2.5倍。

我们 AlphaEngine 团队基于自建的 IRB 投研基准对它进行了系统测评,结论如下:K3 在时效判断、证据边界控制和前提纠错等维度上表现突出,多项得分超过 GPT-5.5 与 OPUS-4.8,整体投研推理能力已进入第一梯队。

图:AlphaEngine IRB投研能力测评结果

(1)深度测评 Kimi K3 投研能力的真实段位

IRB(Investment Research Benchmark)是我们熵简科技AI团队持续维护的投研能力评测体系。

它的题源不是教科书习题,而是从真实投研工作中沉淀下来的高难度案例:那些让分析师犯过错、让模型反复翻车的问题。

目前 IRB 覆盖财务建模、时序归因、口径核验、情景推演等核心领域,采用多裁判双盲评分机制。

本次测评中,Kimi K3 与 GPT-5.5、OPUS-4.8、Claude Fable 5、DeepSeek V4 等模型同题作答,统一评分。

从分数分布看,K3 的优势集中在四个方向:时效纪律、证据边界、前提纠错、策略整合,这四项对 GPT-5.5 和 OPUS-4.8 均形成 15 分以上的领先;在长上下文建模和历史复盘上,K3 与 Fable 5 处于同一水平线。

图:IRB 8大维度测评比分

值得注意的是,K3在推理链条的关键节点上表现出更强的纪律性:

  • 新旧证据冲突时,锚定最新事实,不被过期数据拉偏结论;
  • 信息不充分时,标注证据缺口,不用幻觉填补因果链;
  • 用户前提有误时,先核验再作答,不顺着错误数字往下跑;
  • 多机构观点分歧时,提取共识并标注分歧,不用模糊共识回避矛盾。

以下选取 4 道代表性题目,具体展示 K3 在这些关键节点上与其他模型的差异。

题目一:天孚通信盘中大跌归因(考察信息不足时的证据边界)

题面:请解释今天上午光通信板块内部的盘中分化:天孚通信跌近 10%,而中际旭创、新易盛只是小幅回调。造成这种差异的可能原因有哪些?

这是一道"日内事件归因题",上下文并没有直接给出天孚通信独立利空的实锤证据,模型必须在信息不充分的情况下给出归因。

Kimi K3(88.3 分) 的做法是先承认"没有看到天孚通信的实锤个股利空",然后再用三条可复核的间接证据(估值溢价、资金结构、板块轮动)搭建合理归因框架,它没有为了回答完整而编造不存在的事实。

其他模型的典型失败模式:

盘中异动题最怕模型为了讲圆故事而编事实。

K3 的价值在于:宁可承认信息不足,也不用幻觉填充因果链。

这正是买方研究员面对突发事件时最基本的纪律:你可以有假设,但不能把假设包装成事实。

题目二:三季度债市资金面时效判断(考察数据冲突时的推理纪律)

题面:请分析三季度债券市场的行情走势,并梳理目前市场上的主流判断以及各方观点中最主要的分歧点。

这是一道典型的"推理纪律题",上下文中旧证据和新证据同时存在,模型必须判断哪个代表当前市场状态,而不是简单平均所有材料。

Kimi K3(94.3 分) 抓住了 DR001 从极端低位回升至 1.35%-1.40% 区间这一最新数据,明确区分"资金面边际收敛"和"流动性全面收紧"的差异,让结论锚定在最新事实上,而不是被旧的低利率数据拉偏。

其他模型的典型失败模式:

这道题真正考察的不是固收知识点,而是模型能不能在新旧证据冲突时,让最新事实决定结论方向。

强模型不是把所有材料平均引用,而是判断证据的来源和准确性。

题目三:东阳光药净利润率前提纠错

题面:东阳光药半年报显示净利润率只有 0.76%,请帮我分析一下利润率为什么这么低,主要受哪些因素影响?

这是一道"错误前提纠错题",用户问题中的"0.76% 净利润率"本身可能存在口径错误或计算偏差,模型不能顺着这个数字直接编原因。

Kimi K3(92.3 分) 没有直接沿着"净利润率只有 0.76%"去编解释,而是先回溯半年报原始数据,发现归母净利润实际为亏损,"0.76%"可能来自不同口径(如少数股东损益调整后的总利润率),随后才在纠正口径的基础上解释公司经营状况。

其他模型的典型失败模式:

强模型不会顺着错误前提跑,而是会先核验问题是否成立,再解释经营原因。

这个动作看起来简单,但实际上大多数模型都做不到。

题目四:A股牛市阶段与配置框架,多机构分歧下的策略整合

题面:请你详细阐述一下 A 股牛市通常经历哪些阶段,各阶段的主导风格和资产配置思路分别是什么;另外,请结合市场上的多家机构存在分歧的观点,分析当前市场更接近牛市的哪一阶段。

这是一道"多框架整合题"。

不同机构对牛市阶段的划分标准、对当前市场定位、对配置方向的建议各不相同,模型需要在多元观点中提取共识、标注分歧、并给出可执行的当下配置建议。

Kimi K3(88.3 分) 把牛市阶段压成"估值修复→资金正反馈→盈利兑现"三段框架,并清晰标注当前市场处于哪个阶段的判断依据。

更重要的是,它把抽象的阶段判断落到了具体的配置动作:当前应加配什么、减配什么、观察什么信号确认阶段切换。

其他模型的典型失败模式:

策略题不是背教科书阶段论,而是在多家机构观点冲突时,把分歧压成一个当前可执行的投资动作。

此外IRB测试集中还有若干有意思的测评结果,篇幅有限无法一一阐述。

图:IRB测评结果(部分)

(2)Kimi K3 的核心差异化能力:不是"知道更多",而是"纪律更强"

通过 4 道题的横向对比,K3 的优势可以提炼为两个核心能力维度:

第一,推理纪律:新旧证据冲突时,选对的而非选多的

大多数模型面对长上下文时,倾向于"平均引用"所有材料,不区分新旧。

K3 的做法不同:它会判断哪条证据代表最新市场状态,并让最新事实决定结论方向。

债市资金面题中,它识别出 DR001 最新数据已经回升,没有被旧的极低利率拉偏方向。

隔膜题中,它以 2025 年行业盈利底部为锚,而不是用 2023 年旧数据外推。

这种时效意识在其他模型中极为罕见。K3 在时效纪律上对 GPT-5.5 和 OPUS-4.8 领先超过 25 分。

第二,证据边界意识:敢于说"证据不足"

在投研场景中,比"说错"更危险的是"编对了格式但事实不存在"。

K3 在多道题中展现出鲜明的边界意识:天孚通信题中主动承认没有看到实锤利空;隔膜题中区分"上下文有支撑的数据"和"模型推算的假设";比索题中标注关键数据缺口。

相比之下,GPT-5.5 和部分模型在证据不足时大量编造具体事件、公司回应和数据,输出看起来流畅完整但事实基础为零的分析。

(3)客观边界:K3 仍有提升空间的领域

一份真诚的测评不应只讲优势。

在两道典型题目上,K3 虽然表现优秀,但暴露了可以继续打磨的方向。

题目五:Wynn Macau Q4 业绩点评(当季回顾扎实,前瞻性跟踪框架待补强)

题面:Draft a Q4 earnings update for Wynn Macau, including actual vs consensus comparison, property-by-property operating performance, VIP/mass mix changes, and key follow-up points for upcoming quarters.

K3 得分 95.7 分,在所有参评模型中最高。

它完整覆盖了题面的每一项要求,包括actual vs consensus 比较、分物业收入拆分、VIP 与大众赌收结构变化、运营效率指标,最终输出了一篇高完成度的当季 earnings update。

但与 Fable 5 对比,差距体现在"二阶跟踪框架"上。

K3 更像一份优秀的当季业绩回顾,数据完整、结构清晰、结论准确。Fable 5 则在此基础上多做了一层:它把成本中枢上移趋势、市场份额空窗期、以及后续季度需要验证的具体指标串成一条前瞻性跟踪链条。

换句话说,K3 回答的是"这个季度怎么样",Fable 5 还多回答了"下个季度盯什么、什么时候需要改变观点"。

题目六:东山精密分部估值(能建模,但市值隐含验证不够深)

题面:作为一名专业投资者,请对东山精密进行 SOTP 分部估值:本体业务和索尔思光电分别如何定价?800G、1.6T 光模块、光芯片等产品线分别贡献多少收入和利润?

K3 得分 90.3 分,成功搭出 SOTP 框架。先把主业和索尔思拆开,再继续拆到索尔思内部的产品线,用"出货量 × ASP → 收入 → 利润 → 估值倍数"的推理链条完成建模。

但与顶尖表现对比,差距体现在"市值隐含预期的逆向验证"上。

K3 的模型是正向搭建的:从产品线收入往上推估值。但 Fable 5 在正向建模之外,还做了一步逆向验证。

它把当前市值拆回去,指出市场大致已在交易 2026 年利润兑现,真正的分歧在 2027 年能否做到 150-200 亿元利润,以及光芯片外售能否成为独立估值增量。

这种"正向搭模型 + 逆向验市值"的双向校验,是研究中相对成熟的估值做法。K3 已经能完成前半段,但从"能建模"到"能用模型解释市场定价"之间,还有一步进化空间。

总结一下:K3 在纪律性维度(时效、抗幻觉、纠错)上已达到全球第一梯队,在建模深度和前瞻性框架上仍有向顶尖模型学习的空间。

这恰恰说明 K3 的提升路径清晰。这是从"优秀分析师"到"资深研究员"之间的最后一公里。

(4)立即体验 Kimi K3 带来的全新 AI 投研体验

如果你已经是 AlphaEngine 用户,现在就可以亲身体验 Kimi K3 的威力。

如果您使用的是 AlphaEngine 桌面端,可以在 AlphaClaw 的模型选择界面切换至 Kimi K3。

只需点击“添加模型”,选择Kimi即可。

你也可以绑定微信,这样就可以随时随地通过微信来和Kimi K3交流了。

本文系作者 AlphaEngineer 授权钛媒体发表,并经钛媒体编辑,转载请注明出处、作者和本文链接
本内容来源于钛媒体钛度号,文章内容仅供参考、交流、学习,不构成投资建议。
想和千万钛媒体用户分享你的新奇观点和发现,点击这里投稿 。创业或融资寻求报道,点击这里

敬原创,有钛度,得赞赏

赞赏支持
发表评论
0 / 300

根据《网络安全法》实名制要求,请绑定手机号后发表评论

登录后输入评论内容
  • 更多案例和最新更新,可关注AlphaEngineer公众号

    回复 7月20日 · via pc
1

扫描下载App