![]()
AI 圈这几天最受关注的名字,是一个不会聊天的模型,Jev。
它不写文章、不写代码,也不陪用户聊天。有人问它「这封邮件紧急吗」,它不会先写三段分析再下结论,而是直接回答「紧急,概率 95%」。
发布才一周,创始人发布的官宣帖在 X 上的浏览量冲上数千万;主流 AI 模型网关 Vercel,上线 24 小时内就有近 13% 的付费团队接入。有人拿它打《毁灭战士》,移动、瞄准、绕障一气呵成,流畅得不像机器;有人让它和 GPT-6 Astra 在《我的世界》里用 8 分 43 秒打赢末影龙,总花销不到 1 美元,其中 Jev 只占 0.01 美元;还有开发者实测 6 个代码 PR 后推算,审 1000 个只需 7 美分,而同等工作交给 Claude Opus 5 要 14.5 美元。
一个不会聊天的模型,为什么能引来整个技术圈集体关注?
热度从哪里来
先交代出身。Jev 来自美国创业公司 TypeSafe AI。创始人 Diogo Almeida 是 OpenAI 老将,也是 InstructGPT 和 RLHF(基于人类反馈的强化学习)论文的共同作者,这两项工作正是 ChatGPT 技术路线的重要前身。2024 年他离开 OpenAI,带队隐身研发两年,直到 2026 年 9 月 15 日才正式亮相。资本早已押注,DCVC 领投了 4000 万美元种子轮。
Jev 这个名字本身也经过设计,取自 19 世纪英国经济学家威廉·杰文斯。杰文斯用「杰文斯悖论」说明一个道理:效率提升,有时反而会带来更大的总体消耗。一家 AI 公司拿一位经济学家当名字,隐隐指向它对「效率」的执念,这正是 Jev 的立身之本。
发布当天,它在 Hacker News 冲到 1800 多分、近 500 条评论;OpenRouter、Cloudflare、LangChain 等主流平台先后接入;几天之内,社区还出现了开源仿制版。
发布 36 小时,TypeSafe 收到的内测申请就涉及约 14 万名开发者;9 月 21 日 Jev 向所有人开放,每位新用户直接送 5 美元额度,约合 1.2 亿 token。按官方口径,一次判断通常只烧几百个 token,省着点够个人尝鲜几十万次。换句话说,它几乎把「决策」这件过去很贵的事,做到了接近免费,热度的含金量也在这里。
为什么一个不会说话的模型能引爆这样的热度?因为过去两年,大家可能让 AI 干了太多它不擅长的事。
看看社区都拿它干了什么。有人把它接进 Claude Code 做上下文清理,让长对话不再越聊越笨;也有人因此翻车,用不做推理的分类模型去删改 Agent 历史,模型忘掉了试过的操作、陷入循环。还有人拿它实时判断跑酷游戏里下一个平台落点、给 Agent 验收任务、在 40 秒内拆完 724 条实时广告。这些用法有个共同点,都不是要它「说」,而是要它「判」。
过去一年,Agent 概念正当红,可真正落地时大家才发现:一个 Agent 跑起来,要做的不是「想」,而是无数次「判断」,调哪个工具、留哪些上下文、这次操作有没有风险、结果要不要人工复查。这些高频判断题交给动不动就「深度思考」的大模型,既慢又贵。Jev 的走红正踩在这个节点上,在最需要的时候递上一把顺手又便宜的刀。
Jev 是什么:把「判断」做成零件
做 AI 产品的人都熟悉一个困境:系统里每天有海量琐碎判断,这封邮件算不算投诉,这笔退款该不该自动批,这条评论要不要删。
最常见的做法,是每次都请一个大模型来回答。但大模型的核心工作方式是「生成」:用户要一个「是或否」,它可能先写三段分析再给结论,按字数收费,还要等上几秒甚至几十秒,回来的文字还得让程序拆解、校验,格式不对就重来。
更麻烦的是,大模型说「我很确定」时,这句话本身不附带刻度。「很确定」到底是七成还是九成?剩下那部分不确定性落在哪个方向?无从得知。于是大量本该由机器自动完成的判断,卡在一种两难里:用大模型太贵太慢,靠写死的规则又不够灵活。
TypeSafe 把这类模型命名为「System One」,借用了诺贝尔经济学奖得主卡尼曼《思考,快与慢》里的框架:人脑有两套系统,System 1 负责不费力的直觉快判断,System 2 负责缓慢的深度推理。GPT、Claude 这些主流模型全是「System 2」路线,逐字推演、组织语言、生成答案,能力强,但慢、贵、输出不可控。
Jev 则是第一个公开的「System One」模型。它放弃文本生成,专做决策:给它一段状态,比如一份文档、一条工单、一段聊天记录,再附上几个预设好类型的问题,它一次并行返回所有答案,每个答案都带概率和置信度。
这个概念并非空穴来风,卡尼曼的理论本身就给出了依据:人脑在做大量琐碎决策时,靠的正是那个不费力的系统一;只有在真正复杂的问题上,才启动缓慢的系统二。TypeSafe 想做的,就是给软件也装一个「系统一」,让高频、明确、低风险的判断变得又快又便宜,把宝贵的「系统二」留给真正需要深度推理的任务。
![]()
人脑的快慢思考,如何变成 AI 的两种路线
工作流程大致五步:先描述决策需求,系统生成问题集供用户挑选;再从历史标注数据里选样本喂给它,优化判断逻辑;最终对每个输入返回「决策结果+置信概率」,用户可以设阈值,低于阈值的转人工或交回大模型。要提醒一句:Jev 本身无状态,不记忆历史;所谓「复用」要靠外部配置层,把高置信度的判断模式沉淀下来反复调用。
输出形式只有三种,全是「强类型」:Choice(从选项里选一个)、Score(在刻度上打分)、Noul(判断一件事成立与否,返回 0 到 1 的概率)。它不可能输出类型之外的东西,也就从结构上杜绝了生成式模型那种「幻觉」:它不会编造一篇不存在的文章,最多只是选错一个选项。
![]()
Jev 只输出三种「强类型」结果:Choice、Score、Noul
![]()
Jev 的工作流程:把「判断」做成软件可直接使用的零件
快 20–200 倍、省 40–400 倍:一次分工的胜利
按 TypeSafe 官方数据:端到端响应时间 70 到 500 毫秒,传统大模型要 3 秒到 300 多秒,快 20 到 200 倍;每百万输入 token 只要 0.042 美元,输出免费,成本低 40 到 400 倍。这一设计带来的数字相当夸张。但这两个区间的上限,是厂商在自家工作流里跑出的最乐观值,独立实测通常达不到那么多倍。一次请求还能并行回答多个判断问题,问题多了延迟也基本不变。

同一个判断,两种响应速度
这里不妨打个比方。过去请 AI 做事,像请一位作家替人写报告,他文采飞扬,可用户要的只是一个「是或否」,他还得先洋洋洒洒写八百字。Jev 则像请了一位裁判,什么都不写,只在摆好的选项里果断亮分。同样是做判断,前者的强项在表达,后者的强项在决策。而软件后端九成以上的调用,需要的恰恰是后者。
TypeSafe 反复强调的一个词是「校准」,训练方法叫 RLCD(面向校准决策的强化学习)。这里要打个折扣:让「模型说有 95% 把握的答案,在真实世界里大约 95% 是对的」,是 RLCD 的设计目标,并不是已经拿到验证的结论,官方目前还没公布可靠性图或 ECE(期望校准误差)数据。而且官方文档自己说明,「把握」衡量的是各选项之间的相对偏好,不等于答案的绝对正确率。
TypeSafe 自评的四项业务工作流里,Jev 准确率 67.8%,最强的基线模型是 74.1%;OpenRouter 用 3080 条真实客服语料(Banking77)实测,Jev 是 81.0%,Claude Opus 5 是 84.4%。也就是说,它并不「更准」,只是把速度和成本压了下来。准确率恰恰是最需要冷静看待的一项,这也是为什么高置信度要设阈值转人工,在把判断交给它之前,最好先用自己的数据测一测。
另外提醒中文读者:Jev 对中文的支持目前弱于英文,官方文档明确标注 CJK 语言「可用但准确率不等同英文」,中文场景建议先用自有材料测过再决定。这个服务目前在中国大陆还无法直接使用,官方并没有公布地区限制名单,主要是服务节点集中在美国西海岸、尚未覆盖亚太,想用的中文开发者得先想想接入渠道。![]()
置信概率的意义:一条输入,两条路径
这引出 Jev 真正的用法:完全信任模型,要担出错风险;完全人工审核,又效率低下。现在可以按业务容错率设一个阈值:高置信度直接自动化执行,低置信度转人工或升级到大模型,既提升自动化比例,又守住风险底线。
用一位开发者的比喻:以前的 LLM 像是返回一个自由格式的字符串,得自己写正则、解析、异常处理、重试;Jev 像是直接返回一个强类型对象,字段类型确定、值域确定,连置信度都算好了。
至于「快而可靠」里的「可靠」,实际测试要打个问号。有媒体拿 190 次财报任务实测:第一轮 45 次全对,是因为增长率事先算好喂给了它,那一串「满格把握」说明不了什么;一旦把正确选项从列表里拿掉,Jev 会把八成以上的置信度押在与事实矛盾的描述上,毛利率题连错 10 次时,报出的把握也都在八成以上。它真正的卖点是便宜,而不是这份「把握」。
当然,官方也坦承,并非所有任务都能获得同等提升,这些数字是基于自有业务自动化工作流跑出来的。横向看,Jev 单次请求能并行处理多个判断问题,数量增加而延迟基本不变,这让它特别适合嵌入现有软件:代码继续控制业务流程,Jev 只负责其中一个范围明确的判断,像是给程序加了一个只管判断的专职模块。![]()
JEV 与传统大语言模型(LLM)在响应速度与调用成本上的对比(对数刻度)
哪里该用,哪里别碰
Jev 擅长的高频固定判断,恰恰是 Agent 落地时最拖后腿的部分。在一个真正的 Agent 里,它至少能顶三个位置。
- 模型路由:判断这次请求该调用哪个大模型,还是根本不用调用、直接走预设逻辑,能省下大把 token 钱。
- 工具调用门槛:判断该不该调工具、调哪个工具,不必每次都让大模型做选择,响应快得多。
- 验证与监督:对大模型生成的结果做校验,看是否符合要求、有没有风险,不必把输出再喂给大模型审一遍。
![]()
Jev 在 Agent 里顶的三个位置
落到具体业务上,客服工单分类、用户意图识别、内容合规校验、商品打标、实时风控、查询路由到知识库,凡是「从几个明确选项里做决定」的活,都是它的主场。
但边界同样清晰:如果要的是写文案、生成摘要、创作故事、开放域问答这类「生成非固定结果」的场景,Jev 帮不上忙,还得回到大模型。如果决策逻辑极其复杂、选项没有固定边界、或者样本少得连判断依据都没有,也别硬用。它只支持文本输入,选择字段的候选上限是 255(官方文档),评测也主要基于自有业务工作流,而非 MMLU 等公开基准。
一句话:它是一把精密的扳手,不是瑞士军刀。放对位置,它是利器;放错位置,就成了隐患。
更现实的用法,是把它当 Agent 架构里的一层。过去一个 Agent 跑起来,判断一次调一次 LLM,路由一次调一次,验证一次再调一次,延迟、成本和不确定性层层叠加。把高频判断拆给 Jev 后,架构就变成「规则+决策模型+LLM+工具」的多层协同:LLM 继续负责复杂推理,Jev 负责那些又小又急的判断题。这种拆法,可能是它在工程上最值钱的地方。
热闹背后的真问题
围绕 Jev 的争议不少,Redis 之父 antirez 就公开泼冷水:Jev 或许有一些很狭窄的应用场景,但围绕它出现的炒作,恰恰说明 AI 泡沫里的大多数人分不清什么重要、什么不重要。这种质疑不无道理,Jev 并没有抬高 AI 的能力上限,它只是把「判断」这件小事做得又快又便宜。
也有人直接说它「不就是个 JSON 分类器吗」。但大模型研究工程师 Sebastian Raschka 提醒别低估它:传统分类器训练完标签就固定了,场景一变就要重训;Jev 能在运行时接收自然语言标签,结合上下文对动态选项做判断,泛化能力完全不同。2026 年 9 月 20 日,谷歌 Gemma 官方账号发了条「DiffusionGemma as Jev」,把自家的扩散模型适配成 Jev 式决策接口,风向的变化比争吵更说明问题。
技术之外,Jev 真正触及的,是行业一个长久的困惑:为什么模型已经这么能聊,大规模自动化却没有随之而来?TypeSafe 的答案是,聊天形态的模型,天生不是软件该依赖的接口。软件需要的不是一篇篇「文章」,而是一个个确定、可靠、能插进控制流的判断。把「判断」单独拆成一层,让大模型专注复杂推理,这可能是 Agent 架构下一轮演进的起点。
质疑者担心的是热度跑在能力前面;支持者看重的是它把「判断」做成了一种可复用的基础能力。两者其实并不矛盾,分野恐怕要等 Agent 真正大规模落地后才有答案。对普通读者而言,比起记住这些数字,更值得留意的是这个信号:当判断开始按件计价、按毫秒交付,软件自动化的门槛,正在被一点点磨低。
(本文首发钛媒体APP,作者 | 硅谷Tech-news,编辑 | 焦燕)







快报
根据《网络安全法》实名制要求,请绑定手机号后发表评论