你的Agent在prod环境里打了14轮工具调用,烧掉几千个token,最终给出一个语气自信但完全错误的答案。而APM面板上,每个HTTP状态码都是200,每次延迟都在正常范围,没有一行告警抛出。
传统监控看不到语义层面的失败——它不关心LLM的回复质量、检索相关性、或者Agent的推理轨迹是否合理。这正是LLM可观测性与评估平台填补的空白。2026年,这个赛道已经从“开发者调试小工具”进化成了生产级AI基础设施的标配组件。
26.9亿美元的市场,三个信号
The Business Research Company的数据显示,LLM可观测性平台市场在2026年达到26.9亿美元,较2025年的19.7亿美元增长36.2%,预计到2030年将攀升至92.6亿美元,年复合增长率36.2%。Gartner则预测,到2028年,LLM可观测性投资将覆盖50%的GenAI部署,而2026年初这一数字仅为15%。
LangChain发布的《Agent工程现状报告》调研了1300多名专业人士,发现57%的受访者已将Agent投入生产环境,其中近89%已经为Agent实施了可观测性。但评估环节明显滞后:52.4%运行离线评估,37.3%运行在线评估,还有29.5%根本没有做任何评估。质量问题被32%的受访者列为生产部署的首要障碍。
市场已经分裂为四个阵营,理解这个阵营划分比罗列任何单一功能列表都更重要。每个阵营代表了一种不同的产品哲学,也对应着不同的锁定风险。
阵营一:生态绑定者——LangSmith
LangSmith是LangChain母公司推出的可观测性与评估平台。它的核心优势也是核心局限:与LangChain和LangGraph深度绑定。如果你的应用完全构建在LangChain生态中,LangSmith的集成体验几乎无可挑剔——trace、dataset和evaluator天然映射到LangChain的约定之上。
2025年10月,LangChain 1.0 GA发布,围绕核心Agent循环重构,引入了第一类中间件体系。2026年3月,LangSmith Fleet(前身为Agent Builder)正式推出,将LangSmith从可观测性扩展到了“一键部署和运维”的Agent运营全栈。这意味着LangSmith不再只是一个“看完问题就结束”的工具,而是一个试图吃掉整个Agent生命周期所有环节的平台。
定价方面,Developer计划免费提供1个席位和每月5k条base trace,Plus计划$39每席位每月含10k条trace,超出部分按$2.50每千条计费。但它的核心取舍很明确:你享受了最深的LangChain生态集成,代价是框架绑定——一旦深度接入,切换成本会越来越高。LangSmith的客户名单中不乏知名企业,但它的生态位也意味着,如果你的栈不是LangChain,它就不是最优解。
阵营二:开源中立派——Langfuse
Langfuse是目前开源LLM可观测性领域的事实领导者。MIT许可证,支持自托管(Postgres加ClickHouse),框架无关,通过OpenTelemetry支持任何LLM SDK或Agent框架。截至2026年3月,GitHub Star数已达23.3k。
Langfuse近期被ClickHouse收购,这让它的底层存储获得了天然的规模化优势。它的功能覆盖极为全面——从会话追踪、prompt管理、评估到批量导出和SOC2合规,官网上列出了78项功能。云服务免费层支持每月50k events、2个用户和30天数据访问,Pro方案从$29每月起,含100k events。
Langfuse的定位是“可观测性平台,不绑定框架”。这对于有多框架混合部署或数据驻留合规需求的团队来说,是难以替代的吸引力。它的评估能力不如Braintrust等专门平台深,但作为“够用且完全可控”的选择,Langfuse在开源生态中占据了最稳固的阵地。
阵营三:评估优先的商业选手——Braintrust与Confident AI
Braintrust在2026年2月完成了8000万美元的Series B融资,由ICONIQ Growth领投,现有投资者a16z、Greylock、Elad Gil和Basecase Capital跟投,投后估值8亿美元,相较于2024年Series A的1.5亿美元估值翻了5倍以上。这个增速本身就说明了市场对“评估优先”理念的认可。
它的差异化在于评估优先:结构化实验、prompt版本对比、eval数据集管理和发布前回归测试。其最强价值在于系统性的事前验证——在代码变更上线之前,用真实的输入数据跑一遍自动评估,确保新版本不会“变笨”。Braintrust的客户包括Notion、Replit、Cloudflare、Ramp和Dropbox等知名企业。
但Braintrust在生产环境中的自动异常发现能力相对薄弱,失败模式聚类和eval自动生成并非原生功能。这意味着你需要自己分析生产trace来发现模式,而不是让平台自动告诉你“这里有问题”。
Confident AI则走了一条不同的路:评估驱动的可观测性。它的Starter方案$200每月含无限席位,支持RAG、Agent、多轮对话和安全评估等多种用例覆盖。Confident AI在评估广度上更全面,但在品牌认知度和社区规模上仍处于追赶阶段。
阵营四:监控延伸者——Arize与Opik
Arize AI从ML模型监控起家,这个基因深刻影响了它的LLM可观测性产品。Arize Phoenix是免费的、可自托管的评估与可观测性工具,基于OpenInference和OpenTelemetry。但它采用的是Elastic License 2.0——你可以免费内部使用,但不能把它作为服务对外提供。这比OSI定义的开源要弱一个等级。
Arize AX是商业版,提供大规模span、trace和session级别的评估,支持预发布prompt测试和Alyx——一个AI工程Agent,可以从你的IDE内部运行评估和调试问题。AX Free包含每月25k spans,AX Pro每月$50含50k spans、10GB摄入和30天保留。Enterprise定价为定制方案,起价约每年5万美元。Arize的企业客户包括Uber、Duolingo和Booking.com。
Opik(Comet旗下)走的是Apache 2.0开源路线,GitHub Star数约18.3k。它的核心差异化在于LLM-as-judge评估框架和Agent优化能力。相较于Arize,Opik的开源承诺更纯粹(Apache 2.0对比Elastic 2.0),但在监控深度和品牌成熟度上仍有差距。
开源许可证的暗战
许可证选择是这个赛道最容易被忽视的竞争维度。
- Langfuse:MIT(核心功能),OSI认证的开源,可自托管、可商用
- Opik:Apache 2.0,OSI认证的开源,最宽松的企业许可
- Arize Phoenix:Elastic License 2.0,源代码可用但非OSI开源,不可作为服务转售
- LangSmith、Braintrust、Confident AI、Galileo:纯商业软件,部分提供企业自托管选项
对选型来说,这意味着什么?如果你的团队有数据合规要求(金融、医疗、政府),Langfuse和Opik是唯一真正意义上“跑在你自己的基础设施上、没有许可证陷阱”的选择。如果只是快速验证,Phoenix的免费层和商业版的灵活度也足够。
从调试工具到生产基础设施
这个赛道爆发的底层逻辑很简单:随着Agent从demo走向生产,失败模式的复杂度呈指数级增长。
单个LLM调用的可观测性相对简单——你记录prompt、completion、latency和token cost,然后用一个LLM-as-judge打分。但Agent的失败模式完全不同:一个Agent可能做了14次工具调用,每一次调用在技术上都是“正确”的,但组合在一起却产生了错误的业务结果。Reddit上一位工程师描述了这样的场景:“Agent坐在绿色仪表盘上好几周,延迟正常,无错误,eval分数稳定,但它悄悄给一个它从未被授权的客户群发了邮件。”
可观测性平台正在从“记录请求-响应”进化为“理解语义行为轨迹”。这个进化远未完成,但方向已经清晰——谁能在语义层面而不是技术层面捕获失败,谁就掌握了这个赛道的定价权。
谁会赢,谁会危险
2026年的LLM可观测性市场,正在经历从“可选工具”到“必选基础设施”的临界点跨越。四个阵营各有各的生态位,但它们之间正在发生一场隐形的“框架争夺战”——LangSmith试图用LangChain生态锁定用户,Langfuse用开源和框架无关性建立护城河,Braintrust用评估深度切入工程师工作流,Arize则试图从监控侧向上渗透。
对技术选型者来说,决策框架可以简化为三个问题:你的栈是否绑定了LangChain?你的团队有多重视数据合规?你的核心痛点是上线前的评估还是上线后的监控?
答案不同,选型就不同。但有一个趋势是确定的:这个赛道不会合并到少数几个赢家手中。因为LLM应用本身还在快速进化,Agent的失败模式还在不断涌现,没有任何一个平台能同时满足“深度生态集成”“完全开源可控”“最强评估能力”和“企业级监控”这四个维度。
在AI基础设施的“卖水人”战争中,可观测性平台可能是最微妙的一个战场——它不直接创造AI能力,但它决定了谁能在生产环境中真正把AI能力用起来。
当每个Agent都声称自己“一切正常”时,能告诉你“哪里不正常”的,才是真正不可或缺的基础设施。






快报