数据评测安全

LangSmith 简调

LangChain 推出的 AI 应用与 agent 工程平台,覆盖运行链路追踪、离线和在线评测、提示词管理,以及云端、混合和自托管部署。

LangSmith llm-observability agent-evaluation prompt-management LangChain 推出的 AI 应用与 agent 工程平台,覆盖运行链路追踪、离线和在线评测、提示词管理,以及云端、混合和自托管部署。

Frontmatter

结构化元信息

实体类型
产品
主分类
数据评测安全
产品状态
已上线
开放状态
闭源
产品形态
saasapi
能力标签
evaluationobservability自动化
目标用户
开发者企业
交付方式
SaaSAPIself-hosted
区域
us
模型策略
多模型混合
部署方式
混合部署
技术披露
公开较多
是否实测
未测试
融资阶段
Series B
信息截至
2026-07-22
最后复查
2026-07-22

LangSmith

1. 调研缘由

大模型应用的难点已经不只在“能不能调用模型”,还包括一次回答经过了哪些步骤、为什么失败、换模型或提示词后是否退化,以及生产流量里如何持续发现问题。LangSmith 正是围绕这些环节提供追踪、评测、提示词管理和 agent 部署能力。[S1][S2]

它与 LangChain、LangGraph 的关系很紧密,但官方也在推动 OpenTelemetry 和非 LangChain 应用接入。[S3] 本篇主要回答:LangSmith 到底是观测工具、评测平台还是 agent 运行平台;它的 LangChain 生态优势会不会同时形成绑定;以及与 Langfuse、Arize Phoenix 等开放方案相比,部署和成本边界在哪里。

2. 简介与产品工作流

LangSmith 是 LangChain 推出的 AI 应用工程平台。它可以记录模型调用、工具调用和 agent 决策形成的 trace,并在开发阶段做离线评测、在生产阶段做在线评测;同时提供数据集、提示词、实验比较和部署能力。[S1][S2]

一个较完整的工作流通常是:

  1. 接入追踪:应用通过 LangSmith SDK、LangChain 集成或 OpenTelemetry 上报运行数据,形成包含模型、检索、工具和中间步骤的 trace。[S3][S4]
  2. 建立数据集:团队把人工整理的案例、历史生产 trace 或合成数据放进数据集,给关键任务定义可复查样本。[S2]
  3. 离线评测:使用代码规则、人工审核、LLM-as-a-Judge 或成对比较,对不同模型、提示词和 agent 版本做基准、回归或单元测试。[S2][S5]
  4. 上线并在线监控:在生产 trace 上按过滤和抽样规则运行评测,观察安全、格式、质量和异常信号。[S2]
  5. 形成反馈回路:把线上失败样本加入离线数据集,验证修复后再部署。若使用 LangSmith Deployment,还可以把 agent 服务的部署和版本管理纳入同一平台。[S2][S6]

所以,LangSmith 的核心起点是 observability 和 evaluation,但产品边界已经延伸到提示词和 agent 部署。

3. 团队与资本背景

LangSmith 属于 LangChain 公司。LangChain 最早由 Harrison Chase 在 2022 年发起,随后从开源开发框架扩展到 LangGraph 和 LangSmith 等产品。

2025 年 10 月,LangChain 宣布完成 1.25 亿美元 Series B,并把公司定位为 agent engineering 平台。[S7] 官方没有在该公告页面完整披露估值,本篇不采用未经一手确认的估值数字。

LangSmith 的商业逻辑与开源框架有明显衔接:LangChain 和 LangGraph 帮助开发者搭建应用,LangSmith 负责追踪、评测、协作和生产管理。开源入口可以带来开发者分发,但也需要区分开源框架与闭源商业平台的边界。

4. 技术基础与生态位

LangSmith 的最小观测单元是 trace。一个 trace 可以包含多步模型调用、工具调用和其他事件,用来还原一次应用执行。[S8] 对 agent 来说,这比只记录最终输入输出更重要,因为错误可能发生在检索、工具选择、参数、权限或中间状态。

评测分为离线和在线两类。离线评测面向数据集,适合版本比较、回归测试、单元测试和回放;在线评测面向生产运行,可以做抽样监控、异常检测和没有标准答案的质量判断。[S2][S5]

平台支持 Cloud、Hybrid 和 Self-hosted 等部署边界。Cloud 由 LangChain 托管;Hybrid 由 LangChain 管理控制面、客户托管数据面;Self-hosted 由客户在自己的基础设施管理完整栈。Hybrid 和 Self-hosted 属于 Enterprise 方案。[S6][S9]

自托管不是一个轻量单体程序。官方文档列出了 ClickHouse、PostgreSQL、Redis、可选对象存储,以及前端、后端、队列和 Playground 等组件;如果再启用 LangSmith Deployment,还要管理 control plane、data plane 和 Kubernetes 资源。[S9] 因此,“数据留在自己环境”会换来部署和运维责任。

open_status 记为 closed-source,因为 LangSmith 主平台不是像 LangChain 框架那样的开源项目。它可以接入开源框架和开放标准,但不能把生态开放性等同于产品本身开源。

5. 市场与外部信号

LangSmith 当前提供 Developer、Plus 和 Enterprise 路径。官方定价说明 Plus 面向需要协作和中等用量的团队,包含每月 1 万条基础 trace 和一个免费小型 serverless deployment;Enterprise 面向更强的管理、安全、支持和部署需求。[S8]

平台用 LCU 和 LSU 计量不同计算与存储工作:官方页面列出 1 LCU 为 1.50 美元、1 LSU 为 1.00 美元。[S8] 这种归一化单位能覆盖 trace、部署、sandbox 等不同服务,但也增加了成本估算步骤,团队需要把业务请求量、trace 长度、评测抽样和保存周期换算成实际账单。

从产品扩张看,LangSmith 已经把 observability、evaluation、prompt engineering 和 deployment 放到同一平台,并提供 Cloud、Hybrid、Self-hosted 和 standalone server 等不同拓扑。[S6][S9] 这表明它的竞争范围从 LLM 调试工具扩展到 agent 的开发与运行生命周期。

6. 公开评价与主要分歧

正面评价:

一份 2026 年的独立生产比较把 LangSmith 的优势概括为与 LangChain/LangGraph 的深度衔接,以及从 trace 到数据集和评测的完整工作流;报告同时提醒,不同团队应按既有技术栈选择,而不是只按功能表选择。[S10]

Thoughtworks Technology Radar 也把 LangSmith 与 Langfuse、Arize Phoenix、Helicone 等放在同一拥挤赛道中,说明 LLM 可观测与评测已经形成多个可替代方案。[S11]

主要分歧:

第一是生态整合与框架绑定之间的取舍。对已经使用 LangChain/LangGraph 的团队,自动追踪和对象模型衔接可以减少接入工作;对强调框架中立的团队,这种紧密关系可能成为迁移和组织标准化时的顾虑。[S3][S10]

第二是托管便利与自托管复杂度。LangSmith 提供企业自托管,但官方架构包含多个数据库和服务组件;而一些开源竞品提供更直接的本地部署入口。[S9][S12]

第三是评测可信度。LLM-as-a-Judge 能快速扩大覆盖面,但评测器本身也会受模型偏差、提示词、成本和版本变化影响,所以仍要与代码规则、人工样本和可复现数据集组合使用。[S2][S5]

7. 同类对比(与头部/高知名度同类项目)

主要对标项目: Langfuse、Arize Phoenix。

维度LangSmithLangfuseArize Phoenix
核心范围追踪、离线/在线评测、提示词与 agent 部署。[S1][S2]追踪、评测、提示词、数据集与实验。[S12]LLM/agent 追踪、评测和 RAG 分析,并可升级到 Arize AX。[S13]
生态关系与 LangChain/LangGraph 深度集成,也支持 OpenTelemetry。[S3][S4]强调模型和框架中立,通过 SDK、OpenTelemetry 与 API 接入。[S12]以 OpenTelemetry/OpenInference 为重要接入方式。[S13]
开放状态商业闭源平台。核心平台以 MIT 许可证开源,可自托管。[S12]Phoenix 为开源项目,可用单 Docker 容器部署。[S13]
自托管Enterprise 方案,完整栈包含多项数据库和服务。[S9]开源核心可免费自托管,企业功能另行付费。[S12]Phoenix 可自托管,企业能力通过 Arize AX 扩展。[S13]
部署 agentLangSmith Deployment 可直接管理 agent 服务。[S6][S9]主要聚焦可观测、评测和提示词;不以托管 agent runtime 为相同主线。[S12]主要聚焦可观测与评测;不以托管 agent runtime 为相同主线。[S13]

这三者的重叠集中在 trace、数据集和 evaluation。LangSmith 的边界更靠近 LangGraph agent 的部署与运行;Langfuse 和 Phoenix 的公开差异则更多体现在开源、自托管和框架中立。选型时要同时比较接入工作、数据驻留、维护成本、评测流程和退出路径。

8. 信息缺口与后续观察

LangChain 没有公开拆分 LangSmith 的独立收入、付费客户、留存率、trace 规模和部署业务占比,因此无法判断各模块的商业成熟度。

官方定价单位覆盖多种服务,但真实账单仍依赖 trace 大小、评测频率、保留周期、部署负载和模型费用;公开页面不足以替代用自有流量做成本模拟。

独立长期比较仍然有限,尤其缺少在同一生产系统中对 LangSmith、Langfuse 和 Phoenix 的故障恢复、查询性能、长 trace、团队协作和运维人力做统一测量。

后续可观察:OpenTelemetry 接入范围、自托管架构复杂度是否下降、LangSmith Deployment 的采用情况、评测器版本管理,以及不同数据驻留区域的扩展。

9. 归纳洞察 ★

LangSmith 的核心价值不是替模型回答问题,而是把 AI 应用每次执行变成可记录、可比较、可回放的工程对象。它把线上失败样本送回离线数据集,再通过评测验证修复,这构成了产品最完整的一条闭环。

与 LangChain/LangGraph 的深度集成既是分发优势,也是选型变量。已有该技术栈的团队能更快接入;强调框架中立和开源自托管的团队,则需要把 Langfuse、Phoenix 等方案放到同一测试里。

LangSmith 扩展到 agent 部署后,已经不只是 observability 工具。它开始同时承载观测、质量门禁和运行平台,因此数据边界、成本和平台退出能力会比单纯调试工具更重要。

10. 来源与更新时间

  • 信息截至(as_of): 2026-07-22
  • 最后复查(last_checked): 2026-07-22
  • 最后更新(last_updated): null
来源索引

可追溯来源

  1. [S1]Tier1LangChain:LangSmith访问 2026-07-22
  2. [S2]Tier1LangSmith Docs:Evaluation访问 2026-07-22
  3. [S3]Tier1LangSmith Docs:Observability访问 2026-07-22
  4. [S4]Tier1LangSmith Docs:Evaluate with OpenTelemetry访问 2026-07-22
  5. [S5]Tier1LangSmith Docs:Evaluation Types;Evaluation Concepts访问 2026-07-22
  6. [S6]Tier1LangSmith Docs:Platform Setup访问 2026-07-22
  7. [S7]Tier1LangChain:LangChain raises $125M Series B访问 2026-07-22
  8. [S8]Tier1LangChain:LangSmith Plans and Pricing访问 2026-07-22
  9. [S9]Tier1LangSmith Docs:Self-hosted LangSmith访问 2026-07-22
  10. [S10]Tier2Turion AI:LangSmith vs Langfuse vs Arize Phoenix访问 2026-07-22
  11. [S11]Tier2Thoughtworks:Technology Radar Vol. 34访问 2026-07-22
  12. [S12]Tier1Langfuse:Self-hosting and Pricing访问 2026-07-22
  13. [S13]Tier1Arize Phoenix:Phoenix vs Langfuse访问 2026-07-22