LangSmith 七大核心功能全解析, AI智能体框架,开发必学
·
LangSmith 的功能大体可以分成 7 块:
可观测(Tracing + 监控 + Insights)、
评测(Offline/Online Eval)、
提示工程、
部署(Agent Server)、
Studio(可视化 IDE)、
CLI/脚本化、
以及平台与合规(SaaS/自托管/权限等)。
下面按模块把“能做什么”说清楚。
总体定位
官方把 LangSmith 定义为“框架无关的 Agent 工程平台”,把可观测、评测、部署和平台配置整合到一个工作流里,从本地开发一直贯穿到生产环境。
模块一:可观测(Tracing + 监控 + Insights)
这一块是 LangSmith 最核心的能力。
- 请求/Trace 追踪(Tracing)
- 自动或手动采集“每一步在干什么”,支持常见 Agent 框架,也支持 OpenTelemetry;提供 Python/TS/Go/Java SDK。
- 多轮对话用“消息线程”组织。
- 监控(Monitoring)
- 实时仪表盘:成本、Token 用量、延迟(P50/P99)、错误率等。
- 支持在线 LLM-as-judge 与基于代码的评测在监控中打分。
- 告警:支持 Webhook、PagerDuty 等。
- 智能分析(Insights)
- 对 Trace 做无监督聚类,发现使用模式、常见行为和失败模式;给出错误分析模板和“总结报告”。
总结:你能完整看到“Agent 每一步做了什么、调了什么工具、花了多少钱、卡在哪里”。
模块二:评测(Evaluation)
LangSmith 把评测分成“离线/在线”两条线,并用 Trace 数据驱动评测。
- 数据集(Datasets)
- 从生产 Trace、历史数据或合成数据创建数据集(UI 或 SDK)。
- 支持多种预置 schema(例如 QA、多轮对话等)。
- 评测类型
- 离线评测:对数据集跑实验,比较版本、回归测试、基准测试等。
- 在线评测:在生产 Trace 上自动执行评测(安全、格式、质量、无参考 LLM-as-judge 等),支持采样率控制成本。
- 评测器
- 支持“人工评测、代码规则、LLM-as-judge、成对比较”等多种方式。
- 实验管理
- 实验列表、过滤、对比、查看指标、导出结果;也支持把外部实验导入 LangSmith 对比。
- 标注与人工反馈(Annotation & Feedback)
- 在 Trace 或 Run 上直接打标;也可配置“标注队列”,按评分标准、流程、多人评审来批量审核。
- 队列支持单条对比与成对(Pairwise)A/B 对比。
模块三:提示工程(Prompt Engineering)
这块专门解决“写/改/测/版本管理 Prompt”的问题。
- Prompt 管理
- 在 UI 或 SDK 里创建/更新 Prompt;支持“提交、标签、Webhook、共享到 Prompt Hub”。
- Playground
- 针对某个 LLM 调用做快速实验:选模型、改 Prompt、调参数、测试效果。
- 与 Trace/Studio 联动
- 在 Studio 里直接对图中的节点改 Prompt,并回写到图配置。
- 与 GitHub 同步
- 文档中提供“把 Prompt 同步到 GitHub”的教程,便于纳入版本控制。
模块四:部署(LangSmith Deployment / Agent Server)
这是把你的 Agent 变成“可伸缩、可运维的后端服务”的模块。
- 核心原语
- Assistants:维护你的 Agent 配置(模型、参数、工具等)。
- Threads:按会话组织状态,支持“长期记忆”。
- Runs:每一次执行,支持持久化和重试。
- Cron jobs:定时触发类任务。
- 持久化与“Durability”
- 默认用 PostgreSQL 存储“核心资源、检查点(短期记忆)、Store(长期记忆)”;检查点可配置为每步或仅最终状态;可切换检查点与存储实现。
- 任务队列与水平扩展
- 用 Redis 做 API 与 Worker 之间的信号/流;Worker 可并发执行多个 Run;API 与 Worker 独立扩展。
- 能力与协议
- Streaming API;Human-in-the-loop;Time travel(从某个检查点重放/分叉);MCP 端点;A2A 端点;分布式追踪;Webhooks 等。
- 部署模式
- 云托管(Cloud)、混合(Hybrid,BYOC)、自托管(Self-hosted)三选一。
- 可观测/评测的闭环
- 部署后自动采集 Trace,接入监控与在线 Eval;失败 Trace 可直接加入数据集做离线评测。
模块五:LangSmith Studio(Agent IDE)
Studio 是连接本地或线上 Agent Server 的可视化 IDE,专注“调试 & 迭代”。
- 图与执行可视化
- 可视化你的图结构,看节点与边;运行并观察执行路径。
- 断点与 Human-in-the-loop
- 在指定节点前/后打断点(Interrupt),单步调试,适合 HITL 流程。
- 助手与线程管理
- 创建/编辑/切换 Assistants;管理 Threads;编辑历史状态(Fork/Re-run)。
- 提示与实验
- 直接在节点上编辑 Prompt;Playground 测试单次 LLM 调用;对数据集批量做实验、评分与对比。
- Trace 调试
- 把生产 Trace 导入 Studio,克隆到本地调试或“把某个节点结果加入数据集”。
- 两种模式
- Graph 模式:完整调试视图(节点、状态、Trace、数据集、Playground)。
- Chat 模式:轻量聊天界面,方便业务/产品测试整体行为。
模块六:CLI 与脚本化
LangSmith CLI 把常见操作搬到终端,并天然适合给 AI Coding Agent 当“工具调用入口”。
- 资源管理(命令行)
- 项目/Traces/Runs/Threads/Datasets/Examples/Evaluators/Experiments/Sandboxes 的列表、查询、创建、删除、导出等。
- 输出与集成
- 默认 JSON,支持
--format pretty与-o file,便于管道、脚本与 Agent 消费。
- 默认 JSON,支持
- 认证与环境
- 支持 OAuth 或 API Key 登录;多 profile 管理;可指定 SaaS/自托管端点。
- 与其他工具联动
- CLI 可作为 Claude Code/Cursor/Deep Agents 等的“工具层”,统一访问 LangSmith 资源。
模块七:平台与合规、企业特性
这些是“平台级”能力,保证安全、合规和多团队协作。
- 部署方式
- SaaS(多区域数据驻留)、混合、自托管。
- 安全与合规
- 支持 SSO/SAML、SCIM、审计日志、RBAC/ABAC、加密;符合 HIPAA、SOC 2 Type 2、GDPR。
- 组织与协作
- Workspace、用户与权限管理;多项目;跨团队共享数据集/提示/评测。
- 辅助能力
- Polly:内嵌在工作区里的 AI 助手,帮你分析 Trace、线程、提示与实验结果。
- Skills:把常用操作封装成“技能”,可从 Fleet 下载并在编码 Agent 中调用。
- Sandboxes:为“执行代码/访问外部资源”等高风险操作提供隔离环境。
- Insights Agent:自动分析 Trace 聚类与异常,给出总结。
一句话总结
如果你用 LangGraph 做后端,LangSmith 基本能覆盖:
- 看得见(Tracing + 监控 + Insights)
- 测得准(Offline/Online Eval + 数据集 + 标注)
- 改得快(Prompt 管理 + Playground + Studio)
- 跑得稳(Agent Server + Durability + 多模式部署)
- 管得住(权限、审计、合规、自托管)
如果你接下来要“从零搭一个 LangGraph + LangSmith 的 Python 后端”,我可以按模块帮你列一份最小可用配置和接入步骤。
更多推荐



所有评论(0)