---
type: study
created: 2026-08-11
updated: 2026-08-11
sensitivity: standard
status: evergreen
tags: [langchain, python, providers, observability, evaluation, security, governance]
topic: LangChain Python 可观测性、评测、安全与治理生态
sources:
  - https://docs.langchain.com/oss/python/integrations/providers/agentsystems
  - https://docs.langchain.com/oss/python/integrations/providers/context
  - https://docs.langchain.com/oss/python/integrations/providers/datadog
  - https://docs.langchain.com/oss/python/integrations/providers/graphsignal
  - https://docs.langchain.com/oss/python/integrations/providers/helicone
  - https://docs.langchain.com/oss/python/integrations/providers/langchain_decorators
  - https://docs.langchain.com/oss/python/integrations/providers/langfair
  - https://docs.langchain.com/oss/python/integrations/providers/langfuse
  - https://docs.langchain.com/oss/python/integrations/providers/log10
  - https://docs.langchain.com/oss/python/integrations/providers/mlflow_tracking
  - https://docs.langchain.com/oss/python/integrations/providers/open_agent_spec
  - https://docs.langchain.com/oss/python/integrations/providers/plainid
  - https://docs.langchain.com/oss/python/integrations/providers/trulens
last_verified: 2026-08-11
---

# 可观测性、评测、安全与治理生态

## 结论

这些集成可解决 trace、分析、离线评测、公平性、授权和 Agent 规格治理问题，但不能用一个 callback 代替全面的安全设计。最大风险是观测管道捕获 prompt、response、工具参数、用户标识和文档正文，从而创建一份更集中的敏感数据副本。

## 集成与用途

| 集成 | 包/入口 | 价值 | 生产控制 |
|---|---|---|---|
| AgentSystems | AgentSystems Notary callback | 防篡改的 AI 审计记录 | 导航页仅指向 callback；需确认签名密钥管理、时间同步、验证与保留期，不记录未脱敏秘密 |
| Context | `context-python` | LLM 产品用户分析 | provider 页只给出安装，未提供详细采集 schema；上线前必须审计事件字段和用户同意 |
| Datadog | `ddtrace`; patch/config | LangChain tracing、prompt/completion sampling | 采样不代表安全；必须默认关闭正文或先脱敏，限制 tag cardinality，审核 agent/region 路由 |
| Graphsignal | `graphsignal` | tracing 与 monitoring | 页面主要描述 API key 设置；应先核对数据上传、sampling、脱敏与故障时是否 fail-open |
| Helicone | OpenAI-compatible proxy + custom properties/cache | 请求观测、缓存和属性 | 代理层可见完整内容；缓存需租户/权限键，custom properties 禁止放 PII/高基数值 |
| LangChain Decorators | `langchain_decorators`; `llm_prompt`, StreamingContext, prompt type settings | 用装饰器组织 prompt/流式/结构化输出 | 隐式全局设置可破坏可测性；生产要锁定 prompt 版本、显式传递 callbacks/memory，避免类型注解被当成唯一运行时校验 |
| LangFair | `langfair`; ResponseGenerator、toxicity/stereotype metrics、counterfactual | 公平性、毒性和反事实评测 | 只适合作为一组评测信号；阈值需基于业务数据校准，不应自动下结论或记录敏感属性 |
| Langfuse | `langfuse`; CallbackHandler、LangChain/LangGraph tracing | trace、span、运行元数据 | 自托管/云 host 都需管理数据保留与租户隔离；公开/秘密 key 不写入笔记或日志 |
| Log10 | Log10 callback/config | prompt/LLM 调试、tags 和数据管理 | 示例同时支持 OpenAI/Anthropic；必须脱敏并限制按 tag 查询的访问权限 |
| MLflow | `mlflow` + autolog/tracing | LangChain/LangGraph trace 与实验记录 | 不把 prompt/response 当普通 metric artifact；tracking server、artifact store 和 model registry 分别做认证/保留管理 |
| Open Agent Spec | `pyagentspec[langgraph]`; AgentSpecSerializer/Loader | 序列化 Agent、模型、工具与参数规格 | 规格是配置代码；只加载受信名单/签名版本，禁止在规格中内嵌凭据，对 tool server 另行授权 |
| PlainID | `langchain_plainid` | RAG 数据过滤、prompt 授权、PII 匿名 | 授权必须 fail-closed；策略决策 ID/版本写入审计，并防止模型控制 policy/filter 参数 |
| TruLens | `trulens-eval`; TruChain/Feedback | tracing + 反馈评测 | 评分模型也有成本、偏差和数据外发；离线评测不应阻塞在线请求 |

## 观测设计

- trace 最小字段：内部 request/run ID、tenant 的不可逆标识、provider/model、延迟、usage/cost、retry、finish/error code、tool name；正文默认不采集。
- 如必须保留 prompt/response，先做数据分类、字段脱敏、按租户加密、最短保留期和可删除链路；不采集 authorization/header、signed URL 和密钥。
- callback/exporter 失败默认不影响主业务，但对法定审计可采用本地可靠队列 + 告警，而不是向用户请求无限重试。

## 评测与治理闭环

1. 线下数据集版本化，同时保留 prompt/model/tool/retriever 版本和评分器版本。
2. 自动指标与人工审查结合；毒性、偏见、groundedness 和正确性都不是可互换的单一分数。
3. 权限判定在 retrieval/tool 执行前完成，模型输出只能提供意图，不能提升权限。
4. 每次发布要比较质量、安全、延迟和成本；网关/模型 fallback 也必须进入同一评测矩阵。
