学习笔记 · Obsidian

可观测性、评测、安全与治理生态

LangChainPython

结论

这些集成可解决 trace、分析、离线评测、公平性、授权和 Agent 规格治理问题,但不能用一个 callback 代替全面的安全设计。最大风险是观测管道捕获 prompt、response、工具参数、用户标识和文档正文,从而创建一份更集中的敏感数据副本。

集成与用途

集成包/入口价值生产控制
AgentSystemsAgentSystems Notary callback防篡改的 AI 审计记录导航页仅指向 callback;需确认签名密钥管理、时间同步、验证与保留期,不记录未脱敏秘密
Contextcontext-pythonLLM 产品用户分析provider 页只给出安装,未提供详细采集 schema;上线前必须审计事件字段和用户同意
Datadogddtrace; patch/configLangChain tracing、prompt/completion sampling采样不代表安全;必须默认关闭正文或先脱敏,限制 tag cardinality,审核 agent/region 路由
Graphsignalgraphsignaltracing 与 monitoring页面主要描述 API key 设置;应先核对数据上传、sampling、脱敏与故障时是否 fail-open
HeliconeOpenAI-compatible proxy + custom properties/cache请求观测、缓存和属性代理层可见完整内容;缓存需租户/权限键,custom properties 禁止放 PII/高基数值
LangChain Decoratorslangchain_decorators; llm_prompt, StreamingContext, prompt type settings用装饰器组织 prompt/流式/结构化输出隐式全局设置可破坏可测性;生产要锁定 prompt 版本、显式传递 callbacks/memory,避免类型注解被当成唯一运行时校验
LangFairlangfair; ResponseGenerator、toxicity/stereotype metrics、counterfactual公平性、毒性和反事实评测只适合作为一组评测信号;阈值需基于业务数据校准,不应自动下结论或记录敏感属性
Langfuselangfuse; CallbackHandler、LangChain/LangGraph tracingtrace、span、运行元数据自托管/云 host 都需管理数据保留与租户隔离;公开/秘密 key 不写入笔记或日志
Log10Log10 callback/configprompt/LLM 调试、tags 和数据管理示例同时支持 OpenAI/Anthropic;必须脱敏并限制按 tag 查询的访问权限
MLflowmlflow + autolog/tracingLangChain/LangGraph trace 与实验记录不把 prompt/response 当普通 metric artifact;tracking server、artifact store 和 model registry 分别做认证/保留管理
Open Agent Specpyagentspec[langgraph]; AgentSpecSerializer/Loader序列化 Agent、模型、工具与参数规格规格是配置代码;只加载受信名单/签名版本,禁止在规格中内嵌凭据,对 tool server 另行授权
PlainIDlangchain_plainidRAG 数据过滤、prompt 授权、PII 匿名授权必须 fail-closed;策略决策 ID/版本写入审计,并防止模型控制 policy/filter 参数
TruLenstrulens-eval; TruChain/Feedbacktracing + 反馈评测评分模型也有成本、偏差和数据外发;离线评测不应阻塞在线请求

观测设计

  • trace 最小字段:内部 request/run ID、tenant 的不可逆标识、provider/model、延迟、usage/cost、retry、finish/error code、tool name;正文默认不采集。
  • 如必须保留 prompt/response,先做数据分类、字段脱敏、按租户加密、最短保留期和可删除链路;不采集 authorization/header、signed URL 和密钥。
  • callback/exporter 失败默认不影响主业务,但对法定审计可采用本地可靠队列 + 告警,而不是向用户请求无限重试。

评测与治理闭环

  1. 线下数据集版本化,同时保留 prompt/model/tool/retriever 版本和评分器版本。
  2. 自动指标与人工审查结合;毒性、偏见、groundedness 和正确性都不是可互换的单一分数。
  3. 权限判定在 retrieval/tool 执行前完成,模型输出只能提供意图,不能提升权限。
  4. 每次发布要比较质量、安全、延迟和成本;网关/模型 fallback 也必须进入同一评测矩阵。