学习笔记 · Obsidian

数据接入、搜索工具与代理生态

LangChainPython

高风险边界

一旦集成从“读取文本”进入“浏览网页、发送消息、签名交易、查询企业数据或自动生成工具”,就必须将它视为不可信输入 + 外部副作用边界。工具描述不是授权策略,模型选择某个工具也不代表用户同意执行。

集成清单

Provider包/组件主要用途生产要点
Boxlangchain-box; BoxAuth、Loader/Retriever/BlobLoader企业文件搜索与加载支持多种 auth type;权限继承、文件版本、共享链接和删除同步必须保留
Browserbasebrowserbase + Stagehand/Deep Agents远程浏览器、抓取和操作文档示例带 HITL;对登录、支付、删除和发布必须强制人工确认,隔离 cookie/下载文件和网络
Dell PowerScalepowerscale-rag-connector loadersPowerScale 文件加载页面仅导航 loaders;需验证 ACL、增量扫描、大文件、编码和删除传播
Discord Shikensolangchain-discord-shikenso; read/send tools、toolkitDiscord 消息读写bot token 只授予必需 guild/channel;发送是副作用,需幂等键、频率限制和内容审核
Doclinglangchain-docling; DoclingLoader本地/服务化文档解析保留页码、标题和表格元数据;对密码/损坏/扫描件和超大文件定义失败类型
Docugamidocugami-langchain; DocugamiLoader结构化企业文档加载结构标签与源文件版本需同步;托管处理前评估数据外发
Egnyteegnyte-langchain-connector; EgnyteRetriever/SearchOptions企业内容检索user token 代表个人权限,不应被所有租户共用;需保留 source ACL
Exalangchain-exa; SearchRetriever、Search/FindSimilar toolsweb/semantic search外部页面为不可信内容,需 prompt-injection 隔离;保留 URL、发布时间和搜索参数
John Snow LabsjohnsnowlabsCPU/GPU/Apple Silicon/AARCH 的 embedding 管道页面主要是平台特定示例;需锁定 model/license/runtime 并在目标硬件压测
KoNLPykonlpy; KonlpyTextSplitter韩文分词/分割可能依赖 JVM/本地形态学组件;容器中需验证字符集、内存和冷启动
PrivyPrivy wallet tool创建/管理钱包、付款、签名、查余额极高风险;使用交易政策、金额/资产/链/recipient allowlist、人工批准、幂等和不可篡改审计
Supadatasupadata-langchain; SupadataLoader外部内容加载保留 metadata 与源 URL;验证版权、访问权和内容完整性
Tableaulangchain-tableau; Tableau toolsBI 分析工具访问数据源/工作簿的身份不可超越用户;查询行数、超时和导出需限制
Tavilylangchain-tavily; Search/Extract/Crawl/Map搜索、提取和网站遍历Crawl/Map 要限制域名、深度、页数、请求预算与 robots/合规;结果作为不可信输入
Tensorlakelangchain-tensorlake; document_markdown_tool文档 parse/extract/orchestrate,示例为签名检测包含文本/音频/视频处理;路径、外发、大文件、超时和解析缺失应显式处理
Timbrlangchain-timbr; SQL agent/generate/execute chain本体驱动的 semantic SQL生成与执行 SQL 必须分层;用只读账户、允许 schema、成本/行数/超时上限
MCP Toolboxtoolbox-langchain向 Agent 提供一组 MCP tools对每个 tool 单独授权、输入校验、副作用标记和审计;不因为来自同一 Toolbox 就共享凭据
Unstructuredlangchain-unstructured / unstructured; UnstructuredLoader多格式文档解析本地与 API 模式数据边界不同;扩展依赖会增大镜像和 native tool 攻击面
Yeager.aiyeagerai-agentno-code/low-code 生成工具与 Agent文档会引导在 .env/UI 输入密钥;生成代码未经审查不得获得主机、网络或生产凭据

工具执行基线

  1. 使用类型化 schema 校验参数,应用层再做 tenant/业务授权,最终参数不直接信任 LLM 输出。
  2. 所有副作用工具支持 idempotency key,记录调用人、审批人、工具版本、脱敏参数和结果摘要。
  3. 浏览/搜索/文档内容与 system/tool instructions 物理分离,防止网页或文档中的 prompt injection 改写 Agent 规则。
  4. 定义每次调用、每个 Agent run 的 URL/页数/字节/时间/成本预算;取消信号要传递到外部 SDK。
  5. 对金融交易、发布、删除、消息发送、权限变更设置人工确认和二次显示最终参数。