学习笔记 · Obsidian
数据接入、搜索工具与代理生态
高风险边界
一旦集成从“读取文本”进入“浏览网页、发送消息、签名交易、查询企业数据或自动生成工具”,就必须将它视为不可信输入 + 外部副作用边界。工具描述不是授权策略,模型选择某个工具也不代表用户同意执行。
集成清单
| Provider | 包/组件 | 主要用途 | 生产要点 |
|---|---|---|---|
| Box | langchain-box; BoxAuth、Loader/Retriever/BlobLoader | 企业文件搜索与加载 | 支持多种 auth type;权限继承、文件版本、共享链接和删除同步必须保留 |
| Browserbase | browserbase + Stagehand/Deep Agents | 远程浏览器、抓取和操作 | 文档示例带 HITL;对登录、支付、删除和发布必须强制人工确认,隔离 cookie/下载文件和网络 |
| Dell PowerScale | powerscale-rag-connector loaders | PowerScale 文件加载 | 页面仅导航 loaders;需验证 ACL、增量扫描、大文件、编码和删除传播 |
| Discord Shikenso | langchain-discord-shikenso; read/send tools、toolkit | Discord 消息读写 | bot token 只授予必需 guild/channel;发送是副作用,需幂等键、频率限制和内容审核 |
| Docling | langchain-docling; DoclingLoader | 本地/服务化文档解析 | 保留页码、标题和表格元数据;对密码/损坏/扫描件和超大文件定义失败类型 |
| Docugami | docugami-langchain; DocugamiLoader | 结构化企业文档加载 | 结构标签与源文件版本需同步;托管处理前评估数据外发 |
| Egnyte | egnyte-langchain-connector; EgnyteRetriever/SearchOptions | 企业内容检索 | user token 代表个人权限,不应被所有租户共用;需保留 source ACL |
| Exa | langchain-exa; SearchRetriever、Search/FindSimilar tools | web/semantic search | 外部页面为不可信内容,需 prompt-injection 隔离;保留 URL、发布时间和搜索参数 |
| John Snow Labs | johnsnowlabs | CPU/GPU/Apple Silicon/AARCH 的 embedding 管道 | 页面主要是平台特定示例;需锁定 model/license/runtime 并在目标硬件压测 |
| KoNLPy | konlpy; KonlpyTextSplitter | 韩文分词/分割 | 可能依赖 JVM/本地形态学组件;容器中需验证字符集、内存和冷启动 |
| Privy | Privy wallet tool | 创建/管理钱包、付款、签名、查余额 | 极高风险;使用交易政策、金额/资产/链/recipient allowlist、人工批准、幂等和不可篡改审计 |
| Supadata | supadata-langchain; SupadataLoader | 外部内容加载 | 保留 metadata 与源 URL;验证版权、访问权和内容完整性 |
| Tableau | langchain-tableau; Tableau tools | BI 分析工具 | 访问数据源/工作簿的身份不可超越用户;查询行数、超时和导出需限制 |
| Tavily | langchain-tavily; Search/Extract/Crawl/Map | 搜索、提取和网站遍历 | Crawl/Map 要限制域名、深度、页数、请求预算与 robots/合规;结果作为不可信输入 |
| Tensorlake | langchain-tensorlake; document_markdown_tool | 文档 parse/extract/orchestrate,示例为签名检测 | 包含文本/音频/视频处理;路径、外发、大文件、超时和解析缺失应显式处理 |
| Timbr | langchain-timbr; SQL agent/generate/execute chain | 本体驱动的 semantic SQL | 生成与执行 SQL 必须分层;用只读账户、允许 schema、成本/行数/超时上限 |
| MCP Toolbox | toolbox-langchain | 向 Agent 提供一组 MCP tools | 对每个 tool 单独授权、输入校验、副作用标记和审计;不因为来自同一 Toolbox 就共享凭据 |
| Unstructured | langchain-unstructured / unstructured; UnstructuredLoader | 多格式文档解析 | 本地与 API 模式数据边界不同;扩展依赖会增大镜像和 native tool 攻击面 |
| Yeager.ai | yeagerai-agent | no-code/low-code 生成工具与 Agent | 文档会引导在 .env/UI 输入密钥;生成代码未经审查不得获得主机、网络或生产凭据 |
工具执行基线
- 使用类型化 schema 校验参数,应用层再做 tenant/业务授权,最终参数不直接信任 LLM 输出。
- 所有副作用工具支持 idempotency key,记录调用人、审批人、工具版本、脱敏参数和结果摘要。
- 浏览/搜索/文档内容与 system/tool instructions 物理分离,防止网页或文档中的 prompt injection 改写 Agent 规则。
- 定义每次调用、每个 Agent run 的 URL/页数/字节/时间/成本预算;取消信号要传递到外部 SDK。
- 对金融交易、发布、删除、消息发送、权限变更设置人工确认和二次显示最终参数。