---
type: study
created: 2026-08-11
updated: 2026-08-11
sensitivity: standard
status: evergreen
tags: [langchain, python, providers, loaders, tools, search, agents]
topic: LangChain Python 数据接入、搜索、工具与代理供应商生态
sources:
  - https://docs.langchain.com/oss/python/integrations/providers/box
  - https://docs.langchain.com/oss/python/integrations/providers/browserbase
  - https://docs.langchain.com/oss/python/integrations/providers/dell
  - https://docs.langchain.com/oss/python/integrations/providers/discord-shikenso
  - https://docs.langchain.com/oss/python/integrations/providers/docling
  - https://docs.langchain.com/oss/python/integrations/providers/docugami
  - https://docs.langchain.com/oss/python/integrations/providers/egnyte
  - https://docs.langchain.com/oss/python/integrations/providers/exa_search
  - https://docs.langchain.com/oss/python/integrations/providers/johnsnowlabs
  - https://docs.langchain.com/oss/python/integrations/providers/konlpy
  - https://docs.langchain.com/oss/python/integrations/providers/privy
  - https://docs.langchain.com/oss/python/integrations/providers/supadata
  - https://docs.langchain.com/oss/python/integrations/providers/tableau
  - https://docs.langchain.com/oss/python/integrations/providers/tavily
  - https://docs.langchain.com/oss/python/integrations/providers/tensorlake
  - https://docs.langchain.com/oss/python/integrations/providers/timbr
  - https://docs.langchain.com/oss/python/integrations/providers/toolbox
  - https://docs.langchain.com/oss/python/integrations/providers/unstructured
  - https://docs.langchain.com/oss/python/integrations/providers/yeagerai
last_verified: 2026-08-11
---

# 数据接入、搜索工具与代理生态

## 高风险边界

一旦集成从“读取文本”进入“浏览网页、发送消息、签名交易、查询企业数据或自动生成工具”，就必须将它视为不可信输入 + 外部副作用边界。工具描述不是授权策略，模型选择某个工具也不代表用户同意执行。

## 集成清单

| Provider | 包/组件 | 主要用途 | 生产要点 |
|---|---|---|---|
| Box | `langchain-box`; BoxAuth、Loader/Retriever/BlobLoader | 企业文件搜索与加载 | 支持多种 auth type；权限继承、文件版本、共享链接和删除同步必须保留 |
| Browserbase | `browserbase` + Stagehand/Deep Agents | 远程浏览器、抓取和操作 | 文档示例带 HITL；对登录、支付、删除和发布必须强制人工确认，隔离 cookie/下载文件和网络 |
| Dell PowerScale | `powerscale-rag-connector` loaders | PowerScale 文件加载 | 页面仅导航 loaders；需验证 ACL、增量扫描、大文件、编码和删除传播 |
| Discord Shikenso | `langchain-discord-shikenso`; read/send tools、toolkit | Discord 消息读写 | bot token 只授予必需 guild/channel；发送是副作用，需幂等键、频率限制和内容审核 |
| Docling | `langchain-docling`; DoclingLoader | 本地/服务化文档解析 | 保留页码、标题和表格元数据；对密码/损坏/扫描件和超大文件定义失败类型 |
| Docugami | `docugami-langchain`; DocugamiLoader | 结构化企业文档加载 | 结构标签与源文件版本需同步；托管处理前评估数据外发 |
| Egnyte | `egnyte-langchain-connector`; EgnyteRetriever/SearchOptions | 企业内容检索 | user token 代表个人权限，不应被所有租户共用；需保留 source ACL |
| Exa | `langchain-exa`; SearchRetriever、Search/FindSimilar tools | web/semantic search | 外部页面为不可信内容，需 prompt-injection 隔离；保留 URL、发布时间和搜索参数 |
| John Snow Labs | `johnsnowlabs` | CPU/GPU/Apple Silicon/AARCH 的 embedding 管道 | 页面主要是平台特定示例；需锁定 model/license/runtime 并在目标硬件压测 |
| KoNLPy | `konlpy`; `KonlpyTextSplitter` | 韩文分词/分割 | 可能依赖 JVM/本地形态学组件；容器中需验证字符集、内存和冷启动 |
| Privy | Privy wallet tool | 创建/管理钱包、付款、签名、查余额 | 极高风险；使用交易政策、金额/资产/链/recipient allowlist、人工批准、幂等和不可篡改审计 |
| Supadata | `supadata-langchain`; SupadataLoader | 外部内容加载 | 保留 metadata 与源 URL；验证版权、访问权和内容完整性 |
| Tableau | `langchain-tableau`; Tableau tools | BI 分析工具 | 访问数据源/工作簿的身份不可超越用户；查询行数、超时和导出需限制 |
| Tavily | `langchain-tavily`; Search/Extract/Crawl/Map | 搜索、提取和网站遍历 | Crawl/Map 要限制域名、深度、页数、请求预算与 robots/合规；结果作为不可信输入 |
| Tensorlake | `langchain-tensorlake`; `document_markdown_tool` | 文档 parse/extract/orchestrate，示例为签名检测 | 包含文本/音频/视频处理；路径、外发、大文件、超时和解析缺失应显式处理 |
| Timbr | `langchain-timbr`; SQL agent/generate/execute chain | 本体驱动的 semantic SQL | 生成与执行 SQL 必须分层；用只读账户、允许 schema、成本/行数/超时上限 |
| MCP Toolbox | `toolbox-langchain` | 向 Agent 提供一组 MCP tools | 对每个 tool 单独授权、输入校验、副作用标记和审计；不因为来自同一 Toolbox 就共享凭据 |
| Unstructured | `langchain-unstructured` / `unstructured`; UnstructuredLoader | 多格式文档解析 | 本地与 API 模式数据边界不同；扩展依赖会增大镜像和 native tool 攻击面 |
| Yeager.ai | `yeagerai-agent` | no-code/low-code 生成工具与 Agent | 文档会引导在 `.env`/UI 输入密钥；生成代码未经审查不得获得主机、网络或生产凭据 |

## 工具执行基线

1. 使用类型化 schema 校验参数，应用层再做 tenant/业务授权，最终参数不直接信任 LLM 输出。
2. 所有副作用工具支持 idempotency key，记录调用人、审批人、工具版本、脱敏参数和结果摘要。
3. 浏览/搜索/文档内容与 system/tool instructions 物理分离，防止网页或文档中的 prompt injection 改写 Agent 规则。
4. 定义每次调用、每个 Agent run 的 URL/页数/字节/时间/成本预算；取消信号要传递到外部 SDK。
5. 对金融交易、发布、删除、消息发送、权限变更设置人工确认和二次显示最终参数。
