semantic-search

🔍 企业数据智能检索中枢

企业级语义检索技能,支持表格/字段/文件搜索及 Text-to-SQL 数据生成,基于 BGE-M3 向量+BM25 混合检索,适配企业数据资产智能查询场景。

收藏
4k
安装
987
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Semantic Search 是一套面向企业数据资产的多模态语义检索解决方案,支持四大核心场景:

1. 表格语义检索:通过自然语言定位数据库表,支持资源范围过滤与查询增强
2. 字段语义检索:精准定位表内字段,辅助数据血缘分析与Schema理解

3. Text-to-SQL 数据生成:将自然语言转化为可执行SQL,直接返回查询结果与SQL语句

4. 文件语义检索:覆盖文本与表格类文档的向量化检索

技术架构采用 BGE-M3(1024维向量)+ LanceDB/FlightSQL + BM25 混合检索 方案,结合 BGE-Reranker/Qwen3-Reranker 重排序,由 LangGraph 实现意图识别与工作流编排。配置层面支持 Nacos 动态管理,查询增强可选 HyDE、关键词提取、查询改写等策略。

显著优点

  • 检索精度高:向量+BM25 混合检索配合 Rerank 重排,实测准确率 88%
  • 企业级性能:P95 响应 1.2s,支持 120 QPS 并发,缓存命中率 65%
  • 开箱即用:标准化 OpenClaw 接口封装,支持批量查询与TTL缓存
  • 灵活扩展:模块化 Graph 架构(Structured/Unstructured/Field),便于场景定制

潜在局限

  • 强依赖外部服务:需部署 FlightSQL、Embedding、Reranker、LLM 四类服务,运维复杂度高
  • 数据安全边界模糊:企业敏感数据需经 Embedding 和 LLM 处理,存在数据外泄风险敞口
  • SQL生成可控性:Text-to-SQL 依赖 LLM 生成逻辑,复杂业务场景需人工校验
  • 中文优化有限:BGE-M3 虽支持多语言,但垂直领域术语理解需微调

适合人群

  • 企业数据平台团队(数据中台、数据治理)
  • 需要自然语言查询 BI/报表的业务分析师
  • 构建企业知识库+数据资产统一检索的开发者

常规风险

| 风险类型 | 说明 | 缓释建议 |
|---------|------|---------|
| 数据泄露 | 敏感数据经第三方 Embedding/LLM | 部署私有化模型,启用数据脱敏 |
| SQL注入 | LLM生成SQL可能存在注入漏洞 | 执行前语法校验+权限白名单 |
| 服务可用性 | 多链路依赖导致级联故障 | 熔断降级+本地向量缓存 |
| 结果幻觉 | 检索或生成结果与事实不符 | 置信度阈值过滤+人工复核流程 |

semantic-search 内容

src文件夹
graph文件夹
手动下载zip · 44.3 kB
__init__.pytext/plain
请选择文件