核心用法
Semantic Search 是一套面向企业数据资产的多模态语义检索解决方案,支持四大核心场景:
1. 表格语义检索:通过自然语言定位数据库表,支持资源范围过滤与查询增强
2. 字段语义检索:精准定位表内字段,辅助数据血缘分析与Schema理解
3. Text-to-SQL 数据生成:将自然语言转化为可执行SQL,直接返回查询结果与SQL语句
4. 文件语义检索:覆盖文本与表格类文档的向量化检索
技术架构采用 BGE-M3(1024维向量)+ LanceDB/FlightSQL + BM25 混合检索 方案,结合 BGE-Reranker/Qwen3-Reranker 重排序,由 LangGraph 实现意图识别与工作流编排。配置层面支持 Nacos 动态管理,查询增强可选 HyDE、关键词提取、查询改写等策略。
显著优点
- 检索精度高:向量+BM25 混合检索配合 Rerank 重排,实测准确率 88%
- 企业级性能:P95 响应 1.2s,支持 120 QPS 并发,缓存命中率 65%
- 开箱即用:标准化 OpenClaw 接口封装,支持批量查询与TTL缓存
- 灵活扩展:模块化 Graph 架构(Structured/Unstructured/Field),便于场景定制
潜在局限
- 强依赖外部服务:需部署 FlightSQL、Embedding、Reranker、LLM 四类服务,运维复杂度高
- 数据安全边界模糊:企业敏感数据需经 Embedding 和 LLM 处理,存在数据外泄风险敞口
- SQL生成可控性:Text-to-SQL 依赖 LLM 生成逻辑,复杂业务场景需人工校验
- 中文优化有限:BGE-M3 虽支持多语言,但垂直领域术语理解需微调
适合人群
- 企业数据平台团队(数据中台、数据治理)
- 需要自然语言查询 BI/报表的业务分析师
- 构建企业知识库+数据资产统一检索的开发者
常规风险
| 风险类型 | 说明 | 缓释建议 |
|---------|------|---------|
| 数据泄露 | 敏感数据经第三方 Embedding/LLM | 部署私有化模型,启用数据脱敏 |
| SQL注入 | LLM生成SQL可能存在注入漏洞 | 执行前语法校验+权限白名单 |
| 服务可用性 | 多链路依赖导致级联故障 | 熔断降级+本地向量缓存 |
| 结果幻觉 | 检索或生成结果与事实不符 | 置信度阈值过滤+人工复核流程 |