Knowledge Retrieval Publish

🗃️ 本地知识库,越搜越懂你

专为知识工作者打造的本地优先知识库检索方案,支持PPT/PDF多格式、BM25+AI双通道搜索,越用越聪明,数据不出本地

收藏
2.3k
安装
957
版本
3.2.8
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能

Knowledge Retrieval 是一款面向知识工作者和顾问的本地优先知识库管理与检索工具,核心解决多格式文档检索难题。支持直接读取 PPTX(含嵌套图形和演讲备注)、PDF(双引擎兜底)、DOCX、XLSX、图片及各类文本格式,文件原地读取不修改原始文档。

显著优点

1. 双通道检索架构:创新性地结合 BM25 关键词索引与 AI 语义分析。AI 先将搜索词扩展为最多 20 个同义词进行精准匹配,再通过语义通道交叉验证,既解决纯关键词搜索的同义词遗漏问题,又避免纯向量检索的维护成本和模糊性。

2. 渐进式知识进化:区别于传统搜索工具"初始化即定型",本工具采用"越用越聪明"设计。每次搜索时 AI 提取 3-5 个关键短语自动补充到文件描述,高频检索文件积累更丰富的描述,搜索质量天花板随使用次数持续提升。

3. 本地优先与合规友好:原始文件、索引、缓存全部本地存储,不上传第三方平台,满足顾问行业客户材料的合规要求。同时支持 OneDrive 等云同步目录,自动触发本地下载。

4. 动态感知与透明缓存:自动检测文件新增、修改、删除并更新索引,无需重建。缓存非黑盒设计,通过双向快捷链接可随时查看、清理。

5. 优雅降级机制:依赖缺失时自动降级运行(如无 PDF 库则跳过 PDF 搜索,BM25 损坏则 fallback 到纯语义匹配),零候选时诚实告知不编造。

潜在局限性

  • 首次搜索耗时较长:大文件(PDF/PPT)首次提取需 2-7 分钟,120 文件规模索引构建约 10-15 分钟
  • 超时风险:OpenClaw 默认 600 秒超时,超大规模文件夹(500+ 文件 / 10GB+)需拆分处理
  • 跨库搜索暂不支持:不同文件夹索引独立,需按项目选择对应知识库
  • 模型依赖:语义分析依赖宿主 LLM 能力,需确保使用可信模型

适合人群

  • 积累大量本地文档(PPT/PDF/Word/Excel)的知识工作者
  • 对客户数据合规敏感的咨询顾问、投行分析师、法务人员
  • 不愿将文件上传云端、偏好本地管理的隐私敏感用户
  • 需要处理多格式文档、厌烦反复格式转换的专业人士

常规风险

  • 缓存长期积累可能占用磁盘空间,需定期手动清理
  • OneDrive 等同步目录可能触发非预期下载产生流量
  • 文件内容作为上下文传入 LLM 时,需确认模型服务商的可信度
  • WPS 原生格式需额外安装 pywpsrpc 依赖

Knowledge Retrieval Publish 内容

references文件夹
scripts文件夹
手动下载zip · 32.4 kB
degradation.mdtext/markdown
请选择文件