核心功能
Knowledge Retrieval 是一款面向知识工作者和顾问的本地优先知识库管理与检索工具,核心解决多格式文档检索难题。支持直接读取 PPTX(含嵌套图形和演讲备注)、PDF(双引擎兜底)、DOCX、XLSX、图片及各类文本格式,文件原地读取不修改原始文档。
显著优点
1. 双通道检索架构:创新性地结合 BM25 关键词索引与 AI 语义分析。AI 先将搜索词扩展为最多 20 个同义词进行精准匹配,再通过语义通道交叉验证,既解决纯关键词搜索的同义词遗漏问题,又避免纯向量检索的维护成本和模糊性。
2. 渐进式知识进化:区别于传统搜索工具"初始化即定型",本工具采用"越用越聪明"设计。每次搜索时 AI 提取 3-5 个关键短语自动补充到文件描述,高频检索文件积累更丰富的描述,搜索质量天花板随使用次数持续提升。
3. 本地优先与合规友好:原始文件、索引、缓存全部本地存储,不上传第三方平台,满足顾问行业客户材料的合规要求。同时支持 OneDrive 等云同步目录,自动触发本地下载。
4. 动态感知与透明缓存:自动检测文件新增、修改、删除并更新索引,无需重建。缓存非黑盒设计,通过双向快捷链接可随时查看、清理。
5. 优雅降级机制:依赖缺失时自动降级运行(如无 PDF 库则跳过 PDF 搜索,BM25 损坏则 fallback 到纯语义匹配),零候选时诚实告知不编造。
潜在局限性
- 首次搜索耗时较长:大文件(PDF/PPT)首次提取需 2-7 分钟,120 文件规模索引构建约 10-15 分钟
- 超时风险:OpenClaw 默认 600 秒超时,超大规模文件夹(500+ 文件 / 10GB+)需拆分处理
- 跨库搜索暂不支持:不同文件夹索引独立,需按项目选择对应知识库
- 模型依赖:语义分析依赖宿主 LLM 能力,需确保使用可信模型
适合人群
- 积累大量本地文档(PPT/PDF/Word/Excel)的知识工作者
- 对客户数据合规敏感的咨询顾问、投行分析师、法务人员
- 不愿将文件上传云端、偏好本地管理的隐私敏感用户
- 需要处理多格式文档、厌烦反复格式转换的专业人士
常规风险
- 缓存长期积累可能占用磁盘空间,需定期手动清理
- OneDrive 等同步目录可能触发非预期下载产生流量
- 文件内容作为上下文传入 LLM 时,需确认模型服务商的可信度
- WPS 原生格式需额外安装
pywpsrpc依赖