Knowledge Retrieval Publish

🔍 本地双通道智能检索,越用越懂你

本地优先的双通道文档检索方案,支持PPT/PDF等多格式,关键词+AI语义搜索,渐进式自我进化,无需上传云端。

收藏
4.1k
安装
957
版本
3.2.4
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Knowledge Retrieval 是一款专为知识工作者和顾问设计的本地优先文档检索 Skill,采用三层架构(Phase 0 → Phase A → Phase B)实现渐进式知识检索:

Phase 0(环境就绪):自动检测原始文件夹状态、索引新鲜度,支持动态更新(新增/修改/删除文件自动感知)。

Phase A(双通道定位)

  • BM25 关键词通道:轻量级索引,精确匹配
  • AI 语义通道:将查询扩展为20个同义词,交叉验证结果
  • 合并去重后输出 Top 10 候选文件

Phase B(阅读+回答+进化):读取候选文件定位相关段落,综合生成带引用来源的回答;同时提取3-5个关键词自动更新文件描述,实现「越用越聪明」的渐进式优化。

---

显著优点

| 优势 | 说明 |
|------|------|
| **真·多格式支持** | PPTX(含嵌套图形、备注)、PDF(双引擎兜底)、DOCX、XLSX、图片、WPS兼容格式 |
| **本地优先合规** | 文件、索引、缓存全部本地,零上传;满足顾问行业「客户材料不上云」的合规底线 |
| **渐进式智能** | 首次仅建最小索引,每次搜索后AI自动丰富文件描述,质量天花板随使用次数提升 |
| **双通道检索** | 解决「纯关键词搜不到同义词」和「纯语义搜索模糊」的双重痛点 |
| **透明缓存机制** | 双向快捷链接原始文件夹,索引非黑盒,可随时查看、清理 |
| **优雅降级** | 缺依赖、索引损坏、零候选等场景均有明确 fallback,不卡死、不 hallucination |

---

潜在缺点与局限性

| 局限 | 详情 |
|------|------|
| **首次搜索慢** | 大文件(PDF/PPT>50页)首次提取需3-7分钟,整体首次搜索5-8分钟 |
| **大文件夹易超时** | 500+文件或10GB+文件夹建索引可能超30分钟,需拆分项目 |
| **暂不支持跨库搜索** | 不同文件夹索引独立,需按客户/项目手动切换 |
| **依赖本地环境** | 需 Python + pdfminer + python-pptx,Windows 功能最全 |
| **扫描件PDF需OCR** | 图片型PDF依赖OCR处理,增加额外耗时 |
| **维护成本** | 动态更新虽自动,但长期积累后需关注缓存膨胀 |

---

适合人群

  • 管理/战略顾问:项目文档庞杂,需快速定位过往案例、方法论、数据依据
  • 企业知识管理岗:构建部门内部知识库,满足数据不出域合规要求
  • 法律/财务专业人士:合同、报告、底稿本地管理,需精准溯源
  • 研究人员:长期积累的本地论文、资料库,需语义级检索而非文件名匹配
  • 对云存储敏感者:任何「文件不能上传第三方」的场景

---

常规风险

| 风险类型 | 等级 | 说明 |
|----------|------|------|
| 数据泄露 | **极低** | 本地运行,零上传设计;但用户需自行确保设备安全 |
| 幻觉回答 | **可控** | 反幻觉铁律强制约束(零候选诚实告知、预训练知识不替代检索) |
| 索引过时 | **中** | 动态更新机制存在,但用户需关注 Phase 0 的 fresh 检测 |
| 性能衰减 | **中** | 缓存长期积累可能膨胀,需按指引手动清理 |
| 超时中断 | **中** | 大文件夹未拆分易导致任务超时,需遵循「按项目拆库」最佳实践 |
| 依赖缺失 | **低** | 优雅降级机制覆盖,但功能可能受限(如无PDF库则跳过PDF) |

Knowledge Retrieval Publish 内容

references文件夹
scripts文件夹
手动下载zip · 33.9 kB
degradation.mdtext/markdown
请选择文件