RAGLite - Local Expandable Library AI Library

🔎 本地RAG缓存 · 私人文档智能检索

本地优先的RAG缓存工具,将文档蒸馏为结构化Markdown后使用Chroma+混合搜索索引查询,保护敏感数据隐私。

收藏
9.8k
安装
2.2k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

RAGLite 是一个本地优先的RAG(检索增强生成)缓存系统,专为需要反复查询非训练数据的场景设计。其核心流程分为三步:

1. 蒸馏(Condense)——使用OpenClaw引擎将原始文档转换为结构化Markdown,去除冗余内容,保留关键信息
2. 索引(Index)——将蒸馏后的内容嵌入到本地Chroma向量数据库集合中

3. 查询(Query)——支持混合检索:向量相似度搜索(Chroma)+ 关键词匹配(ripgrep)

典型使用场景

  • 个人知识库管理(学习笔记、医疗记录)
  • 企业内部文档查询(运维手册、内部规范)
  • 敏感数据的本地化处理,避免上传云端

技术依赖

  • Python 3.11+
  • Chroma向量数据库(默认本地http://127.0.0.1:8100)
  • ripgrep(rg)用于关键词搜索
  • OpenClaw Gateway(用于文档蒸馏,需配置OPENCLAW_GATEWAY_TOKEN)

显著优点

| 优势 | 说明 |
|:---|:---|
| **隐私优先** | 敏感数据完全本地处理,不上传第三方服务 |
| **成本优化** | "压缩后再嵌入"策略减少token消耗,降低API调用成本 |
| **可审计性** | 中间产物为纯Markdown,人类可读、可版本控制 |
| **混合检索** | 向量+关键词双模式,兼顾语义理解和精确匹配 |
| **开源可扩展** | 基于Chroma和ripgrep,无厂商锁定,可迁移至托管方案 |
| **智能去重** | `skip-existing`和`skip-indexed`参数避免重复处理 |

潜在缺点与局限性

1. 基础设施要求:需要自行维护Chroma服务和Python环境,对非技术用户门槛较高
2. 依赖外部LLM:文档蒸馏依赖OpenClaw Gateway,若网关不可用则核心功能受限

3. 单机性能瓶颈:本地Chroma在数据量激增时可能遇到扩展性问题

4. 无实时同步:文档变更后需重新执行完整pipeline,非自动增量更新

5. 索引冷启动:首次构建大规模知识库耗时较长

适合人群

  • 隐私敏感用户:医疗、法律、金融从业者处理机密文档
  • 开发者/运维人员:需要查询内部技术文档、运维手册
  • 研究者/学生:管理大量学术论文、学习笔记的本地知识库
  • 成本意识团队:希望替代Notion/Confluence等付费知识库的中度用户
  • 合规要求严格的组织:数据必须驻留本地的企业环境

常规风险

| 风险类别 | 具体描述 | 缓解建议 |
|:---|:---|:---|
| 数据持久化风险 | Chroma本地存储若未备份可能丢失 | 定期备份`--out`目录和Chroma数据 |
| 网关单点故障 | OpenClaw服务不可用时无法蒸馏新文档 | 保留原始文档,建立网关健康检查 |
| 权限配置泄露 | OPENCLAW_GATEWAY_TOKEN等敏感配置 | 使用.env文件,避免提交至版本控制 |
| 索引一致性 | 文档删除后索引残留孤儿记录 | 定期重建索引或使用`--skip-indexed`策略 |
| 模型幻觉传递 | 蒸馏阶段若LLM产生幻觉,将污染整个知识库 | 对关键文档进行人工抽检验证 |

架构定位澄清

> 重要:RAGLite 不是内存替代品,也不直接管理对话上下文。它是专门用于"需要反复查找的非训练数据"的持久化存储层,与模型的短期记忆形成互补。

RAGLite - Local Expandable Library AI Library 内容

scripts文件夹
手动下载zip · 5.0 kB
install.shtext/x-shellscript
请选择文件