rag-ingest

🧠 智能文本切片与向量入库专家

将已解读的长文本自动切片、向量嵌入并写入 Qdrant 知识库,为 Agent 提供结构化检索能力。

收藏
2.1k
安装
963
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

rag-ingest 是 RAG(Retrieval-Augmented Generation)流水线中的关键一环,专注于知识入库。它接收 Agent 已解读/精炼好的正文文本,自动完成以下处理:

1. 智能切片(Chunking):将长文本切分为语义连贯的段落块
2. 向量嵌入(Embedding):调用外部 API 生成语义向量

3. 向量写入:存储至 Qdrant 向量数据库的指定 collection

典型工作流

网页抓取 → 深度解读/总结 → rag-ingest → 向量检索 → 问答生成

支持两种输入方式:

  • --content 直接传参
  • stdin 管道输入(推荐与 deep-research/summarize 联用)

关键参数

| 参数 | 作用 |
|------|------|
| `--doc-id` | 文档唯一标识,支持幂等覆盖更新 |
| `--topic-tags` | 检索过滤标签,提升查询精准度 |
| `--source` | 来源追溯,写入 payload 元数据 |
| `--collection` | 指定 Qdrant collection(默认 `kb_main`) |

显著优点

  • 解耦设计:专注入库,不耦合抓取与解读,Pipeline 灵活组合
  • 幂等写入doc-id 机制确保同一文档可安全重复执行
  • 标签过滤topic-tags 支持多维度检索策略
  • 轻量依赖:仅需 Node.js + 两个环境变量即可运行

潜在局限

  • 无内容校验:不负责原文质量检测,垃圾入则垃圾出
  • 嵌入黑箱:依赖外部 EMBED_API,模型选择/质量不可控
  • 无冲突解决:同一 doc-id 直接覆盖,无版本历史
  • 单点依赖:Qdrant 故障直接导致入库失败

适合人群

  • 构建 Agent RAG 系统的开发者
  • 需要自动化知识库维护的技术团队
  • 已有内容生产流程、需补齐向量存储能力的场景

常规风险

| 风险类型 | 说明 | 缓解建议 |
|---------|------|---------|
| 数据泄露 | 正文经外部 API 嵌入 | 确认 EMBED_API 服务商合规性 |
| 注入污染 | `topic-tags` 未过滤特殊字符 | 上游做好输入校验 |
| 密钥暴露 | `EMBED_API_KEY` 环境变量管理 | 使用密钥管理系统,避免日志打印 |
| 存储膨胀 | 高频更新无清理机制 | 定期归档或设置 TTL 策略 |

rag-ingest 内容

scripts文件夹
手动下载zip · 4.8 kB
ingest.mjstext/javascript
请选择文件