SwarmVault

🗃️ 本地优先的多模态知识图谱引擎

基于本地优先架构的知识库管理工具,通过三层结构(原始源、Wiki、Schema)将书籍、笔记、代码、URL 等多源内容持久化为可检索、可分享、可导出的结构化知识图谱,支持多模态嵌入与 AI 上下文打包。

收藏
7.1k
安装
2.1k
版本
3.17.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

SwarmVault 综合评估

核心用法

SwarmVault 是一款本地优先(local-first)的知识库 CLI 工具,采用 Karpathy 提出的 LLM Wiki 三层架构模式:

  • Raw Sources:原始材料(PDF、代码仓库、视频转录、网页等)
  • Wiki 层:LLM 维护的持久化知识页面(Markdown 格式)
  • Schema 层:人类定义的分类、命名规则与检索策略

用户通过 swarmvault init 初始化仓库,使用 ingest/source add 导入多源内容,compile 触发 LLM 合成 Wiki 页面,query 进行自然语言检索,chat 开启持久化多轮对话。高级功能包括 context build 生成令牌受限的上下文包、task start 创建可追溯的任务台账、以及 export ai 输出 llms.txt 等静态 AI 导出格式。

显著优点

1. 数据主权:所有内容默认落盘为 Markdown/JSON,无云锁厂商依赖
2. 多模态支持:原生覆盖 30+ 种编程语言、Office 文档、音视频(Whisper 本地转录)、EPUB、Jupyter Notebook 等

3. Graph-first 检索:编译后优先通过图谱(wiki/graph/report.md)而非原始文件回答代码理解类问题,显著降低 Token 消耗

4. 生态集成:内置 40+ IDE/Agent(Claude Code、Cursor、Aider、Codex 等)的安装钩子与 MCP 服务器支持

5. 渐进式工作流:支持 --guide 单源审核模式、--approve 人工确认队列、--code-only 快速增量更新等灵活策略

潜在缺点与局限性

  • 本地资源门槛:视频处理依赖 ffmpeg/yt-dlp,大模型功能需自配 Ollama/OpenAI 等 provider,纯离线场景需下载 Whisper 模型
  • 学习曲线:Schema 设计、检索调优、Provider 路由等概念对非技术用户存在认知负担
  • LLM 质量依赖:Wiki 合成质量受限于所选模型,schema 设计不当易导致信息组织混乱
  • 无原生协作:本地优先架构下,多人实时协作需依赖 Git 等外部工具

适合人群

  • 个人知识管理极客:需要跨格式、跨来源的长期知识沉淀
  • AI 辅助开发者:希望通过图谱而非文件阅读理解大型代码库
  • 研究团队:需要可追溯的来源审核、任务台账与上下文打包进行多 Agent 协作
  • 隐私敏感场景:医疗、法律、金融等领域要求数据不出本地

常规风险

  • 配置泄露风险swarmvault.config.json 可能包含 API Key,需加入 .gitignore
  • 存储膨胀:原始素材与多版本 Wiki 页面可能快速增长,需定期 review/archive 清理
  • 检索幻觉:语义检索依赖嵌入模型质量,需通过 doctor --repair 定期重建索引
  • 版本兼容性state/wiki/ 结构随版本迭代可能需迁移,升级前建议备份

来源可信度

项目官网 https://www.swarmvault.ai/docs 提供文档,CLI 通过 npm 分发(@swarmvaultai/cli),开源生态可见度高,但需注意目前报告为系统占位生成,未执行完整安全审计。

SwarmVault 内容

examples文件夹
references文件夹
validation文件夹
手动下载zip · 38.6 kB
graph-first-agent-workflow.mdtext/markdown
请选择文件