核心定位
SwarmVault 是一款基于 "LLM Wiki" 三层架构(原始源、Wiki、Schema)的本地优先知识管理工具,旨在弥合原始数据源与 LLM 之间的持久化知识鸿沟。它将书籍、笔记、代码库、音视频、网页等多种输入转化为结构化的 Markdown、知识图谱和检索索引,支持从个人研究到团队协作的完整工作流。
显著优点
- 本地优先与数据主权:所有原始数据、生成的 Wiki 页面、图谱、检索索引均存储于本地文件系统,支持通过
SWARMVAULT_OUT自定义输出根目录,确保用户对数据的完全控制。 - 多模态数据摄取:支持 30+ 种文档格式(Office 全家桶、PDF、EPUB、Jupyter、邮件、Slack 导出等)和代码语言(Python、Go、Rust、Java、TypeScript、SQL 等),原生集成 YouTube 字幕捕获、本地 Whisper 语音转录、以及
yt-dlp公共视频下载。 - 三层知识架构:原始层(
raw/)、Wiki 层(wiki/)、Schema 层(swarmvault.schema.md)分离,便于溯源、版本控制与结构化查询。 - 丰富的交互模式:支持单次查询(
query)、多轮持久对话(chat)、任务追踪(task/memory)、探索式研究循环(explore),以及面向 Agent 的上下文包生成(context build)。 - 图谱与可视化:自动生成知识图谱(
state/graph.json),支持社区聚类、HTML 交互树、Neo4j/Obsidian 导出、以及可视化分享卡片(SVG/Bundle)。 - Agent 生态集成:提供 30+ 主流 AI 编码助手的专用规则安装(
install --agent)和 MCP 服务器(swarmvault mcp),便于与 Codex、Claude、Cursor、Aider 等工具深度协同。 - 可审计与可复现:所有操作(编译、查询、探索、审查)均生成会话记录,支持
--commit自动提交到 Git,确保知识演化的可追溯性。
潜在局限
- 依赖 Node.js 生态:作为 npm 包(
@swarmvaultai/cli)分发,需要 Node.js 运行环境,对纯 Python 或 Rust 工具链用户可能增加负担。 - 配置复杂度:
swarmvault.config.json、swarmvault.schema.md、多 Provider 配置(LLM、嵌入、音频、视觉)构成较高的学习曲线,初学者可能感到 overwhelm。 - 硬件资源要求:本地 Whisper 语音转录需要下载 ggml 模型;大型知识库的编译和嵌入检索对内存和磁盘 I/O 有显著要求。
- 结构化生成兼容性:部分 OpenAI 兼容后端可能不支持严格的结构化输出,需要手动降级 Provider 能力声明。
- R 语言支持待完善:R 文件解析目前仅输出诊断信息,缺乏安全的打包解析器。
适合人群
- 研究者与知识工作者:需要长期维护跨源文献、笔记、访谈记录的结构化知识库。
- 软件工程师与架构师:管理大型代码库的知识图谱,进行依赖分析、影响分析(
graph blast)和模块文档化。 - AI/ML 从业者:构建可审计的 RAG(检索增强生成)基础设施,生成
llms.txt等标准 AI 导出格式。 - 技术写作与文档团队:将分散的源材料(代码、设计文档、会议纪要)编译为连贯的产品文档。
- 多 Agent 协作场景:需要通过 MCP 服务器或上下文包(context pack)在不同 AI 工具间传递工作状态的团队。
常规风险
- 数据残留风险:
raw/目录存储原始源的本地副本,敏感内容可能意外泄露;需配合.gitignore和加密存储策略。 - Schema 漂移:
swarmvault.schema.md作为"人类意图层"与profile配置的"确定性行为层"需保持同步,否则可能导致编译输出与预期不符。 - Provider 密钥管理:配置 OpenAI、Anthropic 等云 Provider 时,API 密钥需妥善保管,避免提交到版本控制。
- 长时任务中断:大型编译或探索任务可能耗时较长,中断后需依赖
task系统或会话恢复机制,否则可能产生不一致状态。 - 自动提交风险:
--commit标志会直接将生成内容提交到 Git,建议在启用前配置适当的 CI 审查流程。
版本与维护
当前版本 3.14.1,由 SwarmVault AI 团队维护,官网 https://www.swarmvault.ai/docs 提供完整文档。