核心用法
本 skill 为 OpenClaw 提供《毛泽东选集》本地知识库检索能力,采用分层设计:默认模式下仅使用 SQLite FTS 结构化检索与关键词匹配,不依赖任何外部 API;高级模式下可通过配置开启向量召回(embedding)与重排(rerank)组成的混合检索。
索引构建:运行 scripts/build_index.py 从 Markdown 源文件建立文档级与段落级双重索引。文档级支持按卷、篇、标题、别名检索;段落级支持关键词命中片段。若开启 RAG,则同时生成向量索引。
查询方式:提供 5 种检索模式——catalog(卷目浏览)、lexical(精确标题/关键词)、lexical-like(模糊匹配)、hybrid(向量+关键词)、hybrid-rerank(混合+重排优化)。支持多维度过滤组合:卷次、篇次、标题、关键词可同时叠加。
配置管理:通过 scripts/config.py 管理 API 端点、模型参数与开关状态。默认嵌入模型为 BAAI/bge-m3,重排模型为 BAAI/bge-reranker-v2-m3,分批大小 64 条。API 密钥通过环境变量 MAO_SKILL_API_KEY 注入,避免硬编码。
显著优点
- 离线可用:默认模式零外部依赖,适合内网或隐私敏感场景
- 检索精度高:结构化索引确保卷/篇/标题的精确导航,FTS 支持中文分词优化
- 渐进式能力:基础功能开箱即用,高级 RAG 能力按需开启,成本可控
- 来源可追溯:强制返回卷次、篇次、日期、源文件路径及检索方式,便于核对
- 无幻觉承诺:未命中时明确告知,禁止臆造内容
潜在局限
- 语料范围限定于《毛泽东选集》四卷,不含后续著作或讲话
- 向量检索需自行准备兼容 OpenAI API 格式的 embedding 服务端点
- 别名覆盖依赖人工维护的 metadata,可能存在遗漏
- 混合检索增加延迟与成本,需权衡精度与效率
适合人群
- 党史研究者、政治学学者需快速定位原著原文
- 内容创作者需准确引用毛选论述及出处
- 企业内训、思政教育场景需离线部署的合规知识库
- 对数据主权敏感、拒绝云端处理的机构用户
常规风险
- 政治内容敏感性:《毛选》涉及历史评价与意识形态,检索结果可能被用于争议性解读,建议配套原文上下文呈现,避免断章取义
- 模型幻觉传导:若开启 RAG,需确保 embedding/rerank 服务稳定,向量召回可能引入相关性较低但表面相似的段落
- 配置泄露风险:API 密钥通过环境变量管理,需防止容器镜像或日志泄露
MAO_SKILL_API_KEY - 版权合规:确认本地语料来源合法,开源协议与原始出版社授权状态需独立核查