Siphonclaw Skill

🔍 多模态文档智能,现场知识随拍随查

企业级文档智能管道,支持PDF/图片/表格的多模态检索与OCR识别,本地+云端混合部署降低成本,适合现场工程师与研究人员快速构建可搜索知识库。

收藏
4.5k
安装
1.2k
版本
1.1.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能

SiphonClaw 是一款面向专业场景的多模态文档智能管道,核心能力围绕"文档→知识→检索"的完整闭环构建:

1. 三重混合检索体系

采用 BM25 关键词匹配 + 语义文本向量 + 视觉页面嵌入的融合架构,通过 RRF(倒数排名融合)与交叉编码器重排序,实现跨模态的精准检索。支持纯文本、纯视觉、纯关键词及混合四种检索模式。

2. 视觉识别与OCR

内置基于 Qwen3-VL 的 OCR 引擎,可识别设备照片、零件标签、错误屏幕截图,自动提取文字信息后联动本地知识库检索,置信度不足时自动降级至网页搜索。

3. 现场知识捕获

独创的 field_note 机制将维修记录、现场观察转为结构化知识条目,形成"使用→积累→复用"的学习闭环,特别适合设备维护、科研实验等场景的经验沉淀。

4. 成本优化架构

提供"本地嵌入+云端生成"的混合模式(推荐):本地 Ollama 运行 OCR 与嵌入模型(约 10GB 显存/内存),OpenRouter 按需调用推理模型,典型月费仅 $0.50-5,较全云端模式首月成本降低 90%以上。

显著优点

  • 多模态原生设计:文本与视觉向量 dual-track 存储,图片搜索无需依赖 OCR 转录质量
  • 企业级置信度体系:复合评分(检索+忠实性+相关性+覆盖度)+ 脚注式引用,满足审计需求
  • MCP 协议原生:5 个工具函数标准化暴露,便于集成至现有 Agent 工作流
  • 渐进式成本:先本地验证再云端增强,避免全量上云的初期投入

局限与风险

| 维度 | 说明 |
|------|------|
| 部署复杂度 | 混合模式需同时维护 Ollama 本地服务与 OpenRouter 密钥,对非技术用户门槛较高 |
| 视觉模型依赖 | 零件识别准确率受拍摄角度、光照、遮挡影响,关键场景需人工复核 |
| 数据隐私 | 云端生成模式下文档内容需传输至第三方 API,敏感资料建议纯本地部署 |
| 规模瓶颈 | 本地模式依赖单机资源,十万级文档集需评估向量数据库分片策略 |

适合人群

  • 现场服务工程师:快速定位设备手册、零件编号、维修程序
  • 科研人员:构建实验文献与观测记录的跨模态知识库
  • 设备维护团队:沉淀故障案例,形成可检索的组织记忆
  • 技术型知识管理者:愿意投入初期配置以换取长期成本优势

MCP 工具一览

| 工具 | 用途 |
|------|------|
| `siphonclaw_search` | 三重混合检索,支持元数据过滤 |
| `siphonclaw_ingest` | 文档入库(PDF/Excel/图片/截图)|
| `siphonclaw_field_note` | 保存现场记录为结构化知识 |
| `siphonclaw_identify` | 图像识别+自动知识库联动 |
| `siphonclaw_status` | 健康检查、成本追踪、模型状态 |

> ⚠️ 安全提示:本项目依赖外部模型服务(OpenRouter、Ollama),建议生产环境配置 SIPHONCLAW_BUDGET_DAILY 预算上限,并定期审计 dead_letter_queue 中的失败任务。

Siphonclaw Skill 内容

手动下载zip · 10.1 kB
README.mdtext/markdown
请选择文件