Siphonclaw Skill

🔍 文档智能管道 · 视觉搜索专家

文档智能管道,支持视觉搜索、OCR 和字段捕获,为现场工程师和研究人员构建可搜索的知识库,混合本地+云部署月费仅 $0.5-5。

收藏
4.1k
安装
1.2k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

SiphonClaw 是一个面向现场服务工程师、研究人员和机械师的领域无关文档智能管道。核心工作流程包括:

文档摄取:支持 PDF、Excel、图片和截图,提取文本和视觉嵌入存入本地向量数据库。使用 siphonclaw_ingest 工具指定文件路径即可批量处理,自动完成 OCR、分块和视觉索引。

三重混合检索siphonclaw_search 融合 BM25 关键词匹配、语义文本向量和视觉页面嵌入,经 RRF 融合与交叉编码器重排序,返回带置信度评分和脚注式引用的结果。

视觉识别与搜索siphonclaw_identify 接受设备照片,先用视觉模型识别组件,再自动检索本地知识库,低置信度时回退网页搜索。

现场知识捕获siphonclaw_field_note 将维修记录转为结构化知识库条目,形成持续学习的闭环系统。

系统监控siphonclaw_status 提供管道健康、模型可用性、成本追踪和死信队列状态。

显著优点

  • 成本极优:推荐混合模式(本地 OCR/嵌入 + 云端生成)月度成本仅 $0.50-5,大规模文档摄取零费用
  • 多模态检索:业界少有的文本+视觉双轨检索,支持从照片直接定位文档段落
  • 置信度透明:复合评分(检索+忠实性+相关性+覆盖度)和分级提示(如"Confident - verify part number")
  • 学习闭环:现场笔记成为可检索知识,组织经验持续累积
  • 模型灵活:本地 Ollama 模型(Qwen3-VL、BGE-M3)+ OpenRouter 云端推理(MiniMax-M2.5、Kimi-K2.5),故障自动降级

潜在局限

  • 本地硬件门槛:推荐模式需 ~10GB 本地模型,无 GPU 时 OCR 和嵌入速度较慢
  • 首次配置复杂:需同时管理 Ollama、OpenRouter、Brave Search 三处凭证
  • 视觉依赖训练数据:识别罕见设备或老旧型号时可能需依赖网页回退
  • 单用户架构:当前设计侧重个人知识库,缺乏原生多用户协作或权限管理

适合人群

现场服务工程师、设备维修技师、工业研究人员、技术档案管理员,以及需要管理海量技术文档并快速提取信息的个人用户。特别适合处理混合型文档(手册、零件目录、手写笔记、现场照片)的场景。

常规风险

  • 数据驻留:本地模式文档不出境,但云端生成阶段查询内容会发送至 OpenRouter
  • OCR 准确性:手写体、低分辨率截图或复杂排版可能导致字段提取错误,关键操作建议人工复核
  • 模型可用性:依赖 Ollama 本地服务和 OpenRouter 网络,任一节点故障将触发降级但可能影响响应质量
  • 成本失控:云端摄取模式(Mode B)首月可能产生 $50-100+ 费用,需明确设置 SIPHONCLAW_BUDGET_DAILY 预算上限

Siphonclaw Skill 内容

config文件夹
db文件夹
ingestion文件夹
pipeline文件夹
retrieval文件夹
scripts文件夹
tests文件夹
手动下载zip · 192.2 kB
__init__.pytext/plain
请选择文件