核心用法
SiphonClaw 是一个面向现场服务工程师、研究人员和机械师的领域无关文档智能管道。核心工作流程包括:
文档摄取:支持 PDF、Excel、图片和截图,提取文本和视觉嵌入存入本地向量数据库。使用 siphonclaw_ingest 工具指定文件路径即可批量处理,自动完成 OCR、分块和视觉索引。
三重混合检索:siphonclaw_search 融合 BM25 关键词匹配、语义文本向量和视觉页面嵌入,经 RRF 融合与交叉编码器重排序,返回带置信度评分和脚注式引用的结果。
视觉识别与搜索:siphonclaw_identify 接受设备照片,先用视觉模型识别组件,再自动检索本地知识库,低置信度时回退网页搜索。
现场知识捕获:siphonclaw_field_note 将维修记录转为结构化知识库条目,形成持续学习的闭环系统。
系统监控:siphonclaw_status 提供管道健康、模型可用性、成本追踪和死信队列状态。
显著优点
- 成本极优:推荐混合模式(本地 OCR/嵌入 + 云端生成)月度成本仅 $0.50-5,大规模文档摄取零费用
- 多模态检索:业界少有的文本+视觉双轨检索,支持从照片直接定位文档段落
- 置信度透明:复合评分(检索+忠实性+相关性+覆盖度)和分级提示(如"Confident - verify part number")
- 学习闭环:现场笔记成为可检索知识,组织经验持续累积
- 模型灵活:本地 Ollama 模型(Qwen3-VL、BGE-M3)+ OpenRouter 云端推理(MiniMax-M2.5、Kimi-K2.5),故障自动降级
潜在局限
- 本地硬件门槛:推荐模式需 ~10GB 本地模型,无 GPU 时 OCR 和嵌入速度较慢
- 首次配置复杂:需同时管理 Ollama、OpenRouter、Brave Search 三处凭证
- 视觉依赖训练数据:识别罕见设备或老旧型号时可能需依赖网页回退
- 单用户架构:当前设计侧重个人知识库,缺乏原生多用户协作或权限管理
适合人群
现场服务工程师、设备维修技师、工业研究人员、技术档案管理员,以及需要管理海量技术文档并快速提取信息的个人用户。特别适合处理混合型文档(手册、零件目录、手写笔记、现场照片)的场景。
常规风险
- 数据驻留:本地模式文档不出境,但云端生成阶段查询内容会发送至 OpenRouter
- OCR 准确性:手写体、低分辨率截图或复杂排版可能导致字段提取错误,关键操作建议人工复核
- 模型可用性:依赖 Ollama 本地服务和 OpenRouter 网络,任一节点故障将触发降级但可能影响响应质量
- 成本失控:云端摄取模式(Mode B)首月可能产生 $50-100+ 费用,需明确设置
SIPHONCLAW_BUDGET_DAILY预算上限