核心用法
本 Skill 提供 Windows 平台上的完全本地化 OCR 解决方案,基于智谱开源的 GLM-OCR 模型(Q8_0 量化,约 1.5GB),通过 llama.cpp Vulkan 后端在本地运行。执行流程分为四阶段:环境预检(工作目录/llama.cpp/模型文件状态检查)→ Python 环境准备(自动检测或静默安装 Miniforge)→ llama.cpp 与模型下载(支持 HuggingFace/ModelScope 双源)→ 推理执行(启动 llama-server HTTP 服务,Python 脚本转发图像并返回识别结果)。
用户可通过命令行参数直接传入本地图片路径,或配合 OpenClaw 等接口处理上传的临时文件。输出支持原始文本保留、JSON 结构化(发票/名片/证件)、Markdown 表格等多种格式。
显著优点
1. 完全离线:零云端 API 调用,敏感文档不出本机,满足企业数据合规要求。
2. 硬件亲和:优先使用 Intel iGPU Vulkan 加速,无需 NVIDIA 显卡,轻薄本亦可流畅运行。
3. 中文优化:GLM-OCR 针对中英混合场景训练,中文识别准确率优于通用多语言模型。
4. 自动化部署:一键检测环境缺口,自动完成 Python/Miniforge、llama.cpp、模型文件的全链路安装。
5. 多源下载:内置 HuggingFace 与 ModelScope 镜像 fallback,兼顾国际与国内网络环境。
潜在缺点与局限性
- 平台限制:仅支持 Windows,macOS/Linux 用户无法直接使用。
- 显存门槛:虽优先核显,但复杂大图或批量处理时仍可能触发 OOM,需手动调整
-ngl层数或回退 CPU。 - 模型体积:1.5GB 模型 + 约 100MB llama.cpp 二进制,首次下载对低带宽用户不友好。
- 无 GPU 加速回退:若 Vulkan 驱动缺失或未正确安装,性能将显著下降至纯 CPU 模式。
- 单次服务:每次调用独立启动 llama-server,未实现常驻服务,频繁调用存在冷启动开销。
适合人群
- Windows 办公用户:需要处理发票、合同、扫描件、截图的文字提取,且对数据隐私敏感。
- 轻薄本/商务本用户:无独立显卡,依赖 Intel 核显进行本地 AI 加速。
- 开发者/集成者:希望将 OCR 能力嵌入本地工作流,避免云服务延迟与费用。
常规风险
- 供应链风险:llama.cpp 二进制与模型文件均从 GitHub/HuggingFace/ModelScope 拉取,虽为官方源,但仍需防范中间人攻击或镜像篡改。建议校验文件哈希。
- 执行权限:Miniforge 静默安装与 llama-server 二进制执行涉及中等风险操作,需在受控环境运行。
- 路径与编码:Windows 路径含空格或中文时,需确保脚本正确转义,避免偶发文件未找到错误。
- 驱动兼容性:Vulkan 驱动版本差异可能导致初始化失败,需保持 Intel/NVIDIA/AMD 显卡驱动为最新。