Local GLM OCR with llama.cpp on AIPC(no API Key)

🔍 本地 AI 文字识别,隐私无忧

基于 GLM-OCR 模型的 Windows 本地图像文字识别技能,支持中英混合文本,优先 Intel 核显推理,无需云端 API。

收藏
4.5k
安装
1.1k
版本
1.0.4
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

本 Skill 提供 Windows 平台上的完全本地化 OCR 解决方案,基于智谱开源的 GLM-OCR 模型(Q8_0 量化,约 1.5GB),通过 llama.cpp Vulkan 后端在本地运行。执行流程分为四阶段:环境预检(工作目录/llama.cpp/模型文件状态检查)→ Python 环境准备(自动检测或静默安装 Miniforge)→ llama.cpp 与模型下载(支持 HuggingFace/ModelScope 双源)→ 推理执行(启动 llama-server HTTP 服务,Python 脚本转发图像并返回识别结果)。

用户可通过命令行参数直接传入本地图片路径,或配合 OpenClaw 等接口处理上传的临时文件。输出支持原始文本保留、JSON 结构化(发票/名片/证件)、Markdown 表格等多种格式。

显著优点

1. 完全离线:零云端 API 调用,敏感文档不出本机,满足企业数据合规要求。
2. 硬件亲和:优先使用 Intel iGPU Vulkan 加速,无需 NVIDIA 显卡,轻薄本亦可流畅运行。

3. 中文优化:GLM-OCR 针对中英混合场景训练,中文识别准确率优于通用多语言模型。

4. 自动化部署:一键检测环境缺口,自动完成 Python/Miniforge、llama.cpp、模型文件的全链路安装。

5. 多源下载:内置 HuggingFace 与 ModelScope 镜像 fallback,兼顾国际与国内网络环境。

潜在缺点与局限性

  • 平台限制:仅支持 Windows,macOS/Linux 用户无法直接使用。
  • 显存门槛:虽优先核显,但复杂大图或批量处理时仍可能触发 OOM,需手动调整 -ngl 层数或回退 CPU。
  • 模型体积:1.5GB 模型 + 约 100MB llama.cpp 二进制,首次下载对低带宽用户不友好。
  • 无 GPU 加速回退:若 Vulkan 驱动缺失或未正确安装,性能将显著下降至纯 CPU 模式。
  • 单次服务:每次调用独立启动 llama-server,未实现常驻服务,频繁调用存在冷启动开销。

适合人群

  • Windows 办公用户:需要处理发票、合同、扫描件、截图的文字提取,且对数据隐私敏感。
  • 轻薄本/商务本用户:无独立显卡,依赖 Intel 核显进行本地 AI 加速。
  • 开发者/集成者:希望将 OCR 能力嵌入本地工作流,避免云服务延迟与费用。

常规风险

  • 供应链风险:llama.cpp 二进制与模型文件均从 GitHub/HuggingFace/ModelScope 拉取,虽为官方源,但仍需防范中间人攻击或镜像篡改。建议校验文件哈希。
  • 执行权限:Miniforge 静默安装与 llama-server 二进制执行涉及中等风险操作,需在受控环境运行。
  • 路径与编码:Windows 路径含空格或中文时,需确保脚本正确转义,避免偶发文件未找到错误。
  • 驱动兼容性:Vulkan 驱动版本差异可能导致初始化失败,需保持 Intel/NVIDIA/AMD 显卡驱动为最新。

Local GLM OCR with llama.cpp on AIPC(no API Key) 内容

手动下载zip · 15.0 kB
_ocr_cfg.pytext/plain
请选择文件