核心用法
local-image-ocr-aipc 是一款面向 Windows 平台的本地化 OCR 技能,通过部署 GLM-OCR 多模态大模型实现图像文字识别。技能采用三段式执行流程:Pre-flight 环境检查 → Step 1/2 自动安装依赖 → Step 3 执行识别。
首次使用时,系统自动完成以下部署:
- 从 GitHub 下载 llama.cpp Vulkan 预编译版本(~50-100MB)
- 自动下载 GLM-OCR Q8_0 量化模型(~950MB)及视觉投影层(~484MB)
- 支持从 HuggingFace、hf-mirror 或 ModelScope 多源下载
运行阶段,用户可通过本地文件路径或界面直接上传图像,技能调用 llama-cli 执行推理,输出保留原始排版的纯文本,并支持发票、表格、名片等场景的结构化解析。
显著优点
| 特性 | 说明 |
|------|------|
完全离线 | 零云端 API 调用,敏感文档不上传网络,满足金融、政务等隐私合规场景 |
| **硬件加速** | 优先使用 Intel iGPU Vulkan 推理,`-ngl 99` 全层卸载,平衡速度与显存 |
| **中英优化** | GLM-OCR 针对中文场景深度优化,混合文本识别准确率高于通用 OCR |
| **自动运维** | 集成 Python/Miniforge 自动安装、SHA256 校验、断点续传,降低技术门槛 |
| **灵活部署** | 工作目录可自定义或自动选择剩余空间最大的磁盘,无需管理员权限 |
潜在缺点与局限性
1. 硬件门槛:需支持 Vulkan 的 Intel 核显或兼容 GPU;纯 CPU 推理(--device none)速度显著下降
2. 显存约束:Q8_0 量化模型仍需要 ~2GB 可用显存/内存,低配置设备可能触发 OOM
3. 首次部署耗时:1.5GB 模型下载对慢速网络用户不友好(10Mbps 约 20 分钟)
4. Windows 独占:llama.cpp Vulkan 预编译仅提供 Windows x64 版本,macOS/Linux 用户需手动编译
5. 无原生表格识别:需依赖后处理脚本将文本重组为 Markdown 表格,复杂版式可能错位
适合人群
- 隐私敏感型用户:律师、会计师、政府工作人员处理合同、发票、身份证件
- 离线场景工作者:工厂质检、野外勘探、军队/保密单位等无公网环境
- Intel 轻薄本用户:希望利用闲置 iGPU 性能,避免云端订阅费用
- 自动化集成者:需将 OCR 嵌入本地 RPA 或文档管理系统的开发者
常规风险
| 风险类别 | 具体描述 | 缓解措施 |
|----------|----------|----------|
| **供应链攻击** | 从 GitHub 下载的可执行文件可能被篡改 | 强制 SHA256 校验,哈希不匹配时终止安装 |
| **环境污染** | Miniforge 自动安装修改用户 Python 环境 | 支持 `$customPythonExe` 指定现有环境,拒绝自动安装 |
| **权限提升** | 设计为非管理员运行,但用户可能误用管理员执行 | 文档明确警示,安装路径限定用户目录 |
| **模型完整性** | 大文件下载可能损坏导致推理异常 | 下载后校验文件大小(±50MB 容差)并打印 SHA256 供人工核对 |
| **敏感数据残留** | 临时图像文件可能残留在系统 | 建议配合系统临时目录自动清理策略 |
> 技能明确声明为「instruction-only」,所有系统变更均通过用户可见的 PowerShell 脚本执行,保留完整审计日志。