核心用法
本 Skill 在 Windows 系统本地部署 GLM-OCR 视觉语言模型,通过 llama.cpp Vulkan 后端实现图像文字识别。使用前需完成三步环境准备:检测并安装 llama.cpp 推理引擎(约50-100MB)、下载 GLM-OCR 模型文件(约1.5GB)、执行 OCR 识别。支持用户直接提供本地图片路径,或通过界面上传图片获取临时路径进行识别。
识别时调用 llama-cli 加载 Q8_0 量化模型(~950MB)及视觉投影层(~484MB),使用 Vulkan 加速优先调度 Intel iGPU。识别结果保留原始排版输出,并支持发票、名片、表格等场景的格式化后处理。
显著优点
- 完全本地运行:无需联网,无云端 API 调用,数据不出本机,隐私性极强
- 中英混合优化:GLM-OCR 针对中文场景训练,汉字识别准确率优于通用 OCR 模型
- Intel 核显加速:Vulkan 后端优先使用 iGPU,无独显设备也能流畅运行
- 开源可审计:llama.cpp 与 GLM-OCR 均为开源项目,代码与模型权重透明可查
潜在缺点与局限性
- Windows 专属:当前仅支持 Windows 平台,macOS/Linux 需自行适配
- 存储空间占用:模型文件约 1.5GB,加上 llama.cpp 二进制约需 2GB 磁盘空间
- 首次配置复杂:需用户确认多次下载安装(Miniforge、llama.cpp、模型文件),学习成本较高
- GPU 依赖:虽支持 CPU 回退,但无 Vulkan 驱动时推理速度显著下降
- 输出格式有限:复杂表格结构可能识别为纯文本,需人工二次整理
适合人群
- 处理敏感文档(合同、证件、病历)且对数据隐私要求极高的个人用户与企业
- 无稳定外网环境或需离线工作的移动办公场景
- Intel 核显轻薄本用户,希望利用 iGPU 加速本地 AI 任务
- 已熟悉命令行与 Python 环境的技术爱好者
常规风险
- 下载源信任:需从 GitHub、HuggingFace/ModelScope 下载可执行文件与模型,存在供应链攻击理论风险(建议校验 SHA256)
- 自动执行风险:PowerShell 脚本涉及网络下载、目录创建、二进制执行,用户需审慎授权
- 模型误判:GLM-OCR 作为生成式模型,存在幻觉风险,关键业务场景需人工复核
- 系统资源占用:大图片识别时可能占用较多内存与显存,建议关闭其他大型应用