核心用法
feishu-doc-extended 是面向飞书文档的扩展技能,主要提供两大功能:
1. get_image:通过图片 token 获取飞书文档中图片的临时下载 URL
2. image_ocr:结合 tesseract 引擎对下载的图片进行本地 OCR 文字识别
典型工作流程为:先用 feishu_doc list_blocks 获取文档中的图片 block 及其 token,再调用 get_image 获取下载链接,最后通过 tesseract 完成文字提取。
显著优点
- 本地化处理:OCR 识别完全在本地运行,敏感图片数据无需上传第三方云服务
- 零额外成本:依赖开源 tesseract 引擎,无需按次付费的云端 OCR 服务
- 飞书生态整合:与内置 feishu 插件深度配合,延续官方 API 调用模式
- 灵活扩展:开源架构允许用户自定义识别语言包和预处理流程
潜在缺点与局限性
- 安装门槛较高:需手动安装 tesseract 及中文语言包,并修改内置插件源码(doc-schema.ts 和 docx.ts),对非技术用户不友好
- URL 时效性问题:飞书返回的图片 URL 为临时链接,存在有效期,过期后需重新获取
- 多步骤操作:完整 OCR 流程需人工介入(浏览器访问 URL、截图保存),无法一键完成
- 识别质量依赖输入:tesseract 对低分辨率、复杂背景或手写体识别效果有限
- 维护负担:源码级修改意味着插件更新时需手动合并变更
适合人群
- 技术背景较强的开发者或运维人员
- 对数据隐私敏感、需本地化 OCR 处理的企业用户
- 已部署 OpenClaw 飞书插件、希望扩展文档处理能力的团队
常规风险
- 插件稳定性:源码修改可能引入运行时错误或与其他功能冲突
- Token 泄露风险:图片 token 和临时 URL 需妥善管理,避免未授权访问
- 依赖维护:tesseract 版本更新或语言包缺失可能导致识别失败
- API 变更:飞书开放平台接口调整可能使硬编码的端点失效