vision-skill

👁️ Doubao 驱动的视觉识别与生成引擎

基于腾讯COS与Doubao模型的视觉识别与图像生成CLI工具,支持OCR、对象检测、文生图、图生图等异步任务,适合自动化视觉工作流。

收藏
4.9k
安装
1.1k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Vision Skill 是一个面向计算机视觉任务的命令行工具,封装了 Doubao AI 的视觉模型与腾讯 COS 对象存储服务。它通过 scripts/vision_cli.py 脚本暴露两大核心能力:

视觉识别(recognize):支持图像描述、OCR 文字提取、结构化内容解析(发票、合同、表格、代码等)。用户可传入本地路径或 URL,工具自动上传至 COS 后调用 Doubao Vision API,输出纯文本或格式化数据(JSON、Markdown、键值对等)。内置 --format 预设覆盖发票、合同、白板、幻灯片、代码截图等 12 种常见场景;--quality high--retry 参数保障复杂图像的识别准确率。

图像生成(generate):支持文生图、图生图及序列生成(故事板)。提供 PPT、商务扁平、卡通、科技等轴、手绘、照片、动漫、图标等 9 种风格预设。参考图模式允许以现有图像为基底进行风格迁移或内容改写。--seq 参数可批量生成风格一致的连续画面,适用于漫画分镜或产品原型迭代。

所有任务默认异步执行,任务状态持久化存储于 .tasks/ 目录。--wait 标志阻塞至完成,--output 自动保存结果,便于 Agent 工作流集成。

显著优点

  • 云原生架构:COS 托管解决大体积图像传输与临时存储问题,避免本地磁盘瓶颈。
  • 模型即服务:直接调用字节跳动 Doubao 生产级多模态模型,无需自建推理环境。
  • 场景化预设:识别与生成均提供丰富的格式/风格模板,降低 Prompt 工程门槛。
  • 异步弹性:默认非阻塞设计适合高并发批处理;--wait 兼顾同步脚本需求。
  • 批处理友好:支持多图批量识别与序列生成,输出结构化 JSON 便于下游解析。

潜在缺点与局限性

  • 密钥依赖严苛:需预先配置 7 项环境变量(COS 4 项 + Doubao 3 项),密钥泄露风险较高。
  • 网络延迟敏感:图像上传 COS、模型推理往返均依赖公网,大文件或弱网环境延迟显著。
  • 成本不可控:COS 存储费用与 Doubao Token 消耗随用量线性增长,无本地限额保护机制。
  • 黑盒模型:Doubao 视觉模型的能力边界、更新策略、内容安全过滤规则未公开文档化,可能产生不可预期的审核拒绝或幻觉输出。
  • CLI 独占:目前仅提供命令行接口,无 Python SDK 或 HTTP API 封装,集成灵活性受限。

适合人群

  • 需要批量处理发票、合同、截图 OCR 的财务/法务自动化工程师
  • 快速生成产品示意图、图标、PPT 配图的运营与设计师
  • 构建 AI Agent 工作流、需异步视觉能力的技术开发者
  • 希望低成本试用多模态大模型、无 GPU 资源的小团队

常规风险

  • 数据出境:图像上传至腾讯 COS(中国大陆节点)及 Doubao 服务,涉密或敏感内容存在合规风险。
  • 密钥管理.env 文件或环境变量中的 Secret Key 若未妥善保管,可能导致云资源被盗刷。
  • 生成内容合规:AI 生成图像可能触发平台审核机制,需人工复核版权与敏感信息。
  • 任务状态丢失.tasks/ 目录若被误删或跨环境迁移,异步任务状态将不可恢复。

vision-skill 内容

scripts文件夹
手动下载zip · 21.7 kB
cos_client.pytext/plain
请选择文件