核心用法
Wuli 是一个命令行 AI 图像与视频生成工具,通过调用 Wuli.art 开放平台的 15+ 模型 API,覆盖四大核心能力:
1. 文生图(text-to-image):--action image-gen 支持 Qwen Image 2.0/Seedream/通义万相等 6+ 图像模型,可指定 1:1 到 21:9 多种比例、最高 4K 分辨率,支持批量生成(--n 1-4)和 AI 提示词优化(--optimize)。
2. 图生图(image-to-image):--action image-edit 支持局部重绘、风格迁移、元素增删,可引用本地文件(--image_path)或远程 URL(--image_url)。
3. 文生视频(text-to-video):--action txt2video 支持 通义万相/Kling/Seedance/MiniMax Hailuo 等 9+ 视频模型,时长 5-15 秒,分辨率 480P-1080P。
4. 图生视频(image-to-video):--action image2video 可将静态图片动画化,支持运镜、表情动作等控制。
技术实现上,工具纯 Python 3 标准库编写,零依赖,自动处理图片上传、任务轮询(图片 5 秒/视频 10 秒)、无水印结果下载,并支持生成后自动打开文件。
显著优点
- 模型覆盖全面:15+ 模型涵盖阿里系(Qwen、通义万相)、快手(Kling)、字节(Seedance)、MiniMax 等头部厂商,可按成本/质量/速度灵活选型
- 成本透明可控:按 credits 计费,Turbo 模型最低 1 credit/图、20 credits/5秒视频,支持预算敏感场景
- 零依赖轻量:仅需 Python 3,无需 PyTorch/Transformers 等重型库
- 自动化工作流:自动上传、轮询、下载、打开,减少人工等待
- 中文优化:通义万相系列针对中文提示词和审美风格优化
潜在局限
- 商业平台依赖:核心服务托管于 wuli.art,存在 API 变更、定价调整、服务中断风险
- 内容审核限制:敏感内容会触发 REVIEW_FAILED,创意自由度受平台政策约束
- 视频时长受限:最长仅 15 秒,不适合长视频制作
- 无本地推理:所有计算云端完成,离线不可用,大流量场景可能触发 429 限流
- 成本累积:高质量模型(Seedream 4.5、可灵 2.6)单图/视频成本可达默认模型 4-6 倍
适合人群
- 设计师、内容创作者需要快速生成视觉素材
- 开发者构建 AI 应用原型,需标准化 API 接入
- 营销团队批量生产社交媒体配图/短视频
- 研究人员对比多模型生成效果
常规风险
- Token 安全:WULI_API_TOKEN 以明文环境变量传递,共享环境或日志中可能泄露
- 内容合规:生成内容需符合中国大陆法律法规,存在被平台审查拦截的可能
- 服务商锁定: credits 充值与 wuli.art 平台绑定,迁移成本较高
- 网络稳定性:依赖境外/境内混合 CDN,部分区域可能存在延迟或超时