核心用法
pixcli 是面向 AI Agent 的创意资产统一生成工具,通过单一 CLI 接口覆盖图像、视频、音频、播客四大媒介。用户以自然语言描述需求,系统自动完成任务分类 → 提示增强 → 模型选型 → 异步生成 → 结果交付的全流程。
典型工作流:
- 图像:
pixcli image "产品图,柔和灯光,白底" --json - 视频:
pixcli video "镜头环绕产品缓慢旋转" --from product.png --no-wait - 播客:
pixcli podcast "AI 编程的未来" -m 5 -o episode.mp3(自动脚本、双主播、配乐、封面、分享页) - 后期:用 Remotion 模板将素材组装为成片
关键特性:
- 智能路由:自动识别任务类型并选择最优模型(如 Nano Banana、GPT-Image-2、Veo 3.1、Seedance 等)
- 异步作业:视频生成支持
--no-wait非阻塞提交,避免 Agent 工具调用超时 - 播客自动化:单命令产出完整播客,含 Google Search 实时 grounding、多声道配音、音乐 beds、封面艺术
- Remotion 集成:6 套内置模板支持视频组装,结合 AI 生成素材与代码化编辑
显著优点
1. 统一接口:一个工具替代图像、视频、语音、音乐、播客等多个零散服务
2. 模型无关:无需了解底层模型差异,提示自动重写为模型最优格式
3. 生产就绪:JSON 模式 (PIXCLI_JSON=1) 减少 90% token 消耗;分享链接自动生成;支持私有/公开/限时发布
4. 身份保持:kontext/phota-enhance 模型支持人脸/身份一致性编辑
5. 视频背景移除:removebg 输出透明 WebM,直接用于合成
潜在缺点与局限性
- 成本不可视:部分服务(如 Quiver 矢量化)按复杂度计费,最终价格事后结算
- 视频耗时:高质量视频需 5–10 分钟,虽支持异步仍增加流程复杂度
- 播客语言限制:Gemini TTS 仅支持最多 2 个说话人;自动检测语言可能误识别方言变体
- 外部依赖:需 Node.js ≥18、npx 环境;Remotion 模板需 npm install
- 封闭生态:资产托管于 shellbot.sh 域名,长期可用性依赖单一服务商
适合人群
- 营销团队:快速迭代广告素材、产品视频、社交媒体内容
- 独立开发者/创始人:无需设计团队即可产出专业级演示视频与播客
- AI Agent 开发者:需要结构化输出(
--json)与非阻塞作业管理的自动化流程 - 内容创作者:批量生成配音、配乐、视频片段并自行组装
常规风险
- API 密钥泄露:
METERKEY_API_KEY为唯一凭证,泄露可能导致额度被盗刷 - 超时处理不当:未使用
--no-wait可能导致 Agent 调用失败而作业仍在服务端运行,需通过pixcli job <id>恢复 - 版权与品牌:
--searchgrounding 可引用真实品牌/Logo,商用需确认授权 - 发布可见性:播客默认公开分享,敏感内容需显式
--private或--no-publish