核心用法
pixcli 是面向 AI Agent 的创意生产中枢,覆盖图像、视频、音频、播客四大媒介。用户仅需自然语言描述需求,CLI 自动完成「任务分类 → 提示词增强 → 模型选择 → 结果交付」的全流程。
图像:pixcli image 支持文生图、图生图、背景移除、SVG 矢量化(--vectorize),内置 Nano Banana、GPT-Image-2、FLUX 等模型,自动识别文字渲染、产品摄影、虚拟试穿等场景。
视频:pixcli video 提供文生视频、图生视频、视频延长、背景移除(removebg)。推荐先用 pixcli image 生成首帧,再用 --from 动画化,确保视觉可控。支持 Veo 3.1(原生音频同步)、Seedance 2、Kling 等后端,长任务建议 --no-wait 异步提交避免超时。
音频与播客:pixcli voice 为单句配音;pixcli dialogue 为双人对白;pixcli podcast(别名 sipcast)是「一键播客工作室」——自动脚本(Google Search 实时 grounding)、双主播配音、配乐、封面、分享页全包,支持多语言学习与语音重录。
视频合成:生成素材后,通过 6 套 Remotion 模板(aida-classic、cinematic-product 等)完成最终剪辑,命令如 npx remotion render。
显著优点
1. 模型抽象层:用户无需了解 FLUX vs. Veo vs. Seedance 的差异,pixcli 按提示词自动路由到最优模型。
2. 全链路闭环:从创意到可分享 URL(/p/<id>)或播客页(/sip/<id>)一站式完成,支持公开/私有/限时链接。
3. 异步与恢复:--no-wait + pixcli job <id> 模式避免视频生成 5-10 分钟阻塞;超时后仍可用 job ID 恢复下载。
4. 成本可控:--quality draft/standard/high、分辨率、时长均影响计费,JSON 模式(PIXCLI_JSON=1)减少 90% Token 消耗。
5. 多语言原生:播客支持强制西班牙(Castilian)、法语等,语音克隆(ElevenLabs)与 Gemini 多音色 TTS 并存。
潜在缺点与局限性
1. 外部依赖重:必须持有 METERKEY_API_KEY(ShellBot 生态),且所有生成依赖云端 API(pixcli.shellbot.sh),无离线能力。
2. 视频时长与一致性:单段视频目前 1-15 秒(Veo 3.1 可达 4k),长叙事需分段生成后在 Remotion 拼接;人物一致性需配合 kontext 模型或固定首帧。
3. CLI 阻塞与超时:默认同步轮询,Agent 工具调用若限 2-5 分钟,必须显式使用 --no-wait 模式,增加编排复杂度。
4. Remotion 模板学习成本:虽提供 6 套模板,但自定义动画仍需编写 React/Remotion 代码(src/index.ts),非纯无代码体验。
5. 版权与合规:AI 生成内容的商用授权取决于底层模型(如 FLUX、Veo、ElevenLabs 各自条款),需用户自行合规审查。
适合人群
- AI Agent 开发者:需为 Agent 赋予「生成任意创意资产」能力的场景(营销素材、产品视频、播客、社交广告)。
- 内容运营与营销团队:快速产出 A/B 测试素材、多语言播客、短视频混剪。
- 独立创作者与设计师:用草稿质量快速验证概念,再升舱到高质量最终交付。
常规风险
- 密钥泄露:
METERKEY_API_KEY泄露可导致账户被恶意消耗额度,需严格环境变量管理。 - 模型供应商中断:依赖 fal、Google、ElevenLabs 等第三方后端,单点故障可能导致特定功能不可用。
- 内容审核:云端 API 可能对敏感提示词返回过滤或拒绝,需预留降级策略。
- 成本累积:视频与播客生成单价较高,批量任务需配合
--no-wait与--quality draft先做小规模验证。