核心用法
本技能将文本描述转化为完整视频,通过自动化流水线完成:生成分镜脚本 → 调用文生图生成画面序列 → 调用TTS生成配音 → 使用ffmpeg合成MP4。全程国内网络直连,无需VPN,依赖硅基流动API(FLUX生图、CosyVoice2配音)。
执行流程:
1. 环境检查:自动检测并安装ffmpeg、校验china-image-gen和china-tts技能、验证SILICONFLOW_API_KEY
2. 需求解析:提取视频主题、时长、风格、平台比例(支持小红书1:1或3:4、抖音9:16、B站16:9等)
3. 分镜设计:AI生成带英文prompt的画面描述、中文解说词、运镜参数(Ken Burns/静止/平移)
4. 批量生图:调用FLUX.1-schnell/dev生成各分镜图片,支持多分辨率
5. 语音合成:合并解说词,使用CosyVoice2生成自然配音
6. 视频合成:ffmpeg将图片序列与音频合并,支持静止画面、Ken Burns缩放、淡入淡出转场等效果
显著优点:
- 无时长限制:突破15秒AI视频模型限制,可制作任意长度内容
- 完全可控:分镜、 pacing、配音、转场均可精细调整
- 成本低廉:单视频成本约0.5-2元,远低于商用视频平台
- 国内友好:硅基流动API支持支付宝/微信,最低10元起充,新用户有免费额度
- 自动化依赖管理:首次使用自动安装ffmpeg,降低技术门槛
潜在缺点与局限性:
- 依赖链复杂:需同时维护3个技能+API密钥,任一环节失效则流程中断
- 生成速度受限:Ken Burns效果处理慢(10-30秒/图),长视频耗时较长
- 图片一致性:分镜间人物/场景 continuity 依赖prompt工程,易出现风格漂移
- 无动态元素:本质为"图片幻灯片+配音",无法实现角色动作、镜头运动等真视频效果
- API稳定性:依赖单一服务商,限速策略未明确披露
适合人群:
- 电商运营(快速产出商品展示视频)
- 自媒体创作者(小红书/抖音内容批量生产)
- 中小企业市场部(低成本品牌宣传)
- 教育内容生产者(知识科普类视频)
常规风险:
- API密钥泄露风险(需妥善保管SILICONFLOW_API_KEY)
- 生成内容版权归属需确认服务条款
- 商业用途建议确认硅基流动API的商用授权范围
- 图片URL 1小时过期机制可能导致流程中断需重试