核心用法
本 Skill 封装 OpenAI TTS 能力,通过 scripts/text_to_speech.py CLI 工具将文本转换为语音。核心流程:判定单条/批量需求 → 收集文本、音色、风格、格式等参数 → 调用 CLI 执行生成 → 输出至 output/speech/。批量场景需先将任务写入临时 JSONL 文件,执行后清理。
关键参数与默认:
- 模型:
gpt-4o-mini-tts-2025-12-15(可切换) - 默认音色:
cedar;明亮风格首选marin - 仅支持内置音色,不支持自定义声线克隆
- 单请求上限 4096 字符;RPM 限制 50
- 必须配置
OPENAI_API_KEY环境变量
指令增强机制:将用户模糊描述(如"旁白")转写为结构化指令模板(Voice Affect / Tone / Pacing / Emphasis 等),但不改写原文、不虚构未提及的风格。
显著优点
- 工程化完整:提供 CLI 工具、临时文件管理、批量 JSONL 流水线,降低重复开发成本。
- 多场景模板:内置 narration、voiceover、IVR、accessibility 四类参考模板,快速对齐行业惯例。
- 可控迭代:支持通过 instructions 微调音色、语速、情感,且遵循"单变量迭代"原则,便于 A/B 对比。
- 合规内置:强制要求 RPM 限速、AI 生成声源披露,降低合规风险。
潜在缺点与局限
- 供应商锁定:仅支持 OpenAI Audio API,无 Azure、Google Cloud 等替代后端。
- 无自定义声线:无法基于个人录音克隆专属音色,限制品牌声效差异化。
- 长度与速率限制:4096 字符上限需手动分片;50 RPM 对大规模批量生产(如数万条 IVR)仍显不足。
- 网络依赖:需实时 API 调用,离线环境不可用;sandbox/网络白名单环境需额外配置(见
references/codex-network.md)。 - 安全提示:文档未提及输入文本的 XSS/注入过滤,需调用方自行校验。
适合人群
- 产品经理/开发者需快速生成 Demo 旁白、产品解说视频配音。
- 客服/运维团队需批量制作 IVR 语音导航、电话提示音。
- 无障碍开发者需为视障用户生成屏幕阅读补充音频。
- 内容创作者需 AI 语音替代人工配音以降低制作成本。
常规风险
- API Key 泄露风险:文档明确禁止在聊天中粘贴密钥,但用户若误操作仍可能导致泄露。
- 版权与标识义务:需向终端用户披露"AI 生成",否则可能违反平台政策或区域法规。
- 成本波动:TTS API 按字符计费,长文本或高频批量调用需关注用量预算。
- 音色一致性:多批次生成时,同一 voice 参数在不同时间点可能因模型更新产生细微差异,需版本锁定。