Speech

🔊 OpenAI 语音合成,一键生成专业配音

调用 OpenAI Audio API 实现文本转语音,支持单条/批量生成,内置语音库与 CLI 工具,适用于旁白、客服语音、无障碍朗读等场景。

收藏
4.4k
安装
1.1k
版本
0.1.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

本 Skill 封装 OpenAI TTS 能力,通过 scripts/text_to_speech.py CLI 工具将文本转换为语音。核心流程:判定单条/批量需求 → 收集文本、音色、风格、格式等参数 → 调用 CLI 执行生成 → 输出至 output/speech/。批量场景需先将任务写入临时 JSONL 文件,执行后清理。

关键参数与默认

  • 模型:gpt-4o-mini-tts-2025-12-15(可切换)
  • 默认音色:cedar;明亮风格首选 marin
  • 仅支持内置音色,不支持自定义声线克隆
  • 单请求上限 4096 字符;RPM 限制 50
  • 必须配置 OPENAI_API_KEY 环境变量

指令增强机制:将用户模糊描述(如"旁白")转写为结构化指令模板(Voice Affect / Tone / Pacing / Emphasis 等),但不改写原文、不虚构未提及的风格。

显著优点

  • 工程化完整:提供 CLI 工具、临时文件管理、批量 JSONL 流水线,降低重复开发成本。
  • 多场景模板:内置 narration、voiceover、IVR、accessibility 四类参考模板,快速对齐行业惯例。
  • 可控迭代:支持通过 instructions 微调音色、语速、情感,且遵循"单变量迭代"原则,便于 A/B 对比。
  • 合规内置:强制要求 RPM 限速、AI 生成声源披露,降低合规风险。

潜在缺点与局限

  • 供应商锁定:仅支持 OpenAI Audio API,无 Azure、Google Cloud 等替代后端。
  • 无自定义声线:无法基于个人录音克隆专属音色,限制品牌声效差异化。
  • 长度与速率限制:4096 字符上限需手动分片;50 RPM 对大规模批量生产(如数万条 IVR)仍显不足。
  • 网络依赖:需实时 API 调用,离线环境不可用;sandbox/网络白名单环境需额外配置(见 references/codex-network.md)。
  • 安全提示:文档未提及输入文本的 XSS/注入过滤,需调用方自行校验。

适合人群

  • 产品经理/开发者需快速生成 Demo 旁白、产品解说视频配音。
  • 客服/运维团队需批量制作 IVR 语音导航、电话提示音。
  • 无障碍开发者需为视障用户生成屏幕阅读补充音频。
  • 内容创作者需 AI 语音替代人工配音以降低制作成本。

常规风险

  • API Key 泄露风险:文档明确禁止在聊天中粘贴密钥,但用户若误操作仍可能导致泄露。
  • 版权与标识义务:需向终端用户披露"AI 生成",否则可能违反平台政策或区域法规。
  • 成本波动:TTS API 按字符计费,长文本或高频批量调用需关注用量预算。
  • 音色一致性:多批次生成时,同一 voice 参数在不同时间点可能因模型更新产生细微差异,需版本锁定。

Speech 内容

agents文件夹
assets文件夹
references文件夹
scripts文件夹
手动下载zip · 21.7 kB
openai.yamltext/plain
请选择文件