Zvukogram

🎙️ 俄语 AI 配音专家,SSML 精准掌控

Zvukogram API 驱动的专业俄语 TTS 服务,支持 SSML 标记、语速控制与音频合成,适合播客、语音通知等多场景。

收藏
4.6k
安装
1.4k
版本
1.1.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Zvukogram 是一个基于俄罗斯 Zvukogram 云 TTS 服务的文本转语音技能,通过 API 将文本转换为自然人声。核心功能包括:基础 TTS 生成、SSML 标记支持(重音标记、语速控制、停顿)、多片段音频合并,以及英语外来词俄语转写。

使用方法分为三步:配置 API 凭证(token + email)、选择语音角色(如 Алена/Андрей)、调用脚本生成音频。支持通过 --speed 参数调整语速(0.5-2.0),通过 SSML <prosody><break> 标签精细控制朗读节奏。

显著优点

  • 俄语质量高:专注俄语 TTS,重音标记(+)解决俄语文本歧义发音问题
  • SSML 完整支持:相比基础 TTS 服务,支持语速、停顿、转写等语音合成标记语言标准
  • 批量与长文本/longtext 端点支持最高 100 万字符,适合有声书、播客制作
  • 多角色可选:4+ 预设声线,支持通过 ffmpeg 合并实现多角色对话效果
  • 外来词优化:内置英语品牌/技术词汇的俄语转写表(OpenAI→Оупен Эй Ай)

潜在局限

  • 俄语单语种:核心优化俄语,其他语言支持有限
  • API 限制:单次请求 1000 字符上限,需分批处理长内容
  • 多声线限制:API 不支持 <voice> 标签切换,需客户端合成多片段
  • 付费依赖:需 Zvukogram 账户与 API token,存在调用成本

适合人群

俄语内容创作者、播客制作人、语音通知系统开发者、需要批量生成俄语有声内容的企业用户,以及希望精细控制语音韵律的技术用户。

常规风险

  • API 密钥泄露:token 存储于本地配置文件,需确保 ~/.config/zvukogram/ 目录权限安全
  • 成本不可控:长文本/高频调用可能产生意外费用,建议实现余额检查(balance.py
  • 音频版权:生成内容受 Zvukogram 服务条款约束,商业使用需确认授权范围
  • 外部依赖:服务可用性依赖 Zvukogram 平台,存在单点故障风险

Zvukogram 内容

references文件夹
scripts文件夹
手动下载zip · 12.5 kB
EXAMPLES.mdtext/markdown
请选择文件