Alicloud Ai Audio Tts

🔊 Qwen3 语音合成 · 一键生成自然人声

阿里灵积 Qwen3 TTS 语音合成,支持流式/非流式输出,适合短视频配音与自动化语音生成。

收藏
5.8k
安装
1.9k
版本
1.0.4
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

alicloud-ai-audio-tts 是阿里云灵积平台(DashScope)Qwen3 TTS 模型的封装技能,提供标准化接口将文本转换为自然人声。支持两款主力模型:qwen3-tts-flash(基础版)与 qwen3-tts-instruct-flash(指令控制版),后者可通过 instruction 参数微调语速、情绪与风格。接口采用归一化设计 tts.generate,核心参数包括 text(文本)、voice(音色标识)、language_type(语言类型)及可选的 stream(流式开关)。非流式模式返回 24kHz WAV 音频 URL;流式模式返回 Base64 PCM 分片,适用于实时播放场景。

显著优点

1. 模型先进:基于 Qwen3 架构,中文发音自然度高,支持多语言自动识别。
2. 灵活输出:兼顾一键获取完整音频(URL)与低延迟流式合成(PCM)两种模式。

3. 风格可控:Instruct 版本支持自然语言指令调节情绪、语速,降低后期剪辑成本。

4. 生态集成:与阿里云账号体系、SDK(dashscope-python)深度整合,便于企业级部署。

潜在局限

  • 区域限制:默认北京 endpoint,国际用户需切换至新加坡节点(dashscope-intl)。
  • 成本敏感:长文本建议分片调用并缓存 (text, voice, language_type) 组合,避免重复计费。
  • 网络依赖:流式模式对延迟敏感,弱网环境可能出现断流或音质下降。
  • 音色固定:当前版本未开放实时 Voice Cloning,如需克隆需转接独立技能 alicloud-ai-audio-tts-voice-clone

适合人群

  • 短视频创作者(短剧、新闻播报配音)
  • 自动化内容生产开发者(播客、有声书批量生成)
  • 企业客服/ IVR 系统集成工程师

常规风险

  • 密钥泄露DASHSCOPE_API_KEY 需严格隔离,避免硬编码至仓库。
  • 版权合规:合成语音的商业使用需确认文本与音色的授权范围。
  • 内容安全:输入文本若含敏感信息,需前置过滤以满足平台审核策略。

Alicloud Ai Audio Tts 内容

agents文件夹
references文件夹
scripts文件夹
手动下载zip · 6.6 kB
openai.yamltext/plain
请选择文件