Gemini Tts

✨ Gemini Tts

Gemini Tts

收藏
1.8k
安装
766
版本
1.0.0
CLS 安全性认证2026-07-19
点击查看完整报告 >

使用说明

安全解读

核心用法

Gemini TTS Skill 是一个基于 Google Gemini 2.5 Flash 模型的文本转语音工具,通过命令行调用 Python 脚本实现高质量语音合成。用户需先设置 GEMINI_API_KEY 环境变量,然后执行:

uv run ~/.openclaw/workspace/skills/gemini-tts/generate_voice.py --text "内容" --voice "little-claw-persona"

输出为 output_voice 音频文件,支持自定义语音风格(persona)。

显著优点

  • 官方模型背书:调用 Google 官方 Gemini 2.5 Flash Preview TTS API,语音质量有保障
  • 零依赖轻量:仅使用 Python 标准库(os/urllib/json/argparse/base64),无第三方包风险
  • Persona 驱动:支持通过 --voice 参数切换不同角色音色,满足个性化需求
  • 代码透明度高:62 行简洁代码,无混淆或危险函数,易于审计
  • 传输安全:强制 HTTPS/TLS 1.2+ 加密,无中间人攻击风险

潜在缺点与局限性

  • 云端依赖:所有文本必须发送至 Google 服务器处理,无法离线使用
  • 隐私风险:输入文本内容将被 Google 收集,不适合处理敏感信息
  • API 成本:按 Gemini API 调用计费,长文本可能产生较高费用
  • 功能精简:无输入长度校验、无重试机制、输出路径固定,需用户自行把控
  • 仅限单语种:当前版本未明确说明多语言支持能力

适合人群

  • 内容创作者需要快速生成 AI 配音
  • 开发者集成 TTS 到自动化工作流
  • 对语音质量有要求、能接受云端处理的个人或团队

常规风险

| 风险类型 | 等级 | 说明 |
|---------|------|------|
| 数据隐私 | 中 | 文本上传至 Google,需避免输入敏感信息 |
| 密钥管理 | 中 | API Key 通过环境变量传入,需防止泄露 |
| 费用失控 | 低 | 无内置长度限制,长文本可能导致意外计费 |
| 服务可用性 | 低 | 依赖 Google API 稳定性,无本地降级方案 |

Gemini Tts 内容

手动下载zip · 2.8 kB
generate_voice.pytext/plain
请选择文件