核心用法
Gemini TTS Skill 是一个基于 Google Gemini 2.5 Flash 模型的文本转语音工具,通过命令行调用 Python 脚本实现高质量语音合成。用户需先设置 GEMINI_API_KEY 环境变量,然后执行:
uv run ~/.openclaw/workspace/skills/gemini-tts/generate_voice.py --text "内容" --voice "little-claw-persona"
输出为 output_voice 音频文件,支持自定义语音风格(persona)。
显著优点
- 官方模型背书:调用 Google 官方 Gemini 2.5 Flash Preview TTS API,语音质量有保障
- 零依赖轻量:仅使用 Python 标准库(os/urllib/json/argparse/base64),无第三方包风险
- Persona 驱动:支持通过
--voice参数切换不同角色音色,满足个性化需求 - 代码透明度高:62 行简洁代码,无混淆或危险函数,易于审计
- 传输安全:强制 HTTPS/TLS 1.2+ 加密,无中间人攻击风险
潜在缺点与局限性
- 云端依赖:所有文本必须发送至 Google 服务器处理,无法离线使用
- 隐私风险:输入文本内容将被 Google 收集,不适合处理敏感信息
- API 成本:按 Gemini API 调用计费,长文本可能产生较高费用
- 功能精简:无输入长度校验、无重试机制、输出路径固定,需用户自行把控
- 仅限单语种:当前版本未明确说明多语言支持能力
适合人群
- 内容创作者需要快速生成 AI 配音
- 开发者集成 TTS 到自动化工作流
- 对语音质量有要求、能接受云端处理的个人或团队
常规风险
| 风险类型 | 等级 | 说明 |
|---------|------|------|
| 数据隐私 | 中 | 文本上传至 Google,需避免输入敏感信息 |
| 密钥管理 | 中 | API Key 通过环境变量传入,需防止泄露 |
| 费用失控 | 低 | 无内置长度限制,长文本可能导致意外计费 |
| 服务可用性 | 低 | 依赖 Google API 稳定性,无本地降级方案 |