核心用法
telegram-offline-voice 是一款专为 Telegram 设计的离线文本转语音(TTS)技能,通过调用底层 sherpa-onnx-tts 引擎,将输入文本自动转换为 OGG/Opus 格式的语音消息,直接兼容 Telegram 原生语音功能。用户只需输入文字内容,技能即可完成语音合成、格式封装与输出,实现"一键语音"的无缝体验。
显著优点
1. 完全离线运行:无需联网、无需 API Token、零调用成本,彻底杜绝隐私泄露风险,适合对数据安全敏感的用户场景。
2. 音质调优专业:由首席体验官 @sanwecn 操刀调校,采用 1.2x 黄金语速比与 0.6x 自然停顿缩放,输出温暖、类人化的语音节奏,告别机械感。
3. 生态集成度高:作为 Moltbot/Clawdbot 技能生态的一环,依赖关系清晰,与基础 sherpa-onnx-tts 引擎解耦,便于维护升级。
4. 格式原生适配:直接输出 Telegram 客户端原生支持的 OGG/Opus 语音消息,无需二次转码。
潜在缺点与局限性
- 模型依赖较重:需额外下载中文 VITS 模型(如
vits-zh-aishell3),首次部署体积较大,对存储与内存有一定要求。 - 语言支持受限:当前配置针对中文场景优化,多语言支持取决于所选模型的覆盖范围。
- 平台绑定:专为 Telegram 格式调校,如需迁移至其他平台可能需要调整输出参数。
- 离线资源占用:本地推理依赖 sherpa-onnx 运行时,低配设备可能出现延迟。
适合人群
- 注重隐私、拒绝云服务的 Telegram 重度用户
- 需要自动化语音消息推送的运维/通知场景
- 中文语音交互开发者及本地化 TTS 爱好者
常规风险
- 模型版权合规:VITS 模型需确认开源许可,商用场景需核查模型授权协议。
- 依赖链维护:
sherpa-onnx与ffmpeg版本迭代可能引入兼容性断点。 - 输出质量控制:极端长文本或特殊符号可能导致合成异常,建议输入长度限制与内容过滤。