Telegram Voice Group

🔊 AI语音一键送达Telegram话题

messaging榜 #4

向 Telegram 群组或话题发送 AI 生成的语音消息,支持 Microsoft Edge-TTS 高质量中文语音,话题上下文完全隔离可替代 Discord 频道功能。

收藏
14.6k
安装
3.1k
版本
0.1.4
CLS 安全性认证2026-07-06
点击查看完整报告 >

使用说明

核心用法

Telegram 群组语音消息发送技能通过 Microsoft Edge-TTS 引擎生成高质量中文语音,经 FFmpeg 转换为 Telegram 兼容的 OGG Opus 格式,以语音气泡形式发送至指定群组或话题。用户可通过自然语言指令(如"向 agent:main:telegram:group:[GROUP_ID]:topic:[TOPIC_ID] 发送语音: 内容")、sessions_spawn 调用或直接 JS 函数调用的方式触发。

显著优点

1. 话题级上下文隔离:每个 Telegram 话题拥有独立的会话键格式 agent:main:telegram:group:{groupId}:topic:{threadId},对话历史、AI 模型配置完全隔离,可直接替代 Discord 频道的组织功能
2. 高质量语音合成:采用 Microsoft Edge-TTS(zh-CN-XiaoxiaoNeural 等音色),支持语速调节(如 +5%

3. 格式自动适配:自动生成 MP3 后通过 FFmpeg 转换为 libopus 编码、48k 比特率、48kHz 采样率的 VOIP 级 OGG 格式,确保 Telegram 语音气泡原生播放

4. 智能文本清洗:自动移除 Markdown 标记、URL 链接和特殊符号,避免朗读出格式符号

5. 多模型并行支持:不同话题可配置不同 AI 模型,实现真正的多租户隔离

潜在缺点与局限性

  • 部署门槛较高:需完成 Bot 创建、群组邀请、管理员权限授予、话题创建等 6 步配置流程
  • 依赖外部服务:依赖 Microsoft Edge-TTS 在线服务和 Telegram Bot API,存在服务可用性风险
  • Linux 环境限制:metadata 显示仅支持 Linux 系统,且需预装 ffmpeg 和 edge-tts 二进制依赖
  • 语音内容审核:自动发送至公开群组时缺乏人工审核环节,存在误发或内容不当风险
  • 临时文件管理:虽声称自动清理,但高频调用时 /tmp 目录的 IO 和磁盘占用需关注

适合人群

  • 运营 Telegram 社区(替代 Discord)的管理员,需要话题级隔离的组织者
  • 需要将 AI 助手语音化输出至即时通讯场景的内容创作者
  • 构建多租户 AI 服务、需为不同客户/项目隔离上下文的开发者

常规风险

  • 权限过度授予:部署教程要求授予删除消息、封禁成员、添加管理员等敏感权限,实际仅需发送消息和发送媒体即可完成核心功能
  • 会话键泄露:群组 ID 和话题 ID 组合可能暴露群组结构,建议通过环境变量或加密存储管理
  • TTS 内容注入:用户输入文本直接传入 edge-tts 命令行,虽经清洗但仍需防范命令注入(文档未明确说明是否使用参数化调用)
  • 频率限制:Telegram Bot API 对语音消息有速率限制,大规模群发可能触发封禁
  • 隐私合规:语音消息生成涉及文本内容处理,需关注 Microsoft TTS 服务的数据留存政策

安全解读

核心用法

telegram-voice-group 是一个纯文档型 Skill,本身不包含可执行代码,而是依赖 OpenClaw 框架的 message API 实现功能。用户通过自然语言指令或 sessions_spawn 调用,即可将文本转换为语音并发送至指定 Telegram 群组话题。

典型调用方式

  • 自然语言:向 agent:main:telegram:group:[GROUP_ID]:topic:[TOPIC_ID] 发送语音: 语音内容
  • JS 调用:sessions_spawn({ task: "...", agentId: "telegram-voice-group" })

技术流程
1. edge-tts 生成 MP3(Microsoft 神经网络语音,支持中文)

2. ffmpeg 转码为 OGG Opus(48k 比特率,单声道,48kHz,VOIP 应用类型)

3. message API 以语音气泡形式推送至指定 threadId

显著优点

  • 话题隔离机制:每个 Telegram 话题拥有独立会话上下文(agent:main:telegram:group:{groupId}:topic:{threadId}),可完全替代 Discord 频道的组织功能
  • 多模型支持:不同话题可配置不同 AI 模型,上下文互不干扰
  • 文本清洗:自动移除 Markdown、URL、特殊符号,避免朗读混乱
  • 格式兼容:严格遵循 Telegram 语音气泡规范(asVoice: true
  • 零代码风险:纯文档型 Skill,无实际可执行文件,依赖外部可信工具(Edge-TTS、FFmpeg)

潜在缺点与局限性

  • 外部依赖强:必须预装 edge-ttsffmpeg,Linux 环境限定
  • T3 来源等级:个人开发者维护,无公开 GitHub 仓库,长期维护性存疑
  • 无实时预览:无法先试听再发送,依赖文本清洗后的效果
  • 语音风格受限:Edge-TTS 音色选择有限,定制化程度低
  • 权限配置繁琐:需手动将 Bot 提升为管理员并授予多项权限

适合人群

  • 使用 OpenClaw 框架的 Telegram 社群运营者
  • 需要将 AI 回复以语音形式推送至群组话题的场景
  • 追求 Discord 式频道隔离但偏好 Telegram 生态的团队

常规风险

| 风险维度 | 评估 | 说明 |
|---------|------|------|
| 代码执行 | 极低 | 无可执行代码,纯文档型 |
| 数据外泄 | 极低 | 仅处理用户输入文本,无敏感数据访问 |
| 权限滥用 | 低 | 依赖 Telegram Bot 权限,需管理员手动授权 |
| 依赖安全 | 中 | 依赖 Edge-TTS(Microsoft 官方)和 FFmpeg(开源),需自行保障二进制来源可信 |
| 社交工程 | 中 | 语音消息可能被用于伪造身份,需结合群组管理策略 |

> 安全评级 A(95/100):CLS-Certify 全扫描通过,零依赖文件,零动态代码,GDPR/CCPA 合规。

Telegram Voice Group 内容

手动下载zip · 3.2 kB
SKILL.mdtext/markdown
请选择文件