概述
wecom-voice 是一款面向企业微信(WeCom)用户的自动化语音消息发送工具,利用 Windows 系统内置 TTS(文本转语音)引擎,将文字内容转换为原生语音消息格式发送,而非普通的音频文件附件。
核心用法
用户通过命令行调用脚本,输入待转换的文字内容及可选的目标联系人:
node scripts/send-voice.cjs "要说的内容" # 基础用法 node scripts/send-voice.cjs "Hello" FanQi # 指定接收人
工具内部执行三步流程:首先调用 Windows System.Speech 组件(Microsoft Huihui 语音引擎)生成 WAV 音频;随后通过 FFmpeg 将音频转换为 AMR 格式(8000Hz 单声道、12.2kbit/s),该规格为企业微信原生语音消息的标准格式;最后借助 OpenClaw CLI 从 ~/.openclaw/media/inbound 目录完成消息投递。
显著优点
- 原生体验:接收方看到的是微信风格的语音消息气泡,可直接点击播放,与人工录制的语音无差别
- 零额外成本:依赖 Windows 内置 TTS 引擎,无需调用第三方付费语音合成 API
- 办公自动化友好:命令行接口便于集成至自动化脚本、定时任务或工作流系统
- 中文优化:采用 Microsoft Huihui 中文语音,发音自然度优于通用英文 TTS 引擎
潜在缺点与局限性
- 平台锁定:仅支持 Windows 环境,macOS 与 Linux 用户无法直接使用
- 依赖链复杂:需同时满足 Windows TTS + FFmpeg + OpenClaw CLI 三重依赖,任一环节缺失即失效
- 语音单一性:固定使用 Microsoft Huihui 音色,不支持语音风格切换或情感调节
- 无实时反馈:发送成功与否依赖 OpenClaw 的底层实现,缺乏独立的状态确认机制
- 目录硬编码:必须严格遵循
media/inbound路径约定,灵活性受限
适合人群
- 企业微信重度用户,需要频繁发送标准化语音通知(如运维告警、日报播报)
- 已部署 OpenClaw 生态的 Windows 办公环境
- 希望以低成本实现"文字→语音消息"自动化的开发者与运维人员
常规风险
- 账号安全:通过 OpenClaw 发送消息需授权第三方客户端,存在企业微信账号合规性审查风险
- 音频质量瓶颈:TTS 合成效果受限于本地引擎,复杂文本(多音字、专业术语)可能出现误读
- 格式兼容隐患:AMR 编码参数若与企业微信后续更新不匹配,可能导致消息无法正常播放
- 路径污染风险:脚本需写入用户目录下的固定路径,存在文件冲突或权限问题的可能性