Speak Skill 是 OpenClaw 生态中的语音输出自适应模块,核心功能是通过观察用户反馈自动学习并配置 TTS(文本转语音)参数。其设计亮点在于"渐进式学习"机制:系统通过捕捉用户对语音输出的反馈模式(如重复修改、明确指令或隐式偏好),在检测到2次以上一致信号后确认偏好设定,避免过早固化错误假设。
核心用法:该 Skill 维护四个配置维度——Voice(指定 TTS 引擎与声线,如"openai: tts-1-hd")、Style(沟通风格特质,如"casual"或"professional")、Spoken Text(输出格式规则,如"avoid emojis")、Avoid(明确排斥的元素)。配置采用延迟写入策略,空字段表示尚未建立可靠偏好。
显著优点:① 零配置启动,降低初期使用门槛;② 镜像学习机制使 AI 语音风格自然贴近用户习惯;③ 模块化设计兼容多平台(Linux/macOS/Windows),与 config.md 中的 TTS 基础设施解耦。
潜在局限:依赖用户反馈信号的质量与频次,沉默用户可能长期无法触发偏好学习;未内置冲突解决机制,若用户前后偏好矛盾需人工介入;"ultra-compact"存储格式限制了复杂规则的表达能力。
适合人群:高频使用语音交互、对 AI 语音人格化有明确偏好的重度用户;需要统一多场景语音风格的团队管理员。
常规风险:TTS 配置可能含敏感服务商 API 密钥(需参考 config.md),存储文件若未加密存在凭证泄露风险;自动学习的偏好可能被 prompt 注入攻击恶意操纵。