核心用法
Voice Memo 技能将文本转化为 ElevenLabs 生成的 AI 语音,并以原生 iMessage 语音气泡形式发送(非文件附件)。用户只需提供文本内容和接收方手机号,系统自动完成 TTS 生成、音频格式转换(Opus CAF @ 24kHz)和 BlueBubbles 推送。
关键配置:
- 依赖 BlueBubbles 本地服务 + Private API 模式
- 默认使用 ElevenLabs「Rachel」语音(Turbo v2.5 模型)
- 支持情绪标签如
[laughs]、[excited]增强表现力 - 成本约 $0.04/30秒消息
双向流程:
- 发送:文本 → ElevenLabs TTS → CAF 转换 → 原生语音气泡
- 接收:BlueBubbles 自动转 MP3 → Whisper 转录 → 进入对话上下文
显著优点
1. 原生体验:接收方看到标准 iMessage 语音波形 UI,非突兀的文件附件
2. 高保真语音:ElevenLabs Turbo v2.5 模型提供接近真人的自然度
3. 情绪可控:通过标签指令调节语气和表现力
4. 双向闭环:接收语音自动转录并融入上下文,形成完整对话流
潜在局限
1. 平台锁定:仅限 macOS(需 afconvert),且接收方必须是苹果用户
2. 基础设施依赖:需本地运行 BlueBubbles 并开启 Private API,配置门槛较高
3. 成本累积:ElevenLabs 按字符计费,高频使用需考虑成本
4. 单点故障:BlueBubbles 稳定性直接影响发送成功率
适合人群
- 需要向 iPhone 用户发送语音通知/提醒的自动化场景
- 希望用语音增强故事讲述或摘要表达力的内容创作者
- 已部署 BlueBubbles 基础设施的苹果生态深度用户
常规风险
- 凭证暴露:
ELEVENLABS_API_KEY和BLUEBUBBLES_PASSWORD需存储于本地环境变量,存在本地文件泄露风险 - API 超时:
chatGuid格式错误(必须用any;-;+PHONE而非iMessage;-;)会导致发送失败 - 隐私边界:接收的语音转录默认进入对话上下文,需显式指令才不保留