核心用法
小米 MiMo TTS 技能提供基于 mimo-v2-tts 的语音合成服务,支持通过 shell/NodeJS/Python 脚本调用。基础用法为直接传入文本生成语音文件;进阶用法支持 <style> 标签(如开心、悲伤、东北话、悄悄话等)和括号情感标签(如(紧张,深呼吸))进行细粒度控制。
智能版本 mimo-tts-smart.sh 为推荐入口,可自动检测运行环境并选择 NodeJS/Python/Shell 最佳实现,通过关键词分析自动匹配合适的情感、方言与语速,无需手动标注。
显著优点
- 多语言实现:提供 Shell/NodeJS/Python 三种实现,兼容性覆盖主流环境
- 智能场景感知:自动识别文本情感、方言特征、诗词格式,降低使用门槛
- 丰富表达能力:支持 6 种情感、5 种方言、3 种特殊效果及语速调节
- 统一入口设计:
mimo-tts-smart.sh自动路由最佳实现,体验一致
潜在缺点与局限性
- 依赖外部 API:需配置 MIMO_API_KEY,服务可用性受小米平台制约
- 网络依赖:语音合成需联网调用,离线场景无法使用
- 方言/情感覆盖有限:预设标签固定,无法自定义新音色或细调参数
- 输出格式限制:文档未明确支持格式,需实际测试确认兼容性
适合人群
- 需要为 Agent 添加中文语音交互能力的开发者
- 内容创作者(有声书、播客、视频配音)
- 多语言客服系统、教育类应用开发者
- 对方言、情感表达有特定需求的本地化项目
常规风险
- API 密钥泄露风险:MIMO_API_KEY 需妥善保管,避免硬编码在公共仓库
- 成本不可控:未提及免费额度或计费策略,高频调用可能产生费用
- 内容合规风险:合成语音可能被用于诈骗等场景,需结合使用场景评估
- 服务稳定性:作为第三方云服务,存在接口变更或下线可能