核心用法
小米MiMo TTS是一款集成多语言、多方言、多情感的中文语音合成工具,通过Shell/NodeJS/Python三种实现方式提供灵活的语音生成能力。
基础调用:
./scripts/mimo-tts.sh "文本内容" [输出文件.ogg]
风格控制:使用<style>标签</style>前缀指定风格,支持情感(开心、悲伤、紧张、愤怒、惊讶、温柔)、方言(东北话、四川话、台湾腔、粤语、河南话)、效果(悄悄话、夹子音、唱歌)及语速调节。细粒度情感可通过()插入文本,如"(紧张,深呼吸)"。
智能模式:mimo-tts-smart.sh自动分析文本内容选择合适风格,基于关键词启发式检测,适合快速原型与交互场景。
Agent主动决策:系统要求Agent根据对话场景主动判断——好消息用"开心",坏消息用"温柔/悲伤",诗词朗读用"温柔+慢速",私密内容用"悄悄话"。
显著优点
- 维度丰富:情感×方言×效果的三维控制,远超常规TTS单一音色选择
- 中文优化:对中文诗词、口语化表达、方言特征有专门适配
- 实现灵活:统一入口自动选择NodeJS/Python/Shell最佳实现
- Agent原生设计:明确将风格选择作为Agent职责,非被动工具
- 细粒度控制:文本内嵌情感标签支持动态情绪变化
潜在局限
- 智能模式精度:文档明确说明智能模式"非高精度",基于启发式而非语义理解
- 生产适用性:建议关键场景显式使用style标签,智能模式不宜用于自动化流水线
- 输出格式限制:默认ogg格式,需外部转换用于其他场景
- API依赖:需MIMO_API_KEY,服务可用性受小米官方制约
适合人群
- 需要中文多风格语音的内容创作者
- 构建语音交互Agent的开发者
- 方言内容制作与本地化团队
- 快速原型验证场景
常规风险
- API密钥泄露:脚本需MIMO_API_KEY环境变量,存在密钥管理风险
- 风格误判:智能模式可能误识别情感或方言,关键场景需人工复核
- 版权与合规:合成语音的内容版权及方言使用的文化敏感性需注意
- 服务稳定性:依赖小米第三方API,存在服务变更或限流可能