核心功能
Xiaomi MiMo TTS 是基于小米 MiMo-v2-TTS 模型的语音合成工具,提供多维度声音风格控制能力。核心特性包括:
风格控制体系
- 情感维度:开心、悲伤、紧张、愤怒、惊讶、温柔等 6 种基础情绪
- 方言支持:东北话、四川话、台湾腔、粤语、河南话等 5 种地方口音
- 特殊效果:悄悄话、夹子音、唱歌、语速调节(快/慢)
- 细粒度标签:通过
()语法插入动作提示如「(紧张,深呼吸)」
使用方式
提供基础版与智能版双模式:基础版需手动添加 <style>标签</style> 控制风格;智能版通过启发式算法自动识别文本情感与场景,自动匹配最优风格参数。支持 Shell、NodeJS、Python 三种运行时环境。
显著优点
1. 中文 TTS 领域少有的细粒度情感+方言双重控制能力
2. 智能模式降低使用门槛,适合快速原型与非技术用户
3. 多语言运行时覆盖,便于集成至不同技术栈
4. 开源脚本形态,无商业 SDK 依赖
局限与风险
- 依赖外部 API:需申请 MIMO_API_KEY,服务可用性受小米云服务制约
- 智能模式精度有限:文档明确说明智能模式为「快速试验」设计,非高精度场景需手动指定风格
- 方言覆盖不全:仅 5 种方言,无法满足全国区域需求
- 语音选项较少:仅 3 种基础音色,不支持自定义声线克隆
- 输出格式:示例显示为 OGG 格式,需注意下游兼容性
适合人群
内容创作者(有声书、短视频配音)、开发者快速原型、方言内容实验、情感化人机交互原型设计。不适合对语音质量有严苛要求的商业生产环境,或需要高度定制化声线的专业配音场景。
安全建议
API Key 需妥善保管,避免硬编码;敏感内容生成需遵守小米云服务条款;智能模式的自动判断存在语义偏差风险,关键场景务必人工校验。