核心用法
Xiaomi MiMo TTS 是一款基于小米自研 mimo-v2-tts 模型的语音合成工具,可通过自然语言指令直接生成语音。核心交互模式为"发语音 + 内容描述",支持零代码快速调用与脚本化批量生产。
语音合成流程:
1. 基础调用:直接输入文本即可使用默认女声(default_zh)与夹子音风格输出
2. 音色选择:提供3种官方语音,涵盖中英文女声及通用默认音色
3. 风格控制:通过 <style> 标签实现语速、情感、角色、方言等多维度控制
4. 细粒度标注:使用 () 语法插入停顿、呼吸、音量变化等副语言特征
显著优点:
- 中文优化突出:针对中文韵律、方言(东北话、四川话、粤语等)深度调优
- 情感表达丰富:支持紧张、疲惫、苦笑等细腻情绪,超越传统TTS机械感
- 风格标签直观:自然语言描述即可控制,无需学习复杂参数
- 工程化完善:提供Bash/Python双版本脚本,支持WAV输出与base64编码
潜在缺点与局限性:
- 生态封闭性:仅限小米平台API,存在供应商锁定风险
- 音色选择有限:仅3种官方语音,不支持自定义声线克隆
- 英文支持薄弱:
default_eh为实验性英文女声,质量不及中文 - API依赖:必须配置
MIMO_API_KEY,离线场景不可用 - 标签语法约束:
<style>必须置于文本开头,括号标签需半角字符
适合人群:
- 中文内容创作者(短视频配音、有声书、播客)
- 需要方言或角色化语音的娱乐/教育应用开发者
- 追求"人声感"而非"广播感"的UI/UX设计师
常规风险:
- API密钥泄露:
MIMO_API_KEY需妥善保管,避免硬编码至版本控制 - 内容合规:合成语音需符合《深度合成管理规定》,禁止伪造他人声纹
- 服务稳定性:小米平台SLA未公开,生产环境需设计降级方案
- 音频版权:生成内容商用需确认平台授权条款更新