核心用法
Xiaomi MiMo TTS 是一款集成小米 MiMo-v2-TTS 模型的语音合成技能,通过 API 调用实现文本转语音。用户可直接输入 "发语音" 触发,或在文本中使用 <style> 标签和 () 音频标签实现精细化控制。支持中英文双语、多音色切换(mimo_default/default_zh/default_eh),并提供语速、情感、角色扮演、方言等风格参数。
显著优点
- 丰富的风格控制:支持夹子音、悄悄话、台湾腔等特色风格,以及东北话、四川话、粤语等方言
- 细粒度情感标签:通过括号标注实现紧张、疲惫、苦笑、咳嗽等细腻情感表达
- 低门槛调用:支持 Shell 脚本和 Python 两种使用方式,默认配置即开即用
- 唱歌功能:内置唱歌模式,拓展娱乐场景
- 输出格式友好:直接返回 base64 编码 WAV 音频,便于集成
潜在缺点与局限性
- 依赖外部 API:需注册并获取 MIMO_API_KEY,存在服务可用性风险
- 平台限制:目标文本必须位于 assistant 消息中,user 消息无法触发
- 标签语法严格:
<style>标签必须位于文本开头,学习成本较高 - 音色选择有限:目前仅提供 3 种预设语音,定制化空间受限
- 环境依赖:需要 curl、python3、ffmpeg 等本地工具链
适合人群
- 内容创作者(有声书、短视频配音)
- 开发者构建语音交互应用
- 需要方言或特色语音合成的本地化项目
- 虚拟主播、游戏 NPC 语音生成
常规风险
- API 密钥泄露:MIMO_API_KEY 以环境变量形式存储,需妥善保管
- 服务稳定性:依赖小米平台 API,存在限流或停机风险
- 内容合规:生成语音需遵守平台使用协议,避免违规内容合成
- 版权风险:角色模仿(如孙悟空、林黛玉)可能涉及版权边界