核心用法
Gemini Voice Assistant 是一款调用 Google Gemini Live API 的语音-语音 AI 助手。用户可通过两种模式与其交互:
- 文本模式:直接输入文字提问,获取文本回复
- 语音模式:上传
.ogg音频文件,AI 以语音形式回应,返回音频文件路径
使用时需配置 GEMINI_API_KEY,支持环境变量或 .env 文件。默认采用 gemini-2.5-flash-native-audio-preview-12-2025 模型,原生支持音频输入输出。
显著优点
- 端到端语音能力:无需 ASR/TTS 中转,延迟更低、交互更自然
- Gemini Flash 速度:响应迅速,适合实时对话场景
- 灵活配置:系统指令可定制,模型版本可手动切换
- 双模态支持:同一接口兼顾语音与纯文本需求
潜在缺点与局限性
- API 依赖:需自备 Gemini API Key,存在额度与地区限制
- 音频格式限制:输入仅支持
.ogg,需 FFmpeg 转换其他格式 - 本地依赖较重:需 Python 环境及 numpy、librosa、soundfile 等库
- 无多轮会话管理:每次调用独立,不保留上下文(需自行实现)
- 预览模型风险:
native-audio-preview为预览版,接口可能变更
适合人群
- 需要快速搭建语音交互原型的开发者
- 希望体验 Gemini 原生音频能力的 AI 爱好者
- 对延迟敏感、追求端到端语音体验的用户
常规风险
- API 密钥泄露:
.env文件或环境变量若权限设置不当,存在密钥暴露风险 - 数据隐私:语音数据上传至 Google 服务器,需符合相关隐私条款
- 成本不可控:Gemini API 按调用计费,高频使用需注意额度消耗
- 模型迭代风险:预览版模型可能下线或行为变更,需关注官方公告