Gemini Assistant

🤖 Gemini 驱动的智能语音助手

基于 Google Gemini API 的通用 AI 助手,支持文本与语音双模态交互,适用于日常问答、对话及通用任务处理。

收藏
3k
安装
1.1k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Gemini Assistant 是一款集成 Google Gemini 系列模型的通用 AI 助手技能,采用本地 Python 脚本调用模式运行。用户可通过命令行触发文本或语音交互:文本模式直接传入问题字符串,语音模式需指定 --audio 参数并可选配上下文提示。响应以 JSON 格式返回,包含文本内容字段 text 及可选的语音文件路径 message(以 [[audio_as_voice]] 标记)。

显著优点

1. 原生多模态支持:默认搭载 gemini-2.5-flash-native-audio-preview-12-2025 模型,实现语音输入、语音合成的端到端处理,无需额外 TTS/STT 服务;
2. 部署轻量:仅需 FFmpeg 及 Python 依赖库(google-genai、soundfile、librosa 等),无复杂容器化要求;

3. 响应速度快:Gemini Flash 系列模型针对低延迟优化,适合实时交互场景;

4. 配置灵活:支持环境变量或 .env 文件管理 API 密钥,系统指令可自定义以适配个性化需求。

潜在缺点与局限性

  • 模型版本锁定风险:预览版模型(native-audio-preview)可能面临 API 变更或下线,需持续关注 Google 官方更新;
  • 音频格式依赖:输入音频需为 OGG 格式,虽依赖 FFmpeg 转码,但对非标准音频仍存在兼容性边界;
  • 本地化运维负担:API 密钥与模型配置分散于环境变量或源码修改,缺乏集中式配置管理能力;
  • 网络依赖性强:所有推理均通过 Google 云端 API 完成,离线场景不可用,且存在数据跨境传输合规考量。

适合人群

  • 需要快速搭建语音交互原型的开发者与极客用户;
  • 已具备 Google Cloud/Gemini API 使用经验的技术团队;
  • 对响应延迟敏感、追求轻量级部署的个人助理场景用户。

常规风险

  • API 密钥泄露.env 文件或环境变量若权限配置不当,可能导致密钥被本地进程或日志窃取;
  • 音频文件残留:临时语音文件 /tmp/gemini_voice_xxx.ogg 若未自动清理,存在隐私数据残留风险;
  • 依赖供应链风险google-genai 等库的快速迭代可能引入破坏性变更,建议锁定版本号。

Gemini Assistant 内容

scripts文件夹
手动下载zip · 5.3 kB
handler.pytext/plain
请选择文件