Deep Research (Gemini)

🔬 Gemini 驱动的深度研究与 RAG 检索工具

research榜 #12

通过 Gemini Interactions API 执行深度研究,支持本地文件 RAG 检索、成本预估、结构化 JSON 输出,兼容 30+ AI 代理包括 Claude Code、Amp、Codex 等。

收藏
11.7k
安装
3.1k
版本
2.0.2
CLS 安全性认证2026-07-09
点击查看完整报告 >

使用说明

核心用法

Deep Research Skill 是一个基于 Google Gemini 深度研究代理的异步研究工具,无需安装 Gemini CLI,仅通过 uv 运行 Python 脚本即可。核心功能包括:

1. 深度研究执行research.py start "研究问题" 启动异步研究,支持自定义报告格式(executive_summary/detailed_report/comprehensive)、研究深度(quick/standard/deep)、输出格式(md/html/pdf)。

2. RAG 本地文件检索:通过 --context PATH 自动上传本地文件到 Google 临时文件搜索存储,实现基于自有文档的检索增强生成研究。文件按 MIME 类型过滤,二进制文件被拒绝,研究完成后自动清理临时存储。

3. 成本预估与预算控制--dry-run 可预览预估成本(JSON 格式),--max-cost USD 设置成本上限自动中止。

4. 结构化输出--output-dir 生成包含完整报告、元数据、交互数据、引用来源的结构化目录,适合 AI 代理集成。

5. 自适应轮询:基于历史研究完成时间的智能轮询策略,或固定间隔曲线,自动等待研究完成。

6. 文件搜索存储管理store.py 子命令创建、列出、查询、删除文件搜索存储,支持智能同步上传(--smart-sync 基于哈希跳过未更改文件)。

显著优点

  • 广泛兼容性:支持 30+ AI 代理(Claude Code、Amp、Codex、Gemini CLI 等),纯异步 API 设计,无需 CLI 依赖。
  • 安全透明:API 密钥仅通过环境变量读取,绝不记录或写入文件;代码完全可读(PEP 723 内联元数据),无二进制混淆、无遥测。
  • 灵活输出:双输出模式——stderr 富格式人类可读输出,stdout 机器可读 JSON,便于脚本集成。
  • 智能成本控制:预估成本、实际成本追踪、预算上限三重保护。
  • 非交互式友好:自动检测 TTY,无确认提示挂起,适合 CI/代理自动化。

潜在缺点与局限性

  • 成本不可完全精确:预估为启发式计算,Gemini API 不返回实际 token 计数,可能与实际账单有偏差。
  • PDF 输出依赖:需额外安装 weasyprint 库。
  • 文件大小限制:单个文件 100MB 上限,36 种原生 MIME 类型,其他文件通过 text/plain 回退处理。
  • 网络依赖:必须能访问 Google Gemini API,国内用户需考虑网络连通性。
  • 代理风险:非交互模式下,具有文件系统访问权限的自主代理可能触发非预期的文件上传,需通过路径限制或 --dry-run 防范。

适合人群

  • 需要深度研究报告的开发者、研究员、技术写作者
  • 希望在 AI 工作流中集成自动化研究能力的 AI 代理用户
  • 需要基于私有代码库/文档进行 RAG 检索分析的团队
  • 追求成本可控、输出结构化、可脚本化的自动化研究流程的用户

常规风险

  • API 密钥泄露风险:虽然工具本身安全处理密钥,但用户需妥善保管环境变量,避免提交到版本控制。
  • 文件上传隐私--context 上传的文件暂存于 Google 云端,虽为临时存储且自动清理,但敏感数据仍需谨慎评估。
  • 长时间运行任务:深度研究可能耗时 15-45 分钟,需合理设置 --timeout
  • 成本累积:未设置 --max-cost 时,复杂研究可能产生意外费用。

安全解读

核心用法

Deep Research Skill 是一个基于 Google Gemini 深度研究代理的异步研究工具,专为 Claude Code、Amp、Codex 等 30+ AI Agent 设计。核心功能包括:

  • 异步深度研究:通过 uv run research.py start "问题" 启动,支持自适应轮询等待结果
  • RAG 本地文档检索--context 参数可将本地文件上传至 Google 临时文件搜索存储,实现基于文档的深度研究
  • 成本透明可控--dry-run 预览成本,--max-cost 设置上限,输出 JSON 格式费用估算
  • 多格式输出:支持 Markdown、HTML、PDF 报告,结构化目录输出便于 Agent 集成

显著优点

1. Agent 原生设计:双输出模式(stderr 人类可读、stdout JSON 机器可读),非 TTY 环境自动跳过确认提示
2. 安全透明:代码完全可审计(MIT 开源),PEP 723 内联元数据,无二进制混淆、无遥测收集

3. 智能轮询:历史自适应算法学习过往研究完成时间,动态调整轮询频率,节省 API 调用

4. 灵活工作流:支持持久化存储管理、增量上传(--smart-sync)、研究会话续传(--follow-up

潜在局限

  • 第三方云依赖:研究核心依赖 Google Gemini API,存在服务可用性与定价政策变动风险
  • 文件上传限制:单文件 100MB 上限,36 种 MIME 类型原生支持,二进制文件需转文本
  • 成本不可精确预估:API 不返回 token 计费数据,费用估算基于启发式算法
  • 个人开发者维护:T3 来源级别,虽开源规范但缺乏企业级 SLA 保障

适合人群

  • AI Agent 开发者:需要结构化研究输出与 JSON API 的自动化工作流
  • 技术写作者:需基于代码库生成深度技术报告
  • 研发团队:进行代码库智能检索与架构分析
  • 成本敏感用户:需研究前成本预估与预算控制

常规风险

  • 凭证泄露:API 密钥从环境变量读取,需妥善保护 GOOGLE_API_KEY 等变量
  • 意外文件上传--context 可能上传敏感文件,建议配合 --dry-run 预览
  • 供应链安全:缺乏依赖锁定文件,建议添加 uv.lock 并定期审计 CVE

Deep Research (Gemini) 内容

docs文件夹
examples文件夹
references文件夹
scripts文件夹
tests文件夹
手动下载zip · 97.8 kB
event-sourcing-patterns.mdtext/markdown
请选择文件