Deep Research 技能评估
核心用法
Deep Research 是一个通过 Google Gemini Interactions API 实现异步深度研究的通用技能,无需安装 Gemini CLI。它提供完整的 RAG(检索增强生成)工作流:将本地文件上传至 Gemini 的临时文件搜索存储,基于文档内容进行深度研究,并以 Markdown、HTML 或 PDF 格式输出结构化报告。
主要命令包括:research.py start 启动研究(支持 --context 上传文件、--dry-run 成本预估、--output 阻塞等待结果)、status 检查进度、report 获取最终报告。配套工具涵盖 store.py(管理文件搜索存储)、upload.py(上传文档)和 state.py(会话状态管理)。
显著优点
1. Agent 原生设计:为非 TTY 环境自动跳过确认提示,输出 JSON 到 stdout、富格式到 stderr 的双通道设计,便于 AI 代理解析。
2. 智能轮询机制:历史自适应轮询根据过往研究完成时间动态调整查询频率,减少 API 调用同时保证响应速度。
3. 安全透明:API 密钥仅通过环境变量读取,绝不记录或外传;敏感文件(.env、密钥、token)自动排除上传;所有代码为可读 Python,无混淆或遥测。
4. 成本可控:--dry-run 预估费用,--max-cost 硬上限,研究完成后 metadata.json 包含实际成本估算。
5. 生态兼容:明确支持 Claude Code、Amp、Codex、Gemini CLI 等 30+ AI 代理。
潜在局限
- 阻塞模式风险:
--output或--output-dir会阻塞至研究完成(通常 2-45 分钟),脚本警告勿用&后台运行,但在 CI/Agent 场景中需合理设置--timeout。 - 成本估算为启发式:基于输出大小和时长推算,非 Gemini API 返回的实际计费数据,存在偏差可能。
- 文件上传限制:单文件 100MB,36 种 MIME 类型原生支持,二进制文件被拒绝。
- 环境依赖:需
uv运行时和有效 Google API 密钥,对网络环境有要求。
适合人群
- AI 代理/自动化工作流开发者
- 需要 RAG 增强研究的开发者、技术写作者、安全审计人员
- 希望在 Claude Code、Cursor 等环境中集成 Gemini 深度研究能力的用户
常规风险
- 凭证泄露:需妥善保管
GOOGLE_API_KEY等环境变量,避免提交到版本控制。 - 非交互模式安全隐患:Agent 拥有文件系统访问权限时,可能自动触发
--context上传,建议配合--dry-run审核或限制 Agent 路径权限。 - 临时存储残留:默认自动清理,但
--keep-context或崩溃可能导致文件留存,需定期state.py gc清理。