核心功能
TinyFish 提供四级递进式网页自动化能力:
1. search - 快速网页检索,返回标题、URL 和摘要
2. fetch - 并行获取多 URL 内容,自动清理广告和导航元素,输出 Markdown/HTML/JSON
3. agent - 自然语言驱动的浏览器自动化,支持点击、填表、导航和结构化数据提取
4. browser - 原始 CDP 浏览器会话,供 Playwright/Puppeteer 完全控制
显著优势
- 渐进式复杂度:按任务需求选择工具层级,避免过度消耗
- 自然语言交互:agent 模式用日常语言描述目标,降低自动化门槛
- 并行处理:fetch 和 agent 均支持批量操作,提升效率
- 结构化输出:内置 JSON/Markdown 格式化,便于下游处理
- 反爬适配:agent 使用真实浏览器,可处理动态渲染和基础防护
局限与风险
- 成本梯度:从 search 到 browser 成本递增,高频使用需预算规划
- 异步复杂性:agent 默认 SSE 流式输出,需正确解析 COMPLETE 事件
- 速率限制:批量操作时可能触发源站风控
- 依赖外部服务:需有效 API Key,网络中断即不可用
适用人群
- 数据分析师:快速提取竞品价格、新闻内容
- 产品经理:自动化市场调研和信息聚合
- 开发者:构建基于实时网页数据的 pipeline
- 研究人员:大规模文献和资料采集
安全考量
- API Key 需妥善管理,建议通过环境变量注入
- 遵守目标网站的 robots.txt 和服务条款
- 敏感数据提取需确认合规性
- 浏览器自动化可能留下可追踪的行为指纹