Tinyfish

🐟 搜索·抓取·自动化,四层工具链

TinyFish CLI 提供搜索、页面抓取、AI 智能体交互与浏览器自动化能力,适合需要实时网络数据与结构化提取的研究场景。

收藏
21k
安装
4.2k
版本
1.0.6
CLS 安全性认证2026-07-13
点击查看完整报告 >

使用说明

核心用法

TinyFish 是一套四层递进的网络工具套件,按复杂度从轻到重分为 search → fetch → agent → browser

  • search:快速获取搜索结果(标题、URL、摘要),适合发现信息源
  • fetch:并行抓取多页面,自动清洗广告与导航,输出 Markdown/JSON 结构化内容
  • agent:自然语言驱动的浏览器自动化,支持点击、填表、分页、JSON 结构化提取
  • browser:原始 CDP 会话,供 Playwright/Puppeteer 完全控制

典型工作流
1. 研究型任务:search 找来源 → fetch 读全文

2. 动态提取:search 定位站点 → agent 交互并提取结构化数据

3. 对抗性场景:fetch 失败(JS 渲染)→ 升级到 agent → 再升级到 browser

关键特性

  • 批量并行:单次 fetch 可处理多 URL;agent 支持 CSV 批量提交
  • 结构化输出:强制在 agent 指令中声明 JSON Schema,确保结果可用
  • 地理位置与语言:search 支持 --location--language 定向

显著优点

  • 分层设计合理:从轻到重的工具链避免过度消耗,成本与速度可控
  • 提取质量高:fetch 自动去噪,agent 可处理动态/登录态页面
  • 开发者友好:输出 JSON 为主,支持 --pretty 调试,CDP 兼容现有生态
  • 批处理能力:agent batch 模式适合大规模监控与竞品抓取

潜在缺点与局限性

  • 成本阶梯:agent 和 browser 显著慢于 search/fetch,高频调用需预算规划
  • 并发限制:大规模并行需依赖 batch 模式,单次 CLI 调用非真异步
  • 反爬对抗:未明确提及 CAPTCHA 或指纹绕过能力,极端场景可能降级
  • 依赖外部服务:需 API Key 认证,离线环境不可用

适合人群

  • 需要实时信源的研究者、分析师、记者
  • 构建竞品监控、价格追踪、SEO 采集的工程师
  • 希望用自然语言而非 XPath 提取数据的非技术用户
  • 已有 Playwright/Puppeteer 工作流、需云端浏览器池的团队

常规风险

  • 数据合规:抓取需遵守目标站点的 robots.txt 与服务条款,商业用途存在法律边界
  • API 密钥安全TINYFISH_API_KEY 若泄露可能导致配额滥用
  • 结果一致性:agent 依赖 LLM 理解页面结构,复杂布局可能出现提取遗漏
  • 成本失控:agent/browser 按时间或步骤计费,长会话或未设限的 batch 任务可能超支

安全解读

核心用法

use-tinyfish 是 TinyFish CLI 的完整使用指南,提供四层工具链应对不同 Web 信息需求:

| 层级 | 命令 | 适用场景 | 特点 |
|:---|:---|:---|:---|
| 搜索发现 | `tinyfish search query` | 找资料、查新闻、比价格、搜文档 | 最快最省 |
| 页面获取 | `tinyfish fetch content get` | 读全文、抓链接、提取元数据 | 并行多 URL,自动去广告 |
| 智能代理 | `tinyfish agent run` | 点击导航、填表登录、结构化抓取 | 自然语言目标,自动操作浏览器 |
| 原始控制 | `tinyfish browser session create` | CDP 级底层控制,复杂多步流程 | Playwright/Puppeteer 兼容 |

典型工作流:

  • 轻量研究:searchfetch 最佳结果
  • 深度提取:search 定位 → agent 自动化交互
  • 动态页面:fetch 失败后 escalate 到 agent

显著优点

1. 分层设计合理:从搜索到原始浏览器控制,按需升级,避免过度消耗
2. 输出格式灵活:支持 Markdown/JSON/HTML,含链接与图片提取选项

3. 并行效率高fetchagent batch 支持多 URL 并发处理

4. 自然语言驱动agent 模式用目标描述替代复杂脚本,降低使用门槛

5. 元数据完整:返回包含发布时间、作者、语言等结构化字段

潜在缺点与局限性

1. 成本梯度明显agentbrowser 模式响应慢、费用高,需精打细算
2. 外部依赖关键:功能完全依赖 TinyFish API,服务可用性即 Skill 可用性

3. 认证门槛:需 TINYFISH_API_KEY 或 OAuth 登录,增加配置复杂度

4. 异步管理负担agent --async 需自行轮询状态,批量任务需 CSV 预处理

5. 无本地回退:纯云端架构,无法离线或局域网场景使用

适合人群

  • 市场研究员:竞品价格监控、产品信息聚合
  • 内容运营者:批量采集文章、自动生成摘要
  • 数据工程师:结构化数据提取、网站自动化测试
  • 开发者:需要 CDP 级浏览器控制的复杂工作流

常规风险

  • API Key 泄露:环境变量配置不当可能导致密钥暴露
  • 自动化误操作agent/browser 模式可能意外提交表单或触发付费
  • 服务中断:TinyFish 平台故障将完全阻断功能
  • 合规边界:批量抓取需遵守目标网站 Robots.txt 和服务条款

---

安全认证显示该 Skill 为纯文档型,无执行代码,风险可控。

Tinyfish 内容

手动下载zip · 4.7 kB
skill-card.mdtext/markdown
请选择文件