Read, Search & Extract Web Pages by Dokobot

🌐 真实浏览器驱动 · 动态网页抓取专家

通过真实Chrome浏览器读取任意网页内容,支持SPA、动态渲染站点及登录态页面,提供本地免费与云端API双模式。适用于需要完整JavaScript渲染的网页抓取、搜索及多语言内容提取。

收藏
5.4k
安装
1.5k
版本
2.3.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Dokobot 是一款基于真实 Chrome 浏览器的网页内容提取工具,区别于传统 headless 爬虫,它能完整渲染 JavaScript 动态页面,支持单页应用(SPA)、需登录态的站点以及反爬虫机制复杂的平台。

双模式架构:

  • 本地模式(--local):免费无限量,通过本地桥接(dokobot install-bridge)直接操控用户打开的 Chrome 浏览器,无需 API Key
  • 远程模式:通过云端 API 访问其他机器的浏览器,需配置 DOKO_API_KEY 并在扩展中启用远程控制

核心命令:

  • dokobot doko read <url>:读取并提取网页文本内容
  • dokobot doko search <query>:执行联网搜索
  • dokobot doko list:列出已连接设备
  • dokobot doko close-session <id>:关闭活跃会话

会话连续性:长页面支持分页续读,通过 sessionId--screens 参数实现

显著优点

1. 真实浏览器渲染:突破 headless 工具限制,完美处理 React/Vue/Angular 等现代前端框架构建的 SPA
2. 登录态继承:可直接读取用户已登录的社交媒体、付费内容平台(Twitter/X、LinkedIn、微信公众号、知乎、B站等)

3. 反检测能力强:使用真实 Chrome 实例,规避多数 bot 检测机制

4. 多语言原生支持:内置网页翻译、文章总结、内容提取能力

5. 零数据外泄:本地模式下数据完全在用户设备闭环流转

潜在缺点与局限性

  • 环境依赖重:必须安装 Chrome 浏览器、扩展程序及 Node.js CLI 工具链,配置门槛较高
  • 并发受限:官方建议最多 5 个并发请求,大规模抓取效率受限
  • 平台锁定:生态封闭,依赖 Dokobot 官方维护的浏览器扩展和 CLI
  • 远程模式成本:API Key 模式可能涉及付费配额(文档未明确免费额度)
  • 仅限读取:设计为只读工具,不支持表单提交、点击交互等自动化操作

适合人群

  • 需要抓取动态渲染内容的研究人员与数据分析师
  • 需访问登录态内容的社交媒体运营、竞品分析从业者
  • headless 工具失效时的应急网页抓取场景
  • 对数据隐私敏感、偏好本地处理的个人用户

常规风险

| 风险类型 | 说明 | 缓解措施 |
|---------|------|---------|
| 凭证泄露 | `DOKO_API_KEY` 若硬编码或误提交存在泄露风险 | 使用环境变量,遵循 CLI 的 `dokobot config` 配置流程 |
| 浏览器安全 | 扩展程序需较高权限操控 Chrome | 仅从官方渠道安装,定期检查扩展权限 |
| 服务可用性 | 依赖 Dokobot 云端基础设施(远程模式) | 关键任务优先使用本地模式 |
| 速率限制 | 目标网站可能封禁异常流量 | 控制并发数,尊重 `robots.txt` |
| 法律合规 | 抓取受保护内容可能违反平台 ToS | 仅抓取公开授权内容,遵守当地数据法规 |

Read, Search & Extract Web Pages by Dokobot 内容

手动下载zip · 2.7 kB
SKILL.mdtext/markdown
请选择文件