Deep Scraper + Amazon

🕸️ 智能穿透反爬的电商与社媒数据采集器

企业级容器化爬虫引擎,基于Crawlee+Playwright穿透反爬,专精亚马逊电商数据与YouTube字幕抓取,支持畅销榜/搜索/详情三模式智能识别。

收藏
7.2k
安装
1.5k
版本
1.0.0
CLS 安全性认证2026-07-13
点击查看完整报告 >

使用说明

Deep Scraper 综合评估

核心用法

Deep Scraper 是一款基于 Docker 容器化架构的高性能网页爬取工具,采用 Crawlee 框架与 Playwright 浏览器自动化引擎,专为穿透现代反爬机制而设计。系统内置三大智能识别模式:Amazon 电商模式YouTube 字幕模式通用网页模式,可根据 URL 特征或用户关键词自动切换,无需手动配置。

在 Amazon 场景下,工具能精准识别四种页面类型——畅销榜(Best Sellers)、新品榜(New Releases)、飙升榜(Movers & Shakers)及搜索结果页,自动提取 ASIN、价格、评分、评论数、月销量(boughtPastMonth)等关键字段。特别值得注意的是,月销量数据仅存在于搜索页和产品详情页,畅销榜页面不提供此字段,系统会在用户同时需要排名与销量时建议组合爬取策略。

YouTube 模式通过拦截网络请求捕获 timedtext 字幕 API,模拟点击"展开描述"和"转录稿"按钮,输出结构化字幕或描述文本。通用模式则适用于任意非目标网站,提取 document.body.innerText 纯文本内容,自动去噪并限制 10000 字符输出上限。

显著优点

1. 反爬对抗能力强:每次请求清除 Cookie、Docker 沙箱隔离指纹、Playwright 模拟真实浏览器行为,配合自动滚动加载与最多 2 次重试机制,显著降低被封禁概率。
2. 多场景智能路由:内置决策树自动识别用户意图,支持从模糊需求(如"帮我看看亚马逊 XX 品类")自动构造目标 URL,降低使用门槛。

3. 电商数据专精:针对亚马逊生态深度优化,理解 BSR、ASIN、选品分析等行业术语,输出标准化 JSON 便于后续 BI 分析。

4. 容器化交付:Docker 镜像一次构建处处运行,环境一致性有保障,易于集成至 CI/CD 或 Serverless 架构。

潜在缺点与局限性

  • 冷启动开销:Docker 容器启动约 10 秒,不适合毫秒级响应场景。
  • 单页容量限制:Amazon 单页最多提取 30-50 个产品,大规模爬取需分页循环,增加总耗时。
  • 认证壁垒:不支持需要登录的页面(如买家账户、会员专区),遇到反爬升级可能需人工介入调整策略。
  • 字符截断:通用模式 10000 字符上限可能导致长文网页信息丢失。
  • 法律合规风险:爬虫行为需遵守目标网站 robots.txt 及当地数据保护法规(如 GDPR),高频爬取可能触发法律纠纷。

适合人群

  • 跨境电商卖家/选品分析师:需监控竞品价格、销量趋势、评论情感
  • 市场研究人员:进行品类机会分析、爆款识别、价格带分布研究
  • 内容创作者/译者:批量获取 YouTube 视频字幕用于二次创作或翻译
  • 数据工程师:需要标准化、可编程的网页数据源接入 ETL 流程

常规风险

| 风险类型 | 说明 | 缓释建议 |
|---------|------|---------|
| 账号封禁 | 目标网站 IP/账号限制 | 控制请求频率,使用代理池轮换 |
| 数据结构变更 | 亚马逊前端改版导致字段缺失 | 建立字段缺失告警,及时更新选择器 |
| 法律合规 | 违反网站 ToS 或数据法规 | 咨询法务,优先使用官方 API |
| 数据时效性 | 爬取结果非实时,存在延迟 | 标注数据采集时间,避免决策滞后 |

安全解读

核心用法

Deep Scraper 是一款基于 Docker + Crawlee + Playwright 的容器化网页爬虫工具,内置三种智能模式自动识别:

1. Amazon模式 (amazon_handler.js): 自动识别畅销榜(/zgbs/)、新品榜(/zg/new-releases/)、飙升榜(/zg/movers-and-shakers/)、搜索页(/s?k=)、产品详情页(/dp/),可抓取排名、ASIN、价格、评分、评论数、月销量(boughtPastMonth)等字段。关键规则: 畅销榜无月销量数据,需用搜索页或详情页获取。

2. YouTube模式 (main_handler.js): 拦截 timedtext API 捕获字幕,支持转录稿提取。

3. 通用模式 (main_handler.js): 非Amazon/YouTube网址,提取页面纯文本(上限10000字符)。

显著优点

  • 反爬能力强:清除Cookie、Docker沙箱隔离、模拟真实浏览器行为、自动滚动加载
  • 开箱即用:支持多页爬取(--pages)、JSON结构化输出
  • 选品场景深度优化:自动构造Amazon各类URL,智能判断数据获取策略

潜在局限

  • 通用模式输出上限10000字符
  • Amazon单页约30-50个产品
  • 不支持需登录页面
  • Docker冷启动约10秒
  • 个人开发者维护(T3来源),长期更新频率不确定

适合人群

  • 亚马逊卖家/选品分析师:竞品调研、类目分析、销量追踪
  • 市场研究人员:爆款挖掘、价格带分析、review情感分析
  • 内容创作者:YouTube视频字幕提取、竞品内容调研
  • 数据分析师:需要结构化网页数据的自动化采集场景

常规风险

  • 合规风险: 需遵守目标网站ToS和robots.txt,避免高频请求导致IP封禁
  • Docker安全: 使用--no-sandbox运行Playwright,建议以非root用户运行容器
  • 数据准确性: 依赖Amazon/YouTube页面结构,网站改版可能导致解析失败
  • 法律边界: 仅采集公开数据,禁止爬取个人隐私或需授权内容

Deep Scraper + Amazon 内容

assets文件夹
手动下载zip · 11.6 kB
amazon_handler.jstext/javascript
请选择文件