Facebook Scraper

📘 浏览器级 Facebook 数据采集专家

基于 Playwright 的浏览器级 Facebook 页面/群组抓取工具,支持反检测、住宅代理和断点续传,无需 API 密钥即可采集公开商业数据。

收藏
6.5k
安装
2k
版本
0.1.1
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

本技能提供两阶段 Facebook 数据采集系统:Discovery(发现)Scraping(抓取)。发现阶段通过 Google Custom Search API 按地理位置与类别检索目标页面/群组;抓取阶段使用 Playwright 启动真实 Chromium 浏览器,模拟人类行为完成登录、导航与数据提取。

Agent 接口示例

  • discover --location "Miami" --category "restaurant" --type page --output json
  • scrape --page-name examplebusiness --output json

支持 JSON/CSV 双格式导出,自动下载缩略图,并按 nano/micro/mid/macro/mega 五档标签分类账号规模。

显著优点

1. 零 API 密钥依赖:无需 Facebook Graph API 权限,直接通过浏览器访问公开数据,降低合规门槛。
2. 企业级反检测:内置浏览器指纹随机化、行为模拟(鼠标轨迹、滚动延迟)及 stealth 脚本,规避平台风控。

3. 生产级稳定性:断点续传机制、自动过滤私人群组/低活跃账号、会话级住宅代理粘性会话,支持小时级长时任务。

4. 灵活代理生态:预集成 Bright Data、IProyal、Storm Proxies、NetNut 四家主流住宅代理,支持环境变量一键配置与 Geo-Targeting。

潜在缺点与局限性

  • 法律与 ToS 风险:抓取 Facebook 数据违反平台《服务条款》,存在账号封禁或法律追责可能;商业用途需评估数据隐私法规(GDPR/CCPA)。
  • 结构脆弱性:依赖 DOM 选择器,Facebook 前端改版将导致抓取失效,需持续维护。
  • 功能边界:无法抓取私人群组、好友关系链或需特殊权限的内容;Google API 配额与代理成本构成隐性开支。
  • 性能瓶颈:单浏览器实例串行处理,大规模并发需配合代理池与多账号轮换。

适合人群

  • 市场研究员:批量采集竞品商业页面、粉丝规模与互动数据。
  • 本地服务聚合商:构建地域化商家目录(餐饮、健身、房产)。
  • 社媒运营工具开发者:需非官方数据源补充官方 API 盲区。

常规风险

| 风险类型 | 说明 |
|---------|------|
| 账号/IP 封禁 | 即使使用住宅代理,高频请求仍可能触发风控 |
| 数据准确性 | 动态加载内容可能因网络延迟导致抓取不完整 |
| 代理泄露 | 硬编码凭证或日志未脱敏可能暴露代理凭据 |
| 合规争议 | 抓取用户生成内容需获得合法授权或符合合理使用原则 |

Facebook Scraper 内容

手动下载zip · 5.1 kB
SKILL.mdtext/markdown
请选择文件