Twitter Scraper

🐦 零登录采集Twitter网红数据

基于浏览器的Twitter/X公开资料采集工具,支持Google/DuckDuckGo发现用户、Playwright模拟真人行为采集数据,无需登录即可获取粉丝、推文、互动等完整信息。

收藏
9.2k
安装
2.7k
版本
0.1.1
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Twitter/X Profile Scraper 采用双阶段架构:第一阶段通过 Google Custom Search API 或 DuckDuckGo 搜索发现目标用户,第二阶段使用 Playwright 浏览器引擎模拟真人行为采集公开资料。支持按地理位置(如 Miami、New York)和领域分类(如 tech、crypto)批量发现网红账号,自动过滤私密账户、低粉丝量(<500)及已停用账号。

采集数据涵盖:用户名、显示名称、简介、粉丝/关注数、推文数量、认证状态、头像、加入时间、网站链接、地理位置、影响力分级(nano 至 mega),以及最近推文(含互动数据、媒体下载)。输出格式支持 JSON/CSV,自动下载缩略图至本地目录。

显著优点

1. 零登录采集:无需 Twitter/X 账号,仅访问公开可见内容,规避账号封禁风险
2. 多层反检测机制:4 套轮换浏览器指纹(viewport、UA、时区、WebGL)、隐藏 navigator.webdriver、Canvas 噪声、插件/语言/硬件伪装、随机鼠标轨迹与滚动行为

3. 智能代理支持:内置 Bright Data、IProyal、Storm Proxies、NetNut 四大住宅代理服务商配置,支持 IP 轮换与会话保持(sticky session),成功率宣称 95%+

4. 断点续采:队列文件记录进度,支持中断后恢复,适合长时间大规模采集

5. 自动过滤与分级:按粉丝量自动划分 influencer 层级,跳过私密/停用/低活跃账户

潜在缺点与局限性

1. 法律与合规风险:抓取 Twitter/X 数据可能违反平台 Terms of Service,存在被平台追责或 IP 封禁可能(即使使用代理)
2. 数据完整性受限:仅限公开内容,私密账户、被保护推文、需登录查看的互动数据无法获取

3. 依赖平台 UI 稳定性:虽使用 data-testid 等相对稳定的属性,但 Twitter/X 频繁改版仍可能导致选择器失效

4. 代理成本:大规模采集需付费住宅代理,运行成本随数据量线性增长

5. 无实时数据:采集为离线快照,非实时流式数据

6. Google API 配额限制:使用 Google Custom Search 需申请 API Key 与 Search Engine ID,有每日查询配额

适合人群

  • 市场研究员与品牌方:分析网红影响力、监测竞品账号
  • 数据分析师:构建社交媒体数据集、情感分析训练数据
  • 创业者与投资人:发现特定领域(crypto、AI 等)新兴 KOL
  • 开发者:需集成 Twitter 公开数据至自有系统的技术团队

常规风险

| 风险类型 | 说明 |
|---------|------|
| **平台封禁** | Twitter/X 可能识别并封锁采集行为,导致 IP/代理被封 |
| **法律合规** | 需确保采集符合当地数据保护法规(GDPR、CCPA)及平台 ToS |
| **数据误用** | 公开数据再加工仍可能涉及隐私争议,建议匿名化处理 |
| **代理泄露** | 代理凭证配置于环境变量或配置文件,存在泄露风险 |
| **依赖安全** | Playwright、Python 依赖库需及时更新以修补安全漏洞 |

Twitter Scraper 内容

手动下载zip · 5.5 kB
SKILL.mdtext/markdown
请选择文件