Reddit Spy

🕵️ 隐身采集 Reddit 情报,多层备份永不掉线

多层级隐身抓取 Reddit 数据,从实时 API 到 Tor/归档备份,支持子版块情报分析、用户画像与内容策略提取。

收藏
3.3k
安装
1.1k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Reddit Spy 是一款专为竞争情报设计的 Reddit 数据采集工具,通过五级回退架构(OAuth API → Tor SOCKS5 → Stealth HTTP → 浏览器隐身 → PullPush 归档)实现高可用性抓取。主要功能包括:

  • `spy`:综合子版块扫描,输出关于信息、热门帖、内容类型分布、钩子模式、发布时间分析
  • `deep-read`:完整帖文与嵌套评论的深度提取,支持指定递归深度
  • `bulk-scan`:多子版块批量扫描与横向对比
  • `strategy`:内容策略模式提取(标题类型、钩子模式、最佳发布时间)
  • `search`:关键词子版块内搜索
  • `user-intel`:用户发帖行为画像与跨版块分析
  • `health-check`:分层健康状态检测

显著优点

1. 多层级容错:实时数据优先,归档数据保底,Tor 自动轮换 IP 规避封禁
2. 策略洞察:自动分析内容类型(how-to/showcase/question 等)、标题钩子模式、最佳发布时段

3. 纯读取设计:零交互风险,无发帖/评论/投票行为

4. 结构化输出:所有命令返回 JSON,便于自动化集成

潜在缺点与局限

  • Tor 依赖:主链路依赖 Tor 网络,延迟与稳定性受 Tor 节点影响
  • 数据时效性:PullPush 归档层数据可能滞后数周至数月
  • VPS 限制:Stealth HTTP 与浏览器层在部分云 VPS IP 上被 Reddit 拦截
  • 速率限制:即使有 OAuth,仍受 60 请求/分钟限制
  • 法律灰色地带:大规模抓取可能违反 Reddit ToS,Tor 使用在某些场景下引发合规顾虑

适合人群

  • 增长黑客与内容营销人员研究竞品社区策略
  • 独立开发者分析 IndieHackers/SaaS 等垂直社区趋势
  • 市场研究员进行社媒情报(OSINT)采集
  • 需规避 IP 封禁的数据采集工程师

常规风险

| 风险类型 | 说明 |
|---------|------|
| 平台封禁 | Reddit 可能封禁 Tor 出口节点或检测到异常流量模式 |
| 数据合规 | 抓取用户生成内容可能涉及 GDPR/CCPA 等隐私法规 |
| 网络延迟 | Tor 路由增加 200-500ms 典型延迟 |
| 归档滞后 | PullPush 数据非实时,关键决策需交叉验证 |
| 依赖维护 | Tor systemd 服务需手动监控,故障时自动降级但性能下降 |

建议生产环境搭配健康检查命令前置执行,并设置监控告警 Tor 服务状态。

Reddit Spy 内容

scripts文件夹
lib文件夹
手动下载zip · 21.4 kB
__init__.pytext/plain
请选择文件