Reddit Archive

📥 Reddit 多媒体内容一键归档

开源 Reddit 内容存档工具,支持批量下载用户/子版块的图片、GIF 和视频,具备时间过滤与并行下载能力。

收藏
3.1k
安装
1.4k
版本
1.0.1
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Reddit Archive 是一款基于 Python 的命令行工具,用于系统性归档 Reddit 平台上的公开内容。用户可通过指定用户名 (-u) 或子版块名 (-s) 定向抓取帖子,支持图片(JPG/PNG/WebP)、GIF 及视频的多媒体下载。

关键功能特性:

  • 多维度筛选:提供 hot/new/rising/top/controversial 五种排序方式,配合时间过滤器(hour/day/week/month/year/all)精确定位内容
  • 日期范围控制:通过 --after--before 参数实现 YYYY-MM-DD 格式的时段限定
  • 智能并行下载:默认 4 个 worker 线程加速获取,配合 --skip-existing 避免重复下载
  • 多媒体支持:集成 yt-dlp 处理 GFYcat、RedGIFs、Imgur 等平台的视频/GIF 资源
  • 图库解析:自动提取 Reddit 原生图库(gallery)中的全部媒体文件

技术实现:直接调用 Reddit JSON API(非官方 OAuth 端点),通过 created_utc 时间戳参数实现服务端过滤,本地仅做文件组织。

显著优点

1. 零认证门槛:无需 Reddit API Key 或 OAuth 授权,即开即用
2. 轻量化依赖:核心仅依赖 requestsyt-dlp,无重型框架

3. 灵活输出:自定义目录结构,文件命名包含目标标识与帖子 ID,便于追溯

4. 合规限速:内置 0.8 秒请求间隔与标准 User-Agent,降低触发反爬机制风险

潜在局限与风险

功能性限制:

  • 无法抓取需登录查看的私有/受限内容
  • 时间过滤依赖 Reddit 服务端实现,极端日期范围可能返回不完整数据
  • 视频下载依赖第三方 yt-dlp,若源平台规则变更可能导致解析失败

安全与合规风险:

  • 版权敏感:抓取他人原创媒体存在潜在版权争议,需遵守 Reddit TOS 及当地法规
  • 隐私边界:用户存档功能可能涉及第三方个人信息聚合,建议仅限公开数据分析用途
  • API 稳定性:非官方端点可能随时变更,无 SLA 保障

适合人群

  • 数据归档研究者、数字保存从业者
  • 需要批量获取公开视觉素材的内容创作者(需确保合规授权)
  • 社交媒体分析人员进行子版块内容趋势研究

常规风险提示

  • 严禁用于抓取 NSFW 受限内容或违反 Reddit 平台规则的大规模爬取
  • 单实例运行限制:并行多开将触发 403 速率限制
  • 建议配合 VPN 或代理使用,避免 IP 段被封禁

Reddit Archive 内容

scripts文件夹
手动下载zip · 5.0 kB
reddit_archive.pytext/plain
请选择文件