知乎数据获取 | Zhihu Data Fetcher

📰 三级降级保障的热榜采集利器

知乎热榜数据获取工具,三级认证降级机制(浏览器→Cookie→备用源),支持自动限流与SQLite持久化,适合舆情监控与内容研究

收藏
4.3k
安装
1.3k
版本
1.1.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

zhihu-fetcher 是一款面向知乎平台的数据采集工具,采用极简设计理念,专注于热榜与搜索数据的可靠获取。其核心架构围绕「三级认证降级机制」展开,确保在复杂网络环境与认证限制下仍能稳定工作。

三级认证流程
1. Browser Profile(推荐):复用 OpenClaw 浏览器已登录态,数据完整度最高,适合日常开发

2. File Cookie:通过配置文件固化 Cookie,无需浏览器交互,适合 CI/CD 自动化场景

3. Fallback Source:完全无认证的备用数据源(GitHub 镜像等),作为应急兜底方案

主要功能模块

  • 数据采集fetch-hot.js 提供统一入口,自动选择最优认证方式,支持自定义限流(默认 2秒/请求)
  • 数据持久化:内置 SQLite 数据库,自动去重(同一天同一 URL 仅存一次),支持按日期、排名、热度多维度查询
  • 可视化报告:自动生成 HTML 看板,含日期筛选、关键词搜索、热度过滤、Top3 高亮等功能
  • 扩展机制:支持自定义备用源与认证优先级调整

显著优点

  • 可靠性高:三级降级消除单点故障,认证失败时无缝切换
  • 场景覆盖广:从交互式开发到无人值守自动化均有对应方案
  • 数据可追溯:完整抓取日志与历史数据留存,便于趋势分析
  • 轻量易部署:纯 Node.js/Python 实现,无外部依赖服务

潜在局限

  • 备用源存在约 1 小时数据延迟,实时性要求高的场景需优先保证前两级认证
  • 固化 Cookie 存在过期风险,需定期维护
  • 知乎平台反爬策略可能变化,需关注频率限制调整

适合人群

  • 内容研究者、舆情分析师、市场调研员
  • 需要知乎数据输入的自动化工作流开发者
  • 对数据获取稳定性有要求的个人或小型团队

常规风险

  • Cookie 配置文件含敏感凭证,需加入 .gitignore 避免泄露
  • 高频抓取可能触发平台限流,建议保持默认速率或更低
  • 备用源为第三方服务,数据完整性与时效性不受控

知乎数据获取 | Zhihu Data Fetcher 内容

config文件夹
data文件夹
scripts文件夹
snippets文件夹
手动下载zip · 43.5 kB
fallback-sources.jsonapplication/json
请选择文件