核心用法
zhihu-fetcher 是一款面向知乎平台的数据采集工具,采用极简设计理念,专注于热榜与搜索数据的可靠获取。其核心架构围绕「三级认证降级机制」展开,确保在复杂网络环境与认证限制下仍能稳定工作。
三级认证流程:
1. Browser Profile(推荐):复用 OpenClaw 浏览器已登录态,数据完整度最高,适合日常开发
2. File Cookie:通过配置文件固化 Cookie,无需浏览器交互,适合 CI/CD 自动化场景
3. Fallback Source:完全无认证的备用数据源(GitHub 镜像等),作为应急兜底方案
主要功能模块:
- 数据采集:
fetch-hot.js提供统一入口,自动选择最优认证方式,支持自定义限流(默认 2秒/请求) - 数据持久化:内置 SQLite 数据库,自动去重(同一天同一 URL 仅存一次),支持按日期、排名、热度多维度查询
- 可视化报告:自动生成 HTML 看板,含日期筛选、关键词搜索、热度过滤、Top3 高亮等功能
- 扩展机制:支持自定义备用源与认证优先级调整
显著优点:
- 可靠性高:三级降级消除单点故障,认证失败时无缝切换
- 场景覆盖广:从交互式开发到无人值守自动化均有对应方案
- 数据可追溯:完整抓取日志与历史数据留存,便于趋势分析
- 轻量易部署:纯 Node.js/Python 实现,无外部依赖服务
潜在局限:
- 备用源存在约 1 小时数据延迟,实时性要求高的场景需优先保证前两级认证
- 固化 Cookie 存在过期风险,需定期维护
- 知乎平台反爬策略可能变化,需关注频率限制调整
适合人群:
- 内容研究者、舆情分析师、市场调研员
- 需要知乎数据输入的自动化工作流开发者
- 对数据获取稳定性有要求的个人或小型团队
常规风险:
- Cookie 配置文件含敏感凭证,需加入
.gitignore避免泄露 - 高频抓取可能触发平台限流,建议保持默认速率或更低
- 备用源为第三方服务,数据完整性与时效性不受控