Wechat Search

🔍 合规采集公众号文章的智能搜索工具

合规搜索微信公众号文章,采用双层策略优先合法API,支持时间过滤与多格式输出,注重版权尊重与速率限制

收藏
10.2k
安装
4k
版本
1.0.2
CLS 安全扫描中
预计需要 3 分钟...

使用说明

WeChat Search Skill 综合评估

核心用法

WeChat Search Skill 是一个专为微信公众号文章检索设计的开源工具,采用合规优先的双层搜索架构。核心工作流如下:

第一层(主策略):通过通用搜索引擎 API(如 Tavily)配合 site:mp.weixin.qq.com 站点限定符进行检索,快速获取公开索引的公众号文章元数据。

第二层(回退策略):当搜索 API 无法覆盖目标内容时,启动受控的网页抓取模式,通过 web_fetch 工具直接访问文章页面,配合 5 秒以上的请求延迟、自定义 User-Agent 及 robots.txt 检查,确保行为透明可识别。

用户可通过 CLI 执行基础查询、调整结果数量(默认 5,上限 20)、设置时间范围(如 --past-week 或自定义 --from/--to 日期),并选择 text/JSON/markdown 三种输出格式。高级配置支持通过 ~/.openclaw/wechat-search-config.json 自定义延迟、缓存时长等参数。

显著优点

1. 合规设计突出:主动声明遵守 robots.txt、强制 5 秒速率限制、透明 User-Agent 标识,降低法律与平台封禁风险
2. 策略灵活性:搜索 API 与直接抓取的双层 fallback,兼顾效率与覆盖度

3. 隐私友好:仅采集公开文章元数据,明确承诺不存储完整内容

4. 开发者友好:JSON 输出便于集成,配置文件支持深度自定义

5. 时间敏感场景适配:内置近一周/自定义日期范围过滤,适合追踪热点议题

潜在缺点与局限性

  • 依赖外部工具链:必须预装 web_searchweb_fetch 工具,Tavily 增强功能需额外 API Key
  • 反爬脆弱性:微信平台的反爬机制可能绕过 5 秒延迟,导致回退策略失效
  • 内容完整性限制:仅获取公开可见文章,付费/受限内容无法访问
  • 延迟权衡:合规速率限制在批量采集场景下效率受限
  • 地域与账号差异:部分公众号文章存在地区可见性或登录墙,影响抓取一致性

适合人群

  • 研究人员与分析师:需追踪特定行业(如 AI、金融科技)公众号舆论动向
  • 内容策展者:希望合规聚合多源信息,避免侵权风险
  • 开发者与自动化用户:寻求可集成、可配置的微信内容获取管道

常规风险

| 风险类型 | 说明 | 缓解措施 |
|---------|------|---------|
| 平台政策变更 | 微信 robots.txt 或反爬策略更新 | 监控官方公告,预留策略切换接口 |
| API 依赖中断 | Tavily 等服务可用性波动 | 保持纯 web_fetch 回退能力 |
| 数据时效性 | 搜索引擎索引延迟导致内容非最新 | 结合 `--past-week` 等时间过滤验证 |
| 误封风险 | 即使合规仍可能触发平台风控 | 分布式请求池、动态 User-Agent 轮换(需权衡合规性) |

总体评价

WeChat Search Skill 在开源微信内容采集工具中属于合规意识领先的设计,其显式的速率限制、robots.txt 尊重及元数据-only 策略,为同类工具提供了负责任开发的参考范式。适合对法律风险敏感、需稳定可维护采集管道的用户群体。

Wechat Search 内容

手动下载zip · 6.8 kB
debug_test.pytext/plain
请选择文件