核心用法
wechat-search 是一款专为微信公众号文章设计的搜索技能,采用双层合规策略:优先通过合法搜索 API(如 Tavily)配合 site:mp.weixin.qq.com 过滤器获取结果,失败时自动降级为带礼貌延迟的网页抓取。用户可通过简洁命令行界面执行关键词搜索,支持时间范围限定(过去一周、自定义日期)、结果数量调节(默认 5 条,最大 20 条)及多种输出格式(文本/JSON/Markdown)。配置文件允许自定义请求延迟、缓存时长和 User-Agent,满足个性化与合规双重需求。
显著优点
1. 合规优先设计:明确遵循 robots.txt、强制 5 秒以上请求间隔、透明 Bot 身份标识,降低法律与平台封禁风险;
2. 双层容错机制:API 与爬虫策略互补,确保服务可用性;
3. 中文内容专注:针对微信公众号生态优化,弥补通用搜索引擎对中文私域内容索引不足的缺陷;
4. 轻量可配置:JSON 配置文件与命令行参数结合,既适合快速查询也支持集成到自动化工作流;
5. 隐私友好:仅缓存元数据、不存储全文内容,减少数据滞留风险。
潜在缺点与局限性
- 内容覆盖盲区:未关注或付费专区的文章无法访问,仅限公开内容;
- 实时性瓶颈:5 秒延迟 + 缓存机制可能导致热点内容更新滞后;
- 单平台依赖:微信公众号生态封闭,若平台反爬策略升级可能导致技能失效;
- 功能简约:暂不支持文章摘要生成、作者订阅管理等进阶功能(已列入未来计划)。
适合人群
- 研究人员与行业分析师:追踪中文科技、商业领域趋势;
- 内容运营者:监测竞品公众号动态与热点话题;
- 开发者:需要将微信公域内容集成至知识库或 RSS 管道的自动化场景;
- 对合规爬虫有要求的企业用户:避免黑箱采集带来的法务隐患。
常规风险
| 风险类型 | 说明 |
|---------|------|
| 平台策略变动 | 微信可能收紧反爬规则,导致技能需频繁适配; |
| API 依赖 | Tavily 等第三方服务若调整定价或限流,影响搜索质量; |
| 内容版权 | 公开文章仍受著作权保护,商业用途需注意授权; |
| 配置误用 | 用户擅自调低延迟或修改 User-Agent 可能触发封禁。 |