Wechat Search Weread

📚 微信读书直搜公众号,带链返回

通过微信读书渠道搜索微信公众号文章,绕过搜狗/Exa限制获取带直链的完整文章数据,适合需要精准时效性的微信生态内容检索场景。

收藏
5.2k
安装
1.1k
版本
0.1.1
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

wechat-search-weread 是一套针对微信公众号文章的深度搜索方案,通过微信读书(weread.qq.com)的「搜一搜」功能绕过传统搜索引擎限制,直接获取微信公众号原文链接。该 skill 采用浏览器自动化(agent-browser + CDP)架构,完整覆盖登录态维护、无限滚动加载、批量 URL 提取三大核心环节。

标准执行流程:启动浏览器 → 微信扫码登录(二维码时效极短,需一气呵成)→ 导航至搜索页并保持 weread session 活跃 → 无限滚动加载(默认滚至「暂无更多内容」或 500 条封顶)→ 批量 eval 提取文章 URL(关键步骤,不可跳过)→ 格式化输出 Top 10 结果。

URL 提取原理:微信公众号文章链接在 DOM 中无 href,需通过拦截 window.open 实现。点击 .search_list_item 卡片触发 Vue 事件委托,原生 .click() 配合 async/await sleep(50ms) 可 100% 稳定捕获 mp.weixin.qq.com 直链,60 篇文章约 0.5 秒完成。

显著优点

1. 直链可用性:返回的 mp.weixin.qq.com/s?... 链接可直接访问,无需经过搜狗/Exa 的二次跳转或缓存延迟
2. 时效性优先:支持按「小时前/分钟前/天前」筛选,适合追踪突发热点

3. 深度加载:无限滚动机制可加载数百篇结果,远超常规 API 的 15-30 条限制

4. 元数据完整:同步采集标题、公众号来源、发布时间、文章简介

5. 微信生态闭环:利用微信读书与公众号的内容同源特性,绕过外部索引滞后问题

潜在缺点与局限性

1. 环境依赖苛刻:强制依赖 agent-browser + CDP 浏览器,WSL 用户需额外配置 Windows 端口转发
2. 登录态脆弱:httpOnly cookie 无法通过 JS 清除,session 丢失会导致滚动卡死;weread.qq.com 标签页绝对不能关闭,否则无限滚动失效

3. 二维码时效瓶颈:登录二维码仅 1-2 分钟有效期,整个扫码流程必须在一个 terminal 调用内完成,拆分即过期

4. 反爬风险:部分链接返回「参数错误」属微信服务端限制,非提取 bug,需额外 CDP 抓取全文作为 fallback

5. 长任务稳定性:超过 3 轮滚动必须用前台 terminal + 600s timeout,background 进程可能无声卡住

6. 维护成本高:依赖微信读书前端 DOM 结构,selectors 可能随版本更新失效

适合人群

  • 舆情监测分析师:需要第一时间获取微信生态内的品牌/事件相关发文
  • 内容运营人员:追踪竞品公众号最新动态,分析选题趋势
  • 研究员/记者:微信文章作为信源时,需要可验证的原文直链而非第三方缓存
  • 自动化工作流搭建者:已将 agent-browser 纳入技术栈的团队

常规风险

| 风险类别 | 具体表现 | 缓解措施 |
|---------|---------|---------|
| 账号风控 | 高频搜索可能触发微信读书登录态异常 | 控制单次搜索频率,避免短时间内多次重新登录 |
| 链接失效 | 部分文章因删除/权限变更导致「参数错误」| 提取后立即用 CDP 抽查验证,主动 offer 全文抓取 |
| 进程卡死 | background terminal 在长滚动中无声失败 | 强制使用前台 terminal + 长 timeout |
| DOM 变更 | 微信读书前端改版导致 selectors 失效 | 关注 `.search_list_item` 等核心 class 变化 |

该 skill 属于微信生态内容获取的「重型武器」,配置正确后输出质量极高,但需严格遵循流程中的时序约束与异常处理规范。

Wechat Search Weread 内容

references文件夹
scripts文件夹
手动下载zip · 20.8 kB
cdp-patterns.mdtext/markdown
请选择文件