核心用法
wechat-search-weread 是一套针对微信公众号文章的深度搜索方案,通过微信读书(weread.qq.com)的「搜一搜」功能绕过传统搜索引擎限制,直接获取微信公众号原文链接。该 skill 采用浏览器自动化(agent-browser + CDP)架构,完整覆盖登录态维护、无限滚动加载、批量 URL 提取三大核心环节。
标准执行流程:启动浏览器 → 微信扫码登录(二维码时效极短,需一气呵成)→ 导航至搜索页并保持 weread session 活跃 → 无限滚动加载(默认滚至「暂无更多内容」或 500 条封顶)→ 批量 eval 提取文章 URL(关键步骤,不可跳过)→ 格式化输出 Top 10 结果。
URL 提取原理:微信公众号文章链接在 DOM 中无 href,需通过拦截 window.open 实现。点击 .search_list_item 卡片触发 Vue 事件委托,原生 .click() 配合 async/await sleep(50ms) 可 100% 稳定捕获 mp.weixin.qq.com 直链,60 篇文章约 0.5 秒完成。
显著优点
1. 直链可用性:返回的 mp.weixin.qq.com/s?... 链接可直接访问,无需经过搜狗/Exa 的二次跳转或缓存延迟
2. 时效性优先:支持按「小时前/分钟前/天前」筛选,适合追踪突发热点
3. 深度加载:无限滚动机制可加载数百篇结果,远超常规 API 的 15-30 条限制
4. 元数据完整:同步采集标题、公众号来源、发布时间、文章简介
5. 微信生态闭环:利用微信读书与公众号的内容同源特性,绕过外部索引滞后问题
潜在缺点与局限性
1. 环境依赖苛刻:强制依赖 agent-browser + CDP 浏览器,WSL 用户需额外配置 Windows 端口转发
2. 登录态脆弱:httpOnly cookie 无法通过 JS 清除,session 丢失会导致滚动卡死;weread.qq.com 标签页绝对不能关闭,否则无限滚动失效
3. 二维码时效瓶颈:登录二维码仅 1-2 分钟有效期,整个扫码流程必须在一个 terminal 调用内完成,拆分即过期
4. 反爬风险:部分链接返回「参数错误」属微信服务端限制,非提取 bug,需额外 CDP 抓取全文作为 fallback
5. 长任务稳定性:超过 3 轮滚动必须用前台 terminal + 600s timeout,background 进程可能无声卡住
6. 维护成本高:依赖微信读书前端 DOM 结构,selectors 可能随版本更新失效
适合人群
- 舆情监测分析师:需要第一时间获取微信生态内的品牌/事件相关发文
- 内容运营人员:追踪竞品公众号最新动态,分析选题趋势
- 研究员/记者:微信文章作为信源时,需要可验证的原文直链而非第三方缓存
- 自动化工作流搭建者:已将 agent-browser 纳入技术栈的团队
常规风险
| 风险类别 | 具体表现 | 缓解措施 |
|---------|---------|---------|
| 账号风控 | 高频搜索可能触发微信读书登录态异常 | 控制单次搜索频率,避免短时间内多次重新登录 |
| 链接失效 | 部分文章因删除/权限变更导致「参数错误」| 提取后立即用 CDP 抽查验证,主动 offer 全文抓取 |
| 进程卡死 | background terminal 在长滚动中无声失败 | 强制使用前台 terminal + 长 timeout |
| DOM 变更 | 微信读书前端改版导致 selectors 失效 | 关注 `.search_list_item` 等核心 class 变化 |
该 skill 属于微信生态内容获取的「重型武器」,配置正确后输出质量极高,但需严格遵循流程中的时序约束与异常处理规范。