news-search

📰 五大新闻源 · 智能去重 · 实时聚合

聚合五大主流新闻源实时资讯,自动去重并支持多格式输出,为信息追踪与舆情监控提供一站式解决方案

收藏
3k
安装
1.4k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

新闻查询技能通过 Playwright 无头浏览器自动化采集百度新闻、今日头条、Bing 新闻、Google 新闻和新浪新闻五大平台的实时资讯。用户可通过命令行指定关键词、选择单引擎或全渠道聚合模式,自定义返回数量(默认10条/源)与输出格式(Markdown/JSON)。内置去重算法可识别跨平台重复内容,自动合并标注多渠道来源。

显著优点

多源覆盖能力:同时支持国内外主流新闻聚合平台,兼顾中文本土生态(百度、头条、新浪)与全球视野(Google、Bing),满足不同场景的信息完整性需求。技术成熟度:基于 Playwright 的浏览器自动化方案配合 stealth 反检测插件,在目标网站反爬策略升级时具备较强的适应性。输出灵活性:Markdown 格式便于人工快速浏览,JSON 格式支持下游系统对接与数据分析。去重智能化:自动识别标题相似度高的跨平台报道,避免信息冗余。

潜在局限与风险

法律合规性:未经授权大规模抓取新闻内容可能触及《著作权法》及目标网站 Robots 协议,商业用途需评估合规风险。稳定性依赖:无头浏览器方案对目标网站 DOM 结构变化敏感,CSS 选择器失效会导致采集中断,需持续维护。时效性瓶颈:相比官方 API 推送,页面渲染采集存在分钟级延迟,不适合秒级舆情预警场景。IP 封禁风险:高频调用易触发反爬机制,需配合代理池与请求频率控制。数据完整性:部分平台对未登录用户隐藏部分内容,可能产生采样偏差。

适合人群

  • 市场研究人员:追踪行业动态与竞品舆情
  • 内容运营者:监控热点话题与选题策划
  • 投资者:跟踪宏观政策与个股新闻
  • 开发者:搭建轻量级资讯聚合 Pipeline

常规风险提示

建议控制单次查询频率(建议间隔≥30秒),优先使用单一引擎模式降低并发负载;长期运行需配置 residential 代理轮换;关键业务场景应建立官方 API 作为数据备份通道。

news-search 内容

scripts文件夹
手动下载zip · 11.6 kB
news-search.jstext/javascript
请选择文件