Web scraping skill using Chrome + WebMCP

🕷️ 金融数据智能采集专家

基于 Chrome + WebMCP 的网页数据采集工具,支持动态渲染与交互操作,专为金融资讯网站设计,具备完整的资源清理机制。

收藏
4.6k
安装
1.5k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Spider 是一款专为金融数据抓取设计的 Web 爬虫技能,采用 Chrome 浏览器 + WebMCP 协议作为技术底座,替代传统的静态抓取方案。其核心工作流包含五个步骤:检查/启动 Chrome 实例、打开目标页面、获取页面快照、执行交互操作(点击、输入等)、以及强制性的资源清理。

该技能针对中国主流金融网站做了深度适配,内置同花顺(Tonghuashun)、东方财富(East Money)、雪球(Xueqiu)等平台的 URL 模板,支持股票代码直接映射到对应的新闻页、股吧或个股页面。用户可通过自然语言触发,如"抓取光库科技的新闻"或"查一下宁德时代的股吧"。

显著优点

1. 动态渲染能力:基于完整 Chromium 内核,可执行 JavaScript、处理 Ajax 加载的内容,突破传统爬虫对静态 HTML 的依赖
2. 交互式操作:支持点击、输入、滚动等用户行为模拟,可应对分页加载、验证码触发等场景

3. 金融场景深度优化:预设三大财经网站模板,URL 构造逻辑内置于技能,降低用户操作门槛

4. 资源管理规范:强制要求任务结束后清理标签页(保留唯一 about:blank),避免内存泄漏和浏览器实例膨胀

潜在缺点与局限性

1. 环境依赖较重:需预配置 Chrome 实验性功能(WebMCP 支持),且必须在 Host 模式而非沙箱中运行,存在本地系统权限暴露风险
2. 反爬对抗成本高:针对同花顺、东方财富等站点的反爬机制,技能仅建议"等待重试"或"切换站点",缺乏自动化应对策略(如代理轮换、请求频率控制)

3. 单会话串行执行:未体现并发抓取能力,多任务场景下效率受限

4. 数据结构化程度低:输出为原始页面快照,需二次解析提取,未内置 DOM 提取规则或 JSON 化输出能力

适合人群

  • 金融分析师、量化研究员:需要快速获取特定股票的舆情、公告、论坛情绪
  • 二级市场投资者:监控自选股的新闻动态与社区讨论
  • 数据工程师:作为动态抓取的备选方案,处理静态爬虫无法渲染的页面

常规风险

1. 合规风险:抓取金融网站数据可能违反 robots.txt 或用户协议,东方财富、同花顺等均明确限制自动化访问
2. 账号封禁:高频访问可能触发 IP 封锁或账号限制(雪球需登录态)

3. 数据时效性:页面快照为抓取时刻的静态副本,实时行情类数据存在延迟

4. 浏览器安全风险:Host 模式下 Chrome 与本地系统共享部分上下文,恶意页面可能通过浏览器漏洞横向渗透

5. 隐私泄露:若用户抓取含个人持仓信息的页面,快照可能残留敏感数据

Web scraping skill using Chrome + WebMCP 内容

手动下载zip · 3.2 kB
skill-card.mdtext/markdown
请选择文件