核心用法
finviz-crawler 是一款面向金融投资者和量化研究者的本地化新闻爬虫工具,通过持续监控 finviz.com 的新闻流,构建个人专属的财经新闻数据库。与市面上多数一次性 API 查询工具不同,该 skill 以守护进程形式后台运行,自动抓取、提取、存储和清理文章,形成可追溯的历史档案。
显著优点
1. 零成本架构:直接爬取 finviz.com,无需 Bloomberg Terminal、Reuters API 等付费订阅,也避开了 Yahoo Finance、Alpha Vantage 等免费 API 的调用限制。
2. AI 原生设计:查询输出经过清洗优化,可直接输入 LLM 进行摘要生成。配合 OpenClaw 的 cron 任务,可实现自动化晨间简报、收盘复盘或周度投资总结。
3. 灵活的数据管理:SQLite 单库存储文章元数据与全文,支持按时间窗口、股票代码筛选;可配置 7 天至永久保留策略,自动清理过期数据避免磁盘膨胀。
4. 多平台守护进程:内置 systemd(Linux)和 launchd(macOS)配置模板,支持无人值守的自动化运行。
5. 股票代码追踪系统:可维护关注的标的列表(如 NVDA、TSLA),爬虫自动抓取各 ticker 专属新闻页面,实现个性化监控。
潜在缺点与局限性
- 依赖目标网站稳定性:finviz.com 的页面结构变更可能导致爬取失效,需要持续维护选择器。
- 反爬与 rate limit 风险:虽有用户代理轮换和域名级限速,但高频爬取仍可能触发 IP 临时封禁。
- 内容质量参差:自动提取的文章可能包含 paywall 提示、bot 检测页面等垃圾内容,虽有过滤机制但无法 100% 规避。
- 无实时推送:基于轮询架构(默认 5 分钟),非真正实时流,对高频交易场景延迟过高。
- Playwright 依赖:需要安装 Chromium 浏览器,在资源受限环境(如低配置 VPS)内存占用较大。
适合人群
- 个人投资者希望建立本地化新闻档案,避免依赖第三方平台
- 量化研究者需要结构化金融文本数据进行 NLP 训练或情绪分析
- AI 爱好者构建自动化投资简报工作流
- 隐私敏感用户不愿将阅读历史上传至云端服务
常规风险
| 风险类型 | 说明 | 缓解建议 |
|---------|------|---------|
| 合规风险 | 爬取行为可能违反 finviz.com ToS | 控制频率,仅个人使用,避免商业化分发 |
| 数据准确性 | 自动提取可能出现内容截断或格式错误 | 关键决策前人工复核原文 |
| 依赖风险 | Crawl4AI、Playwright 等依赖版本迭代 | 锁定依赖版本,定期回归测试 |
| 安全风险 | 未审计的 Python 依赖可能引入供应链攻击 | 在隔离环境运行,限制网络出口 |
该 skill 适合作为个人金融数据基础设施的基石组件,但不建议用于生产级、高可用性的商业系统。