核心用法
Bilibili Analytics 是一套基于浏览器自动化抓取 B 站视频数据的完整工作流,涵盖搜索、抓取、分析、报告四个阶段:
1. 视频搜索:通过 agent-browser 打开 B 站搜索页,支持指定关键词与分页参数;
2. 数据抓取:利用 DOM 选择器提取标题、作者、发布时间、播放量、评论数等字段,输出结构化 JSON;
3. 多页采集:通过循环翻页实现批量数据获取,可自定义抓取深度;
4. 数据分析:内置 Python 脚本执行时间分布、作者排名、播放量/评论数区间统计等维度分析;
5. 报告输出:自动生成 Markdown 格式统计报告,包含可视化表格与策略建议。
工具提供 scrape_videos.sh 一键抓取脚本和 analyze_data.py 分析脚本,降低使用门槛。
显著优点
- 全流程闭环:从搜索到报告生成一站式完成,无需外部工具拼接;
- 数据维度丰富:覆盖播放量、评论数、时间分布、作者活跃度等核心指标;
- 可扩展性强:基于浏览器自动化,DOM 选择器可随页面结构调整;
- 输出标准化:Markdown 报告模板可直接用于汇报或二次编辑。
潜在缺点与局限性
- 反爬虫依赖:B 站风控机制可能导致 IP 限制或请求失败,需人工控制频率;
- 页面结构脆弱:CSS 选择器硬编码,B 站前端改版会导致抓取失效;
- 数据时效性:仅反映抓取时刻状态,无法实时追踪;
- 无身份认证:未提及登录态处理,无法获取会员专属或推荐算法加权数据。
适合人群
- 内容创作者进行竞品分析与选题参考
- 市场运营人员追踪热点趋势与 KOL 表现
- 研究人员开展平台内容生态分析
常规风险
- 合规风险:需确保仅抓取公开数据,遵守 B 站用户协议;
- 稳定性风险:高频抓取可能触发账号/IP 封禁;
- 数据质量风险:页面动态加载或反爬对抗可能导致字段缺失。
安全评估
本工具仅执行公开页面数据抓取,不涉及用户隐私数据访问或敏感操作,但依赖外部浏览器自动化工具,执行环境需确保可信。