Bilibili Danmaku

💬 B站弹幕抓取与舆情分析神器

一键抓取B站视频弹幕,自动生成词云图、情感分布与舆情分析报告,助力内容创作者与运营者快速洞察观众反馈与热点话题

收藏
4.5k
安装
1k
版本
1.0.3
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

bilibili-danmaku 是一套完整的B站弹幕分析工作流,支持从视频URL或BV号抓取弹幕数据,经分词清洗后输出多维度分析结果。核心流程分为三步:

1. 环境准备:首次运行需执行 ensure_env.sh 安装 Python 依赖(jieba/snownlp/wordcloud)
2. 数据抓取:通过 fetch_danmaku.py 解析视频元数据,下载 XML 格式弹幕并导出为 CSV/JSON/纯文本格式

3. 智能分析:运行 analyze_danmaku.py 完成:

  • 关键词统计:基于 jieba 中文分词,输出高频词 JSON
  • 数据清洗:内置停用词表,支持自定义过滤规则
  • 情感分析:SnowNLP 计算情感极性分布
  • 可视化词云:生成高密度 PNG 词云图
  • 舆情报告:自动生成结构化 Markdown 分析报告

显著优点

  • 开箱即用:封装完整的抓取-分析-可视化链路,无需编写代码
  • 灵活清洗:支持 --stopwords-file--extra-stopwords 双重自定义过滤
  • 多格式输出:同时提供结构化数据(JSON)、可视化图表(PNG)和可读报告(Markdown)
  • 批量友好:支持分P视频解析,可扩展为多视频批量分析

潜在局限

  • 情感分析精度:SnowNLP 基于朴素贝叶斯训练,对网络用语、反讽、梗文化识别能力有限,结论需人工复核
  • 时效性依赖:弹幕接口可能随B站API调整而失效
  • 样本偏差:单视频弹幕量差异大,小样本结论可能不具代表性
  • 无用户画像:仅分析文本内容,无法关联发送者行为数据

适合人群

  • 内容创作者:快速了解观众反馈热点与情绪倾向
  • 新媒体运营:追踪视频舆情走向,识别危机信号
  • 市场研究员:低成本获取UGC文本数据进行趋势分析
  • 学术用户:中文短文本情感分析与词频统计的教学示例

常规风险

| 风险类型 | 说明 | 缓解建议 |
|---------|------|---------|
| 数据合规 | 抓取公开弹幕可能涉及平台ToS边界 | 仅用于个人分析,避免商业转售 |
| 分析误判 | SnowNLP 对弹幕语境理解不足 | 关键结论需抽样人工校验 |
| 样本污染 | 刷屏、机器人弹幕扭曲统计 | 结合高频用户ID模式识别清洗 |
| 依赖失效 | B站API或Python包版本变动 | 锁定依赖版本,关注维护更新 |

> 建议:高风险决策场景(如品牌危机公关)应扩大样本量(多P/多视频汇总),并引入人工复核机制。

Bilibili Danmaku 内容

references文件夹
scripts文件夹
手动下载zip · 19.8 kB
methodology.mdtext/markdown
请选择文件