核心用法
bilibili-danmaku 是一个专门用于抓取和分析 Bilibili(B站)视频弹幕数据的自动化工具链。用户只需提供视频 URL 或 BVID,即可自动完成从数据抓取到可视化报告的全流程。
工作流程:
1. 抓取阶段:通过 fetch_danmaku.py 解析 BVID 获取 CID,下载 comment.bilibili.com/{cid}.xml 弹幕源文件,导出为 CSV/JSON/纯文本三种格式
2. 分析阶段:analyze_danmaku.py 调用 jieba 进行中文分词与词频统计,内置停用词清洗机制,使用 SnowNLP 计算情感分布,最终生成高密度 PNG 词云图与 Markdown 舆情报告
显著优点:
- 零配置开箱即用,一条命令完成抓-洗-析-报全流程
- 支持自定义停用词与分P视频处理,灵活性高
- 产出物丰富:词频 JSON、情感分布 JSON、词云图 PNG、可读报告 MD
潜在缺点与局限:
- SnowNLP 情感分析基于训练语料,对网络新词、反讽、梗文化识别准确率有限,高风险决策需人工复核
- 仅支持弹幕文本,不涵盖评论区的长文本分析
- 受 B站 API 与反爬策略影响,高频抓取可能触发限流
- 词云渲染依赖系统字体,部分环境可能出现中文乱码
适合人群:
- 内容创作者与 MCN 机构:快速洞察观众反馈热点
- 市场运营与公关团队:监测品牌/事件视频的舆论走向
- 学术研究者:获取弹幕语料进行传播学、社会学分析
常规风险:
- 需遵守 B站用户协议,避免商业化大规模爬取
- 弹幕内容可能含敏感信息,分析结果输出需注意合规脱敏
- 情感分析结论仅供参考,不可替代人工判断