douyin-keyword-search

🔍 抖音搜索结果一键采集

基于Playwright的抖音搜索结果自动化抓取工具,支持JSON/CSV/TXT多格式输出,需配合浏览器登录使用,适合数据采集与分析场景

收藏
8.6k
安装
1.9k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

抖音关键词搜索抓取技能评估

核心用法

本技能是一个基于 Python + Playwright 的浏览器自动化脚本,用于抓取抖音(Douyin)搜索结果页面的公开视频数据。用户通过命令行指定关键词,脚本自动启动 Chromium 浏览器模拟用户搜索行为,提取视频标题、作者、链接、互动数据(点赞/评论数)及抓取时间戳,支持以 JSON、CSV 或 TXT 格式输出,也可直接打印到控制台。

显著优点

1. 开箱即用:提供 Shell 包装脚本和 requirements.txt,依赖安装流程清晰
2. 多格式输出:原生支持结构化数据导出,便于后续分析处理

3. 灵活配置:支持无头模式(headless)、数量限制、文件输出等常用参数

4. Claude Code 集成:可通过 /skill 指令直接调用,提升工作流效率

5. 技术栈成熟:Playwright 相比 Selenium 具有更好的异步性能和反检测能力

潜在缺点与局限性

1. 强依赖登录态:抖音搜索需要登录才能获取完整结果,首次使用需手动扫码/验证码登录,自动化程度受限
2. 平台对抗风险:作为爬虫工具,面临抖音反爬策略(滑块验证、IP 限流、账号风控)的直接挑战

3. 数据完整性不确定:仅抓取搜索结果页可见数据,无法获取播放量、分享数等深层指标,且页面结构变更会导致解析失效

4. 无错误重试机制:文档未提及异常处理、代理轮换、请求节流等生产级功能

5. 法律合规灰色地带:抓取用户生成内容(UGC)可能涉及著作权和个人信息保护问题,robots.txt 遵守声明流于形式

适合人群

  • 市场研究人员:需要批量获取竞品账号公开内容
  • 内容创作者:分析热门话题和趋势标签
  • 数据分析师:构建抖音内容数据集(需自行评估合规性)
  • 自动化测试工程师:学习 Playwright 在复杂单页应用(SPA)中的实战应用

常规风险

| 风险类型 | 说明 | 建议缓解措施 |
|---------|------|-------------|
| 账号封禁 | 频繁抓取触发平台风控 | 控制请求间隔(>10秒/次),使用备用账号 |
| IP 限制 | 单 IP 高频访问被拉黑 | 配置住宅代理池,轮换 User-Agent |
| 法律纠纷 | 未经授权大规模抓取内容 | 仅用于个人研究,避免商业化使用 |
| 隐私泄露 | 存储抓取数据不当导致泄露 | 本地加密存储,定期清理敏感字段 |
| 依赖失效 | Playwright/Chromium 版本不兼容 | 锁定依赖版本,关注上游更新 |

总体建议

作为技术学习和小规模数据采集工具尚可接受,但缺乏企业级的稳定性、合规性和可维护性设计。生产环境使用前建议补充完整的异常处理、日志审计、数据脱敏和法律审查机制。

douyin-keyword-search 内容

手动下载zip · 6.7 kB
douyin_keyword_search.pytext/plain
请选择文件