Kb Collector

📚 AI 驱动的 Obsidian 知识自动采集助手

自动化知识收集工具,支持YouTube转录、网页抓取与AI摘要,一键存入Obsidian,适合构建个人知识库

收藏
4.9k
安装
1k
版本
1.2.1
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能

KB Collector 是一款面向 Obsidian 用户的自动化知识采集工具,通过命令行或脚本将分散的网络信息整合至本地知识库。核心能力涵盖三类输入源处理:

YouTube 视频处理:调用 yt-dlp 下载音频,使用 faster-whisper 本地转录生成文字稿,可选接入 OpenAI/Anthropic API 生成结构化摘要

网页内容抓取:基于 requests + BeautifulSoup 提取正文,自动去噪并生成 TL;DR 摘要

纯文本速记:支持直接输入文字并绑定标签,快速归档碎片化信息

周期性回顾机制:内置周报/月报/年报邮件推送功能,通过 cron 定时触发 nightly-research.sh 实现自动化趋势追踪,覆盖 Hacker News、Reddit、Twitter 等科技社区

显著优点

  • 本地优先架构:数据完全存储于用户指定的 Obsidian Vault,无云依赖,隐私可控
  • 开放式管道设计:脚本化工作流易于扩展,可替换摘要模型或接入其他数据源
  • 时间戳标准化:自动生成 ISO 8601 格式 frontmatter,便于后续时间线检索
  • 双版本兼容:同时维护 Python(推荐)与 Bash(轻量)实现,适应不同环境

潜在局限

  • 依赖管理复杂:需手动维护 yt-dlp、faster-whisper、Python 包及可选 API key 的多层依赖
  • 无图形界面:纯 CLI 交互对非技术用户门槛较高
  • 摘要质量不稳定:网页抓取依赖启发式规则,复杂页面可能提取失败;Whisper 转录对专业术语或低音质音频误差率较高
  • 邮件功能未详细说明:文档未披露邮件发送机制(SMTP 配置?第三方服务?),存在配置盲区

适用人群

  • Obsidian 重度用户,追求自动化信息入库的开发者、研究员、投资人
  • 需要构建领域知识库(AI/LLM、金融科技等)的内容策展人
  • 能接受命令行工作流的技术从业者

常规风险提示

| 风险类别 | 具体说明 |
|---------|---------|
| 版权合规 | YouTube 音频下载可能违反平台 ToS,需用户自行评估 |
| API 成本 | 若启用 OpenAI/Anthropic 摘要,高频使用将产生 token 费用 |
| 数据安全 | URL 抓取时可能暴露本地 IP,敏感站点建议配合代理 |
| 依赖维护 | yt-dlp 需持续更新以应对平台反爬机制变化 |

Kb Collector 内容

scripts文件夹
手动下载zip · 9.5 kB
collect.pytext/plain
请选择文件