核心功能
KB Collector 是一款面向 Obsidian 用户的自动化知识采集工具,通过命令行或脚本将分散的网络信息整合至本地知识库。核心能力涵盖三类输入源处理:
YouTube 视频处理:调用 yt-dlp 下载音频,使用 faster-whisper 本地转录生成文字稿,可选接入 OpenAI/Anthropic API 生成结构化摘要
网页内容抓取:基于 requests + BeautifulSoup 提取正文,自动去噪并生成 TL;DR 摘要
纯文本速记:支持直接输入文字并绑定标签,快速归档碎片化信息
周期性回顾机制:内置周报/月报/年报邮件推送功能,通过 cron 定时触发 nightly-research.sh 实现自动化趋势追踪,覆盖 Hacker News、Reddit、Twitter 等科技社区
显著优点
- 本地优先架构:数据完全存储于用户指定的 Obsidian Vault,无云依赖,隐私可控
- 开放式管道设计:脚本化工作流易于扩展,可替换摘要模型或接入其他数据源
- 时间戳标准化:自动生成 ISO 8601 格式 frontmatter,便于后续时间线检索
- 双版本兼容:同时维护 Python(推荐)与 Bash(轻量)实现,适应不同环境
潜在局限
- 依赖管理复杂:需手动维护 yt-dlp、faster-whisper、Python 包及可选 API key 的多层依赖
- 无图形界面:纯 CLI 交互对非技术用户门槛较高
- 摘要质量不稳定:网页抓取依赖启发式规则,复杂页面可能提取失败;Whisper 转录对专业术语或低音质音频误差率较高
- 邮件功能未详细说明:文档未披露邮件发送机制(SMTP 配置?第三方服务?),存在配置盲区
适用人群
- Obsidian 重度用户,追求自动化信息入库的开发者、研究员、投资人
- 需要构建领域知识库(AI/LLM、金融科技等)的内容策展人
- 能接受命令行工作流的技术从业者
常规风险提示
| 风险类别 | 具体说明 |
|---------|---------|
| 版权合规 | YouTube 音频下载可能违反平台 ToS,需用户自行评估 |
| API 成本 | 若启用 OpenAI/Anthropic 摘要,高频使用将产生 token 费用 |
| 数据安全 | URL 抓取时可能暴露本地 IP,敏感站点建议配合代理 |
| 依赖维护 | yt-dlp 需持续更新以应对平台反爬机制变化 |