核心功能
Web-to-FIM 是一款面向AI时代的信息入库工具,核心能力是将任意网络内容一键转换为结构化Markdown,并三处同步存储至Obsidian本地知识库、飞书云文档和腾讯IMA知识库,实现"一次抓取、人机共用"的AI信息库搭建。
支持的信源与路由策略
| 信源类型 | 处理方式 | 特殊说明 |
|---------|---------|---------|
| X/Twitter | x-tweet-fetcher逐字转录 | 纯文本笔记,保留Thread结构 |
| 微信公众号 | markitdown + 移动端UA fallback | IMA用import_urls保留图片排版 |
| 飞书wiki | WebFetch全文转录 + 原文链接优先 | v3.2.0自动检测原文链接跳转 |
| 小红书/微博/YouTube | markitdown标准转换 | 通用网页处理 |
| 本地文件(PDF/Word/PPT/Excel/图片/音频) | markitdown本地转换 | 全格式覆盖 |
三处存放的差异化价值
- Obsidian Vault:本地Markdown + YAML frontmatter + 自动标签(
#wechat#x#feishu等),支持LLM二次加工 - 飞书云文档:云端协作,支持分块插入(最多50 blocks),团队共享
- 腾讯IMA知识库:AI原生知识库,FIM(Find In Memory)检索,支持语义搜索
显著优点
1. 智能路由:v3.0后IMA存储自动分流——公众号/普通网页用import_urls服务端抓取保留图片;X/Twitter/飞书wiki用纯文本逐字转录,符合平台特性
2. 断点续传:批量模式崩溃后自动跳过已完成URL(.progress.json)
3. 文件名规范化:YYYYMMDD-标题-来源.md格式,来源自动识别(waytoagi/feishu/x/github等)
4. 安全设计:所有凭证环境变量配置,零硬编码;支持--no-feishu/--no-ima选择性禁用
潜在局限与风险
| 风险点 | 说明 |
|-------|------|
| 微信反爬 | 部分文章需fallback到移动端UA,偶有失败 |
| 飞书blocks限制 | 长文需分批插入,单次最多50 blocks |
| IMA API版本敏感 | v3.0强制迁移至`IMA_OPENAPI_*`新变量名,旧用户需更新 |
| X/Twitter无图片 | 逐字转录规则导致IMA中X内容纯文本化 |
| 凭证管理 | 需自行配置4组环境变量,新手门槛较高 |
适合人群
- Obsidian + LLM用户:需要结构化本地知识库
- 飞书协作团队:希望网页内容自动入库团队空间
- IMA/FIM实践者:构建AI可检索的个人知识库
- 信息策展人:日常需要批量保存公众号、X线程、PDF报告
技术依赖
- Python 3.8+,核心依赖
markitdownrequestspython-dotenv - 可选
x-tweet-fetcher用于Twitter优化抓取 - 跨平台支持(Windows/macOS/Linux)