Web To Fim

📥 一键入库三处,人机共用

一键将任意网页/文件转为结构化Markdown,自动同步至Obsidian本地库、飞书云文档、腾讯IMA知识库三处,支持公众号、X/Twitter、YouTube等20+信源,AI时代信息管理基础设施。

收藏
4.6k
安装
1k
版本
3.2.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能

Web-to-FIM 是一款面向AI时代的信息入库工具,核心能力是将任意网络内容一键转换为结构化Markdown,并三处同步存储至Obsidian本地知识库、飞书云文档和腾讯IMA知识库,实现"一次抓取、人机共用"的AI信息库搭建。

支持的信源与路由策略

| 信源类型 | 处理方式 | 特殊说明 |
|---------|---------|---------|
| X/Twitter | x-tweet-fetcher逐字转录 | 纯文本笔记,保留Thread结构 |
| 微信公众号 | markitdown + 移动端UA fallback | IMA用import_urls保留图片排版 |
| 飞书wiki | WebFetch全文转录 + 原文链接优先 | v3.2.0自动检测原文链接跳转 |
| 小红书/微博/YouTube | markitdown标准转换 | 通用网页处理 |
| 本地文件(PDF/Word/PPT/Excel/图片/音频) | markitdown本地转换 | 全格式覆盖 |

三处存放的差异化价值

  • Obsidian Vault:本地Markdown + YAML frontmatter + 自动标签(#wechat #x #feishu等),支持LLM二次加工
  • 飞书云文档:云端协作,支持分块插入(最多50 blocks),团队共享
  • 腾讯IMA知识库:AI原生知识库,FIM(Find In Memory)检索,支持语义搜索

显著优点

1. 智能路由:v3.0后IMA存储自动分流——公众号/普通网页用import_urls服务端抓取保留图片;X/Twitter/飞书wiki用纯文本逐字转录,符合平台特性
2. 断点续传:批量模式崩溃后自动跳过已完成URL(.progress.json

3. 文件名规范化YYYYMMDD-标题-来源.md格式,来源自动识别(waytoagi/feishu/x/github等)

4. 安全设计:所有凭证环境变量配置,零硬编码;支持--no-feishu/--no-ima选择性禁用

潜在局限与风险

| 风险点 | 说明 |
|-------|------|
| 微信反爬 | 部分文章需fallback到移动端UA,偶有失败 |
| 飞书blocks限制 | 长文需分批插入,单次最多50 blocks |
| IMA API版本敏感 | v3.0强制迁移至`IMA_OPENAPI_*`新变量名,旧用户需更新 |
| X/Twitter无图片 | 逐字转录规则导致IMA中X内容纯文本化 |
| 凭证管理 | 需自行配置4组环境变量,新手门槛较高 |

适合人群

  • Obsidian + LLM用户:需要结构化本地知识库
  • 飞书协作团队:希望网页内容自动入库团队空间
  • IMA/FIM实践者:构建AI可检索的个人知识库
  • 信息策展人:日常需要批量保存公众号、X线程、PDF报告

技术依赖

  • Python 3.8+,核心依赖markitdown requests python-dotenv
  • 可选x-tweet-fetcher用于Twitter优化抓取
  • 跨平台支持(Windows/macOS/Linux)

Web To Fim 内容

references文件夹
scripts文件夹
手动下载zip · 39.0 kB
feishu-blocks.mdtext/markdown
请选择文件