Web To Fim

🌐 一键入库,三端同步

一键将网页/文件转为结构化Markdown,同步至Obsidian本地库、飞书云文档、腾讯IMA知识库,支持公众号/X/YouTube等主流信源。

收藏
4.1k
安装
1k
版本
3.0.2
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Web-to-FIM 是一个信息入库自动化工具,核心流程为「识别→转换→三处存放」。用户仅需提供 URL 或本地文件路径,系统即可自动识别信源类型,调用最优抓取策略(x-tweet-fetcher 逐字转录 X/Twitter、markitdown 处理网页、移动端 UA fallback 应对微信反爬),输出结构化 Markdown 并同步至三大目的地:Obsidian Vault(本地 frontmatter 格式)、飞书云文档(团队协作)、腾讯 IMA 知识库(AI 原生 FIM 知识库)。

触发方式灵活,支持「转文档」「web to feishu」「存到 ima」等十余种自然语言指令,也可直接调用 web_to_all.py CLI 工具。

显著优点

  • 信源覆盖全面:从 X/Twitter、微信公众号、飞书 wiki、小红书、微博、YouTube 到任意 HTML 网页及本地 PDF/Word/PPT/Excel/图片/音频,几乎涵盖日常信息获取全场景。
  • AI 原生设计:IMA 知识库存储专为 LLM 检索优化,Obsidian frontmatter 兼容各类知识图谱插件,实现「人机共用」的信息基础设施。
  • 智能路由策略:v3.0 引入差异化处理——公众号/普通网页走 import_urls 保留图片排版,X/Twitter/飞书 wiki 走纯文本逐字转录,兼顾合规性与完整性。
  • 安全合规:API 凭证强制环境变量配置,无硬编码风险;文件操作范围明确,无越权扫描。

潜在缺点与局限性

  • 依赖第三方 API 稳定性:飞书、IMA 服务可用性受腾讯、字节跳动平台策略影响,存在接口变更风险(如 v3.0 已经历 IMA 从笔记本到知识库的架构迁移)。
  • X/Twitter 抓取受限:需额外部署 x-tweet-fetcher 技能,且依赖 FxTwitter 等中转服务,SSL 超时或 API 限制可能导致失败。
  • 飞书文档格式限制:单次最多 50 个 blocks,长文需分批插入;复杂排版(表格、嵌套列表)可能丢失结构。
  • 微信反爬对抗:虽支持移动端 UA fallback,但微信风控策略持续升级,极端情况下仍可能返回验证页。

适合人群

  • 知识管理重度用户:Obsidian + LLM 实践者,需要结构化信息输入。
  • 团队信息管理员:需将分散的网络内容沉淀至飞书知识库。
  • AI 应用开发者:构建 RAG 系统,需要批量清洗网页数据灌入 IMA/向量库。

常规风险

  • 凭证泄露:若用户误将 .env 文件提交至公共仓库,飞书/IMA 凭据可能遭滥用。
  • 版权合规:批量抓取付费内容或明确禁止爬取的网站可能触发法律风险。
  • 数据残留:临时 Markdown 文件若未清理,可能在多用户环境暴露敏感信息。

建议启用 .gitignore 隔离环境文件,并定期审计 Obsidian Vault 写入权限。

Web To Fim 内容

references文件夹
scripts文件夹
手动下载zip · 27.9 kB
feishu-blocks.mdtext/markdown
请选择文件