Fact Checker

🔍 一键核验文档真伪,源头数据自动比对

自动化事实核查工具,交叉验证 Markdown 草稿中的数值、日期、模型引用等声明,与本地源代码、API、日志进行比对,确保发布内容准确无误。

收藏
10.5k
安装
2.5k
版本
1.0.3
CLS 安全性认证2026-07-14
点击查看完整报告 >

使用说明

核心用法

Fact-Checker 是一款面向技术文档与报告的智能校验技能,专用于在发布前捕获内容中的事实性错误。用户只需指向待审阅的 Markdown 文件,工具便会自动提取可验证声明(数值、百分比、日期、模型名称、因果陈述),并按优先级查询多源数据:本地 FINDINGS.md 知识库、Control Plane 实时 API、JSON 评分文件、记忆日志、Git 历史及 CHANGELOG,最终生成结构化验证报告。

显著优点

  • 多源交叉验证:整合 6 类数据源,降低单一信息源偏差风险
  • 精细化声明识别:不仅匹配裸数字,更解析上下文语义(如 "phi4/classify scored 1.000")
  • actionable 输出:每项声明标记 ✅/⚠️/❌ 状态,附证据来源与修正建议
  • 离线优先设计:核心功能无需外网,依赖本地文件与内网 API,符合安全敏感场景

潜在局限

  • 数据时效性:依赖本地缓存文件(如 scores/*.json),若源数据未同步可能产生假阴性
  • 语义理解边界:复杂因果陈述("性能提升主要归因于...")可能无法自动判定真伪
  • API 依赖风险:/status API 不可用时,验证覆盖率下降
  • 英语优先:模型引用格式(model/task、model:tag)假设英语命名规范

适合人群

技术写作团队、ML 工程师发布实验报告、DevRel 撰写博客前的自我审校、需要为合规文档提供溯源证据的企业用户。

常规风险

  • 数据泄露误报:工具读取本地敏感日志(memory/*.md),需在受控环境运行
  • 过度自信风险:"CONFIRMED" 仅表示与数据源一致,非绝对真理
  • 版本漂移:git 历史依赖本地仓库状态,未 push 的提交可能产生验证偏差

安全解读

核心用法

Fact-Checker 是一款面向技术写作场景的自动化事实核查工具,通过 Python 脚本解析 Markdown 草稿,提取可验证声明(数值、日期、模型引用、评分、百分比等),并与六类本地数据源交叉比对,生成结构化的验证报告。

执行流程
1. 解析文档提取声明:使用正则表达式识别数值声明(整数/浮点)、模型引用(如 phi4/classify)、日期(YYYY-MM-DD 格式)、评分(0.923)、百分比(95.3%)

2. 多源数据校验:按优先级查询 FINDINGS.md(主数据源)、localhost:8765/status API、scores/.json 文件、memory/.md 日志、git log、CHANGELOG.md

3. 生成三色标记报告:✅ 已确认、⚠️ 无法验证、❌ 存在矛盾

显著优点

  • 多源交叉验证机制:设计严谨,通过 FINDINGS.md → API → 磁盘文件 → 日志 → Git 历史的多层校验,降低单点数据源错误风险
  • 精准声明提取:针对技术文档场景优化,能识别带上下文的数值声明(如 "phi4/classify scored 1.000")
  • 结构化输出:每条声明附带证据链,便于追溯和修正
  • 完全本地执行:无外网依赖,适用于敏感数据环境

潜在局限

  • 依赖特定项目结构:要求严格的目录布局(projects/hybrid-control-plane/),泛化能力受限
  • API 可用性单点:若 localhost:8765/status 服务未启动,部分实时数据校验失效
  • 语义理解有限:基于模式匹配,无法处理复杂因果推论或隐含声明
  • 无历史版本对比:无法检测同一声明在不同草稿版本间的演变

适合人群

  • 技术博客作者、DevRel 团队
  • 机器学习工程团队(需发布模型评测报告)
  • 内部技术文档维护者
  • 对数据准确性有硬性要求的合规敏感场景

常规风险

  • 数据源时效性风险:git log 和磁盘文件可能存在滞后,建议配合 API 实时校验
  • 误报/漏报:模糊表述("大约一天")会被标记为无法验证,需人工复核
  • 本地服务依赖:生产环境需确保 Control Plane 服务稳定运行

Fact Checker 内容

scripts文件夹
手动下载zip · 11.4 kB
fact_check.pytext/plain
请选择文件