核心用途
Clarity Gate 是一个面向 RAG(检索增强生成)系统的文档预摄入验证框架,核心任务是强制执行认知质量标记——确保文档在流入知识库前,已明确区分假设与事实、投影与现实。
显著优点
1. 主动防御而非被动检测:与 UnScientify、HedgeHunter 等仅检测已有不确定标记的工具不同,Clarity Gate 强制要求在需要时出现标记(如将"Revenue will be $50M"改为"Revenue is projected to be $50M")
2. 结构化输出格式 CGD:生成标准化的 .cgd.md 文档,包含完整性校验(SHA-256)、HITL 验证记录、状态追踪等机器可读字段,便于自动化流水线集成
3. 9 点验证体系:覆盖假设/事实标注、不确定性标记、假设可见性、权威外观数据、数据一致性、隐含因果、未来态误用、时间连贯性、外部可验证声明
4. 双层验证机制:
- Tier 1 自动化:内部一致性检查
- Tier 2 HITL 强制验证:Round A(派生数据确认)+ Round B(真人事实核查),无 HITL 不得标记为 REVIEWED
5. 开源工具链:提供 claim_id.py(确定性哈希生成)和 document_hash.py(跨平台规范化哈希),确保可追溯与可复现
潜在局限与风险
> 关键警告:验证形式,而非真理
Clarity Gate 检查的是标记是否存在,而非内容是否真实。攻击路径:LLM 可在文档中生成虚假事实,再添加来源标记"通过"验证。解决方案依赖强制 HITL,但 HITL 本身可能存在疏忽或偏见。
其他局限:
- 不自主核查事实准确性(需外部搜索或人工)
- 不处理文档类型分类、深度链接重构
- 排除区块(exclusion blocks)会导致整份文档被拒绝摄入,无部分摄入机制
- 依赖规范的
.cgd.md格式,遗留文档需转换成本
适合人群
- 构建企业 RAG 系统的 ML 工程师与数据团队
- 需要跨 LLM 会话传递文档的 AI 应用开发者
- 处理预测、估算、假设类内容的知识管理团队
- 对 AI 幻觉风险高度敏感的金融、医疗、法律领域文档流程
常规风险
| 风险类型 | 说明 |
|---------|------|
| 虚假安全感 | 团队可能误认为"通过 Clarity Gate = 内容可信" |
| HITL 瓶颈 | 强制人工验证可能拖慢文档发布节奏 |
| 格式锁定 | 深度绑定 CGD 格式,迁移成本随规模增加 |
| 覆盖盲区 | 复杂因果推断、隐含假设可能逃脱 9 点检查 |
版本与生态
当前 v2.1.2,由 Francesco Marinoni Moretto 以 CC-BY-4.0 开源维护。配套项目包括 Source of Truth Creator、Stream Coding 方法论。