核心功能
Clarity Gate是面向RAG(检索增强生成)系统的文档预处理验证工具,核心使命是解决"若另一个LLM阅读此文档,会否将假设误认为事实?"这一关键问题。其独特定位在于强制执行(enforcement)而非仅仅检测(detection)不确定性标记——不仅发现文本中已有的 hedges(如"可能"),更主动识别应当标注却未标注的不确定性(如将"收入将达5000万"标记为假设)。
9点验证体系
| 类别 | 验证点 | 核心检查 |
|------|--------|---------|
| **认知验证** (1-4) | 1. 假设vs事实标注 | 区分已验证声明与假设 |
| | 2. 不确定性标记强制 | 前瞻性陈述必须添加限定词 |
| | 3. 假设可见性 | 隐性条件必须显式化 |
| | 4. 权威外观的未验证数据 | 表格中具体数字需标注来源 |
| **数据质量** (5-7) | 5. 数据一致性 | 文档内数字、日期冲突检测 |
| | 6. 隐性因果 | 无证据的因果推断识别 |
| | 7. 未来态现述 | 计划目标误述为已实现状态 |
| **验证路由** (8-9) | 8. 时间一致性 | 日期逻辑与版本时序检查 |
| | 9. 外部可验证声明 | 可事实核查的具体数字标记 |
输出格式:Clarity-Gated Document (CGD)
生成符合FORMAT_SPEC v2.1的结构化文档,包含:
- YAML frontmatter(含
clarity-status、hitl-status等状态字段) - 经标注的正文(如
*(unverified projection)*) - HITL Verification Record(人工验证记录表)
<!-- CLARITY_GATE_END -->终止标记
双层验证层级
声明提取 → 是否存在真理源?
↓
YES → Tier 1: 自动化验证(内部一致性+外部系统对接)
NO → Tier 2: 两轮人工验证(Round A:派生数据确认 → Round B:真实验证)关键局限与风险
> 验证形式,非真理。 本工具检查声明是否被正确标记为不确定,无法验证声明本身是否为真。存在"幻觉注入"风险:LLM可在文档中编造虚假事实,再添加来源标记通过校验。
强制性人工参与(HITL)是安全底线:文档需经REVIEWED状态方可标记为RAG可摄入。