核心用法
Redacta 是一款专为医疗场景设计的文档脱敏技能,用于在将临床文档输入AI系统前自动识别并伪匿名化患者标识信息。用户只需粘贴医疗文本,系统会扫描并替换以下标识符:
- 结构化标识符(基于正则规则):英国NHS号码(含Modulus 11校验)、出生日期、英国邮编、电话号码、邮箱地址、医院/病历号、英国国家保险号
- 上下文标识符(基于语义推理):患者姓名、地址、具体年龄
输出包含两部分:脱敏后的完整文档(保留格式和临床内容),以及脱敏报告(列出所有替换项及位置)。
显著优点
1. 双引擎识别:结合正则匹配与AI语义理解,既能捕捉标准格式数据,也能识别上下文中的敏感信息
2. 临床友好设计:明确区分患者信息与临床信息——默认保留医生姓名、医院名称、预约日期等诊疗相关内容
3. 英国医疗体系深度适配:内置NHS号码验证算法、英国邮编格式、英国电话格式等国别化规则
4. 安全优先原则:规则第5条明确"不确定时倾向脱敏",降低漏检风险
潜在局限
1. 仅支持文本输入:v1版本不支持PDF或图像处理
2. 无100%检测保证:开发者明确提示需人工复核输出
3. 依赖底层模型:文本仍需经过语言模型处理,存在模型提供商的数据留存风险
4. 地域局限:虽支持英美格式,但核心设计偏向英国NHS体系,其他国家医疗标识符覆盖可能不全
5. 非正式合规工具:不提供法律合规认证,不能替代机构正式的数据保护流程
适合人群
- 医疗健康领域的研究人员、临床医生、医院IT部门
- 需要将去标识化病历用于AI分析、统计研究或第三方工具处理的机构
- 英国NHS体系内的工作人员(最优适配)
常规风险
- 残留重识别风险:特定组合(罕见疾病+大致年龄+地区)仍可能逆向识别患者
- 模型侧泄露:文本经过底层LLM处理,需确认模型提供商的数据处理条款
- 过度脱敏:严格规则可能导致部分临床相关信息被误删,影响后续分析价值