Redacta

🔒 医疗文档AI脱敏专家

医疗文档脱敏工具,自动识别并替换患者标识符(NHS号、姓名、地址等),保留临床内容,确保AI处理前的隐私安全。

收藏
4k
安装
1.2k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Redacta 是一款专为医疗场景设计的文档脱敏技能,用于在将临床文档输入AI系统前自动识别并伪匿名化患者标识信息。用户只需粘贴医疗文本,系统会扫描并替换以下标识符:

  • 结构化标识符(基于正则规则):英国NHS号码(含Modulus 11校验)、出生日期、英国邮编、电话号码、邮箱地址、医院/病历号、英国国家保险号
  • 上下文标识符(基于语义推理):患者姓名、地址、具体年龄

输出包含两部分:脱敏后的完整文档(保留格式和临床内容),以及脱敏报告(列出所有替换项及位置)。

显著优点

1. 双引擎识别:结合正则匹配与AI语义理解,既能捕捉标准格式数据,也能识别上下文中的敏感信息
2. 临床友好设计:明确区分患者信息与临床信息——默认保留医生姓名、医院名称、预约日期等诊疗相关内容

3. 英国医疗体系深度适配:内置NHS号码验证算法、英国邮编格式、英国电话格式等国别化规则

4. 安全优先原则:规则第5条明确"不确定时倾向脱敏",降低漏检风险

潜在局限

1. 仅支持文本输入:v1版本不支持PDF或图像处理
2. 无100%检测保证:开发者明确提示需人工复核输出

3. 依赖底层模型:文本仍需经过语言模型处理,存在模型提供商的数据留存风险

4. 地域局限:虽支持英美格式,但核心设计偏向英国NHS体系,其他国家医疗标识符覆盖可能不全

5. 非正式合规工具:不提供法律合规认证,不能替代机构正式的数据保护流程

适合人群

  • 医疗健康领域的研究人员、临床医生、医院IT部门
  • 需要将去标识化病历用于AI分析、统计研究或第三方工具处理的机构
  • 英国NHS体系内的工作人员(最优适配)

常规风险

  • 残留重识别风险:特定组合(罕见疾病+大致年龄+地区)仍可能逆向识别患者
  • 模型侧泄露:文本经过底层LLM处理,需确认模型提供商的数据处理条款
  • 过度脱敏:严格规则可能导致部分临床相关信息被误删,影响后续分析价值

Redacta 内容

手动下载zip · 3.9 kB
skill-card.mdtext/markdown
请选择文件