Clinical Data Extractor

💊 临床试验数据结构化提取专家

从制药会议网站或PDF中提取结构化临床试验数据,自动生成标准化markdown报告,支持疗效、安全性数据表格化呈现与专家点评

收藏
6.4k
安装
1.3k
版本
1.0.0
CLS 安全性认证2026-08-03
点击查看完整报告 >

使用说明

核心用法

Clinical Data Extractor 是一款面向医药专业人员的结构化数据提取工具,主要用于处理 ASCO、ESMO、EHA 等权威学术会议发布的创新药临床试验数据。用户只需提供目标网页URL或PDF文档路径,工具即可自动执行五步工作流:检测输入类型→提取原始内容→结构化解析关键字段→生成标准化markdown文件→输出专家点评。

显著优点

1. 标准化输出格式:强制统一的表格结构和文件命名规范(药品名称@适应症.md),确保数据可追溯、可对比
2. 专业术语映射:内置临床终点缩写对照表(ORR/mPFS/mOS等),自动处理中英文转换,减少人工翻译误差

3. 多模态支持:兼容网页抓取(web_fetch)和PDF解析(nano-pdf),支持临床数据图片的URL引用或本地截图保存

4. 专家知识增强:可选生成药学/医学视角的临床数据点评,涵盖疗效评价、安全性分析、研究设计评估和监管前景预判

5. 数据完整性校验:强制要求标注各组入组人数(N值),区分不同分析人群,避免数据混用

潜在缺点与局限性

  • 图片提取受限:微信公众号等受平台保护的网页无法直接提取图片URL,需用户手动截图补充
  • PDF解析依赖质量:扫描版PDF需OCR预处理,复杂表格结构可能无法完整保留,需要人工校验
  • 单任务导向:每次执行建议聚焦单一药物/试验,多药物场景需用户明确指定目标
  • 缺乏实时更新:终点缩写列表和输出路径为静态配置,修改需手动编辑配置区域

适合人群

  • 医药投资分析师(快速跟踪管线进展)
  • 医学事务/临床开发专员(竞品数据监控)
  • 医药咨询顾问(生成标准化研究摘要)
  • 生物制药企业监管事务人员(申报资料整理)

常规风险

  • 数据准确性风险:自动化提取可能遗漏脚注说明或误读表格行列对应关系,关键决策前需人工复核原始来源
  • 文件管理风险:未配置版本控制,重复执行相同药物可能覆盖历史文件
  • 合规使用边界:提取内容仅限个人研究使用,公开发布需获得原版权方授权

安全解读

核心用法

Clinical Data Extractor是一款专为医药研发人员设计的临床数据提取工具。用户只需提供制药会议网站(如ASCO、ESMO、EHA等)的URL或PDF文档,Skill即可自动完成以下流程:首先通过web_fetch MCP工具抓取网页内容,或使用nano-pdf工具提取PDF文本;然后智能解析并提取关键字段,包括药品名称、生产厂家、适应症、临床阶段、试验名称、学术会议信息,以及最核心的疗效与安全性数据;最终将结果以标准化Markdown表格形式保存至~/.openclaw/workspace目录,文件命名遵循{药品名称}@{适应症}.md格式。

该Skill内置了临床终点缩写映射表(如ORR客观缓解率、mPFS中位无进展生存期等),确保数据呈现的专业性与一致性。对于网页或PDF中的临床数据图片,Skill支持URL引用或本地截图保存。此外,Skill还会生成可选的专家点评章节,从疗效评价、安全性考量、研究设计、临床前景等维度提供参考性分析。

显著优点

专业场景深度定制:针对制药行业临床数据报告的标准格式进行了专门优化,内置20+个常见临床终点缩写对照,自动处理多剂量组、对照组等复杂表格结构,生成的报告可直接用于内部研发讨论或知识库沉淀。

数据结构化能力突出:将非结构化的网页或PDF内容转化为高度结构化的Markdown表格,严格规范数值格式(百分比保留一位小数、时间指标不带单位、p-value精确标注等),大幅减少人工整理数据的时间成本。

安全无代码风险:纯Markdown文档型Skill,无可执行代码、无外部依赖、无敏感信息硬编码,通过六维安全检测(静态分析95分、动态分析90分、依赖审计95分等),安全评级达S级。

灵活的图片处理机制:区分网页图片(URL引用)与PDF图片(本地截图),提供清晰的图片保存指引,确保临床数据可视化内容的完整性。

潜在缺点与局限性

数据来源依赖用户输入:Skill本身不具备主动检索能力,必须依赖用户提供准确的URL或PDF文件。若源网页结构复杂、反爬虫机制严格(如微信公众号),或PDF为扫描件未OCR,提取效果可能受限。

专业门槛较高:输出内容涉及大量医药专业术语(cORR、DCR、mDOR等),非医药背景用户可能难以理解与验证数据准确性。专家点评章节虽标注"仅供参考",但仍需具备一定专业判断力。

MCP工具依赖:核心功能依赖web_fetchnano-pdf两个MCP工具,若工具版本更新或配置异常,可能影响提取稳定性。

格式标准化与灵活性权衡:严格的表格格式规范虽保证一致性,但面对非标准格式的会议摘要时,可能需要人工调整。对于非常规终点数据,需手动转换为中文全称,无法自动识别所有变体。

适合的目标群体

医药研发人员:从事新药临床开发、医学事务、药物警戒的专业人士,需要快速整理会议发布的临床试验数据。

投资分析师:关注创新药管线的生物医药领域分析师,用于跟踪ASCO/ESMO等会议的最新临床进展。

医学信息专员(MI):负责竞争对手临床数据监控、内部知识库建设的医学信息部门人员。

科研机构研究人员:进行药物经济学评价、循证医学研究的学术人员,需要批量获取结构化临床数据。

使用风险与注意事项

数据源合法性风险:Skill本身不验证URL来源的合法性与隐私合规性。用户需确保访问的会议网站、下载的PDF文件符合数据使用授权,避免涉及未公开披露的商业机密或受版权保护的内容。

数据准确性验证:自动提取过程可能存在解析偏差(如表格行列错位、数值单位误判),关键决策前建议人工核对原始文档。临床数据图片若依赖URL引用,存在原链接失效导致数据丢失的风险。

输出目录权限管理:默认写入~/.openclaw/workspace目录,需确保该路径存在且具备写入权限,避免与其他敏感文件混存。

MCP工具安全性:虽然Skill本身安全,但建议确认web_fetchnano-pdf工具来自可信来源并保持更新,防止工具层面的潜在风险传导。

专家点评的参考性质:自动生成的分析内容基于通用医学评价框架,不能替代持证医师或监管专业人士的判断,重大决策应咨询相关专业人员。

Clinical Data Extractor 内容

手动下载zip · 7.3 kB
README.mdtext/markdown
请选择文件