核心用法
Clinical Data Extractor是一款专为医药研发人员设计的临床数据提取工具。用户只需提供制药会议网站(如ASCO、ESMO、EHA等)的URL或PDF文档,Skill即可自动完成以下流程:首先通过web_fetch MCP工具抓取网页内容,或使用nano-pdf工具提取PDF文本;然后智能解析并提取关键字段,包括药品名称、生产厂家、适应症、临床阶段、试验名称、学术会议信息,以及最核心的疗效与安全性数据;最终将结果以标准化Markdown表格形式保存至~/.openclaw/workspace目录,文件命名遵循{药品名称}@{适应症}.md格式。
该Skill内置了临床终点缩写映射表(如ORR客观缓解率、mPFS中位无进展生存期等),确保数据呈现的专业性与一致性。对于网页或PDF中的临床数据图片,Skill支持URL引用或本地截图保存。此外,Skill还会生成可选的专家点评章节,从疗效评价、安全性考量、研究设计、临床前景等维度提供参考性分析。
显著优点
专业场景深度定制:针对制药行业临床数据报告的标准格式进行了专门优化,内置20+个常见临床终点缩写对照,自动处理多剂量组、对照组等复杂表格结构,生成的报告可直接用于内部研发讨论或知识库沉淀。
数据结构化能力突出:将非结构化的网页或PDF内容转化为高度结构化的Markdown表格,严格规范数值格式(百分比保留一位小数、时间指标不带单位、p-value精确标注等),大幅减少人工整理数据的时间成本。
安全无代码风险:纯Markdown文档型Skill,无可执行代码、无外部依赖、无敏感信息硬编码,通过六维安全检测(静态分析95分、动态分析90分、依赖审计95分等),安全评级达S级。
灵活的图片处理机制:区分网页图片(URL引用)与PDF图片(本地截图),提供清晰的图片保存指引,确保临床数据可视化内容的完整性。
潜在缺点与局限性
数据来源依赖用户输入:Skill本身不具备主动检索能力,必须依赖用户提供准确的URL或PDF文件。若源网页结构复杂、反爬虫机制严格(如微信公众号),或PDF为扫描件未OCR,提取效果可能受限。
专业门槛较高:输出内容涉及大量医药专业术语(cORR、DCR、mDOR等),非医药背景用户可能难以理解与验证数据准确性。专家点评章节虽标注"仅供参考",但仍需具备一定专业判断力。
MCP工具依赖:核心功能依赖web_fetch和nano-pdf两个MCP工具,若工具版本更新或配置异常,可能影响提取稳定性。
格式标准化与灵活性权衡:严格的表格格式规范虽保证一致性,但面对非标准格式的会议摘要时,可能需要人工调整。对于非常规终点数据,需手动转换为中文全称,无法自动识别所有变体。
适合的目标群体
医药研发人员:从事新药临床开发、医学事务、药物警戒的专业人士,需要快速整理会议发布的临床试验数据。
投资分析师:关注创新药管线的生物医药领域分析师,用于跟踪ASCO/ESMO等会议的最新临床进展。
医学信息专员(MI):负责竞争对手临床数据监控、内部知识库建设的医学信息部门人员。
科研机构研究人员:进行药物经济学评价、循证医学研究的学术人员,需要批量获取结构化临床数据。
使用风险与注意事项
数据源合法性风险:Skill本身不验证URL来源的合法性与隐私合规性。用户需确保访问的会议网站、下载的PDF文件符合数据使用授权,避免涉及未公开披露的商业机密或受版权保护的内容。
数据准确性验证:自动提取过程可能存在解析偏差(如表格行列错位、数值单位误判),关键决策前建议人工核对原始文档。临床数据图片若依赖URL引用,存在原链接失效导致数据丢失的风险。
输出目录权限管理:默认写入~/.openclaw/workspace目录,需确保该路径存在且具备写入权限,避免与其他敏感文件混存。
MCP工具安全性:虽然Skill本身安全,但建议确认web_fetch和nano-pdf工具来自可信来源并保持更新,防止工具层面的潜在风险传导。
专家点评的参考性质:自动生成的分析内容基于通用医学评价框架,不能替代持证医师或监管专业人士的判断,重大决策应咨询相关专业人员。