核心用法
本技能基于浏览器自动化技术,实现对CNKI中国知网的高级检索与数据提取。用户通过结构化指令调用OpenClaw浏览器工具,完成从检索词输入、结果获取到摘要提取的完整工作流。
主要功能模块:
- 专业检索:支持
SU(主题)、TI(篇名)、AU(作者)、AF(机构)等CNKI标准字段组合查询 - 批量列表提取:自动翻页获取多页搜索结果,提取标题、作者、来源、日期、引用数等元数据
- 详情页解析:深入文章页面获取完整摘要、关键词、DOI、页码、卷期等信息
- 时间范围筛选:支持具体日期范围(日历选择)或相对时间(最近一周/一月/半年/一年等)
典型操作示例
# 基础主题检索 SU='结膜松弛' and SU='治疗' # 作者+主题组合 AU='张兴儒' and SU='结膜松弛' # 特定期刊+高被引筛选 LY='中华眼科杂志' and SU='结膜松弛' and CF>10
显著优点
1. 零代码依赖:纯Markdown文档型技能,无需安装额外Python/Node依赖,开箱即用
2. 官方数据源:直连CNKI官方域名(kns.cnki.net),数据权威、格式规范
3. 专业检索语法支持:完整覆盖CNKI专业检索字段,支持布尔逻辑、字段限定、数值比较
4. 反机器人友好设计:明确建议有头浏览器(headful)模式,保留用户手动完成验证码的交互通道
5. 输出结构化:提供JSON/CSV双格式导出示例,便于后续文献管理或数据分析
局限性与潜在缺点
1. 验证码依赖人工:CNKI的滑块/点选验证无法自动绕过,需用户介入,中断自动化流程
2. 页面结构敏感性:数据提取依赖DOM选择器,CNKI前端改版可能导致提取规则失效
3. 无批量下载全文:仅能提取元数据与摘要,无法自动获取PDF全文(需机构订阅权限)
4. 频率限制风险:高频请求可能触发IP限流或账号异常,需主动控制操作间隔
5. 老文献数据缺失:部分早期文献摘要、DOI等字段可能为空
适合人群
- 医学/科研工作者进行系统性文献综述
- 图书情报人员批量采集CNKI元数据
- 研究生阶段的课题文献调研
- 需要结构化文献数据的定量研究(文献计量分析)
常规风险
- 服务条款合规:需遵守CNKI用户协议,避免高频爬取影响平台服务
- 数据完整性风险:网络波动或页面改版时,建议增加重试机制与数据校验
- 隐私边界:虽技能本身不收集敏感信息,但CNKI账号登录状态由用户浏览器管理,需注意账号安全