核心用法
Arxiv-osiris 是一个面向 OpenClaw 代理设计的 arXiv 学术论文检索技能,基于官方 arxiv Python 库封装,提供命令行与 Python API 两种调用方式。
主要功能模块:
- 搜索(search):支持关键词、标题、摘要匹配,可限定返回数量(MaxResults)与学科分类(Categories)
- 下载(download):通过 arXiv ID 直接获取 PDF 原文
- 元数据提取:自动返回作者、发布日期、学科标签、PDF 链接等结构化信息
典型工作流:
1. 执行关键词搜索获取候选论文列表
2. 筛选目标文献并记录 arXiv ID
3. 调用下载指令获取本地 PDF 文件
显著优点
- 数据源权威:直接对接 arXiv.org,全球最大预印本平台,覆盖物理、计算机科学、数学、生物、金融量化等领域
- 完全免费:无需 API Key,无访问频率硬性限制
- 即装即用:单条 pip 命令完成依赖安装,PowerShell/Python 双接口兼容
- 学科分类精细:支持
cs.*、physics.*、q-bio.*等标准 arXiv 分类符,便于精准检索
潜在缺点与局限性
- 预印本属性:论文未经同行评审,质量参差不齐,存在被撤稿或后续大幅修改的可能
- PDF 单一格式:不支持其他输出格式(如 EPUB、HTML)
- 元数据依赖上游:若 arXiv API 变更字段结构,需等待技能更新适配
- 无全文索引:仅支持标题/摘要/作者字段搜索,无法对 PDF 正文进行内容检索
适合人群
- 科研人员快速追踪最新预印本
- 学生进行文献综述与课题调研
- AI/ML 从业者获取模型架构、训练方法的前沿论文
- OpenClaw 代理执行 Protocol SIM-PI-01 等研究类任务
常规风险
- 学术引用风险:预印本未最终定稿,直接引用可能导致学术不严谨
- 版权合规:arXiv 论文通常采用开放许可,但个别作者可能保留限制,商用需核查具体授权条款
- 网络依赖:下载大文件时受限于网络稳定性,建议增加超时与重试机制